Wie man öffentliche Instagram-Daten für Marketingforschung scrapt
Instagram hat 2020 den Zugang zur öffentlichen API beendet, aber die öffentlichen Web-Endpunkte liefern immer noch Profile, Beiträge und Hashtag-Daten als JSON. Hier ist, was erreichbar ist, warum mobile IPs wichtig sind und wo die Grenze liegt.
Instagram hat 2020 den öffentlichen Zugang zu seiner offiziellen API geschlossen, weshalb jeder Leitfaden zum Scrapen von Instagram-Daten jetzt auf die öffentlichen Web-Endpunkte setzt. Die gute Nachricht für die Marketingforschung: Diese Endpunkte liefern immer noch Profile, Beiträge, Reels und Hashtag-Volumen als sauberes JSON, ohne Login erforderlich. Der Haken ist, dass Instagram eine der aggressivsten Plattformen beim Markieren von automatisiertem Traffic ist, sodass die verwendete IP und das Tempo darüber entscheiden, ob der Endpunkt offen bleibt. Dieser Leitfaden behandelt, was erreichbar ist, den Code, um es zu erreichen, und die ToS- und GDPR-Grenzen, die Sie nicht überschreiten sollten.
Welche öffentlichen Instagram-Daten Sie tatsächlich sammeln können
Ohne ein Konto können Sie eine überraschende Menge erreichen, alles nützlich für Markt- und Influencerforschung:
- Profile: vollständiger Name, Bio, Follower- und Folgezahlen, Beitragsanzahl, verifizierter und Geschäftsstatus.
- Beiträge und Reels: Bildunterschrift, Hashtags, Erwähnungen, Medien-URLs, Like- und Kommentarzahlen, Zeitstempel und die ersten paar Kommentare.
- Hashtags: Gesamtbeitragsvolumen und verwandte Tag-Cluster - nützlich, um weniger gesättigte angrenzende Tags zu finden.
- Orte: Name, Koordinaten, Adresse und Beitragsanzahl für einen Ort.
Was Sie ohne eine authentifizierte Sitzung nicht erhalten können: vollständige Follower-Listen, die Liste der Konten, die einen Beitrag geliked haben, private Konten und Stories. Diese Endpunkte erfordern ein Sitzungscookie, und genau dort konzentrieren sich Kontosperren und ToS-Verstöße. Für die Forschung bleiben Sie an der öffentlichen Oberfläche.

Der öffentliche Profil-Endpunkt, mit Code
Die Instagram-Web-App ruft Profildaten von einem JSON-Endpunkt ab, den jeder aufrufen kann, vorausgesetzt, Sie senden den öffentlichen Web-App-ID-Header. Leiten Sie ihn durch einen Proxy und Sie haben Profildaten in wenigen Zeilen:
import requests
PROXY = "http://USER:PASS@gate.quantumproxies.io:8000" # mobile pool
proxies = {"http": PROXY, "https": PROXY}
HEADERS = {
"x-ig-app-id": "936619743392459", # public web app id
"User-Agent": "Mozilla/5.0 (iPhone; CPU iPhone OS 17_2 like Mac OS X) "
"AppleWebKit/605.1.15 (KHTML, like Gecko) Mobile/15E148",
}
def profile(username):
url = "https://www.instagram.com/api/v1/users/web_profile_info/"
r = requests.get(url, params={"username": username},
headers=HEADERS, proxies=proxies, timeout=20)
r.raise_for_status()
return r.json()["data"]["user"]
u = profile("natgeo")
print(u["full_name"], u["edge_followed_by"]["count"])
Die gleiche Nutzlast enthält aktuelle Beiträge unter edge_owner_to_timeline_media, sodass ein Aufruf Ihnen das Profil und dessen neueste Interaktionen zusammen liefert:
for edge in u["edge_owner_to_timeline_media"]["edges"]:
node = edge["node"]
print(node["shortcode"],
node["edge_media_preview_like"]["count"], # likes
node["edge_media_to_comment"]["count"]) # comments
Warum mobile Proxies auf Instagram gewinnen
Instagrams häufigster Fehler ist eine Rate-Limit-Sperre: Der Endpunkt beginnt, Fehler zurückzugeben und sperrt vorübergehend die IP, die ihn getroffen hat. Warten und längere Timeouts helfen ein wenig, aber die dauerhafte Lösung ist der IP-Typ. Mobile Proxies sind hier die stärkste Option wegen CGNAT - eine einzelne mobile IP wird von Tausenden echten Abonnenten geteilt, sodass Instagram sie nicht blockieren kann, ohne echte Nutzer zu treffen. Das macht mobile Exits am schwersten zu sperren und am ehesten vergleichbar damit, wie die meisten Menschen tatsächlich die App durchsuchen. Unser Erklärer zu warum CGNAT mobile IPs vertrauenswürdig macht erklärt den Mechanismus, und mobile Proxies vs VPNs erklärt, warum ein VPN das nicht kann.
Kombinieren Sie einen mobilen Proxy-Pool mit menschlichem Tempo - zufällige Verzögerungen, begrenzte Parallelität und ein Stopp, wenn die Blockrate steigt - und die öffentlichen Endpunkte bleiben über lange Sammelläufe hinweg offen.
Residential Proxies sind eine vernünftige Alternative, wenn ein mobiler Pool nicht verfügbar ist - unser residential network erstreckt sich über 200+ Länder für geo-genaue Sammlung - aber speziell auf Instagram überleben mobile Exits am längsten. Unabhängig vom IP-Typ, behandeln Sie eine Rate-Limit-Antwort als Signal, langsamer zu werden, nicht härter zu versuchen: zurückziehen, rotieren und die Lücke zwischen den Aufrufen verlängern. Ein Scraper, der die Drosselung respektiert, sammelt weit mehr über einen Tag als einer, der durch Sperren hämmert und seinen Pool in einer Stunde verbrennt.

Holen Sie sich mobile Proxies, die für soziale Plattformen gebaut sind
Hashtags und Entdeckung
Für Trend- und Influencer-Entdeckung schlagen Hashtag-Daten das Scrapen einzelner Profile. Die Hashtag-Seiten zeigen Beitragsvolumen und verwandte Tag-Cluster, die es Ihnen ermöglichen, zu kartieren, wie gesättigt ein Thema ist, und ruhigere angrenzende Tags zu finden, auf die Sie abzielen können. Kombinieren Sie das mit den Engagement-Raten pro Profil - Likes und Kommentare über Follower-Zahl - und Sie haben eine verteidigbare Shortlist von Erstellern, ohne jemals geschützte Daten zu berühren. Wenn Ihre Forschung Plattformen umfasst, gilt die gleiche Disziplin für TikTok öffentliche Daten, und es gibt Überschneidungen mit sozialer Automatisierung auf Instagram, TikTok und X.
Was zu behalten ist und was zu verwerfen ist
Für die Forschung speichern Sie die aggregierten Signale und verwerfen den Rest. Follower- und Folgezahlen, Posting-Häufigkeit, durchschnittliche Likes und Kommentare sowie Hashtag-Nutzung sagen Ihnen alles über Reichweite und Engagement, ohne einen Haufen persönlicher Details zu behalten. Medien-URLs laufen ab und vollständige Bildunterschriften blähen Ihren Speicher auf, also behalten Sie stabile Kennungen wie den shortcode plus die Metriken und holen Sie Inhalte bei Bedarf erneut ab. Das Minimieren dessen, was Sie halten, ist sowohl gute Technik als auch die sicherere Seite der GDPR-Grenze - eine Tabelle mit Engagement-Raten ist weit weniger sensibel als ein Lagerhaus mit benannten Konten und deren Beiträgen.
Die ToS- und GDPR-Grenzen
Zwei Grenzen sind wichtig. Erstens schränken die Instagram-Bedingungen die automatisierte Sammlung ein, und die Verwendung einer eingeloggten Sitzung zum Scrapen geschützter Daten gefährdet das Konto, nicht nur die IP - bleiben Sie für die Forschung bei öffentlichen, nicht authentifizierten Endpunkten. Zweitens sind Follower-Handles, Kommentarautoren und Profildetails persönliche Daten. Unter GDPR und ähnlichen Regelungen benötigen Sie eine rechtmäßige Grundlage, um sie zu sammeln und zu speichern, Sie sollten minimieren, was Sie behalten, und Sie sollten vermeiden, Profile von identifizierbaren Personen ohne klaren Grund zu erstellen. Aggregierte Metriken (Follower-Zahlen, Engagement-Raten, Hashtag-Volumen) sind weit sicherer als Listen benannter Personen. Unser Leitfaden zu GDPR und Scraping persönlicher Daten deckt die Einzelheiten ab - und dies ist praktische Anleitung, keine Rechtsberatung.
Häufig gestellte Fragen
Kann man Instagram-Daten ohne ein Konto scrapen?
Ja, für öffentliche Daten. Der Web-Profil-Endpunkt liefert Bios, Follower-Zahlen und aktuelle Beiträge als JSON, wenn Sie den öffentlichen x-ig-app-id Header senden, und Hashtag- und Orteseiten zeigen Volumen und Metadaten. Follower-Listen, Liker und private Konten benötigen eine authentifizierte Sitzung und sollten für die Forschung vermieden werden.
Warum begrenzt Instagram ständig die Rate meines Scrapers?
Sie treffen den Endpunkt zu schnell von einer IP aus, der Instagram misstraut. Verlangsamen Sie mit zufälligen Verzögerungen, begrenzen Sie die Parallelität und wechseln Sie zu mobilen Proxies - eine CGNAT mobile IP wird von Tausenden echten Nutzern geteilt, sodass Instagram sie viel langsamer blockiert als eine Rechenzentrumsadresse.
Ist das Scrapen von Instagram-Daten legal?
Das Sammeln öffentlicher, nicht-personenbezogener Daten für Forschungszwecke ist im Allgemeinen risikoärmer, aber die Instagram-Bedingungen schränken die Automatisierung ein und personenbezogene Daten unterliegen der GDPR und ähnlichen Gesetzen. Bleiben Sie bei öffentlichen Endpunkten, minimieren Sie die personenbezogenen Daten, die Sie speichern, und konsultieren Sie einen Anwalt für alles, was identifizierbare Personen in großem Maßstab betrifft. Dies ist keine Rechtsberatung.
Welcher Proxy-Typ ist am besten für Instagram-Scraping?
Mobile Proxies. Da CGNAT eine mobile IP auf viele echte Abonnenten abbildet, kann die Plattform sie nicht sperren, ohne Kollateralschäden zu verursachen, was mobile Exits am haltbarsten für anhaltende Sammlung macht. Residential Proxies sind eine vernünftige zweite Wahl; Rechenzentrums-IPs werden am schnellsten blockiert.
Öffentliche Instagram-Daten sind für die Marketingforschung sehr gut erreichbar - die Profil-, Beitrags- und Hashtag-Endpunkte liefern immer noch sauberes JSON. Die beiden Variablen, die den Erfolg bestimmen, sind die IP (mobile gewinnt) und Zurückhaltung (nur öffentliche Daten, menschliches Tempo, minimale personenbezogene Daten). Wenn Sie das richtig machen, bleibt der Endpunkt offen.
Beginnen Sie mit dem Sammeln mit QuantumProxies mobile Proxies