Hoe openbare Instagram-gegevens te scrapen voor marktonderzoek
Instagram beëindigde de toegang tot de openbare API in 2020, maar de openbare webendpoints geven nog steeds profielen, berichten en hashtaggegevens terug als JSON. Hier is wat bereikbaar is, waarom mobiele IP's belangrijk zijn en waar de grens ligt.
Instagram sloot in 2020 de openbare toegang tot zijn officiële API, waardoor elke gids voor het scrapen van Instagram-gegevens nu leunt op de openbare webendpoints. Het goede nieuws voor marktonderzoek: die endpoints geven nog steeds profielen, berichten, reels en hashtagvolumes terug als schone JSON, zonder inloggen. Het nadeel is dat Instagram een van de meest agressieve platforms is in het markeren van geautomatiseerd verkeer, dus het IP dat je gebruikt en het tempo dat je aanhoudt bepalen of het endpoint open blijft. Deze gids behandelt wat bereikbaar is, de code om het te bereiken, en de ToS- en GDPR-grenzen die je niet moet overschrijden.
Welke openbare Instagram-gegevens je daadwerkelijk kunt verzamelen
Zonder een account kun je verrassend veel bereiken, allemaal nuttig voor markt- en influenceronderzoek:
- Profielen: volledige naam, bio, volger- en volgcijfers, berichtenaantal, verificatie- en bedrijfsstatus.
- Berichten en reels: onderschrift, hashtags, vermeldingen, media-URL's, like- en reactieaantallen, tijdstempels en de eerste paar reacties.
- Hashtags: totaal berichtvolume en gerelateerde tagclusters - handig om minder verzadigde aangrenzende tags te vinden.
- Plaatsen: naam, coördinaten, adres en berichtenaantal voor een locatie.
Wat je niet kunt krijgen zonder een geauthenticeerde sessie: volledige volgerslijsten, de lijst van accounts die een bericht leuk vonden, privéaccounts en verhalen. Die endpoints vereisen een sessiecookie, en precies daar concentreren accountverboden en ToS-overtredingen zich. Voor onderzoek, blijf op het openbare oppervlak.

Het openbare profielendpoint, met code
De webapp van Instagram haalt profielgegevens op van een JSON-endpoint dat iedereen kan aanroepen, mits je de openbare webapp-id-header meestuurt. Routeer het via een proxy en je hebt profielgegevens in een paar regels:
import requests
PROXY = "http://USER:PASS@gate.quantumproxies.io:8000" # mobile pool
proxies = {"http": PROXY, "https": PROXY}
HEADERS = {
"x-ig-app-id": "936619743392459", # public web app id
"User-Agent": "Mozilla/5.0 (iPhone; CPU iPhone OS 17_2 like Mac OS X) "
"AppleWebKit/605.1.15 (KHTML, like Gecko) Mobile/15E148",
}
def profile(username):
url = "https://www.instagram.com/api/v1/users/web_profile_info/"
r = requests.get(url, params={"username": username},
headers=HEADERS, proxies=proxies, timeout=20)
r.raise_for_status()
return r.json()["data"]["user"]
u = profile("natgeo")
print(u["full_name"], u["edge_followed_by"]["count"])
Dezelfde payload bevat recente berichten onder edge_owner_to_timeline_media, dus één oproep geeft je het profiel en de laatste betrokkenheid samen:
for edge in u["edge_owner_to_timeline_media"]["edges"]:
node = edge["node"]
print(node["shortcode"],
node["edge_media_preview_like"]["count"], # likes
node["edge_media_to_comment"]["count"]) # comments
Waarom mobiele proxies winnen op Instagram
De meest voorkomende fout van Instagram is een rate-limit blokkade: het endpoint begint fouten terug te geven en verbiedt tijdelijk het IP dat het heeft geraakt. Wachten en time-outs verlengen helpt een beetje, maar de duurzame oplossing is het type IP. Mobiele proxies zijn hier de sterkste optie vanwege CGNAT - een enkel mobiel IP wordt gedeeld door duizenden echte abonnees, dus Instagram kan het niet blokkeren zonder echte gebruikers te raken. Dat maakt mobiele exits het moeilijkst te verbieden en de dichtste benadering van hoe de meeste mensen de app daadwerkelijk gebruiken. Onze uitleg over waarom CGNAT mobiele IP's betrouwbaar maakt behandelt het mechanisme, en mobiele proxies vs VPN's legt uit waarom een VPN dit niet kan doen.
Combineer een mobiele proxypool met menselijk tempo - willekeurige vertragingen, beperkte gelijktijdigheid en een stop wanneer het blokkeringspercentage stijgt - en de openbare endpoints blijven open tijdens lange verzamelruns.
Residentiële proxies zijn een redelijk alternatief wanneer een mobiele pool niet beschikbaar is - ons residentiële netwerk beslaat 200+ landen voor geo-nauwkeurige verzameling - maar specifiek op Instagram overleven mobiele exits het langst. Welk type IP je ook gebruikt, behandel een rate-limit reactie als een signaal om te vertragen, niet om harder te proberen: trek je terug, roteer en verleng de tijd tussen oproepen. Een scraper die de beperking respecteert, verzamelt veel meer over een dag dan een die door blokkades heen hakt en zijn pool in een uur verbrandt.

Krijg mobiele proxies gebouwd voor sociale platforms
Hashtags en ontdekking
Voor trend- en influencerontdekking verslaat hashtaggegevens het scrapen van individuele profielen. De hashtagpagina's onthullen berichtvolume en gerelateerde tagclusters, waarmee je kunt bepalen hoe verzadigd een onderwerp is en rustigere aangrenzende tags kunt vinden om te targeten. Combineer dat met per-profiel betrokkenheidspercentages - likes en reacties over volgeraantal - en je hebt een verdedigbare shortlist van makers zonder ooit afgeschermde gegevens aan te raken. Als je onderzoek platforms overspant, geldt dezelfde discipline voor TikTok openbare gegevens, en er is overlap met sociale automatisering uitvoeren op Instagram, TikTok en X.
Wat te bewaren en wat te laten vallen
Voor onderzoek, bewaar de geaggregeerde signalen en laat de rest vallen. Volger- en volgcijfers, postfrequentie, gemiddelde likes en reacties, en hashtaggebruik vertellen je alles over bereik en betrokkenheid zonder een hoop persoonlijke details te bewaren. Media-URL's verlopen en volledige onderschriften blazen je opslag op, dus bewaar stabiele identificatoren zoals de shortcode plus de statistieken, en haal inhoud op aanvraag opnieuw op. Minimaliseren wat je bewaart is zowel goed engineering als de veiligere kant van de GDPR-lijn - een tabel met betrokkenheidspercentages is veel minder gevoelig dan een magazijn vol met naamgegeven accounts en hun berichten.
De ToS- en GDPR-grenzen
Twee grenzen zijn belangrijk. Ten eerste beperken de voorwaarden van Instagram geautomatiseerde verzameling, en het gebruik van een ingelogde sessie om afgeschermde gegevens te scrapen brengt het account, niet alleen het IP, in gevaar - houd je aan openbare, niet-geauthenticeerde endpoints voor onderzoek. Ten tweede zijn volgerhandels, reactieauteurs en profielgegevens persoonlijke gegevens. Onder GDPR en vergelijkbare regimes heb je een wettelijke basis nodig om het te verzamelen en op te slaan, je moet minimaliseren wat je bewaart, en je moet vermijden profielen van identificeerbare individuen op te bouwen zonder een duidelijke reden. Geaggregeerde statistieken (volgeraantallen, betrokkenheidspercentages, hashtagvolumes) zijn veel veiliger dan lijsten van naamgegeven personen. Onze gids over GDPR en het scrapen van persoonlijke gegevens behandelt de specificaties - en dit is praktische begeleiding, geen juridisch advies.
Veelgestelde vragen
Kun je Instagram-gegevens scrapen zonder een account?
Ja, voor openbare gegevens. Het webprofielendpoint geeft bio's, volgeraantallen en recente berichten terug als JSON wanneer je de openbare x-ig-app-id header meestuurt, en hashtag- en plaatspagina's onthullen volume en metadata. Volgerslijsten, likers en privéaccounts vereisen een geauthenticeerde sessie en moeten worden vermeden voor onderzoek.
Waarom blijft Instagram mijn scraper rate-limiten?
Je raakt het endpoint te snel vanaf een IP dat Instagram wantrouwt. Vertraag met willekeurige vertragingen, beperk gelijktijdigheid en schakel over naar mobiele proxies - een CGNAT mobiel IP wordt gedeeld door duizenden echte gebruikers, dus Instagram is veel langzamer om het te blokkeren dan een datacenteradres.
Is het legaal om Instagram-gegevens te scrapen?
Het verzamelen van openbare, niet-persoonlijke gegevens voor onderzoek is over het algemeen minder risicovol, maar de voorwaarden van Instagram beperken automatisering en persoonlijke gegevens worden beheerst door GDPR en vergelijkbare wetten. Blijf op openbare endpoints, minimaliseer de persoonlijke gegevens die je opslaat, en raadpleeg een advocaat voor alles wat identificeerbare individuen op schaal betreft. Dit is geen juridisch advies.
Wat is het beste proxytype voor Instagram-scraping?
Mobiele proxies. Omdat CGNAT één mobiel IP aan veel echte abonnees koppelt, kan het platform het niet verbieden zonder nevenschade, waardoor mobiele exits het meest duurzaam zijn voor langdurige verzameling. Residentiële proxies zijn een redelijk tweede keuze; datacenter-IP's worden het snelst geblokkeerd.
Openbare Instagram-gegevens zijn zeer bereikbaar voor marktonderzoek - de profiel-, bericht- en hashtagendpoints geven nog steeds schone JSON terug. De twee variabelen die succes bepalen zijn het IP (mobiel wint) en terughoudendheid (alleen openbare gegevens, menselijk tempo, minimale persoonlijke gegevens). Krijg die goed en het endpoint blijft open.