Hoe publieke TikTok-gegevens te scrapen in 2026 (Wat werkt)

De publieke gegevens van TikTok zijn allemaal aanwezig — in een verborgen JSON-blob en een cursor-gepagineerde feed — maar de anti-botlaag is de reden waarom elke kant-en-klare scraper uiteindelijk faalt. Hier is wat nog steeds werkt, en waarom mobiele IP's belangrijk zijn.

TikTok publiceert een verrassende hoeveelheid publieke gegevens — profielen, video metadata, hashtag feeds, engagementaantallen — en geen van deze gegevens vereist een login om te lezen. Wat het scrapen van TikTok-gegevens moeilijk maakt, is niet het vinden van de gegevens; het is dat de anti-botlaag van de site geautomatiseerde toegang agressief markeert, wat de reden is waarom elke kant-en-klare bibliotheek uiteindelijk faalt en waarom het exit-IP dat je gebruikt bepaalt of je resultaten krijgt of een CAPTCHA. Deze gids behandelt waar de publieke gegevens zich bevinden, hoe paginering echt werkt, waarom onofficiële tools verouderen, en waarom mobiele proxies de pragmatische standaard zijn. Het gaat om publieke, niet-persoonlijke onderzoeksgegevens — trends, makers, hashtags — niet om het scrapen van privéaccounts.

Waar de publieke gegevens zich daadwerkelijk bevinden

TikTok is een client-gerenderde app, dus een naïeve GET retourneert een omhulsel. De nuttige inhoud bevindt zich op twee plaatsen: een verborgen JSON-blob ingebed in de pagina (een universele-data script waaruit de app hydrateert) en de interne feed-eindpunten die de app oproept na het laden. Tussen deze kun je bijna alles lezen wat een kijker ziet: voor elke video, de bijschrift text, createTime, diggCount (likes), shareCount, playCount, commentCount, collectCount, plus geneste author, music en stats objecten. Auteurgegevens omvatten volger- en totaal-like-aantallen, verificatiestatus, bio en bio-link. Diavoorstellingen markeren isSlideshow en bevatten een afbeeldingslink-array in plaats van een video.

Profielen hebben twee ID's nodig, niet alleen een gebruikersnaam

De valkuil die elke eerste poging struikelt: het ophalen van de videofeed van een gebruiker vereist twee identificatoren, niet alleen de handle. Je hebt de numerieke id (userID) en de secUid nodig, die beide afkomstig zijn van het eerst oplossen van het profiel. Mis de secUid en de feed-aanroep retourneert niets. Los het eenmaal op, en blader dan door de feed.

# Sketch of the account-free flow every TikTok scraper follows.
# 1) Resolve the profile to get BOTH ids
user = get_user("someusername")          # -> {"id": ..., "secUid": ...}
user_id, sec_uid = user["id"], user["secUid"]

# 2) Page the feed with those ids (see cursor loop below)
videos = user_feed(user_id, sec_uid)

Paginering is cursor-gebaseerd (en beperkt tot ~30)

Eén feed-aanroep retourneert ongeveer 30 berichten — lang niet een volledige tijdlijn. TikTok pagineert met een cursor: elke respons bevat een cursor (waar deze batch eindigde) en een hasMore boolean. Om de hele feed te krijgen, moet je herhalen, de cursor teruggeven totdat hasMore onwaar is. Dit is ook waar je het meest blootgesteld bent — elke pagina is een nieuwe aanvraag van je IP, dus een lange tijdlijn betekent veel oproepen vanaf één adres.

def crawl_feed(user_id, sec_uid):
    items, cursor, has_more = [], 0, True
    while has_more:
        page = user_feed(user_id, sec_uid, cursor=cursor)  # ~30 posts
        items.extend(page["itemList"])
        cursor = int(page["cursor"])
        has_more = page["hasMore"]
        # rotate / pace here — every loop is a fresh request from your IP
    return items
Diagram van cursorpaginering op een TikTok-feed: los gebruiker op naar id en secUid, eerste pagina van 30 berichten, mobiele exit-IP, herhaal op cursor terwijl hasMore
De feed geeft je een cursor en een hasMore-vlag; blijf de cursor teruggeven totdat hasMore onwaar wordt.

Waarom onofficiële bibliotheken blijven falen

Als je een populaire open-source TikTok-bibliotheek hebt gebruikt, heb je dit gevoeld: het werkt een tijdje, begint dan CAPTCHAs of lege resultaten te retourneren, en er verschijnt een geforkte patch om het in leven te houden. Die verandering is niet de schuld van de beheerders — TikTok verandert zijn ondertekenings- en anti-botlogica, en elke onofficiële client racet om bij te blijven. Twee lessen volgen. Pin naar een onderhouden fork en verwacht deze bij te werken. En bind de betrouwbaarheid van je datapijplijn niet aan één kwetsbare bibliotheek — het duurzame deel is je eigen parsing- en rotatielaag rond welke ophaalmethode momenteel werkt.

Gescrapete media-URL's verlopen — pak ze snel

Een subtiele valkuil voor iedereen die inhoud archiveert: TikTok's avatar-, omslag- en video-URL's zijn tijd-ondertekend. Ze dragen x-expires en x-signature query-parameters en stoppen met werken binnen enkele uren. Dus een link die je vanmorgen hebt gescrapet, is 's avonds dood. Als je de media zelf nodig hebt, download deze dan in dezelfde run waarin je deze ontdekt; als je alleen metadata nodig hebt, sla de stabiele ID's op en los nieuwe URL's op aanvraag op.

Waarom specifiek mobiele proxies

TikTok is een mobiel-eerst platform met mobiele anti-botverwachtingen, en hier bepaalt de keuze van IP alles. Datacenter-IP's worden snel gemarkeerd. Residentiële IP's zijn veel beter. Maar mobiele proxies zijn de sterkste keuze vanwege hoe carrier-netwerken werken: mobiele operators routeren duizenden echte abonnees via een handvol gedeelde IP's (CGNAT), dus een enkel mobiel IP lijkt op een hele menigte echte gebruikers. Het blokkeren ervan zou betekenen dat echte klanten worden geblokkeerd, wat platforms uiterst terughoudend zijn om te doen — de reden die we behandelen in waarom mobiele IP's zo vertrouwd zijn. Mobiele exits laten je ook geo-specifieke feeds bemonsteren: TikTok stemt trends af per land, dus een UK-exit en een US-exit geven verschillende "For You"-inhoud.

Krijg mobiele proxies voor TikTok-gegevens

TikTok Shop en geo-verschillen

TikTok Shop-productgegevens volgen dezelfde vorm — publieke lijsten, gestructureerde JSON, cursorpaginering — maar beschikbaarheid is sterk geo-geblokkeerd, dus je kunt alleen de catalogus van een regio zien vanaf een exit-IP in die regio. Dit is dezelfde reden waarom TikTok-groeiarbeid leunt op locatie-aangepaste IP's: of je nu Shop-inventaris of trendfeeds leest, de inhoud die je krijgt is een functie van waar je IP zegt dat je bent. Bemonster elke markt vanuit een bijpassende exit en behandel de resultaten als regio-specifiek, niet globaal.

Checklist van wat werkt en wat bijt bij het scrapen van publieke TikTok-gegevens, inclusief verborgen JSON, cursorpaginering, verlopen media-URL's en datacenter-IP-markering
De publieke gegevens zijn allemaal bereikbaar zonder een login — de wrijving is anti-botmarkering, verlopen URL's en de 30-berichtlimiet.

Wanneer de doe-het-zelf-stack over te slaan

Een TikTok-scraper onderhouden betekent het bijhouden van ondertekeningswijzigingen, het omgaan met CAPTCHAs en het babysitten van een fork — een doorlopende belasting, geen eenmalige bouw. Als TikTok-gegevens een invoer zijn voor een product in plaats van het product zelf, neemt een Scraper API die de pagina rendert, mobiele IP's roteert en schone JSON retourneert dat onderhoud van je bord. Run je eigen stack terwijl je de structuur leert kennen; schakel over naar een beheerde ophaallaag wanneer het onderhoud meer begint te kosten dan het inzicht.

Veelgestelde vragen

Kun je TikTok-gegevens scrapen zonder een account?

Ja — publieke profielen, video's, hashtags en hun engagement-metadata zijn leesbaar zonder in te loggen, omdat TikTok ze in een verborgen JSON-blob insluit en ze via interne feed-eindpunten serveert. Je moet nog steeds de numerieke id en secUid van een profiel oplossen voordat je de feed pagineert, en je zult anti-botmarkering tegenkomen zonder schone, roterende IP's.

Waarom krijgt mijn TikTok-scraper CAPTCHAs?

TikTok markeert IP's die zich gedragen als automatisering — te veel verzoeken, datacenter-adresbereiken, of een IP met een slechte reputatie. Cursorpaginering maakt het erger omdat een volledige tijdlijn veel oproepen vanaf één IP zijn. Verspreid verzoeken over een roterende mobiele of residentiële pool, doseer ze, en valideer reacties. Mobiele IP's trekken de minste verdenking omdat ze worden gedeeld door echte abonnees.

Hoeveel TikTok-gegevens kan één verzoek retourneren?

Een enkele feed-aanroep retourneert ongeveer 30 berichten. Om een volledige tijdlijn te verzamelen, moet je herhalen op de cursor die de respons je geeft, deze elke keer teruggeven totdat de hasMore vlag onwaar is. Omdat elke pagina een nieuw verzoek vanaf je IP is, betekenen langere tijdlijnen meer blootstelling — wat de reden is waarom rotatie en dosering belangrijk zijn naarmate het aantal groeit.

Heb ik mobiele proxies nodig voor TikTok?

Niet strikt, maar ze zijn de sterkste optie. Datacenter-IP's worden snel gemarkeerd; residentiële IP's werken beter; mobiele proxies werken het beste omdat carrier CGNAT betekent dat één mobiel IP wordt gedeeld door veel echte gebruikers, dus platforms zijn terughoudend om het te blokkeren. Mobiele exits laten je ook geo-specifieke trend- en Shop-gegevens ophalen door het exit-land te kiezen.

De publieke gegevens van TikTok zijn allemaal bereikbaar zonder een login — het moeilijke deel is bereikbaar blijven. Los beide profiel-ID's op, herhaal de cursor, pak ondertekende media onmiddellijk, en routeer via mobiele IP's zodat je verzoeken eruitzien als de menigte waarin ze zich verbergen. Krijg de IP-laag goed en de rest is gewoon JSON.

Begin met QuantumProxies mobiele proxies