Hoe Reddit-gegevens te scrapen in 2026: JSON-eindpunten en de limiet van 1.000
Sinds de API van Reddit betaald is geworden, is de goudmijn moeilijker te bereiken — maar het openbare .json-eindpunt werkt nog steeds. Hier is hoe je het kunt doorbladeren, de limiet van 1.000 items kunt omzeilen en op grote schaal kunt verzamelen zonder rate-limiting.
Reddit is een van de rijkste opiniedatasets op het web — echte mensen die discussiëren over producten, tools, merken en nieuws in doorzoekbare communities. Sinds Reddit zijn officiële API naar betaalde prijzen heeft verplaatst in 2023 (wijdverspreid gerapporteerd op $0,24 per 1.000 oproepen, wat apps van derden zoals Apollo heeft stilgelegd), is het verzamelen van die gegevens op grote schaal lastiger geworden. Maar er is een route die de prijsverandering niet heeft afgesloten: het openbare .json-eindpunt dat elke Reddit-pagina ondersteunt. Deze gids behandelt hoe je het kunt doorbladeren, hoe je de limiet van 1.000 items kunt omzeilen en hoe je kunt verzamelen zonder de rate limit te overschrijden.
Voeg .json toe aan elke Reddit-URL
Bijna elke Reddit-URL retourneert gestructureerde JSON als je .json toevoegt. Geen OAuth, geen clientgeheim — gewoon een HTTP GET. Een subreddit-lijst, een post met zijn commentaarstructuur, de geschiedenis van een gebruiker: alles. Begin hier:
import requests
headers = {"User-Agent": "research-script/1.0 by u/yourname"}
proxies = {"http": "http://USER:PASS@gate.quantumproxies.io:8000",
"https": "http://USER:PASS@gate.quantumproxies.io:8000"}
url = "https://www.reddit.com/r/webscraping/new.json?limit=100"
r = requests.get(url, headers=headers, proxies=proxies, timeout=20)
data = r.json()
for child in data["data"]["children"]:
post = child["data"]
print(post["title"], post["ups"], post["num_comments"])
Stel een beschrijvende User-Agent in — Reddit is strenger met generieke. De JSON geeft je direct titel, score (ups), upvote-ratio, aantal reacties, auteur en tijdstempels, dus er hoeft niets uit HTML te worden geparsed.
Paginering met de after-token
Lijstpagina met een cursor, geen paginanummers. Elke respons bevat een after-token (de volledige naam van het laatste item, zoals t3_abc123); geef het terug om de volgende batch te krijgen. Herhaal tot after null terugkomt:
def fetch_listing(subreddit, sort="new", pages=10):
after, out = None, []
for _ in range(pages):
url = f"https://www.reddit.com/r/{subreddit}/{sort}.json?limit=100"
if after:
url += f"&after={after}"
data = requests.get(url, headers=headers, proxies=proxies, timeout=20).json()
out += [c["data"] for c in data["data"]["children"]]
after = data["data"].get("after")
if not after:
break
return out

De limiet van 1.000 items (en hoe je die kunt doorbreken)
Hier is de limiet die mensen verrast: elke Reddit-lijst stopt bij ongeveer 1.000 items. Doorblader de new-feed van een subreddit en na ~1.000 posts raakt de after-token op, ongeacht hoeveel meer posts er zijn. Dit is een platformbrede gedraging, geen scraperfout. Het geldt niet voor reacties binnen een enkele post — je kunt er duizenden ophalen. Om meer dan 1.000 posts uit een community te verzamelen, vermenigvuldig je je weergaven ervan:
- Combineer soorten. Scrape
new, dantop,hotencontroversial. Elk is een ander 1.000-item venster in dezelfde subreddit, en de overlap is gedeeltelijk — samen brengen ze veel meer unieke posts naar voren. - Voeg tijdfilters toe. Op
top, herhaal?t=hour,day,week,month,year,allom verschillende segmenten te onthullen. - Gebruik zoekopdrachten. Zoekwoorden brengen oudere posts naar voren die volledig van de hoofdlijsten zijn verdwenen.
- Voer incrementeel uit. Poll
newvolgens een schema en deduplicateer op post-id, zodat je alles vastlegt voordat het voorbij de 1.000-item venster veroudert.
# combine sorts to break past the 1,000-item cap
seen, posts = set(), []
for sort in ("new", "top", "hot", "controversial"):
for post in fetch_listing("webscraping", sort=sort, pages=10):
if post["id"] not in seen:
seen.add(post["id"])
posts.append(post)
print(f"{len(posts)} unique posts across four sorts")
Rate limits en ononderbroken blijven
Eén IP dat de JSON-eindpunten hard polt, wordt snel vertraagd — Reddit retourneert 429's en blokkeert uiteindelijk. Twee dingen houden een verzameltaak gezond: tempo het (een korte vertraging tussen verzoeken verslaat een uitbarsting die de limiter activeert) en verspreid het over IP's zodat geen enkel adres de hele lading draagt. Routeren via residentiële proxies laat een onderzoeks-crawl eruitzien als veel gewone lezers in plaats van één agressieve client, en een Scraper API regelt die rotatie en pacing voor je. Als je constant 429's tegenkomt, behandelt onze gids over rate limits en backoff de pacing-wiskunde.
Wat ermee te doen: luisteren op grote schaal
De reden om Reddit-gegevens te verzamelen is om te luisteren. Volg vermeldingen van je merk of een concurrent in communities, voer sentiment uit op de commentaarstructuren, houd een niche-subreddit in de gaten voor terugkerende problemen die het waard zijn om rond te bouwen, of spot een trend voordat deze mainstream wordt. Voor alles voorbij trefwoordmatching, verandert het doorvoeren van de ruwe tekst door een LLM-extractiestap rommelige threads in gestructureerde signalen — thema's, klachten, functieverzoeken. Reddit's openbare gegevens zijn vrij spel om te verzamelen, maar het zijn de berichten van mensen; als je van plan bent gebruikersnamen of persoonlijke details te verwerken, is onze overzicht van scraping legaliteit in 2026 de moeite van het lezen waard (informatief, geen juridisch advies).

Verzamel Reddit-gegevens op schone residentiële IP's
Veelgestelde vragen
Kun je nog steeds Reddit scrapen na de API-wijzigingen?
Ja. De officiële API is nu betaald, maar het openbare .json-eindpunt achter elke Reddit-pagina retourneert nog steeds gestructureerde gegevens via een eenvoudige HTTP GET zonder OAuth. Het is rate-limited, dus tempo verzoeken en verspreid ze over IP's, maar voor onderzoeks-schaalverzameling blijft het de meest praktische route. old.reddit.com en RSS-feeds zijn aanvullende lichte bronnen.
Waarom stopt Reddit bij 1.000 posts?
Reddit beperkt elke enkele lijst — een subreddit-soort, de geschiedenis van een gebruiker, een zoekopdracht — tot ongeveer 1.000 items platformbreed; de pagineringscursor stopt gewoon. Het is niet je scraper. Kom er voorbij door soorten te combineren (nieuw, top, hot, controversieel), tijdfilters toe te passen, zoekopdrachten te gebruiken, en incrementele taken uit te voeren die posts vastleggen voordat ze uit het venster verouderen.
Heb ik proxies nodig om Reddit te scrapen?
Voor een handvol verzoeken, nee. Voor voortdurende verzameling wel: een enkel IP dat de JSON-eindpunten hamerend benadert, wordt 429-vertraagd en vervolgens geblokkeerd. Residentiële proxies verspreiden de lading zodat het verkeer leest als veel gewone lezers, en pacing tussen verzoeken houdt je onder de limiter. Samen laten ze een onderzoeks-crawl continu draaien zonder verdedigingen te activeren.
Is het legaal om Reddit te scrapen?
Het verzamelen van openbaar zichtbare pagina's is over het algemeen verdedigbaar, maar de voorwaarden van Reddit beperken geautomatiseerde toegang en de gegevens bevatten door gebruikers gegenereerde inhoud en gebruikersnamen. Houd je aan openbare gegevens, respecteer rate limits, en wees voorzichtig met alles wat individuen identificeert. Dit is algemene informatie, geen juridisch advies — controleer de huidige voorwaarden van Reddit en je jurisdictie voordat je een groot project start.
Het feit dat de API betaald is geworden, heeft de deur niet op slot gedaan — het heeft alleen de hendel verplaatst. Het .json-eindpunt, cursorpaginering, en een strategie voor de limiet van 1.000 items geven je de gegevens; residentiële IP's en beleefd tempo houden de verzameling draaiende. Vanaf daar is het een luisterprobleem, en Reddit is een van de beste signalen waar je het op kunt richten. Als je ook het API-prijsverhaal op de andere platforms wilt, behandelt onze post over X/Twitter-gegevens zonder de API hetzelfde terrein.