Wie man Reddit-Daten im Jahr 2026 scrapt: JSON-Endpunkte und die 1.000-Grenze
Seit Reddits API kostenpflichtig wurde, ist die Goldgrube schwerer zu erreichen — aber der öffentliche .json-Endpunkt funktioniert noch. Hier erfahren Sie, wie Sie ihn paginieren, die 1.000-Elemente-Grenze überwinden und in großem Maßstab sammeln können, ohne rate-limitiert zu werden.
Reddit ist eines der reichhaltigsten Meinungsdatensätze im Web — echte Menschen diskutieren über Produkte, Tools, Marken und Nachrichten in durchsuchbaren Communities. Seit Reddit seine offizielle API 2023 auf kostenpflichtige Preise umgestellt hat (weit verbreitet bei $0,24 pro 1.000 Anfragen, was Drittanbieter-Apps wie Apollo zum Erliegen brachte), wurde das Sammeln dieser Daten in großem Maßstab komplizierter. Aber es gibt einen Weg, den die Preisänderung nicht geschlossen hat: den öffentlichen .json-Endpunkt, der jede Reddit-Seite unterstützt. Dieser Leitfaden behandelt, wie man ihn paginiert, wie man die 1.000-Elemente-Grenze überwindet und wie man sammelt, ohne das Rate-Limit zu überschreiten.
Fügen Sie .json zu jeder Reddit-URL hinzu
Fast jede Reddit-URL liefert strukturiertes JSON, wenn Sie .json hinzufügen. Kein OAuth, kein Client-Secret — nur ein HTTP GET. Eine Subreddit-Liste, ein Beitrag mit seinem Kommentarbaum, die Historie eines Nutzers: alles. Beginnen Sie hier:
import requests
headers = {"User-Agent": "research-script/1.0 by u/yourname"}
proxies = {"http": "http://USER:PASS@gate.quantumproxies.io:8000",
"https": "http://USER:PASS@gate.quantumproxies.io:8000"}
url = "https://www.reddit.com/r/webscraping/new.json?limit=100"
r = requests.get(url, headers=headers, proxies=proxies, timeout=20)
data = r.json()
for child in data["data"]["children"]:
post = child["data"]
print(post["title"], post["ups"], post["num_comments"])
Setzen Sie einen beschreibenden User-Agent — Reddit ist strenger mit generischen. Das JSON liefert Ihnen Titel, Score (ups), Upvote-Verhältnis, Kommentaranzahl, Autor und Zeitstempel direkt, sodass nichts aus HTML geparst werden muss.
Paginierung mit dem after-Token
Listen-Seite mit einem Cursor, keine Seitennummern. Jede Antwort enthält ein after-Token (den vollständigen Namen des letzten Elements, wie t3_abc123); geben Sie es zurück, um das nächste Paket zu erhalten. Schleife, bis after null zurückkommt:
def fetch_listing(subreddit, sort="new", pages=10):
after, out = None, []
for _ in range(pages):
url = f"https://www.reddit.com/r/{subreddit}/{sort}.json?limit=100"
if after:
url += f"&after={after}"
data = requests.get(url, headers=headers, proxies=proxies, timeout=20).json()
out += [c["data"] for c in data["data"]["children"]]
after = data["data"].get("after")
if not after:
break
return out

Die 1.000-Elemente-Grenze (und wie man sie durchbricht)
Hier ist das Limit, das viele überrascht: Jede Reddit-Liste stoppt bei etwa 1.000 Elementen. Paginieren Sie den new-Feed eines Subreddits und nach ~1.000 Beiträgen versiegt das after-Token, egal wie viele weitere Beiträge existieren. Dies ist ein plattformweites Verhalten, kein Scraper-Fehler. Es gilt nicht für Kommentare innerhalb eines einzelnen Beitrags — davon können Sie Tausende abrufen. Um mehr als 1.000 Beiträge aus einer Community zu sammeln, multiplizieren Sie Ihre Ansichten davon:
- Kombinieren Sie Sortierungen. Scrapen Sie
new, danntop,hotundcontroversial. Jede ist ein anderes 1.000-Elemente-Fenster in dasselbe Subreddit, und die Überschneidung ist teilweise — zusammen bringen sie weit mehr einzigartige Beiträge ans Licht. - Fügen Sie Zeitfilter hinzu. Bei
topiterieren Sie?t=hour,day,week,month,year,all, um verschiedene Ausschnitte zu enthüllen. - Verwenden Sie die Suche. Stichwortsuchen bringen ältere Beiträge ans Licht, die komplett aus den Hauptlisten gefallen sind.
- Führen Sie inkrementell aus. Polling von
newnach einem Zeitplan und Deduplizieren nach Post-ID, sodass Sie alles erfassen, bevor es aus dem 1.000-Elemente-Fenster herausaltert.
# combine sorts to break past the 1,000-item cap
seen, posts = set(), []
for sort in ("new", "top", "hot", "controversial"):
for post in fetch_listing("webscraping", sort=sort, pages=10):
if post["id"] not in seen:
seen.add(post["id"])
posts.append(post)
print(f"{len(posts)} unique posts across four sorts")
Rate-Limits und ununterbrochen bleiben
Eine IP, die die JSON-Endpunkte stark abfragt, wird schnell gedrosselt — Reddit gibt 429 zurück und blockiert schließlich. Zwei Dinge halten einen Sammeljob gesund: das Tempo einhalten (eine kurze Verzögerung zwischen Anfragen schlägt einen Schub, der den Limiter auslöst) und es über IPs verteilen, sodass keine einzelne Adresse die gesamte Last trägt. Das Routing über residential proxies lässt einen Forschungscrawl wie viele gewöhnliche Leser aussehen, anstatt wie ein aggressiver Client, und eine Scraper API übernimmt diese Rotation und das Tempo für Sie. Wenn Sie ständig 429 erhalten, deckt unser Leitfaden zu Rate-Limits und Backoff die Tempo-Mathematik ab.
Was damit tun: Zuhören im großen Maßstab
Der Grund, Reddit-Daten zu sammeln, ist zuzuhören. Verfolgen Sie Erwähnungen Ihrer Marke oder eines Konkurrenten in Communities, führen Sie Sentiment-Analysen in den Kommentarbäumen durch, beobachten Sie ein Nischen-Subreddit auf wiederkehrende Probleme, die es wert sind, darauf aufzubauen, oder entdecken Sie einen Trend, bevor er den Mainstream erreicht. Für alles, was über die Stichwortsuche hinausgeht, verwandelt ein LLM-Extraktionsschritt den Rohtext in strukturierte Signale — Themen, Beschwerden, Funktionsanfragen. Reddits öffentliche Daten sind fair zu sammeln, aber es sind die Beiträge von Menschen; wenn Sie planen, Benutzernamen oder persönliche Details zu verarbeiten, ist unser Überblick über die Legalität des Web-Scrapings im Jahr 2026 einen Blick wert (informativ, keine Rechtsberatung).

Sammeln Sie Reddit-Daten über saubere Residential-IPs
Häufig gestellte Fragen
Kann man nach den API-Änderungen noch Reddit scrapen?
Ja. Die offizielle API ist jetzt kostenpflichtig, aber der öffentliche .json-Endpunkt hinter jeder Reddit-Seite liefert immer noch strukturierte Daten über einen einfachen HTTP GET ohne OAuth. Es ist rate-limitiert, also Anfragen einteilen und über IPs verteilen, aber für eine Sammlung im Forschungsausmaß bleibt es der praktischste Weg. old.reddit.com und RSS-Feeds sind zusätzliche leichte Quellen.
Warum stoppt Reddit bei 1.000 Beiträgen?
Reddit begrenzt jede einzelne Liste — eine Subreddit-Sortierung, die Historie eines Nutzers, eine Suche — auf etwa 1.000 Elemente plattformweit; der Paginierungscursor stoppt einfach. Es ist nicht Ihr Scraper. Überwinden Sie es, indem Sie Sortierungen kombinieren (new, top, hot, controversial), Zeitfilter anwenden, die Suche verwenden und inkrementelle Jobs ausführen, die Beiträge erfassen, bevor sie aus dem Fenster altern.
Brauche ich Proxies, um Reddit zu scrapen?
Für ein paar Anfragen, nein. Für eine dauerhafte Sammlung schon: Eine einzelne IP, die die JSON-Endpunkte hämmert, wird 429-gedrosselt und dann blockiert. Residential Proxies verteilen die Last, sodass der Traffic wie viele gewöhnliche Leser aussieht, und das Einhalten des Tempos zwischen Anfragen hält Sie unter dem Limiter. Zusammen ermöglichen sie es einem Forschungscrawl, kontinuierlich zu laufen, ohne die Abwehrmechanismen auszulösen.
Ist das Scrapen von Reddit legal?
Das Sammeln öffentlich sichtbarer Seiten ist im Allgemeinen vertretbar, aber Reddits Bedingungen schränken den automatisierten Zugriff ein und die Daten enthalten nutzergenerierte Inhalte und Benutzernamen. Halten Sie sich an öffentliche Daten, respektieren Sie Rate-Limits und seien Sie vorsichtig mit allem, was Einzelpersonen identifiziert. Dies sind allgemeine Informationen, keine Rechtsberatung — überprüfen Sie Reddits aktuelle Bedingungen und Ihre Gerichtsbarkeit, bevor Sie ein großes Projekt starten.
Dass die API kostenpflichtig wurde, hat die Tür nicht verschlossen — sie hat nur den Griff verlegt. Der .json-Endpunkt, die Cursor-Paginierung und eine Strategie für die 1.000-Elemente-Grenze bringen Ihnen die Daten; Residential-IPs und höfliches Tempo halten die Sammlung am Laufen. Von dort aus ist es ein Zuhörproblem, und Reddit ist eines der besten Signale, auf das Sie es richten können. Wenn Sie auch die API-Preise auf den anderen Plattformen wissen möchten, beschreibt unser Beitrag zu X/Twitter-Daten ohne die API dasselbe Terrain.