Nachrichtenscraping in großem Maßstab: Google News, RSS & Aktualität
Die Überwachung von Nachrichten bricht an drei vorhersehbaren Stellen: JavaScript-gerenderte Suche, Paginierungsgrenzen und IP-bezogene Ratenlimits. Hier ist die Pipeline, die alle drei übersteht — Google News, RSS, Duplikaterkennung und ein Aktualitäts-SLA.
Nachrichtenüberwachung klingt wie ein gelöstes Problem, bis Sie versuchen, es stündlich über tausend Verlage hinweg zu betreiben. Dann tauchen dieselben drei Hürden auf, die ein bekannter Scrapy-und-Selenium-Leitfaden vor Jahren traf: Die benötigten Suchergebnisse werden in JavaScript gerendert und kommen bei einer einfachen HTTP-Anfrage leer zurück, die Paginierung ist begrenzt, sodass Sie nur die ersten hundert Ergebnisse pro Abfrage abrufen können, und jeder Verlag begrenzt die Rate pro IP, sodass ein einzelner Crawler nach ein paar hundert Anfragen ins Stocken gerät. Eine Medienüberwachungspipeline, die in großem Maßstab überlebt, ist kein cleverer Scraper — es ist ein geschichtetes System aus Entdeckung, Extraktion, Duplikaterkennung und Aktualität. Dieser Leitfaden baut dieses System mit Google News, RSS und sauberer Artikelauszug auf und markiert, wo die ethische Grenze liegt.
Entdeckung: RSS und das Google News-Vertikal
Sie können nicht überwachen, was Sie nicht finden können, und das Crawlen jeder Verlags-Homepage ist verschwenderisch. Zwei Entdeckungskanäle übernehmen die Hauptarbeit. RSS-Feeds sind die günstigsten und saubersten — von Verlagen genehmigt, bereits strukturiert und trivial zu pollen — aber die Abdeckung ist lückenhaft und die Historie ist flach. Das Google News-Vertikal füllt die Lücken: Es zeigt Geschichten nach Thema und Land an, mit Quelle, Zeitstempel und Ausschnitt bereits analysiert. Anstatt die News-Oberfläche selbst zu scrapen, fragen Sie sie über die SERP API ab, die das Vertikal als JSON zurückgibt, ohne HTML-Parsing und ohne Blockierung auf Ihrer Seite:
curl -G "https://api.quantumproxies.io/serp" \
--data-urlencode "engine=google_news" \
--data-urlencode "q=semiconductor export controls" \
--data-urlencode "gl=us" \
--data-urlencode "hl=en" \
-H "Authorization: Bearer YOUR_API_KEY"
Die gleiche Abfrage mit unterschiedlichen gl-Ländercodes auszuführen, ist der Weg, um regionale Berichterstattung über eine Geschichte zu erfassen — eine Technik, die wichtig ist, weil dasselbe Ereignis in verschiedenen Märkten unterschiedlich dargestellt wird. Für die Mechanik, warum News und andere Vertikale naives Scraping widerstehen, siehe wie SERP-Scraping 2026 funktioniert.
Extraktion: wenn der Artikel zurückschlägt
Entdeckung gibt Ihnen URLs; Extraktion gibt Ihnen den Artikel. Viele Nachrichtenseiten liefern immer noch sauberes serverseitig gerendertes HTML, und für diese reicht eine einfache Anfrage über eine rotierende IP. Aber große Medienhäuser rendern zunehmend den Artikel — oder zumindest die Such- und Archivseiten — clientseitig, sodass ein roher Abruf eine leere Hülle zurückgibt. Das ist genau der Fehlermodus, der in leere Seite, fehlende Daten behandelt wird. Anstatt eine Flotte von Headless-Browsern zu betreiben, überlassen Sie das Rendering der Scraper API, die die Seite ausführt und sauberes Markdown zur Indizierung zurückgibt:
import requests
def fetch_article(url, api_key):
r = requests.get(
"https://api.quantumproxies.io/scrape",
params={"url": url, "render": "auto", "output": "markdown"},
headers={"Authorization": f"Bearer {api_key}"},
timeout=(5, 40),
)
r.raise_for_status()
return r.json() # { title, byline, published, markdown, canonical }
Das IP-bezogene Limit, das Setups mit einem einzigen Crawler ausbremst, verschwindet hier, da Anfragen automatisch über einen rotierenden Wohnpool verteilt werden. Wenn Sie Ihren eigenen Crawler betreiben, budgetieren Sie die Parallelität pro Domain statt global — die Begründung finden Sie in Ratenlimits entmystifiziert.

Normalisierung und Duplikaterkennung
Die unordentliche Realität von Nachrichten aus mehreren Quellen ist, dass dieselbe Geschichte viele Male in inkompatiblen Formen ankommt. Daten erscheinen als 24. März 2021, vor 2 Stunden und ISO-Zeitstempel im selben Batch; Byline-Formate variieren; und Agenturmeldungen von Associated Press oder Reuters werden wortwörtlich auf Dutzenden von Seiten nachgedruckt. Zwei Normalisierungsschritte zähmen dies:
- Jedes Datum in UTC parsen. Relative Zeichenfolgen wie 'gestern' und 'vor 3 Tagen' müssen gegen die Abrufzeit aufgelöst werden, sonst bricht Ihre Aktualitätslogik stillschweigend.
- Duplikaterkennung nach kanonischer URL, dann nach Inhalts-Hash. Das
<link rel="canonical">-Tag reduziert Varianten einer URL mit Tracking-Parametern; ein Hash des normalisierten Textes erfasst syndizierte Agenturmeldungen, die unter verschiedenen URLs leben. - Eine Quellkarte behalten. Speichern Sie, welche Medien eine Geschichte gebracht haben, anstatt Duplikate zu verwerfen — 'von 40 Medien aufgegriffen' ist selbst ein Signal in der Medienüberwachung.
Aktualitäts-SLAs und Zeitplanung
Medienüberwachung wird an der Latenz gemessen: Eine Erwähnung, die sechs Stunden zu spät gefunden wird, ist für Reputations- oder Handelszwecke wertlos. Anstatt alles nach einem Zeitplan zu crawlen, staffeln Sie Ihre Abfragen. Heiße Themen und Eilmeldungen werden alle paar Minuten erneut abgefragt; der lange Schwanz routinemäßiger Schlüsselwörter läuft stündlich oder täglich. Behandeln Sie jede Stufe als Aktualitäts-SLA und alarmieren Sie, wenn eine Quelle es verpasst — der Unterschied zwischen einer Demo und einer Produktion ist genau diese Überwachungsschicht, die wir in Scraper als Produktionssoftware betreiben behandeln.
Die Paywall-Grenze
Einige der wertvollsten Berichterstattungen befinden sich hinter Abonnements, und hier trifft Überwachung auf Ethik. Das Sammeln von Schlagzeilen, Ausschnitten, Veröffentlichungsdaten und öffentlichen Artikelkörpern ist gewöhnliche Medienüberwachung. Das Umgehen einer Paywall, um den vollständigen Text eines Artikels zu erhalten, für den Sie nicht bezahlt haben, ist ein anderer Akt mit Urheberrechts- und Nutzungsbedingungen-Konsequenzen. Der dauerhafte Ansatz besteht darin, das öffentlich bereitgestellte zu indizieren — Schlagzeile, Dek, Ausschnitt, Metadaten — und auf die Quelle für den vollständigen Artikel zu verlinken oder Feeds von Verlagen zu lizenzieren, die sie verkaufen. Dies ist eine informative Anleitung, keine Rechtsberatung; für alles in großem Maßstab bestätigen Sie Ihren Ansatz mit einem Anwalt.

Häufig gestellte Fragen
Wie scrape ich Google News in großem Maßstab?
Fragen Sie das Google News-Vertikal über eine SERP API ab, anstatt die Oberfläche direkt zu scrapen. Sie geben eine Themenabfrage plus gl- und hl-Parameter für Land und Sprache ein und erhalten Quellen, Zeitstempel und Ausschnitte als JSON zurück. Dies vermeidet das JavaScript-Rendering und die IP-Blockierung, die selbstgebaute News-Scraper brechen, und das Ausführen der Abfrage über Ländercodes erfasst die regionale Berichterstattung derselben Geschichte.
Gibt es eine kostenlose Nachrichten-API zum Scrapen von Artikeln?
RSS-Feeds sind das Nächstliegende zu einem kostenlosen, von Verlagen genehmigten Nachrichtenfeed und sollten Ihr erster Entdeckungskanal sein. Sie sind strukturiert und günstig zu pollen, aber die Abdeckung ist unvollständig und die Historie ist flach. Für eine breite, aktuelle Abdeckung über Tausende von Medien hinweg kombinieren Sie RSS mit einer SERP-basierten Nachrichtensuche und direkter Artikelauszug, da keine einzelne kostenlose Quelle die gesamte Medienlandschaft abdeckt.
Warum gibt mein Nachrichtenscraper eine leere Seite zurück?
Die Seite rendert ihren Inhalt — oft speziell die Such- und Archivseiten — mit JavaScript, sodass eine einfache HTTP-Anfrage eine leere HTML-Hülle erhält, bevor die Skripte ausgeführt werden. Entweder rendern Sie die Seite mit einem browserbasierten oder Rendering-Scraper-API, oder finden Sie den zugrunde liegenden JSON-Endpunkt, den die Seite aufruft. Ein leeres Ergebnis bedeutet fast immer clientseitiges Rendering statt eines Netzwerkfehlers.
Wie dedupliziere ich Nachrichtenartikel?
Deduplizieren Sie in zwei Durchgängen: Zuerst URL-Varianten mithilfe des kanonischen Link-Tags der Seite zusammenfassen, um Kopien mit Tracking-Parametern zu entfernen, dann den normalisierten Artikelkörper hashen, um syndizierte Agenturmeldungen zu erfassen, die unter verschiedenen URLs nachgedruckt werden. Behalten Sie eine Karte, welche Medien jede Geschichte gebracht haben, anstatt Duplikate vollständig zu löschen — in der Medienüberwachung ist die Verbreitung einer Geschichte über Medien ein Kernmetriken.
Nachrichten in großem Maßstab sind kein Scraping-Problem, sondern ein Pipeline-Problem. Teilen Sie Entdeckung, Extraktion, Normalisierung und Aktualität in isolierte Phasen auf, stützen Sie sich auf das Google News-Vertikal und RSS für die Abdeckung und lassen Sie rotierende IPs und eine Rendering-API das JavaScript und die Ratenlimits absorbieren, die Einzel-Crawler-Bauten versenken. Tun Sie das, und eine Layoutänderung bringt nie das gesamte System zum Erliegen.