APIの制限を超えてYouTubeコメントとデータをスクレイピングする方法
YouTube Data APIは1日10,000クォーターユニットを提供しますが、本格的なコメント調査では数時間でそれを使い果たします。ここではクォーターの計算方法と、公開データをスクレイピングして壁を回避する方法を紹介します。
YouTubeのコメントは、インターネット上で最も大きな未フィルターの公開意見のプールの一つです。製品、クリエイター、トレンドについてのあなたのオーディエンスが使う正確な言葉です。公式のYouTube Data APIはそれを読み取ることができますが、大量の調査のために作られたものではありません。多くの動画にわたってyoutubeコメントをスクレイピングするとすぐにクォーターの壁にぶつかります。このガイドではクォーターの計算方法、公開データをスクレイピングしてそれを超える方法、そしてブロックされずに行う方法を紹介します。
あなたを止めるクォーターの計算
Data APIは、キーごとに10,000クォーターユニットの厳しい日次制限を課しています。単一のcommentThreads.list呼び出しは1ユニットを消費しますが、返信スレッド、ページネーション、動画ごとの検索を加えると寛大に聞こえます。APIは20から100のコメントをページごとに返すため、数千のコメントがある動画は多くのページネーションされた呼び出しが必要で、ネストされた返信は別のエンドポイントに存在します。それ以前に、Google Cloudプロジェクト、APIクレデンシャル、OAuth同意の設定が必要で、データゼロのために15から30分のセットアップが必要です。重い調査は数時間で上限に達し、太平洋標準時の真夜中にクォーターがリセットされるまで待つことになります。

スクレイピングが壁を超える方法
公開フロントエンドをスクレイピングすることで、クォーターを完全に回避します。キーもOAuthもプロジェクトごとの上限もなく、動画のIDを解決し、ページ自体が使用するコメントページネーションレイヤーを歩き、結果をフラットなテーブルに正規化します。制限されるのはあなた自身のインフラストラクチャであり、Googleの予算ではありません。トレードオフとして、公開データのみ(非公開または未リストの動画、ライブチャットの再生は公開されていません)であり、ペースとクリーンなIPを自分で管理する責任があります。研究、分析、またはビジネスインテリジェンスのために公開コメントをスクレイピングすることは一般的に許容されていると見なされます。必要ない場合は著者の身元を匿名化してください。
コメントスクレイピングの仕組み
使用するツールに関係なくメカニズムは同じです: URLを動画IDに解決し、最初のページのコメントをリクエストし、次のページへの継続トークンを追跡し、コメントがなくなるまで繰り返します。返信は各トップレベルコメントからネストされたスレッドとしてぶら下がっています。YouTubeはコメントを静的HTMLではなくJSON継続APIを通じて提供するため、ヘッドレスブラウザを駆動するか継続エンドポイントを直接呼び出します。どちらも機能しますが、後者は大量の場合ははるかに安価です。
抽出可能なフィールド
完全なコメントレコードは単なるテキスト以上のシグナルを持ちます:
- コメントテキスト — 改行や絵文字を含む全文。
- 著者名とチャンネルURL — フォローアップや重複排除のため。
- 公開タイムスタンプ — ISO 8601形式で、時系列でソートしたり、新しさを測定したりできます。
- いいね数と返信数 — コミュニティの合意と議論の深さによって感情を重み付けします。
- スレッドのネスト — 行がトップレベルのコメントか返信か、親を含めて、会話を再構築できるようにします。
- 著者の確認 — 確認済みアカウントのフラグと、コメント投稿者が動画の作成者かどうか。
コメントはクライアント側で読み込まれるため、ウォッチページの生のHTTPフェッチはしばしば空のシェルを返します。リクエストを住宅プロキシを通じてルートし、継続呼び出しのために地理を一貫させて、YouTubeがクロール全体で同じ地域バリアントを提供するようにします。
import requests
proxy = "http://USER:PASS@gate.quantumproxies.io:8000"
proxies = {"http": proxy, "https": proxy}
# Fetch the watch page (or continuation JSON) through a clean residential exit
r = requests.get(
"https://www.youtube.com/watch?v=VIDEO_ID",
proxies=proxies,
timeout=20,
headers={"Accept-Language": "en-US,en;q=0.9"},
)
print(r.status_code) # extract the continuation token, then page the comments

YouTubeページをレンダリングし、APIを介してコメントを取得する
スクレイピングされたコメントで人々が作るもの
データはYouTubeを離れると価値を持ちます。チームは構造化されたコメントをNLPパイプラインにフィードして感情分析を行い、オーディエンスが使用する正確な表現を抽出し(広告コピーやランディングページに直接)、モデルのトレーニングと微調整のためにラベル付きデータセットを構築し、競合他社のインテリジェンスを実行してライバルのオーディエンスが称賛し、批判している内容を読み取ります。同じリーチは他のプラットフォームにも拡張されます — モバイルファーストのバリアントについてはTikTokの公開データに関するノートをご覧ください。
ここでプロキシが重要な理由
コメントスクレイピングはその性質上高ボリュームです — 単一の人気動画は数百のページネーションされたリクエストであり、チャンネルは数千です。それをすべて1つのIPから送信すると、YouTubeはすぐに制限をかけます。回転する住宅IPは負荷を分散し、単一のアドレスが乱用と見なされないようにし、一貫した地域の出口は長いクロール全体で提供されるコンテンツを安定させます。InstagramやXからも収集している場合、同じインフラストラクチャがプラットフォーム全体でソーシャルメディアの自動化をカバーします。
コメント以外: トランスクリプトとトレンド
コメントは最も大きなシグナルですが、収集する価値のある唯一のものではありません。公開動画のトランスクリプト — 自動生成またはアップロードされたキャプション — は、クリエイターが実際に言ったことの密度の高い検索可能な記録であり、キーワードリサーチ、コンテンツ分析、検索データセットの構築に最適です。それらはプレーヤーが使用するのと同じタイムドテキストエンドポイントの背後にあり、Data APIなしでアクセス可能です。トレンドと検索結果ページは第3のレイヤーを追加します: ある地域で今どのトピックが急上昇しているか、ランキングが市場ごとにどのように異なるかです。これらの3つの表面がすべて地理に敏感であるため、一貫した地域の出口は全体像を一貫させます — 米国のIPは米国のトレンドを見、ドイツのIPはドイツのトレンドを見ます。コメント、トランスクリプト、トレンドシグナルを一緒に収集すると、単一のメトリックのスナップショットではなく、本物のオーディエンスリサーチのための生の素材が得られます。
よくある質問
YouTubeコメントを無料でスクレイピングするにはどうすればよいですか?
一度限りの動画の場合、ブラウザ拡張機能や無料のウェブツールで最初の数百のコメントをCSVにエクスポートできます。スケールで何かを行う場合 — 多くの動画、完全なスレッド、繰り返し実行 — 自分のパイプラインが必要です: 動画IDを解決し、コメント継続APIをページングし、スロットリングを避けるために回転IPを通じてルートします。APIの10,000ユニットの日次制限により、大量の無料公式アクセスは実行不可能です。
YouTubeコメントをスクレイピングすることは合法ですか?
研究、学術分析、またはビジネスインテリジェンスのために公開されているコメントを収集することは、一般的に許容されていると見なされます。データが公開されており、非公開ではないためです。これは法的なアドバイスではありません。公開動画に留まり、合理的なペースを守り、必要ない場合は著者の身元を匿名化してください — 特に共有または公開する予定のデータセットの場合。
APIなしでYouTubeコメントをスクレイピングできますか?
はい。ウォッチページはキーやOAuthなしで直接呼び出すことができる継続APIを通じてコメントを読み込みます。これにより、10,000ユニットのクォーターを完全に回避できます。問題は、ペースとIPの衛生を自分で管理することです — 単一のアドレスからの高リクエストボリュームはスロットリングされるため、スケールでは回転する住宅プロキシが事実上必要です。
YouTubeコメントをどれだけスクレイピングできますか?
公式APIを通じて、10,000の日次ユニットに制限されます — コメントが多い数百の動画でその日の作業は終了です。スクレイピングを通じて、キーごとの上限はありません。実際の制限はプロキシプールとペースです。数万のコメントがある人気動画は、十分な回転IPと時間があれば完全に収集可能です。
YouTube Data APIは軽い統合には適していますが、調査には不向きです — 10,000ユニットの上限は、徹底的なコメント収集を意図したものではありません。公開フロントエンドをスクレイピングすることでクォーターを取り除きますが、その代わりにペースとIPの衛生問題が発生します。それをクリーンな回転プールで解決すれば、実際に必要なスケールで収集できます。