1000件以上のレコードを含むYouTubeデータセットのサンプルです。データセットは Bright Data API を使用して抽出されました。
comment_id: 各コメントの一意の識別子comment_text: コメントのテキスト内容likes: コメントが受け取った「いいね」の数replies: コメントへの返信数username: コメント投稿者のユーザー名username_md5: usernameフィールドのMD5ハッシュuser_channel: コメント投稿者のYouTubeチャンネルのURLdate: コメントが投稿された日付url: コメントが投稿されたYouTube動画のWebアドレスvideo_id: YouTube動画の一意の識別子replies_value: 返信値の配列replies_without_names: 関連するユーザー名のない返信
ほかにも多数あります。
これは「YouTube comments」データセットから派生したサンプルサブセットで、当該データセットには 11.1M件以上のレコード が含まれています。
その他の利用可能なYouTubeデータセット:
-
YouTube posts dataset(1.3B件のレコードを含む)
-
YouTube profiles dataset(29.6M件のレコードを含む)
利用可能なデータセットのファイル形式: JSON, NDJSON, JSON Lines, CSV, または Parquet。オプションで、ファイルを .gz に圧縮できます。
データセットの配信タイプのオプション: Email, API download, Webhook, Amazon S3, Google Cloud storage, Google Cloud PubSub, Microsoft Azure, Snowflake, SFTP。
更新頻度: Once, Daily, Weekly, Monthly, Quarterly, または Custom basis。
抽出したデータポイントに追加できるデータエンリッチメント: リクエストに基づきます。
YouTubeの購読者が貴社ブランドについて何を語っているのかに関するインサイトを得られます。YouTube上のコメント、ハッシュタグ、メンション、「いいね」を収集してブランドおよび製品の言及をモニタリングし、ブランドの評判を高め、サービスを改善できます。 YouTubeデータセットを活用して、トレンド動画、人気の形式、ユーザーが最も関与しているコンテンツに関するインサイトを明らかにできます。このデータを活用して、最大限のリーチと視聴者エンゲージメントを実現するように動画コンテンツを最適化できます。 YouTubeデータセットを用いて、YouTubeにおける競合他社のプレゼンスを分析できます。競合のコンテンツや活動に関するデータを収集し、エンゲージメントを生み出しているコンテンツの種類を特定し、YouTuberが自社ブランドやサービスについてどのように語っているかを把握できます。Bright Initiativeでは、さまざまな環境・社会的課題を推進する主要な大学学部および研究者、NGOおよびNPOに対し、Bright Data の Web Scraper APIs と すぐに使えるデータセット へのアクセスを提供しています。申請は こちら から提出できます。
