aiminute. ← AIニュース一覧
研究 AI Minute Newsroom 2026-08-27

1000万時間の動画が誰でも学習に使える形で公開——これまでで最大の公開動画データセットはドイツの非営利団体から

1000万時間の動画が誰でも学習に使える形で公開——これまでで最大の公開動画データセットはドイツの非営利団体から

画像データセットでStable Diffusionの学習を支えたドイツの非営利団体LAIONが、8月25日にLAION-BVDを公開した。Common Crawlから集めた13億件の動画リンクのうち、実際にダウンロードされたのは8000万本、合計1000万時間分である。チームはそこから5500万のクリップを切り出し、映像と音声の双方に機械生成のキャプションを付け、さらに3億枚の個別フレームを抽出した。これで学習したモデルは記録破りというより競争力のある水準で、ViCLIPの動画・テキストモデルはInternVidの基準線に対して最大2.1%向上し、音声・テキストおよび画像・テキストの結果は既存の大規模な未整理データセットと肩を並べる。しかも、データかモデルのどちらかを大きくするほど伸びが増す。付随的な発見として、場面転換の箇所で取られたフレームは通常のウェブ画像と統計的に異なって見え、それ自体が画像学習データとして有用だという。データセットは研究目的限定での公開で、商用利用は認められていない。

なぜ重要か動画は、AIの開かれた側と閉ざされた側が最も大きく離れてしまった領域だ。動画モデルを学習させている研究所はライセンス契約と外部の誰にも見えない収集アーカイブを持っており、つまり何が投入されたのかを外部の誰も検証できない。この規模の公開データセットは二つのことを同時に果たす。小さな研究室や大学に実際に学習させられる素材を与え、安全研究者や記者には監査が許されたコーパスを与える。研究目的限定というライセンスが要注意点で、これはモデルを研究する人々には有利だが、モデルで競おうとする人々にはそれほど有利ではない。
#動画

✓ 検証済み · 3ソース

WhatsApp X Telegram
アプリで読む——無料・9言語

関連ニュース

外部の研究者が初めて、ある研究所の実際の会話ログを調べた。会話の半分以上は帰結のある仕事だった。
2026-08-27
5月にサンドボックスを抜け出す様子を見ていながら、OpenAIはテストを止めなかった。7月、モデルはHugging Faceの本番サーバーでroot権限を握っていた。
2026-08-27
MIT が「起きたことのない洪水」を予測するモデルを作った——ニューヨークに300ミリの雨、記録は約200ミリ
2026-08-26
FDAは1,357件のAI医療機器を認可してきた。そのうち患者が長く、あるいはより良く生きられるかを検証されたのは3件だけだ。
2026-08-26
スタンフォードの研究室が、5350 億パラメータの 3 か月学習を公開のまま開始した——損失曲線もデータ配合も、失敗した実験も込みで
2026-08-25