曾以图像数据集助力训练Stable Diffusion的德国非营利机构LAION于8月25日发布了LAION-BVD:从Common Crawl中收集的13亿条视频链接,其中实际下载了8000万段视频、合计1000万小时。团队从中切出5500万个片段,并为画面和声音分别生成机器撰写的字幕,还提取了3亿帧单独画面。用它训练出的模型属于有竞争力而非破纪录:ViCLIP视频-文本模型相对InternVid基线最多提升2.1%,音频-文本和图像-文本结果则与现有的大型未筛选数据集持平——且数据或模型规模越大,提升越明显。一个附带发现是:取自场景切换处的帧在统计上与普通网络图片不同,这使它们本身就可作为图像训练数据。该数据集仅限研究用途发布,不可商用。