aiminute. ← Alle KI-News
Forschung AI Minute Newsroom 2026-08-27

Zehn Millionen Stunden Video, freigegeben für jeden, der damit trainieren will — der bislang größte offene Videodatensatz kommt von einem deutschen gemeinnützigen Verein

Zehn Millionen Stunden Video, freigegeben für jeden, der damit trainieren will — der bislang größte offene Videodatensatz kommt von einem deutschen gemeinnützigen Verein

LAION, der deutsche gemeinnützige Verein, dessen Bilddatensätze beim Training von Stable Diffusion halfen, hat am 25. August LAION-BVD veröffentlicht: 1,3 Milliarden aus Common Crawl geerntete Video-Links, von denen tatsächlich 80 Millionen Videos mit insgesamt 10 Millionen Stunden heruntergeladen wurden. Daraus schnitt das Team 55 Millionen Clips mit maschinell geschriebenen Beschreibungen für Bild und Ton und zog 300 Millionen einzelne Frames heraus. Die damit trainierten Modelle sind konkurrenzfähig statt rekordverdächtig: Ein ViCLIP-Video-Text-Modell legt gegenüber der InternVid-Basislinie um bis zu 2,1 Prozent zu, während die Audio-Text- und Bild-Text-Ergebnisse auf Höhe bestehender großer, ungefilterter Datensätze liegen — und die Zugewinne wachsen, je größer Daten oder Modell werden. Ein Nebenbefund: Frames, die an Szenenwechseln entnommen wurden, sehen statistisch anders aus als gewöhnliche Webbilder, was sie für sich genommen als Bildtrainingsdaten nützlich macht. Der Datensatz erscheint ausschließlich für Forschungszwecke, nicht für kommerzielle Nutzung.

Warum es wichtig istVideo ist der Bereich, in dem die offene und die geschlossene Seite der KI am weitesten auseinandergedriftet sind. Die Labore, die Videomodelle trainieren, verfügen über Lizenzverträge und abgegriffene Archive, die von außen niemand einsehen kann — also kann von außen auch niemand prüfen, was hineingeflossen ist. Ein öffentlicher Datensatz dieser Größe leistet zweierlei zugleich: Er gibt kleinen Laboren und Universitäten etwas, womit sie tatsächlich trainieren können, und er gibt Sicherheitsforschern und Journalisten ein Korpus, das sie prüfen dürfen. Die Lizenz nur für Forschung ist der Haken — sie hilft denen, die diese Modelle untersuchen, mehr als denen, die mit ihnen konkurrieren wollen.
#Video

✓ Verifiziert · 3 Quellen

WhatsApp X Telegram
In der App lesen — kostenlos, 9 Sprachen

Verwandte Meldungen

Externe Forscher durften erstmals die echten Chatprotokolle eines Labors auswerten. Mehr als die Hälfte der Gespräche war folgenreiche Arbeit.
2026-08-27
OpenAI sah im Mai zu, wie seine Modelle aus der Sandbox kletterten, und ließ den Test weiterlaufen. Im Juli hatten sie Root-Rechte auf einem Produktionsserver von Hugging Face.
2026-08-27
MIT baut ein Modell, das die Flut vorhersagt, die es nie gab — 300 Millimeter Regen über New York, wo der Rekord bei rund 200 liegt
2026-08-26
Die FDA hat 1.357 KI-Medizinprodukte zugelassen. Drei davon wurden je daraufhin geprüft, ob Patientinnen und Patienten länger oder besser leben.
2026-08-26
Ein Stanford-Labor hat einen dreimonatigen Trainingslauf mit 535 Milliarden Parametern öffentlich begonnen — Verlustkurven, Datenmischung und gescheiterte Experimente inklusive
2026-08-25