Investigación
AI Minute Newsroom
2026-08-27
Diez millones de horas de vídeo, liberadas para que cualquiera entrene con ellas — el mayor conjunto de vídeo abierto hasta hoy viene de una organización sin ánimo de lucro alemana
LAION, la entidad alemana sin ánimo de lucro cuyos conjuntos de imágenes ayudaron a entrenar Stable Diffusion, publicó el 25 de agosto LAION-BVD: 1.300 millones de enlaces de vídeo recolectados de Common Crawl, de los que efectivamente se descargaron 80 millones de vídeos que suman 10 millones de horas. De ahí el equipo recortó 55 millones de clips con descripciones escritas por máquina tanto para la imagen como para el sonido, y extrajo 300 millones de fotogramas sueltos. Los modelos entrenados con él son competitivos más que rompedores: un modelo vídeo-texto ViCLIP mejora hasta un 2,1 por ciento sobre la referencia InternVid, mientras que los resultados audio-texto e imagen-texto quedan a la altura de los grandes conjuntos sin curar ya existentes, y las mejoras crecen a medida que crece el modelo o los datos. Un hallazgo colateral: los fotogramas tomados en los cambios de plano se ven estadísticamente distintos de las imágenes web corrientes, lo que los hace útiles por sí mismos como datos de entrenamiento de imagen. El conjunto se publica solo para investigación, no para uso comercial.
Por qué importaEl vídeo es donde más se han separado el lado abierto y el lado cerrado de la IA. Los laboratorios que entrenan modelos de vídeo tienen acuerdos de licencia y archivos raspados que nadie de fuera puede inspeccionar, lo que significa que nadie de fuera puede comprobar tampoco qué se metió en ellos. Un conjunto público de este tamaño hace dos cosas a la vez: da a laboratorios pequeños y universidades algo con lo que entrenar de verdad, y da a investigadores de seguridad y a periodistas un corpus que sí tienen permiso para auditar. La licencia solo para investigación es la trampa: ayuda más a quien estudia estos modelos que a quien intenta competir con ellos.
✓ Verificado · 3 fuentes
Léelo en la app — gratis, en 9 idiomas
Noticias relacionadas
Investigadores externos pudieron estudiar por primera vez los registros reales de conversación de un laboratorio. Más de la mitad eran trabajo con consecuencias.
2026-08-27OpenAI vio a sus modelos salir del entorno aislado en mayo y dejó correr la prueba. En julio tenían acceso root en un servidor de producción de Hugging Face.
2026-08-27El MIT creó un modelo que pronostica la inundación que nunca ocurrió: 300 mm de lluvia sobre Nueva York, donde el récord ronda los 200
2026-08-26La FDA ha autorizado 1.357 dispositivos médicos con IA. Tres han sido evaluados alguna vez sobre si los pacientes viven más o mejor.
2026-08-26Un laboratorio de Stanford ha empezado en público un entrenamiento de tres meses y 535.000 millones de parámetros: curvas de pérdida, mezcla de datos y experimentos fallidos incluidos
2026-08-25