Nuevos Modelos
2026-08-20
El modelo se inventa sus propias tareas, monta el banco de pruebas para medirlas y luego se entrena con el resultado; y DeepReinforce ha regalado los pesos
DeepReinforce publicó Ornith-1.5 el 19 de agosto en tres tamaños de pesos abiertos: una mezcla de expertos de 397.000 millones de parámetros, otra de 35.000 millones que activa 3.000 millones por token y un modelo denso de 9.000 millones, todos con licencia MIT y los pesos en Hugging Face. Lo interesante no son los tamaños. En lugar de aprender de un conjunto fijo de tareas escritas por personas, el modelo propone las suyas, puntúa cada una por validez, dificultad y novedad, escribe el andamiaje necesario para ejecutarla y genera intentos de solución que realimentan el aprendizaje por refuerzo. El equipo lo describe como cerrar el círculo del autoandamiaje a la automejora. Según las cifras del propio laboratorio, el modelo de 397B obtiene 86,1 en Terminal-Bench 2.1 y 56,0 en DeepSWE, frente a 85,0 y 59,0 de Claude Opus 4.8 y 82,7 y 46,2 de GLM-5.2; en GPQA Diamond declara 92,8. La ventana de contexto es de 262.144 tokens y el modelo completo pesa unos 800 gigabytes en BF16, de modo que abierto no significa aquí que funcione en tu portátil. Eso lo hace la versión de 9B, con 47,0 en Terminal-Bench 2.1 y 70,6 en SWE-bench Verified.
Por qué importaTodos los laboratorios repiten ya que se están acabando los buenos problemas de entrenamiento. Esta es una respuesta: que el modelo escriba el temario. Si funciona, el techo de la capacidad deja de ser cuántos problemas decentes puede redactar un humano y pasa a ser cómo de bien juzga un modelo si el problema que acaba de inventar merece resolverse; un cuello de botella más incómodo, porque un sistema que se califica a sí mismo la dificultad puede derivar hacia problemas difíciles y a la vez inútiles. Conviene recordar además que son cifras de DeepReinforce sobre pruebas elegidas por DeepReinforce, y todavía no hay evaluación independiente. Lo que no admite discusión es la licencia: un modelo con licencia MIT que reclama paridad con un buque insignia en trabajo de agente de terminal es un suelo levantado en público, y quien venda acceso a un modelo cerrado tiene que fijar precio contra eso.
✓ Verificado · 4 fuentes
▶ Vídeo relacionado: Ornith-1.5 Ships 9B Dense, 35B and 397B MoE Models | Models & Agents #Shorts
Léelo en la app — gratis, en 9 idiomas
Noticias relacionadas
Rumor: el modelo anónimo que acaba de encabezar un test de programación, gratis, sería el buque insignia sin publicar de Zhipu
2026-08-21El caballo de batalla barato de DeepSeek ya ve — y en tareas de agente que exigen ojos dice acercarse a lo mejor de Anthropic
2026-08-21Nvidia paga 6.000 millones de dólares por la máquina que fabrica los modelos de un rival — y contrata a 109 de quienes la manejaban
2026-08-21Con cuatro horas y una GPU para mejorar la forma en que se entrena la IA, el mejor agente sacó 0,25 sobre 1 — y la mayoría ni lo intentó
2026-08-21ChatGPT ya puede leer tus iMessages y enviarlos — y el ajuste que le permite dejar de preguntar es justo el que OpenAI advierte
2026-08-21