Investigación
2026-08-10
Google cogió un modelo de lenguaje corriente y le enseñó a escribir 256 palabras de golpe, por menos de una décima parte del coste original de entrenamiento
DiffusionGemma es un modelo experimental de pesos abiertos de Google DeepMind que no genera texto token a token. Refina bloques de 256 tokens en paralelo, como un modelo de difusión de imagen que nitidiza el cuadro entero a la vez, produciendo unos veinte tokens por pasada y alrededor de 1.500 tokens de salida por segundo en una sola Nvidia H100. El informe técnico, atribuido a un equipo de 43 autores y depositado en arXiv el 31 de julio, plantea una afirmación más estrecha y más útil que la cifra de velocidad. Los modelos de lenguaje por difusión se han tratado hasta ahora como un linaje aparte que hay que entrenar desde cero, y por eso casi nadie tiene uno. Google no entrenó desde cero: tomó Gemma 4, un modelo de mezcla de expertos con 25.200 millones de parámetros totales y 3.800 millones activos, y lo convirtió —primero ajuste fino supervisado para reconstruir bloques de texto corrompidos, después una fase que combina aprendizaje por refuerzo y destilación del muestreador— empleando menos del diez por ciento de los tokens con los que se entrenó el modelo original. El modelo convertido conserva el modo de razonamiento, la entrada multimodal y el contexto largo, y el informe sostiene que supera en velocidad de generación a los modelos autorregresivos incluso cuando estos usan decodificación especulativa de última generación. Los pesos están en Hugging Face bajo Apache 2.0. La ventaja de velocidad se estrecha en cuanto un servidor atiende unas 32 peticiones simultáneas, que es el régimen en el que viven de verdad casi todos los despliegues en producción.
Por qué importaCasi todos los modelos de lenguaje que ha usado funcionan de izquierda a derecha y no pueden revisar una palabra una vez comprometida: el modelo que escribió una oración inicial equivocada debe pasar el resto de la frase conviviendo con ella. La decodificación por difusión elimina esa restricción: el bloque se escribe y se reescribe antes de que usted vea nada, de modo que el modelo puede corregir sus propios errores tempranos. La razón de que esto siguiera siendo una curiosidad es el coste. Nadie gasta un entrenamiento de frontera en una arquitectura que quizá no compense. Lo que muestra este informe es que la apuesta ya es barata: se puede convertir un modelo que ya se tiene por menos de una décima parte de lo que costó construirlo, lo que pone el experimento al alcance de cualquier laboratorio con pesos abiertos decentes, y hay muchos. El límite honesto está en la letra pequeña. La ventaja de velocidad encoge bajo carga real de servidor, así que hoy resulta más interesante allí donde importa la latencia de un solo usuario: asistentes en el dispositivo, autocompletado de código, cualquier situación en la que una persona esté esperando a que aparezcan las palabras.
✓ Verificado · 2 fuentes
Léelo en la app — gratis, en 9 idiomas
Noticias relacionadas
El aprendizaje automático leyó la forma de células cerebrales enfermas y eligió nueve fármacos ya aprobados que las calmaron
2026-08-21Con cuatro horas y una GPU para mejorar la forma en que se entrena la IA, el mejor agente sacó 0,25 sobre 1 — y la mayoría ni lo intentó
2026-08-21El agente se inventó a una segunda persona para avalar su código. Un joven de 24 años en Texas no creyó a ninguno de los dos.
2026-08-21Pew pasó medio millón de páginas web por un detector: un tercio de todo lo publicado desde ChatGPT lleva sus marcas
2026-08-21La FDA ha autorizado 1.357 dispositivos médicos con IA. Tres se han evaluado según si los pacientes viven más o mejor.
2026-08-20