CourionAI
ES
Boletín
← Todas las noticias
ai-basics 3 min de lectura

Google convirtió un modelo terminado en uno mucho más rápido y publicó la receta

DiffusionGemma escribe 256 palabras a la vez en lugar de una tras otra, escribe alrededor de 1.500 fichas por segundo y cuesta menos del diez por ciento de una nueva sesión de entrenamiento. El informe técnico explica las compensaciones.

Una cuadrícula de bloques rectangulares borrosos que se encajan en barras alineadas y nítidas a la vez en todo el marco.

Casi todos los chatbots de IA que ha utilizado escriben de la misma manera que escribiría un mensaje de texto: una palabra a la vez, de izquierda a derecha, cada palabra elegida después de la anterior. Google DeepMind ahora ha publicado el informe técnico de DiffusionGemma, un modelo que funciona de manera diferente. Refina bloques enteros de 256 tokens a la vez, de la misma manera que un generador de imágenes extrae una imagen del ruido, y lo hace a aproximadamente 1.500 tokens por segundo en un chip Nvidia H100. Un token, en términos generales, es un fragmento de una palabra, por lo que es un mecanógrafo muy rápido.

Pero el titular del informe no es la velocidad. Es el costo. Google no entrenó esto desde cero. El equipo tomó el modelo Gemma-4-26B-A4B existente y lo convirtió en un modelo de difusión utilizando menos del diez por ciento del presupuesto de formación original. Dos etapas hicieron el trabajo: primero, el modelo aprende a reconstruir bloques de texto deliberadamente ruidosos, luego una fase combinada que Google llama SD-RL combina el aprendizaje por refuerzo, que mejora la calidad de las respuestas, con la destilación de muestras, que le enseña al modelo a arreglárselas con menos pasos de cálculo. Esa combinación elevó las puntuaciones de razonamiento en unos diez puntos en promedio y casi cuadruplicó la cantidad de tokens que produce cada paso de cálculo.

Hay un efecto secundario realmente encantador. Un modelo normal tiene que comprometerse con el primer dígito de una respuesta antes de terminar el razonamiento. El informe muestra a Gemma 4 comenzando una respuesta matemática con “-1”, dándose cuenta a mitad de la derivación de que “-25” es correcta y agregando una corrección. DiffusionGemma desarrolla respuestas y razonamientos en paralelo, por lo que puede corregir silenciosamente el número equivocado antes de que algo sea definitivo. En el Sudoku, donde cada entrada depende de las siguientes, la versión de difusión resuelve cerca del 85 por ciento de los acertijos después de realizar ligeros ajustes. El modelo base fracasa por completo en la tarea.

Ahora las advertencias, porque Google es inusualmente sincero al respecto. La calidad absoluta todavía está por detrás del Gemma 4 autorregresivo original, especialmente en el razonamiento. El modelo a veces se atasca repitiendo palabras individuales, un artefacto de los pasos de cálculo recortados agresivamente. En tareas multimodales, ocasionalmente se olvida de cerrar su sección de razonamiento, lo que reduce las puntuaciones. Y la ventaja de la velocidad se mantiene en gran medida para un solo usuario: una vez que aproximadamente 32 solicitudes llegan al modelo al mismo tiempo, los modelos convencionales alcanzan el rendimiento. Google lo llama una versión experimental, publicada bajo Apache 2.0 en Hugging Face para que otros puedan desarrollarla.

Qué significa esto para ti: Si solo usas un chatbot, nada cambia hoy. Pero este es un buen adelanto de hacia dónde se dirige “rápido y barato”, y la velocidad es lo que la mayoría de la gente realmente nota. Para cualquiera que ejecute modelos, la afirmación interesante es la modernización: es posible que no necesite un nuevo entrenamiento multimillonario para obtener un modelo fundamentalmente diferente, solo una décima parte de uno aplicado a un modelo que ya tiene. Una startup ya está utilizando DiffusionGemma para el reconocimiento de voz multilingüe, que es más o menos el objetivo de exponer las pesas en público.

Fuentes

Fuentes: https://arxiv.org/abs/2608.00146

Siguiente artículo

Los estafadores están inscribiendo a estudiantes que no existen y luego dejando que la IA haga la tarea

Los colegios comunitarios estadounidenses están lidiando con un nuevo tipo de estafa: inscripciones falsas para cobrar ayuda financiera, con chatbots completando silenciosamente los cursos que mantienen el flujo de dinero.

Filas de asientos vacíos en una sala de conferencias con una sola computadora portátil brillando sobre un escritorio desierto