Un modelo de difusión ahora escribe 1.100 palabras por segundo y no cuesta casi nada
Inception Labs lanzó Mercury 2.5, un modelo de lenguaje creado de la misma manera que los generadores de imágenes en lugar de ChatGPT. Produce 1.107 tokens por segundo en tarjetas Nvidia ordinarias a 20 centavos por millón de tokens de entrada.
Inception Labs lanzó Mercury 2.5 el lunes y el número que todos citan es 1.107 tokens por segundo. Los tokens son pequeños fragmentos de texto que un modelo lee y escribe, aproximadamente tres cuartos de palabra cada uno, por lo que son alrededor de 800 palabras por segundo provenientes de un solo modelo en hardware Nvidia ampliamente disponible. A modo de comparación, la mayoría de los modelos de chat que utiliza hoy en día se sienten rápidos, con entre 50 y 150 tokens por segundo.
La compañía dice que Mercury 2.5 es aproximadamente un 40 por ciento más capaz que Mercury 2 en sus medidas internas, y que aterriza en la misma banda de calidad que los niveles baratos y rápidos de los grandes laboratorios: GPT-5.6 Luna en su configuración baja, Gemini 3.5 Flash-Lite, Claude Haiku 4.5. Se entrega con una ventana de contexto de 260 000 tokens, que es la cantidad de texto que el modelo puede tener en mente a la vez, además de un esfuerzo de razonamiento ajustable, llamadas a herramientas paralelas y una salida JSON que sigue un esquema que usted define. El precio estándar es de 0,20 dólares por millón de tokens de entrada y 0,75 por millón de salida, con un descuento de lanzamiento del 80 por ciento que los reduce a 0,04 y 0,15. Inception también afirma que el tiempo hasta el primer token es inferior a 170 ms para los canales de voz, que es el retraso antes de que regrese la primera palabra.
¿Qué hay detrás de esto?
Casi todos los modelos de lenguaje que ha utilizado funcionan de izquierda a derecha. Escribe una ficha, mira todo lo que ha escrito y luego escribe la siguiente. Esa secuencia es la razón por la que la generación tiene un límite de velocidad: el modelo literalmente no puede iniciar el token 200 antes de que exista el token 199.
Un modelo de lenguaje de difusión funciona de la misma manera que funcionan los generadores de imágenes como Stable Diffusion. Comienza con un borrador burdo y ruidoso de toda la respuesta y luego la refina en pasadas, afinando muchas fichas al mismo tiempo. Debido a que el refinamiento ocurre en paralelo, la misma GPU produce mucho más texto por segundo. Históricamente, la compensación ha sido la calidad, ya que un modelo que adopta una forma aproximada desde el principio tiene más dificultades con largas cadenas de razonamiento cuidadoso. Mercury 2.5 es el argumento de Inception de que la brecha se ha cerrado lo suficiente como para importar en el trabajo diario y, según sus propias palabras, es el modelo de lenguaje de mayor difusión que nadie haya entrenado. Esta afirmación aún no ha sido verificada de forma independiente, lo cual vale la pena tener en cuenta.
Qué significa esto para ti: Si simplemente tienes curiosidad acerca de la IA, nada cambia hoy, pero es útil saber esto: la velocidad y el precio no son propiedades fijas de la IA, dependen de cómo se construye el modelo, y alguien acaba de encontrar un atajo. Si construye cosas, el caso interesante es cualquier cosa en la que la espera sea el problema en lugar de la brillantez: autocompletar en un editor, un asistente de voz que tiene que responder antes de que la pausa se vuelva incómoda, limpieza masiva de unos pocos miles de documentos. Con un descuento de lanzamiento de 15 centavos por millón de tokens de salida durante el descuento de lanzamiento, los trabajos que eran demasiado costosos para ejecutarlos en un archivo completo de repente ya no lo son. Una advertencia justa: realice su propia comparación antes de cambiar algo importante, porque “comparable al nivel económico de un modelo fronterizo” es una afirmación del proveedor, no un veredicto del campo.
Fuentes
Fuentes: https://www.inceptionlabs.ai/blog/introducing-mercury-2-5
Meta deja de calificar a los ingenieros según la cantidad de IA que utilizan
Después de que el personal compitiera entre sí en una tabla de clasificación de tokens interna, Meta les dijo a los ingenieros que los paneles de uso de IA y los recuentos de tokens ya no contarán en las revisiones de desempeño. El episodio ya tiene nombre: tokenmaxxing.