Un modelo de 125 mil millones de parámetros en una tarjeta gráfica ordinaria
Tim Dettmers presentó una vista previa de la semana de código abierto de su laboratorio: un marco de inferencia que ejecuta Qwen 3.8 Flash Next en una sola GPU de 24 GB, DeepSeek V4.1 en una MacBook y una técnica de compactación que, según él, reduce a la mitad los costos de los agentes.
Tim Dettmers, el investigador detrás de la ampliamente utilizada biblioteca de cuantificación bitsandbytes, publicó el lunes un adelanto de lo que su laboratorio universitario lanzará esta semana: dos proyectos de código abierto y cuatro artículos, enviados deliberadamente juntos. Los números que contiene son del tipo que cambian lo que es posible en el hardware que la gente ya posee. Su marco de inferencia ejecuta Qwen 3.8 Flash Next, un modelo de 125 mil millones de parámetros, en una sola tarjeta gráfica de 24 GB, del tipo que se encuentra en una computadora de escritorio normal. Con una máquina AMD Strix, una Nvidia DGX Spark o una MacBook con 128 GB de memoria, dice que se puede ejecutar DeepSeek V4.1 con 550 mil millones de parámetros. En Mac, un modelo Qwen 3.6 35B funciona a 450 tokens por segundo a 1,5 bits por peso.
Esa última cifra merece ser analizada. Cada parámetro de un modelo es un número, normalmente almacenado en 16 bits de memoria. La cuantificación comprime esos números en menos bits y, con 1,5 bits, un modelo necesita aproximadamente una décima parte de la memoria que necesitaría de otro modo. El oficio es la precisión, por lo que es difícil hacerlo sin arruinar la calidad de la producción y por eso el nombre de Dettmers está asociado a gran parte de este trabajo. La otra pieza es CliffCompaction, una técnica de compactación automática que su laboratorio ha utilizado internamente durante meses. La compactación es la forma en que un agente sigue trabajando después de que su conversación se hubiera desbordado: resume lo sucedido para poder continuar. Dice que las sesiones se ejecutan por millones de tokens, algunos de sus últimos cien millones, y que esto reduce el costo a aproximadamente la mitad. Una empresa asociada midió una reducción del 45 por ciento en su presupuesto total de IA.
¿Qué hay detrás de esto?
Dettmers enmarca todo el comunicado como un argumento de que la investigación en IA no pertenece sólo a quien posee la mayor cantidad de GPU, y que los pequeños laboratorios universitarios tienen una ventaja precisamente porque deben trabajar en problemas que son baratos de atacar. Es una buena idea, y la afirmación técnica más interesante que hay debajo es que el techo de la IA local no han sido los modelos. Los pesos abiertos lo suficientemente buenos como para ser útiles se pueden descargar desde hace algún tiempo. El obstáculo ha sido que un modelo de 125 mil millones de parámetros no cabría en una máquina normal, por lo que la mayoría de la gente utilizó modelos pequeños y concluyó que la IA local era decepcionante.
La justa advertencia: estas son afirmaciones preliminares de una publicación de blog, el código llegará en los próximos días y nadie fuera del laboratorio ha reproducido nada de él. Los resultados de la cuantificación en particular tienden a verse mejor en los puntos de referencia elegidos para demostrarlos que en su propio trabajo.
Qué significa esto para usted: Si alguna vez le ha resultado atractivo ejecutar modelos en su propia máquina, por motivos de privacidad, costo o trabajo sin conexión, esta es la semana para volver a mirar, porque es posible que los límites de tamaño que recuerda ya no se apliquen. Para todos los demás, el número relevante es el de costo. Si una técnica de compactación puede reducir a la mitad lo que gasta un agente y el método es público, no seguirá siendo una curiosidad de investigación por mucho tiempo. Los agentes más baratos son el mecanismo por el que todo esto llega a los productos ordinarios.
Fuentes
Fuentes: https://timdettmers.com/2026/09/21/dlab-open-source-week/
Una falla de Mac permite que cualquier aplicación redirija lo que usted le dicta al Asistente de Meta
El investigador de seguridad Patrick Wardle reveló un día cero en Muse de Meta para Mac: una configuración no documentada que cualquier proceso local puede cambiar, enviando indicaciones dictadas al servidor de un atacante y exponiendo el token de la cuenta.