Ollama mejora discretamente los Mac para ejecutar modelos abiertos
La versión 0.32.4 incorpora Laguna en las GPU de Apple mediante MLX, una cuantización mixta más inteligente para modelos de mezcla de expertos y una corrección para la decodificación de los MoE Qwen3. Cambios modestos que deciden si la IA local resulta práctica.
Mientras la atención de la semana se centraba en el lanzamiento de un modelo de 1,4 terabytes, la herramienta que la mayoría utiliza de verdad para ejecutar IA en su propio equipo publicó cambios más relevantes para el día a día. Ollama 0.32.4 añade compatibilidad con los modelos Laguna de Poolside, en concreto las variantes XS 2, XS 2.1 y S 2.1, en las GPU de Apple mediante MLX, el marco de aprendizaje automático creado por Apple para sus chips.
El resto de las notas de la versión parece fontanería técnica, y precisamente ahí está lo importante. La actualización modifica la cuantización de los modelos de mezcla de expertos. Cuantizar consiste en guardar los valores de un modelo con menor precisión para reducir la memoria que ocupa, como si una foto se almacenara en un JPEG más pequeño. Si se aplica sin cuidado, baja la calidad; si se hace de forma selectiva, conserva casi toda la calidad y consigue gran parte del ahorro. Ollama ahora lee la configuración del modelo original y aplica una política coherente tanto a las capas densas como a los expertos activados por enrutamiento. Mantiene a plena precisión el enrutador y el cabezal de salida vinculado, cuantiza la atención y las proyecciones de los expertos y devuelve selectivamente a mayor precisión las proyecciones descendentes más sensibles. También corrige la decodificación de los modelos Qwen3 MoE cuyos expertos se habían cuantizado de manera distinta y mejora entre un 4% y un 9% el rendimiento de las proyecciones de compuerta y ascendentes empaquetadas en un M5 Max.
Este trabajo poco vistoso es el que decide si la IA local funciona de verdad. Al ejecutar un modelo en un portátil, el límite casi nunca es la inteligencia, sino la memoria. La diferencia entre que un modelo quepa en la RAM o no puede significar dos segundos o dos minutos por respuesta, o que llegue a funcionar. Cada mejora en la forma de comprimirlo con cuidado traslada toda una clase de modelos del segundo grupo al primero. La mezcla de expertos importa especialmente porque ya es una arquitectura habitual en la gama alta y siempre ha sido difícil de cuantizar bien. El enrutador que decide qué experto se ocupa de cada parte es diminuto, pero muy sensible a la pérdida de precisión; tratarlo como una capa cualquiera estropea el modelo.
Qué significa esto para ti: Si nunca has ejecutado un modelo en local, la versión breve es que puedes hacerlo, que es gratis y que nada de lo que escribes sale de tu ordenador. Un Mac actual con 16 GB o más es una máquina razonable para empezar. Ollama solo exige una instalación y un comando. Si ya utilizas modelos locales en Apple silicon, merece la pena actualizar: Laguna en MLX es una incorporación real y los cambios de cuantización MoE pueden permitirte cargar un modelo que antes no cabía. En Windows o Linux con una tarjeta Nvidia, las novedades de MLX no se aplican, pero la corrección de Qwen3 sí. En cualquier caso, este progreso constante y poco emocionante amplía silenciosamente lo que puede ejecutar el equipo que ya tienes.
Fuentes
Fuentes: https://github.com/ollama/ollama/releases/tag/v0.32.4
OpenAI analiza 800.000 conversaciones de trabajo y descubre que muchos invaden tareas de otras profesiones
Un nuevo estudio de OpenAI afirma que el 43,5% del uso profesional especializado de ChatGPT corresponde a tareas propias de otra profesión. Marketing resuelve problemas de código, ventas analiza sus datos y las pequeñas empresas lo hacen más que nadie.