CourionAI
ES
Boletín
← Todas las noticias
local-ai 3 min de lectura

KoboldCpp 1.120 agrega una nueva forma de cargar modelos y soporte para los abiertos más nuevos

Un lanzamiento tranquilo del sábado para una de las formas más sencillas de ejecutar modelos de IA en su propia computadora. Lo nuevo en esta versión: un modo de carga DirectIO, soporte desde el primer día para Qwen3.8-Flash-Next y Ling-3.0-flash, y herramientas JavaScript personalizadas.

Una torre de computadora de escritorio con el frente abierto y una cinta ancha que ingresa directamente desde un carrete en el piso.

KoboldCpp, una de las formas más sencillas de ejecutar un modelo de IA en su propia máquina, lanzó la versión 1.120 el sábado. Si nunca lo ha usado: es un único archivo descargable, sin instalador ni entorno Python con el que lidiar, que carga un modelo abierto desde el disco y le brinda una ventana de chat en su navegador. Este comunicado es pequeño pero útil y es una buena excusa para explicar un par de cosas que suenan intimidantes y no lo son.

La adición principal es un modo de carga del modelo DirectIO, activado con --usedirectio. Cargar un modelo significa copiar varios gigabytes de su disco a la memoria antes de que suceda algo y, de forma predeterminada, el sistema operativo intenta ser inteligente al almacenar en caché esos bytes a lo largo del camino. DirectIO omite esa capa intermedia y lee directamente desde la unidad, lo que en muchos sistemas significa un inicio más rápido y menos memoria desperdiciada en un caché que no necesita. Relacionado: ahora se pueden combinar mlock y mmap, dos opciones más antiguas que controlan si el modelo se fija en la memoria o se asigna de forma diferida desde el disco. El lanzamiento también agrega soporte desde el primer día para dos nuevos modelos abiertos, Qwen3.8-Flash-Next y Ling-3.0-flash de Alibaba, y el responsable agrega una advertencia que vale la pena repetir: hay malas cuantificaciones de estos flotando, así que tome los archivos de una fuente de confianza. Para completarlo, se encuentran herramientas JavaScript personalizadas configurables por el usuario en la interfaz integrada de Kobold Lite, compatibles con el formato de llamada de herramientas estándar, además de correcciones de generación de imágenes y las fusiones habituales desde llama.cpp ascendente.

Qué está pasando realmente aquí: lanzamientos como este son la mitad poco glamorosa de la IA local e importan más que los anuncios de modelos. Un nuevo modelo abierto sólo es útil una vez que algo en su computadora realmente puede cargarlo, y la brecha entre “pesos publicados en Hugging Face” y “ejecuciones en una computadora portátil normal” se llena con proyectos como este, llama.cpp debajo, y las personas que crean versiones cuantificadas. La cuantificación, si esa es una palabra nueva, es el truco de almacenar los números de un modelo con menor precisión para que quepa en menos memoria, con un pequeño costo en calidad. Obtener soporte desde el primer día para un modelo lanzado tres días antes es el tipo de cosa que decide silenciosamente si las pesos abiertos son una alternativa real o simplemente un comunicado de prensa.

Qué significa esto para usted: si ha sentido curiosidad por ejecutar un modelo localmente, este es un punto de partida realmente de bajo compromiso. Descargue un archivo para su sistema, tome un modelo cuantificado y tendrá un asistente privado que funciona sin conexión y no cuesta nada por mensaje. No coincidirá con un modelo de vanguardia de un gran laboratorio, y debería esperarse que sea más lento y menos capaz, pero para redactar, resumir y preguntar cosas que preferiría no enviar al servidor de nadie, suele ser suficiente. Si ya usa KoboldCpp, la razón práctica para actualizar son los dos nuevos modelos y, en máquinas con discos rápidos y poca memoria, la bandera DirectIO. Todos los demás pueden ignorarlo felizmente y esperar el próximo lanzamiento.

Fuentes

Fuentes: https://github.com/LostRuins/koboldcpp/releases/tag/v1.120

Siguiente artículo

Viernes sin IA: propuesta de un desarrollador para apagar el asistente una vez por semana

El creador de htmx, Carson Gross, publicó un manifiesto de una página pidiendo a los equipos que codificaran sin asistentes de inteligencia artificial un día a la semana. Llegó a la cima de Hacker News y el argumento es fácil de tomar prestado incluso si nunca escribes código.

Una cuadrícula de calendario con una columna arrancada y un cable de alimentación desconectado que se aleja del espacio.