Un modelo de 80 mil millones de parámetros ahora se ejecuta en una Mac normal con 4,3 GB de memoria y uno de 35 mil millones de parámetros se ejecuta en un iPhone.
Swiftlet es un tiempo de ejecución abierto que transmite los pesos expertos de un modelo desde el SSD en lugar de cargarlos en la memoria. Un modelo Qwen con 80 mil millones de parámetros alcanza un máximo de 4,3 GB de RAM en una Mac. La desventaja es la velocidad y una descarga grande.
Un desarrollador ha publicado Swiftlet, un motor de ejecución de código abierto que ejecuta modelos abiertos de gran tamaño en hardware normal de Apple al negarse a cargar la mayor parte del modelo en la memoria. Los titulares: Qwen3-Next-80B, un modelo con 80 mil millones de parámetros, ocupa 42 GB en disco pero alcanza un máximo de 4,3 GB de RAM en una Mac M5, lo que produce alrededor de 5 palabras de texto por segundo. Un Qwen de 35 mil millones de parámetros se ejecuta en un iPhone 17 en aproximadamente 2,5 GB. El código tiene licencia Apache 2.0.
El truco es la arquitectura del modelo. Estos modelos Qwen son lo que se llama un mixture of experts, lo que significa que el modelo se divide en cientos de subredes especializadas y sólo unas pocas se utilizan para una palabra determinada. El modelo 80B enruta cada token a 10 de sus 512 expertos, por lo que solo alrededor de 3 mil millones de parámetros funcionan a la vez. Swiftlet mantiene ese pequeño núcleo permanentemente activo en la memoria, aproximadamente 2,5 GB, y recupera a los expertos individuales del SSD exactamente cuando son necesarios. Los empaqueta en un tamaño fijo para que un experto equivalga a una lectura de disco y almacena en caché los más populares. Los SSD de Apple son lo suficientemente rápidos como para que los fallos apenas duelan.
Qué hay detrás de esto. Durante dos años, la regla general para ejecutar IA localmente era simple: el modelo tiene que caber en la memoria, por lo que un modelo 70B significaba una máquina costosa. La transmisión de expertos rompe silenciosamente esa regla para una familia específica de modelos. No es una idea nueva, el autor atribuye el crédito a proyectos anteriores TurboFieldfare y ANEMLL, pero esta es la primera versión enviada como una biblioteca, una herramienta de línea de comandos, un servidor local compatible con OpenAI y una aplicación para iPhone terminada. El autor también establece la limitación honesta desde el principio, y es la frase más útil de todo el archivo Léame: debido a que sólo hay unos 3B de parámetros activos por token, estos modelos “conversan y escriben como modelos grandes pero recuerdan hechos como los pequeños”. El tamaño en el disco no es conocimiento en el bolsillo.
Qué significa esto para ti: si tienes una Apple Silicon Mac y has sentido curiosidad por ejecutar IA en tu propia máquina, sin enviar nada a un servidor, esto reduce considerablemente el listón del hardware. Haga un presupuesto del espacio en disco, 18 GB para el 35B y 42 GB para el 80B, y espere velocidad de lectura en lugar de respuestas instantáneas. En iPhone, el 35B actualmente maneja aproximadamente una palabra por segundo, lo cual es más una demostración que una herramienta diaria. Si no se toca, lo que se puede sacar de esto es direccional: la brecha entre lo que ejecuta un centro de datos y lo que ejecuta su computadora portátil se sigue estrechando, y la IA local amigable con la privacidad es cada vez más difícil de descartar como un pasatiempo.
Fuentes
Un récord de ocho ganadores y finalistas del Pulitzer revelaron que usaron IA, y para qué la usaron es la parte interesante.
Ocho ganadores del Pulitzer declararon el uso de IA este año, la mayor cantidad desde que la divulgación se hizo obligatoria en 2024. En casi todos los casos, la herramienta se utilizó para buscar o traducir grandes pilas de documentos, no para escribir.