CourionAI
ES
Boletín
← Blog
review 10 min de lectura

Probamos una IA local en un procesador barato de hace seis años. Esto es exactamente lo que pudo hacer.

Dos núcleos de procesador, ninguna tarjeta gráfica y cuatro gigabytes de memoria: ese es el mínimo para ejecutar IA en tu propio ordenador, bastante menos de lo que reconocen muchas guías. Medimos la velocidad, hicimos las mismas pruebas que usamos con todas las herramientas y anotamos cada fallo.

Ilustración en risografía de un portátil antiguo abierto sobre una mesa de cocina, con un cerebro luminoso que emerge de la pantalla y una taza de café al lado

El veredicto de un vistazo

  • Qué es: ejecutar un modelo de IA en tu propio ordenador, sin cuenta, suscripción ni conexión a Internet
  • Qué probamos: Qwen2.5 1.5B Instruct, un pequeño modelo de pesos abiertos, en la versión comprimida Q4_K_M de unos 1,1 GB
  • Quién lo desarrolla: el modelo es de Alibaba y el motor pertenece al proyecto de código abierto llama.cpp
  • En qué equipo: AMD Ryzen 3 3250U, un procesador básico para portátiles de 2020, con dos núcleos disponibles, unos 3,8 GB de memoria y sin tarjeta gráfica dedicada
  • Fecha de la prueba: 25 de julio de 2026, compilación b10107 de llama.cpp
  • Precio: 0 euros, sin cuenta
  • Disponible en la UE: sí, sin registros ni condiciones que comprobar
  • Velocidad: entre 4,8 y 6,9 tokens de salida por segundo, aproximadamente cuatro palabras
  • Lo mejor: reorganizar sin conexión y en privado textos que ya tienes
  • No sirve para: nada que exija datos correctos
  • En una frase: con un equipo tan modesto, la IA local es una herramienta para dar forma al texto, no para obtener conocimiento; dentro de ese límite resulta realmente útil

La mayoría de las guías para ejecutar IA en el propio ordenador empiezan por una tarjeta gráfica que cuesta más que un coche de segunda mano. Con los modelos grandes es razonable. Al mismo tiempo, transmiten de forma implícita a millones de personas con un portátil corriente que esta tecnología no es para ellas.

Nosotros recorrimos el camino contrario. En vez de preguntar por la mejor configuración local, quisimos saber: ¿dónde está el mínimo? ¿Qué ocurre en un ordenador que nadie llamaría estación de trabajo?

La respuesta fue más interesante de lo esperado.

Qué significa realmente «ejecutarlo en local»

Cuando usas ChatGPT o Claude, el texto viaja hasta un centro de datos. Allí, un modelo genera una respuesta y te la devuelve. En local, el archivo del modelo está en tu disco duro y tu propio ordenador realiza el trabajo. Nada sale de la máquina. Funciona incluso en un tren sin cobertura.

El coste de esa autonomía es el tamaño. Un modelo descargado tiene que caber en la memoria, así que los que pueden ejecutarse en casa son mucho más pequeños que los de los centros de datos. Un tamaño menor implica menos conocimientos y peor razonamiento. La pregunta es si lo que queda sigue mereciendo la pena.

Tres avances hacen posible la experiencia en un equipo modesto. La cuantización comprime el modelo, de forma parecida a guardar una foto como un JPEG más pequeño: se pierde algo de detalle, pero el archivo se reduce mucho. Además, los modelos pequeños han mejorado enormemente. Uno con 1.500 millones de parámetros, los números ajustables que aprende durante el entrenamiento, hace hoy cosas que hace dos años exigían diez veces ese tamaño. Por último, llama.cpp, el motor de código abierto que utilizamos, está creado para procesadores corrientes en lugar de costosas tarjetas gráficas. Es el mismo motor que funciona bajo las interfaces sencillas de Ollama, LM Studio y Jan.

Cómo hicimos la prueba

Ejecutamos llama-cli de la compilación b10107 en un contenedor Linux. El archivo qwen2.5-1.5b-instruct-q4_k_m.gguf, descargado de Hugging Face y con un tamaño aproximado de 1,1 GB, utilizó dos hilos de procesador, una ventana de contexto de 512 tokens, la cantidad de texto que el modelo puede tener presente a la vez, y una temperatura de entre 0,2 y 0,3, para generar respuestas más previsibles y menos imaginativas.

Después planteamos cuatro tareas de nuestra batería habitual y anotamos todo lo que devolvió, incluidas las partes que no funcionaron.

Con total claridad sobre lo que no probamos. Controlamos el motor desde la línea de comandos, no mediante Ollama, LM Studio o Jan. Estas aplicaciones añaden una interfaz más amable al mismo motor, por lo que las velocidades deberían ser parecidas, pero no las medimos. Omitimos tres pruebas estándar: los documentos largos y los trabajos de varios pasos necesitan más contexto del que cabe en esta máquina; tampoco ensayamos una segunda lengua europea además del alemán. Cada instrucción se ejecutó una sola vez, de modo que los resultados individuales son indicativos, no promedios. Una última precisión sobre el modelo: Qwen2.5 salió en septiembre de 2024. Lo elegimos por ser el pequeño modelo más replicado y mejor documentado, no por ser el más reciente. Otros más nuevos tienen un límite de conocimientos posterior. Sus cifras de velocidad deberían parecerse a las siguientes, pero quizá no compartan el problema de los conocimientos anticuados.

Las mediciones

Primero, la velocidad, porque determina si todo esto resulta práctico.

  • Lectura de la entrada: entre 11,3 y 12,5 tokens por segundo
  • Escritura de la respuesta: entre 4,8 y 6,9 tokens por segundo
  • Carga del modelo desde el disco: unos 20 segundos la primera vez; después tarda menos mientras el archivo permanezca en memoria

Un token equivale aproximadamente a tres cuartos de palabra, por lo que la salida alcanza entre 3,5 y 5 palabras por segundo. Es un ritmo cercano al de una lectura lenta. Ves aparecer las palabras una tras otra y esperas entre diez y veinte segundos por una respuesta corta.

La memoria fue más que suficiente. El modelo ocupó alrededor de un gigabyte, la máquina tenía casi cuatro y no hubo que trasladar nada al disco.

Lo que hizo bien

Estructuró un texto caótico sin un solo fallo. Le dimos a propósito esta lista de la compra desordenada: milk 1.29 two bottles; bread three euro fifty one loaf; 6 eggs 2,80 EUR, y pedimos una tabla con columnas para producto, precio y cantidad. Esta fue la respuesta:

| Item  | Price (EUR) | Quantity |
|-------|-------------|----------|
| Milk  | 1.29        | 2        |
| Bread | 3.50        | 1        |
| Eggs  | 2.80        | 6        |

Convirtió «three euro fifty» en 3,50, interpretó correctamente la coma decimal de «2,80» y entendió que «6 eggs» era una cantidad de seis, no un precio. Todo en unos segundos y sobre un procesador económico de hace seis años.

Esta es la clase de tarea que funciona: cambiar formatos, extraer, limpiar y convertir. Entra texto y sale mejor organizado, sin que el modelo necesite conocer el mundo.

Reconoció lo que no sabía. Al preguntarle quién era el canciller alemán actual y cuándo habían entrado en vigor las reglas de transparencia de la Ley de IA de la UE, respondió que, según su última actualización de 2023, Olaf Scholz era canciller, pero que no tenía información concreta sobre la segunda fecha. La primera parte está desfasada. La segunda es la buena: que un modelo pequeño admita por iniciativa propia los límites de su conocimiento en vez de inventar una fecha es mejor conducta que la observada en modelos mucho mayores.

La redacción básica funcionó. Produjo en inglés un correo educado para rechazar una reunión, bien estructurado y formateado, con marcadores apropiados entre corchetes para el nombre y el motivo.

Dónde falló

El alemán fue notablemente peor que el inglés. Al pedir una negativa educada en alemán, produjo un texto comprensible pero rígido. Incluía «Absagezeilen», una palabra que nadie emplea, y una frase sobre comprometerse con un proyecto importante que parecía traducida. Para nuestros lectores, esto importa más que cualquier benchmark: al trabajar en alemán, francés o italiano, un pequeño modelo local resulta más torpe que al realizar la misma tarea en inglés. En la prueba alemana, la generación también bajó a 4,8 tokens por segundo, el resultado más lento de los cuatro.

Los borradores son genéricos. El correo era correcto y olvidable. El modelo desconoce tu tono, tu situación y el verdadero motivo por el que rechazas la reunión. Un asistente en la nube de pago y con memoria puede cerrar esa brecha; aquí permanece abierta.

Su conocimiento está anticuado y no hay forma de arreglarlo. El mundo del modelo termina en 2023. No tiene búsqueda web, actualizaciones ni memoria. Para cualquier cuestión actual es la herramienta equivocada, por mucho que se mejore la instrucción.

Esperar forma parte de la experiencia. Veinte segundos para cargar y después cinco palabras por segundo. Para reformatear algo breve es aceptable. En un texto largo notarás cada segundo.

Cuánto cuesta y cómo conseguirlo en Europa

Nada, y ese es el gran titular. Sin suscripciones, cuentas, tarjetas de crédito ni listas de espera. El precio real son 1,1 GB de disco, cerca de un gigabyte de memoria mientras se ejecuta y tu paciencia.

Alibaba publica Qwen2.5 1.5B Instruct con licencia Apache 2.0, que permite el uso comercial. No todos los modelos abiertos ofrecen lo mismo, así que conviene leer la licencia antes de construir un negocio sobre cualquiera de ellos. llama.cpp tiene licencia MIT. Ninguno impone restricciones geográficas: en Europa no hay problemas de disponibilidad ni funciones que lleguen seis meses tarde.

En privacidad, es la posición más sólida posible. Tu texto jamás abandona el ordenador. No hay un proveedor al que enviar una solicitud sobre los datos, condiciones de servicio que leer ni una opción para impedir el entrenamiento escondida en los ajustes, porque no existe ninguna transferencia. Para quien maneje datos de clientes, notas médicas o cualquier material que un delegado europeo de protección de datos quisiera documentar, «procesado en la UE» y «nunca salió de este portátil» no son diferencias menores.

Para quién es y quién debería evitarlo

Merece la pena si tienes un ordenador antiguo sin usar, manejas textos que preferirías no subir a la red, trabajas a veces sin conexión o quieres comprender cómo funciona esta tecnología ejecutando una parte por tu cuenta. También si, sencillamente, te niegas a pagar una cuota mensual por algo que puede hacer una máquina que ya posees.

No es para ti si necesitas datos, información actual o una redacción pulida en una lengua distinta del inglés. Tampoco si esperar te molesta. Y si esperabas sustituir a un asistente de pago, con este tamaño no podrás: afirmar lo contrario solo te haría perder la tarde.

Alternativas

Ollama es la puerta de entrada más sencilla para la mayoría. Un instalador, un comando y ya tienes un modelo en marcha. Debajo funciona el mismo motor, acompañado de una biblioteca desde la que descargar modelos por su nombre.

LM Studio y Jan ofrecen una ventana con un chat en lugar de un terminal, incluyen un explorador de modelos y prescinden por completo de la línea de comandos. Si escribir órdenes te echa para atrás, empieza por uno de ellos.

Un modelo mayor con el mismo planteamiento. Con 16 GB de memoria o una tarjeta gráfica decente, los modelos de entre 7.000 y 12.000 millones de parámetros ofrecen una experiencia distinta: mejor alemán, mejor razonamiento, pero aún gratuitos y privados. Gemma 4 12B es un buen ejemplo de cuánto ha avanzado esta categoría.

Un modelo europeo en la nube cuando el local no basta. En julio de 2026, Mistral procesa por defecto dentro de la UE. Es la segunda mejor respuesta después de «nunca salió de mi portátil».

El veredicto

Esperábamos que una máquina así fracasara, pero no lo hizo. Falló en algunas cosas, en concreto, en conocer datos y escribir buen alemán, y acertó por completo en la tarea cotidiana que de verdad necesita mucha gente: coger un texto desordenado y ponerlo en limpio.

Puede parecer una victoria pequeña. Pero piensa en su precio: nada, para siempre, sin conexión y en un ordenador que quizá estabas a punto de tirar.

Esta es la conclusión honesta. Un pequeño modelo local no es una versión reducida de ChatGPT. Es otra herramienta que comparte una interfaz similar. Juzgado como procesador de textos con un módulo de comprensión del lenguaje, impresiona. Juzgado como asistente, decepciona en cinco minutos.

Prueba realizada el 25 de julio de 2026 con la compilación b10107 de llama.cpp y Qwen2.5 1.5B Instruct Q4_K_M. La IA local evoluciona deprisa y los modelos pequeños mejoran cada pocos meses. Comprueba la fecha del artículo antes de confiar en las cifras.

Fuentes

Siguiente artículo

Quién es quién: Black Forest Labs, el laboratorio alemán que está detrás de Photoshop y Canva

Nació en una ciudad universitaria del sur de Alemania en agosto de 2024, tiene alrededor de cien empleados y sus modelos generan imágenes dentro de Adobe, Canva y Picsart. Así surgió Black Forest Labs, esta es su estructura de propiedad, su forma de ganar dinero y los riesgos a los que se enfrenta.

Ilustración en risografía de varias fotografías impresas dispuestas sin orden sobre un escritorio de madera, con un marco todavía vacío en el centro