CourionAI
ES
Boletín
← Todas las noticias
open-models 3 min de lectura

Un entrenamiento de 500 dólares permite a un modelo 9B superar a los modelos punteros en una tarea rutinaria

La consultora Fermisense especializó un pequeño modelo abierto en la revisión de catálogos de comercio electrónico mediante aprendizaje por refuerzo. Logró un 87,3%, frente al 76,9% de la mejor configuración puntera, con un coste por ficha unas 68 veces menor.

Ilustración risográfica de un pequeño pájaro cantor que, en un plato de una balanza, pesa más que seis grandes esferas de piedra situadas en el otro

Un informe publicado el lunes por la consultora Fermisense, que enseguida recibió numerosos votos en Hacker News, presenta un resultado que parece demasiado bueno hasta que se examina el planteamiento. En una única tarea muy acotada, un modelo de código abierto con 9.000 millones de parámetros superó a todos los modelos punteros probados, incluidos GPT-5.6 Sol, Gemini 3.1 Pro y Claude Fable 5. El entrenamiento duró unos tres días y medio en dos GPU alquiladas y costó alrededor de 500 dólares.

La tarea consiste en revisar catálogos: observar la foto, el título y la descripción de un producto de comercio electrónico, asignarlo a la categoría correcta entre unas 13.000, extraer los atributos que alimentan la búsqueda y los filtros y decidir si incumple alguna norma. Fermisense reprodujo ese flujo de trabajo como lo que denomina un gemelo digital, una simulación del puesto real con las mismas herramientas y consecuencias. Para ello creó 177.767 episodios de revisión a partir del conjunto público Amazon Berkeley Objects e introdujo infracciones de forma deliberada. Como cada episodio tiene una respuesta correcta conocida, un sistema de puntuación puede evaluar cada decisión y penalizar siete veces más una infracción no detectada que una falsa alarma. Esa evaluación hace posible el aprendizaje por refuerzo: el modelo prueba, recibe una nota y se ajusta.

Los resultados: la mejor configuración puntera alcanzó el 76,9% de la puntuación posible, incluso con 2.800 caracteres de instrucciones cuidadosamente optimizadas en el prompt. El modelo 9B entrenado llegó al 87,3%, desde un 64,2% antes del entrenamiento. Superó al grupo de modelos punteros tras unos 250 pasos, aproximadamente un día. El coste por cada 1.000 fichas fue de unos 0,50 dólares, frente a 19 dólares para la opción puntera más barata y 172 para la más cara. Hay un detalle que explica especialmente bien todo el resultado: aquellas instrucciones optimizadas encarecían entre un 28% y un 55% los tokens de entrada en todas y cada una de las llamadas, para siempre. El conocimiento incluido en un prompt se alquila en cada llamada. El conocimiento aprendido se compra una vez y queda en los pesos.

¿Por qué puede ganar un modelo pequeño? Porque la tarea no es difícil, sino específica. Ante cada ficha, un modelo generalista empieza desde cero: no conoce la taxonomía de la tienda ni los valores admitidos para cada atributo y tiene que reconstruirlo todo a partir del prompt. Fermisense explica con claridad dónde deja de funcionar el método. El proceso debe repetirse lo suficiente para que el coste sea relevante y el resultado tiene que poder comprobarse mediante una regla o una rúbrica. Si una decisión solo admite debate, no puede puntuarse; y sin puntuación, el modelo no tiene un criterio con el que practicar. También conviene recordar que Fermisense vende consultoría precisamente sobre esto y que el banco de pruebas es suyo. Los otros ocho despliegues citados, desde Bridgewater hasta Intercom y LinkedIn, se basan igualmente en cifras facilitadas por cada empresa.

Qué significa esto para ti: Si ves la IA como algo que alquilas a tres empresas estadounidenses, este es un contraejemplo útil. El rumbo puede llevarnos hacia especialistas baratos, no hacia un único cerebro gigantesco para todo. Eso sí, no es un proyecto de fin de semana: hizo falta un entorno simulado, una rúbrica de evaluación y auténtico trabajo de ingeniería. Si tu empresa toma miles de veces al día una decisión repetitiva cuya respuesta correcta se puede comprobar, la primera pregunta no tiene por qué ser si debes ajustar un modelo. Pregúntate antes si estás pagando precios de modelo puntero por un trabajo que no requiere capacidades de primera línea.

Fuentes

Fuentes: https://fermisense.com/when-machines-take-the-wheel/

Siguiente artículo

Un tribunal indio considera el entrenamiento de IA «uso privado»: los editores deben leer la letra pequeña

El Tribunal Superior de Delhi denegó a la agencia ANI una medida cautelar contra OpenAI. A su juicio, almacenar artículos protegidos para entrenar ChatGPT probablemente entra en una excepción de uso legítimo. Es una resolución provisional, no una sentencia firme.

Ilustración risográfica de una balanza sobre un escritorio que pesa un fajo de periódicos frente a una pila de tarjetas perforadas en blanco, con un sello sin usar al lado