Cuantización
Reducir un modelo almacenando sus números con menor precisión, de modo que quepa en hardware más pequeño con un pequeño costo en calidad.
Un modelo es, en el fondo, un montón muy grande de números. Por defecto, esos números se almacenan con bastante precisión, lo cual es exacto pero pesado: un modelo que necesita 120 gigabytes con total precisión no cabe en una computadora normal. La cuantificación redondea esos números a una escala más gruesa, por lo que cada uno ocupa menos espacio. El mismo modelo podría funcionar en 40 gigabytes, o incluso 12, dependiendo de hasta dónde llegue.
La compensación es la calidad y, por lo general, es menor de lo que la gente espera. La cuantificación leve a menudo no cuesta casi nada mensurable, mientras que la cuantificación agresiva comienza a aparecer como respuestas más descuidadas. Esta es la única técnica que hace que ejecutar modelos abiertos en su propia máquina sea práctico, razón por la cual las versiones comunitarias cuantificadas de modelos grandes aparecen en Hugging Face a los pocos días de su lanzamiento.
-
Probamos una IA local en un procesador barato de hace seis años. Esto es exactamente lo que pudo hacer.
-
Ollama mejora discretamente los Mac para ejecutar modelos abiertos
-
El mayor modelo de IA gratuito hasta la fecha llega el 27 de julio. Esto es lo que significa realmente «pesos abiertos»
-
Un modelo de IA capaz que cabe en tu teléfono y funciona completamente sin conexión