Inferencia
Ejecutar un modelo de IA ya entrenado para obtener una respuesta, en vez de entrenarlo inicialmente.
La inferencia es el acto de usar un modelo entrenado, proporcionarle un prompt y obtener una respuesta. Se distingue del entrenamiento, el proceso único y mucho más caro que crea los pesos.
La diferencia ayuda a entender los costes. Entrenar un modelo de frontera puede requerir meses y enorme capacidad de cálculo, pero se paga una vez. La inferencia se paga con cada uso; por eso los proveedores la miden, normalmente por token, y por eso importan tanto las mejoras que la abaratan o aceleran.
También explica por qué es práctico ejecutar modelos pequeños localmente: un buen portátil puede hacer inferencia para muchas tareas aunque jamás pudiera entrenar el modelo.
-
AMD y Cerebras se alían para que las respuestas de la IA lleguen más rápido
-
Los próximos chips de IA de Nvidia extraen, según se informa, diez veces más trabajo de la misma energía
-
Kimi K3 se vuelve demasiado popular: Moonshot pausa las nuevas suscripciones
-
DeepSeek busca nuevos miles de millones semanas después de su primera ronda: la IA barata sale cara
-
DeepSeek diseña su propio chip de IA y acepta capital externo por primera vez