OpenAI construyó su propio chip y los primeros puntos de referencia son buenos
Jalapeño, el primer chip de inferencia personalizado de OpenAI con Broadcom, funciona con 700 vatios frente a los 900 a 1150 de Nvidia. Un análisis independiente lo sitúa entre 1,5 y 1,9 veces por delante por kilovatio.
OpenAI y Broadcom presentaron Jalapeño en la conferencia Hot Chips de esta semana, el primer procesador que OpenAI ha diseñado. Es un chip de inferencia, lo que significa que está diseñado para ejecutar modelos terminados en lugar de entrenar otros nuevos, y los primeros puntos de referencia publicados lo sitúan por delante de los bastidores actuales de Nvidia en la medida que más le importa a cualquiera que pague una factura de electricidad.
Las cifras del titular, del boletín de análisis de chips SemiAnalysis y de las propias cifras de OpenAI: Jalapeño consume 700 vatios, frente a los 900 a 1.150 vatios del procesador Rubin de Nvidia. En el punto de referencia InferenceX de SemiAnalysis, entregó de 1,5 a 1,9 veces más rendimiento por kilovatio y de 1,7 a 3,6 veces menor latencia de extremo a extremo que los sistemas de rack GB200 y GB300 de Nvidia, probados en modelos abiertos, incluidos DeepSeek R1, GPT-OSS y Kimi K2.5. El trabajo de diseño comenzó a mediados de 2024, el diseño llegó a fábrica en noviembre de 2025 y está construido sobre el proceso N3P de TSMC con memoria HBM4 a 15,4 TB/s. Hay dos advertencias en el mismo informe. SemiAnalysis sostiene que la comparación justa es la nueva plataforma Vera Rubin de Nvidia en lugar de Blackwell, ya que ambas usan memoria HBM4, y en esa base Jalapeño todavía está a la cabeza en tokens de producción por megavatio, pero sale aproximadamente igualado en el costo total por token.
Lo que realmente está pasando aquí: la inferencia es adónde va el dinero. Entrenar un modelo es un gasto único, pero cada pregunta que hace un usuario cuesta energía para siempre, y en la escala de OpenAI, una quinta parte de la factura de electricidad es una cifra muy grande. Un chip personalizado puede ser más estrecho que una GPU de uso general por diseño: solo tiene que ejecutar bien los propios modelos de OpenAI, por lo que todo lo que no sirva para ese objetivo se elimina. Esa es la única razón por la que Google creó TPU y Amazon creó Inferentia. La parte estratégica no es el punto de referencia, es el apalancamiento. Una empresa con un chip interno creíble negocia con Nvidia desde una posición diferente, y Anthropic leyendo la misma página es presumiblemente la razón por la que acaba de contratar al fundador del programa TPU de Google.
Qué significa esto para ti: No notarás nada este mes y no podrás comprar uno. Pero la inferencia más barata es el mecanismo detrás de casi todas las mejoras que realmente siente: precios de API más bajos, límites de nivel gratuito más altos, respuestas más rápidas y modelos que pueden pensar durante más tiempo antes de responder. Si se basa en API de IA, lo que hay que observar es si OpenAI transmite la eficiencia o la mantiene como margen. También vale la pena aclararlo: estos son puntos de referencia de proveedores y analistas en modelos seleccionados, no pruebas independientes a escala, y la respuesta de Nvidia se envía en la misma ventana.
Fuentes
- OpenAI y Broadcom presentan el chip de inferencia optimizado para LLM (OpenAI)
- OpenAI Jalapeño: Mejor que Nvidia Blackwell (SemiAnálisis)
- El chip Jalapeño de OpenAI está diseñado para una inferencia rápida a escala, según muestran los puntos de referencia (TechCrunch)
- Según se informa, el primer chip personalizado de OpenAI supera a Blackwell y Rubin (The Decoder) de Nvidia
Fuentes: https://openai.com/index/openai-broadcom-jalapeno-inference-chip/
Este robot aprende una tarea de diez minutos viendo un vídeo
Skild AI lanzó S1, un modelo de robot que copia una tarea después de ver una sola demostración humana, sin necesidad de volver a entrenar. Volteó un panqueque a pesar de que nunca vio un panqueque volteado en el entrenamiento.