CourionAI
ES
Boletín
← Todas las noticias
openai 3 min de lectura

El nuevo modo ultrarrápido de OpenAI ejecuta su mejor modelo 14 veces más rápido

Un nuevo nivel de API OpenAI impulsado por Cerebras ejecuta GPT-5.6 Sol a hasta 750 tokens de salida por segundo. Mismo modelo, misma calidad, aproximadamente catorce veces más velocidad, primero para un pequeño grupo de clientes.

Una enorme oblea circular de silicio que se eleva como un sol, con largas líneas de velocidad y un rastro de puntos que se alejan de ella.

OpenAI presentó un nuevo nivel de servicio el jueves llamado Ultrafast, que ejecuta GPT-5.6 Sol, su modelo más capaz, hasta catorce veces la velocidad habitual. En cifras concretas, eso equivale a hasta 750 tokens de salida por segundo. Los tokens son fragmentos de texto que produce un modelo, aproximadamente tres cuartos de palabra cada uno, por lo que 750 por segundo es más rápido de lo que cualquier humano puede leer. El hardware detrás de esto proviene de Cerebras, la compañía de chips cuyos procesadores están construidos sobre una única oblea enorme en lugar de muchos chips pequeños.

Lo que OpenAI quiere decir es que se trata del mismo modelo, no de uno más pequeño. Hasta ahora, la manera de obtener una respuesta rápida era buscar un modelo más ligero y aceptar que sería peor en problemas difíciles. Ultrafast mantiene la inteligencia y elimina la espera. OpenAI informa una aceleración de 5,6 veces de extremo a extremo en GDPval, un punto de referencia construido en torno al trabajo de conocimiento económicamente valioso, sin ninguna caída mensurable en la calidad. Cerebras afirma que la configuración es cinco veces más rápida que Claude Opus 4.8 y once veces más rápida que Claude Fable 5.

Los primeros clientes describen qué cambia cuando desaparece el retraso. Podium lo utiliza en un producto de voz, donde esperar tres segundos para recibir una respuesta a una llamada telefónica es la diferencia entre una conversación y un silencio incómodo. La firma de investigación financiera Rogo dice que la investigación compleja comienza a parecer una interacción en tiempo real. Dentro de OpenAI, los ingenieros lo utilizan durante las interrupciones: cuando se activa una alerta, el modelo lee los registros, analiza los rastros y sugiere las siguientes comprobaciones mientras el sistema todavía se está comportando mal, en lugar de hacerlo después. Los investigadores describen un lote de experimentos nocturnos que se dividen en varias rondas durante un solo día laboral.

¿Qué está pasando realmente aquí?

La velocidad se está convirtiendo silenciosamente en su propio eje de competencia. Durante dos años, la industria corrió en capacidad, y los modelos se volvieron lo suficientemente inteligentes como para que, para muchos trabajos, el cuello de botella restante no sea “puede hacer esto” sino “responderá antes de que pase el momento”. Un modelo que tarda cuarenta segundos no puede mantener una conversación telefónica, no puede ayudar durante un apagón, no puede sentarse dentro de un flujo de caja. Para llegar allí se necesita silicio especializado, razón por la cual OpenAI se apoya en Cerebras en lugar de hacerlo internamente, y es un recordatorio de que la historia de la IA tiene que ver tanto con chips como con modelos. Una advertencia justa: esta es una vista previa limitada para clientes seleccionados, OpenAI no ha publicado precios y “hasta 750 tokens por segundo” es un límite, no un promedio.

Qué significa esto para ti: hoy no cambia nada, y no pasa nada. Es un nivel de API para empresas, no un botón nuevo en ChatGPT. Sí muestra hacia dónde avanzan los productos que utilizas: asistentes de voz sin pausas incómodas, chats de soporte que resuelven problemas en vez de atascarse y herramientas de programación que siguen tu ritmo al escribir. Todos son problemas de velocidad que empiezan a resolverse. Cuando el chatbot de tu banco deje de parecer una cola de espera, puede que debajo haya un cambio técnico como este.

Fuentes

Fuentes: https://openai.com/index/previewing-ultrafast/

Siguiente artículo

Suno Studio 2.0 te permite hablar con un estudio de música como si fuera un compañero de banda

Suno convirtió su generador de música en una herramienta de producción basada en chat: cree instrumentos y complementos escribiendo, importe MIDI, exporte multipistas ilimitadas de 32 bits. La política de exportación se sitúa extrañamente al lado de los límites antispam de la semana pasada.

Una mesa de mezclas de audio cubierta de atenuadores y perillas de la que emerge un gran globo de diálogo vacío y notas musicales flotando a su alrededor.