CourionAI
ES
Boletín
← Todas las noticias
hardware 2 min de lectura

AMD y Cerebras se alían para que las respuestas de la IA lleguen más rápido

Dos empresas de chips se reparten el trabajo de ejecutar un modelo de IA con el objetivo de reducir la latencia y mejorar la eficiencia energética. Esta es la versión en lenguaje sencillo.

Ilustración en risografía de un rack de servidores alto y una oblea de silicio redonda unidos por una franja de luz y compartiendo una tarea

AMD y Cerebras anunciaron esta semana una alianza para ejecutar modelos de IA más rápido, repartiendo el trabajo entre dos tipos de chips muy diferentes. Suena a ingeniería de hardware compleja, pero el objetivo es algo que notas a diario: la espera entre pulsar Intro y que empiece a aparecer la respuesta.

La idea, en términos sencillos, es la siguiente. Cuando un modelo de IA te responde hace dos cosas. Primero lee y asimila tu petición, junto con los documentos o el historial que la acompañan. Después escribe la respuesta palabra a palabra. Esas dos tareas tienen necesidades distintas. Leer una petición larga es una tarea de volumen que premia el rendimiento bruto; escribir la respuesta palabra por palabra exige velocidad en cada paso. Los racks “Helios” de AMD, basados en sus procesadores EPYC y GPU Instinct, se encargarán de la lectura, donde pueden procesar muchas solicitudes grandes a la vez. Cerebras, conocida por un chip del tamaño de un plato, un “wafer-scale engine”, básicamente un procesador gigante en lugar de muchos pequeños conectados, asumirá la escritura y generará tokens con muy poca demora. AMD y Cerebras aseguran que repartir el trabajo ofrece hasta cinco veces más eficiencia energética. Está previsto que el servicio combinado llegue primero a través de Cerebras Cloud en la segunda mitad de este año.

Entonces, ¿qué está pasando realmente? La industria de la IA ha pasado años compitiendo por construir modelos más grandes. La nueva carrera consiste en ofrecerlos bien: rápido, barato y sin consumir cantidades absurdas de energía. Las configuraciones “desagregadas” como esta, en las que se utiliza el chip adecuado para cada parte de la tarea en lugar de uno para todo, son una parte importante de la respuesta. También es un momento relevante para Cerebras, que durante mucho tiempo ha sido el outsider peculiar en un mundo dominado por Nvidia, y para AMD, que recientemente firmó un acuerdo independiente de inferencia con Anthropic. Conviene añadir una cautela: son afirmaciones de rendimiento de las propias empresas y el producto conjunto aún no ha salido, así que las cifras reales todavía tienen que llegar.

Qué significa esto para ti: Nunca verás un chip de AMD o Cerebras, y no necesitas hacerlo. Cuando el asistente que utilizas responde más rápido o un proveedor baja sus precios, este es el tipo de trabajo entre bastidores que lo hace posible. Ofrecer el servicio de forma más rápida y barata convierte una demostración impresionante en algo que realmente quieres usar durante todo el día. Para la mayoría no cambia nada hoy; es simplemente una buena señal sobre el rumbo de la infraestructura.

Fuentes

Fuentes: https://www.cerebras.ai/press-release/amd-and-cerebras-announce-industry-leading-ultra-low-latency-and-high-throughput-ai-inference

Siguiente artículo

Las nuevas normas de China para los compañeros de IA ya están en vigor. Esto es lo que hacen

La semana pasada entraron en vigor nuevas normas chinas sobre las aplicaciones de “compañeros” de IA: prohíben los chatbots románticos para menores y obligan a incluir protecciones contra la dependencia. Un vistazo a los cambios y a por qué se observan en todo el mundo.

Ilustración en risografía de un bocadillo de diálogo con forma de corazón detrás de una barrera baja junto a un pequeño reloj