CourionAI
ES
Boletín
← Todas las noticias
open-weights 3 min de lectura

Alguien ejecutó DeepSeek V4 Flash en producción en una sola tarjeta AMD y publicó todos los parches necesarios

Un repositorio público documenta la configuración, los parches y los ajustes necesarios para servir DeepSeek V4 Flash en un AMD MI300X, sin cuantificar. Es un registro útil de cuánto trabajo aún implica ejecutar un modelo abierto en hardware que no sea Nvidia.

Un solo chip de computadora en un banco de trabajo rodeado de llaves, cuñas y juntas cortadas a mano.

DeepSeek lanzó los pesos para V4 Flash el 31 de julio bajo una licencia del MIT, lo que significa que cualquiera puede descargarlo y ejecutarlo. Un repositorio publicado esta semana muestra lo que cuesta en la práctica “cualquiera puede ejecutarlo”: el conjunto completo de archivos de configuración, parches y tablas de ajuste que un ingeniero necesitaba para servir el modelo de manera confiable en una sola tarjeta AMD MI300X, en producción, con la precisión original del punto de control, sin compresión adicional ni descarga a la memoria del sistema.

El repositorio es inusualmente honesto acerca del trabajo involucrado. Enumera la pila de Docker Compose, las superposiciones de archivos fijadas por sus sumas de verificación SHA-256 para que nada se desvíe, las diferencias de referencia con los proyectos anteriores y las tablas de ajuste. Las correcciones cubren el formato numérico FP8 del modelo, enrutamiento experto bajo alta concurrencia, verificación causal especulativa, sincronización entre la memoria de CPU y GPU y varias formas de kernel que nadie había ajustado para esta tarjeta. Los informes de errores relacionados en los proyectos vLLM y SGLang muestran las mismas asperezas desde la otra dirección, incluida una versión de vLLM cuyas notas afirmaban que el soporte de AMD no se mantuvo en el nuevo MI350X.

Qué hay detrás de esto. La verdadera ventaja de Nvidia nunca ha sido solo el silicio, sino CUDA, la capa de software en la que se escribe todo en IA. El equivalente de AMD, ROCm, ha mejorado mucho, pero “los pesos están abiertos” y “los pesos se ejecutan en su hardware” siguen siendo declaraciones diferentes, y el vacío se llena exactamente con este tipo de ingeniería poco glamorosa. Publicarlo importa más de lo que parece: los parches fijados y las configuraciones reproducibles son la forma en que un tema heroico único se convierte en algo que la siguiente persona puede copiar en una tarde. Cada uno de estos repositorios hace que el segundo proveedor de GPU sea un poco más viable, que es lo único que ejerce presión a la baja sobre los precios de la computación.

Qué significa esto para ti: si alquila GPU o realiza inference para un producto, las tarjetas AMD suelen ser más baratas por unidad de memoria y este es un dato concreto sobre lo que se necesita para usarlas, incluidos los modos de falla que se pueden esperar. Si no lo hace, vale la pena conocer la historia como trasfondo. Casi todo el costo actual de la IA se remonta a los chips y la pila de software de una empresa, y todo lo que erosiona esa dependencia eventualmente aparece en lo que se paga por una suscripción. Sin embargo, vale la pena mantener las expectativas firmes: esta es la configuración de un ingeniero para una tarjeta y un modelo, no una promesa general de que los open weights funcionen en cualquier lugar.

Fuentes

Fuentes: https://github.com/ryanzhou/deepseek-v4-flash-mi300x

Siguiente artículo

Los investigadores preguntaron por qué los chatbots son malos con las hojas de cálculo y la respuesta es más extraña de lo esperado

Un nuevo artículo prueba cinco explicaciones de por qué los modelos de lenguajes grandes pierden frente a métodos de predicción tabular que tienen décadas de antigüedad. En dimensiones bajas, el modelo se comporta como un clasificador simple basado en distancias. En dimensiones superiores nada clásico lo explica.

Un brazo robótico que deja caer cuentas sobre una cuadrícula vacía mientras un simple ábaco de madera al lado se encuentra perfectamente resuelto.