DeepSeek abre un modelo de 305 mil millones de parámetros que finalmente puede ver
DeepSeek-V4-Flash-Vision-Exp apareció en Hugging Face bajo una licencia del MIT: el primer modelo de la familia V4 que maneja imágenes, con grandes avances en las pruebas comparativas de agentes multimodales y un rendimiento de texto que se mantiene estable.
DeepSeek publicó un nuevo modelo en Hugging Face sin mucho ruido a su alrededor. DeepSeek-V4-Flash-Vision-Exp es el primer modelo de la familia V4 que puede mirar imágenes y leer texto, pesa 305 mil millones de parámetros y se envía bajo una licencia del MIT, que es tan permisiva como las licencias de software. La empresa lo describe como experimental y el nombre lleva el “Exp” para demostrarlo.
El enfoque es sencillo: tomar la arquitectura V4-Flash existente, incorporar módulos de visión y seguir capacitándose. Lo que surge es un modelo que mejoró sustancialmente en el trabajo de agentes multimodales, mientras que el rendimiento de solo texto se mantuvo más o menos donde estaba. En ApexBench, una prueba de agente multimodal, obtiene una puntuación de 36,5 frente a 26,2 del V4-Flash-0731 anterior, aunque esa comparación es generosa, ya que el modelo anterior simplemente ignora las imágenes en la entrada. En Agents’ Last Exam, publica 27,3, superando el 25,7 que la propia tabla de DeepSeek enumera para Opus 4.8. Los números del lado del texto prácticamente no han cambiado: 83,9 en Terminal Bench 2.1, 59,3 en DeepSWE. El repositorio incluye un tokenizador, una implementación de referencia y recetas de publicación para vLLM y SGLang, y las versiones comunitarias cuantificadas aparecieron casi de inmediato.
Dos términos que vale la pena analizar. Los parámetros son los números ajustables dentro de un modelo, las cosas que sintonizan el entrenamiento. 305 mil millones de ellos es mucho, y significa que esto no es algo que se ejecute en una computadora portátil. Los pesos abiertos significa que DeepSeek publicó esos números para que cualquiera pueda descargarlos, lo cual es diferente del software de código abierto: obtienes el modelo terminado, no la receta ni los datos de entrenamiento. La licencia del MIT es la parte notable, porque casi no impone restricciones al uso comercial. Una empresa europea puede descargarlo, ejecutarlo completamente en su propio hardware y nunca enviar un solo documento de cliente al servidor de otra persona. Esa es una opción real que no existía hace unos años, y es por eso que los lanzamientos de peso abierto de los laboratorios chinos siguen siendo importantes para empresas que no tienen nada que ver con China.
Qué significa esto para ti. Si usas IA a través de una ventana de chat, nada aquí es para ti hoy, y eso está bien. Si construye cosas, vale la pena echarle un vistazo: es útil tener un modelo con licencia permisiva que lea gráficos, capturas de pantalla y documentos, en un tamaño que pueda autohospedarse si tiene el hardware. Sin embargo, vale la pena mantener las expectativas firmes. “Experimental” en el nombre de un modelo generalmente significa aristas, las comparaciones de referencia provienen de DeepSeek en lugar de un evaluador independiente, y la lectura honesta de los números es que esto coincide con los principales modelos propietarios en algunas tareas de agentes multimodales y los sigue en otras. Lo interesante es la dirección, no la posición en la clasificación.
Fuentes
- Tarjeta modelo DeepSeek-V4-Flash-Vision-Exp (Hugging Face)
- Colección DeepSeek-V4 (Hugging Face)
Fuentes: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp
La UE acaba de clasificar ChatGPT como motor de búsqueda y eso cambia lo que le debe
La Comisión Europea designó a ChatGPT como un motor de búsqueda en línea muy grande en virtud de la Ley de Servicios Digitales, junto con Reddit y Roblox como plataformas. Los tres aprobaron 45 millones de usuarios mensuales de la UE y tienen hasta enero de 2027 para cumplir.