El modelo económico de DeepSeek ahora puede ver y supera al Opus 4.8 en dos pruebas visuales
V4-Flash-Vision-Exp agrega comprensión de imágenes al modelo más pequeño de DeepSeek. Las imágenes se facturan hasta 384 tokens cada una, al mismo precio que el texto.
DeepSeek lanzó una versión experimental de su modelo más pequeño el 21 de agosto que puede mirar imágenes. V4-Flash-Vision-Exp está activo en la plataforma API de la empresa, mantiene las capacidades de texto del V4-Flash existente y agrega comprensión de imágenes.
Los dos números que cita la gente provienen de puntos de referencia visuales. En ALE, un conjunto de tareas de aplicación largas de varios pasos, el modelo de DeepSeek obtuvo una puntuación de 27,3 frente al Opus 4.8 de Anthropic con un 25,7. En ZeroBench, una colección de 100 acertijos de análisis de imágenes deliberadamente difíciles, alcanzó 35.0 frente a 34.0 en Opus 4.8. Ambas son victorias estrechas en dos pruebas, no una afirmación general de superioridad, y el propio DeepSeek lo expresa de manera más modesta: el rendimiento del agente multimodal ahora está “cerca del Opus-4.8”. El modelo base subyacente es un diseño de combinación de expertos, lo que significa que el modelo completo contiene una gran cantidad de parámetros pero solo activa una pequeña porción de ellos para cualquier solicitud determinada, por lo que su ejecución sigue siendo económica.
Los detalles prácticos importan más que la clasificación. Las imágenes se convierten en tokens para facturación de hasta 384 tokens cada una, cobrados a la tarifa normal de V4-Flash, por lo que agregar una captura de pantalla a una solicitud cuesta aproximadamente lo que costarían unos pocos párrafos de texto. DeepSeek también activó una API de archivos el mismo día: usted carga una imagen una vez, recupera una ID de archivo y hace referencia a esa ID en solicitudes posteriores en lugar de volver a cargarla. Es gratis y ahorra mucho ancho de banda si envía el mismo documento o diagrama repetidamente.
La palabra “experimental” en el nombre del modelo funciona realmente. DeepSeek ha utilizado el sufijo “-Exp” antes para modelos que se prueban en público, se ajustan y luego se integran en una versión estable. No construyas nada de lo que dependas todavía. También vale la pena saberlo: esta es una versión solo de API. DeepSeek ha publicado pesos abiertos para varios de sus modelos anteriormente, incluido V4-Flash en julio, pero hasta ahora no se ha publicado nada para la variante de visión. El patrón más amplio es que la visión ya no es una característica premium reservada para los modelos más grandes y caros. Una vez que un modelo económico puede leer de manera confiable una captura de pantalla, un gráfico o una factura escaneada, gran parte de la automatización diaria se vuelve asequible que antes no lo era.
Qué significa esto para ti: si simplemente tienes curiosidad acerca de la IA, la conclusión es que “¿puede mirar mi captura de pantalla?” se está convirtiendo rápidamente en una característica estándar en lugar de un punto de venta. Si construye con estas herramientas, el número interesante es el precio, no el punto de referencia: la entrada de imágenes a velocidades de texto hace que el procesamiento de documentos, la depuración de capturas de pantalla y la lectura de gráficos sean lo suficientemente baratos como para probarlos en volumen real. Una advertencia justa antes de emocionarse: los modelos experimentales pueden cambiar o desaparecer, y las brechas de referencia aquí son de alrededor de un punto, que está dentro del rango en el que una prueba diferente cambiaría la clasificación.
Fuentes
Los modelos gratuitos de Google superaron los mil millones de descargas. Algunos de ellos están funcionando en órbita
Gemma superó mil millones de descargas y 100.000 variantes comunitarias en dos años. Qwen de Alibaba reclamó tres mil millones cinco días antes.