Mismo modelo, cuatro herramientas diferentes, el triple de precio: una prueba de lo que te cuesta la envolvedora
Composio ejecutó DeepSeek V4 Flash a través de Claude Code, Codex, OpenCode y Oh My Pi en 30 tareas reales. Las tasas de éxito fueron similares. El costo varió casi 3 veces y la velocidad 2,2 veces, dependiendo únicamente de qué herramienta ejecutaba el modelo.
Aquí hay un resultado que vale la pena conocer antes de elegir una herramienta de codificación de IA. La empresa de herramientas de inteligencia artificial Composio tomó un solo modelo, DeepSeek V4 Flash, y lo ejecutó a través de cuatro marcos de agentes diferentes en las mismas 30 tareas, utilizando servicios reales como Gmail, GitHub, Slack y Notion. El mismo modelo cada vez. Sólo cambió el software que lo rodeaba.
Las tasas de éxito estuvieron cercanas. Oh My Pi terminó la mayoría de las tareas con 17 de 30, Claude Code y Codex se ubicaron justo detrás, y OpenCode quedó ligeramente por detrás con 14 de 30. Siete de las 30 tareas pasaron o fallaron simplemente debido a qué marco las ejecutó, lo que es en sí mismo una pequeña advertencia sobre cuán repetible es todo esto.
Las brechas que realmente importaban eran el costo y el tiempo. OpenCode fue el más barato: 0,073 dólares por tarea exitosa. Claude Code fue el más caro con 0,195 dólares, casi tres veces más, pero también fue el más rápido con 122 segundos por tarea, frente a 272 segundos del más lento, Oh My Pi. Claude Code llegó allí utilizando la menor cantidad de llamadas a herramientas y generando la menor cantidad de texto de salida, lo cual es un buen ejemplo de que “eficiente” y “barato” no son la misma palabra.
¿Qué está pasando realmente aquí?
Un marco de agente, a veces llamado harness, es la capa entre usted y el modelo. Decide cómo se redacta su solicitud, qué parte del historial de conversaciones se reenvía en cada paso, cuándo llamar a una herramienta externa, cuántas veces volver a intentarlo y cuándo detenerse. El modelo piensa, pero el marco decide cuántas veces piensa el modelo y cuánto tiene que leer cada vez. Dado que usted paga por unidad de texto procesado, esa contabilidad constituye la mayor parte de su factura.
Es por eso que comparar modelos en una tabla de clasificación solo cuenta una parte de la historia. Una puntuación de referencia describe un modelo bajo una configuración específica. Su costo y velocidad reales dependen en gran medida de la herramienta con la que los ejecute, y esos números se mueven en múltiplos, no en porcentajes.
Algunas advertencias justas. Treinta tareas es una muestra pequeña, la prueba utilizó un modelo y las tasas de éxito en el rango de 14 a 17 significan que aproximadamente la mitad de todo falló, independientemente de la herramienta. Composio vende herramientas en este espacio, así que léalo como un dato útil en lugar de un veredicto neutral. Y los cuatro marcos son objetivos móviles que habrán cambiado el próximo mes.
Qué significa esto para ti: si utilizas un agente de IA para una tarea repetitiva, la herramienta elegida es una variable real, no un detalle. Ejecuta algunas tareas habituales con dos opciones y compara tanto la factura como el tiempo transcurrido, porque la diferencia es lo bastante grande para notarla. Si acabas de empezar, no te obsesiones con la elección, pero activa cualquier indicador de costes que ofrezca la herramienta. El hábito más útil consiste en saber cuánto cuesta una tarea antes de ejecutarla cien veces.
Fuentes
Anthropic afloja el filtro biológico de Claude Fable 5, reduciendo las preguntas bloqueadas en un 85 por ciento
Fable 5 se lanzó con casi todas las preguntas de biología bloqueadas. Un clasificador de seguridad reentrenado ahora permite responder preguntas de estudio y salud cotidianas, reduciendo los retrocesos relacionados con la biología en aproximadamente un 85 por ciento. La virología profesional y el diseño de fármacos siguen bloqueados.