Por qué las habilidades de IA realmente ayudan y por qué 100 de ellas son peores que 5
Un estudio de 8.135 ejecuciones de prueba encuentra que las habilidades funcionan brindando a los agentes un proceso confiable, no agregando conocimientos. Haga crecer la biblioteca de 5 a 100 y el agente dejará de encontrar la correcta.
Las habilidades se han convertido silenciosamente en la forma estándar de hacer que un agente de IA sea mejor en algo sin necesidad de volver a capacitarlo. Una habilidad es solo un conjunto de instrucciones escritas: estos son los pasos para esta tarea, esto es lo que se debe verificar, estos son los errores que la gente suele cometer. El agente lo lee antes de comenzar. Todos los productos de agentes importantes ahora admiten alguna versión de esto, y hasta ahora la evidencia para ellos era simplemente que los agentes con habilidades terminaban más tareas. Nadie había mostrado por qué.
Un equipo de Princeton, UC San Diego y otras instituciones realizaron el experimento. Compararon agentes con y sin habilidades en tareas idénticas en 8.135 registros de ensayos y luego codificaron manualmente lo que realmente difería en las transcripciones.
El hallazgo es más limpio de lo esperado. Las habilidades ayudan principalmente al brindarle al agente un procedimiento confiable al cual anclarse, lo que representó el 65,7 por ciento de los casos en los que el agente calificado tuvo mejores resultados. Proporcionar al agente hechos que no conocía explicaba sólo el 4,5 por ciento. En otras palabras, una habilidad es una lista de verificación, no una enciclopedia. Establece qué pasos de configuración ejecutar, qué herramientas y en qué orden, qué verificar a lo largo del camino y eso elimina toda una clase de errores de ejecución descuidados. Frente a Workflow Memory, un enfoque anterior, las habilidades obtuvieron 6,06 puntos mejor en comparaciones emparejadas.
Las habilidades también introducen sus propios fracasos. En aproximadamente uno de cada diez casos, el agente aplicó mecánicamente un manual perfectamente bueno, en una situación que no encajaba. Y el problema de recuperación es grave: aumenta la biblioteca de 5 habilidades a 100 y la precisión con la que el agente elige la correcta colapsa del 29,6 por ciento al 3,3 por ciento. Las habilidades que suenan similares hacen que la elección sea más difícil.
Qué está pasando realmente aquí: hay un corolario reconfortante escondido en los números. Los investigadores descubrieron que invocar la habilidad exactamente correcta no es suficiente ni necesario, porque una habilidad relacionada a menudo proporciona suficiente estructura por sí sola, y el éxito posterior se mantuvo incluso cuando la identificación fuera de línea parecía mala. Entonces, la imagen no es “el agente está perdido”, sino “el agente no sabe qué libro de jugadas tomó y, a menudo, eso está bien”. Su recomendación es tratar las habilidades como un problema del ciclo de vida, donde crearlas, recuperarlas y aplicarlas requiere trabajo, en lugar de asumir que almacenar más experiencias hace que un agente sea más inteligente.
Qué significa esto para ti: si escribes habilidades o instrucciones personalizadas para una herramienta de IA, este es el resultado práctico más útil del mes. Escriba el procedimiento, no los antecedentes. El modelo ya sabe qué es una hoja de cálculo; lo que necesita de usted es el orden de las operaciones y los controles. Y resista la tentación de construir una biblioteca gigante. Un pequeño conjunto de habilidades claramente distintas supera a uno extenso en el que la mitad de las entradas suenan iguales, porque pasado cierto punto el agente simplemente no puede distinguirlas. Si utiliza las herramientas de los agentes sin escribir nada usted mismo, la conclusión es más leve: las habilidades son reales, las ganancias son modestas y específicas, y nadie ha resuelto el problema de la presentación todavía.
Fuentes
Fuentes: https://arxiv.org/abs/2608.14036
Anthropic quiere agentes de IA para ejecutar equipos de laboratorio y tiene un estándar para ello
El Model Hardware Standard es un lenguaje común entre los agentes de IA y las máquinas físicas. Los primeros evaluadores dicen que conectar seis instrumentos de laboratorio tomó menos de una semana en lugar de meses.