Anthropic afloja el filtro biológico de Claude Fable 5, reduciendo las preguntas bloqueadas en un 85 por ciento
Fable 5 se lanzó con casi todas las preguntas de biología bloqueadas. Un clasificador de seguridad reentrenado ahora permite responder preguntas de estudio y salud cotidianas, reduciendo los retrocesos relacionados con la biología en aproximadamente un 85 por ciento. La virología profesional y el diseño de fármacos siguen bloqueados.
Si alguna vez le pidió a Claude Fable 5 que lo ayudara a leer el resultado de un análisis de sangre y obtuvo una respuesta notablemente más débil de lo que esperaba, este es el motivo. Anthropic dijo el jueves que ha vuelto a capacitar el sistema de seguridad que analiza las preguntas de biología, y que el cambio reduce las “alternativas” relacionadas con la biología en aproximadamente un 85 por ciento en todos sus productos.
Una alternativa es lo que sucede cuando Fable 5, el modelo más capaz de la compañía, decide que una solicitud toca un área sensible y silenciosamente se la entrega a Opus 5. Opus 5 es un modelo potente, pero no tiene la capacidad biológica de Fable, por lo que la respuesta que obtienes es diferente a la que pediste. Anthropic dice que el número total de respaldos de todo tipo ahora debería disminuir aproximadamente un 67 por ciento en Claude.ai, un 55 por ciento en Cowork, un 17 por ciento en Claude Code y un 7 por ciento en Claude Platform.
El guardián aquí es un clasificador de seguridad: un sistema de inteligencia artificial más pequeño y más rápido cuyo único trabajo es observar una solicitud y decidir si cae dentro de una categoría protegida. Anthropic reescribió el libro de reglas que sigue el clasificador, hizo que expertos internos y externos lo revisaran, generó nuevos ejemplos de entrenamiento y volvió a entrenarlo. El resultado es un límite que se sitúa en un lugar más sensible. Ahora llegan las preguntas cotidianas sobre salud, las explicaciones de los síntomas y la biología escolar. La virología, la toxicología y el diseño molecular todavía no lo hacen.
Por qué el filtro era tan agresivo en primer lugar
Anthropic es sincero en cuanto a que el escenario original fue deliberadamente contundente. Sus propias evaluaciones de capacidad encontraron que Fable 5 podría brindarle a un actor malintencionado una ayuda significativa para obtener un arma biológica, que es el tipo de riesgo que no se puede retroceder después del hecho. Entonces, la compañía envió el modelo con casi toda la biología bloqueada, aceptó que los usuarios legítimos quedarían atrapados en la red y luego siguió trabajando en el clasificador. La alternativa era retrasar todo el modelo durante semanas o meses.
Lo difícil es que la biología realmente se resiste a las líneas claras. Anthropic da un buen ejemplo: desarrollar una vacuna viva significa cultivar el mismo patógeno que estás tratando de detener. El medicamento para la presión arterial captopril surgió del aislamiento de la parte tóxica del veneno de serpiente. Los trabajos beneficiosos y peligrosos a menudo parecen idénticos desde fuera, y las personas que actúan de mala fe saben cómo disfrazar uno de otro.
Una advertencia justa: los falsos positivos no han desaparecido. Anthropic dice que algunas solicitudes de bajo riesgo aún activarán el clasificador, a propósito, como margen de seguridad. Y Fable sigue siendo inutilizable para la investigación biológica profesional o el desarrollo de fármacos hasta que la empresa construya lo que llama vías de acceso confiables.
Qué significa esto para ti: si utilizas Fable 5 y le has planteado preguntas de biología, vuelve a intentarlo. Interpretar resultados de laboratorio, entender síntomas y aprender conceptos generales debería resultar ahora mucho más sencillo. Si trabajas en ciencias de la vida, la señal es distinta: la puerta sigue cerrada para ti, pero Anthropic ha dicho públicamente que planea abrirla. Para los demás, el cambio muestra el equilibrio que todas las empresas de IA buscan en silencio entre bloquear demasiado y bloquear demasiado poco.
Fuentes
Fuentes: https://www.anthropic.com/news/improving-fable-5-s-biology-safeguards
ChatGPT reduce su límite diario para usuarios gratuitos y cambia a un modelo predeterminado más preciso
OpenAI está eliminando el límite de los chats de texto para las cuentas ChatGPT gratuitas, haciendo que GPT-5.6 Luna sea el predeterminado para todos y brindando a los suscriptores Plus y Pro un control deslizante que controla qué tan duro piensa el modelo.