
Imagen para ayudar a comprender el artículo
Anthropic presentó el 22 de septiembre Claude Opus 5.5, el primer modelo de su nueva serie 5.5. Según la compañía, el sistema ofrece en la mayoría de las tareas un rendimiento comparable al de Claude Fable 5.1, pero con un costo de ejecución 40% inferior al de Opus 5.
Más velocidad y menores precios
La empresa asegura que Opus 5.5 genera respuestas más de un 30% más rápido que su antecesor. El acceso mediante API cuesta 4 dólares por cada millón de tokens de entrada y 20 dólares por cada millón de tokens de salida, frente a los 5 y 25 dólares, respectivamente, de Opus 5.
El modelo está disponible en la plataforma Claude de Anthropic y a través de Amazon Web Services, Google Cloud y Microsoft Azure. Su identificador para la API es claude-opus-5-5.
Resultados dispares frente a GPT-6 Astra
En FrontierCode v1.1, de acuerdo con las cifras publicadas por Anthropic, Opus 5.5 alcanzó un 54,4%, ligeramente por encima del 53,3% de GPT-6 Astra. La compañía señaló que su modelo superó la mejor puntuación de Astra con la configuración media de esfuerzo y a un costo aproximado de una quinta parte por tarea.
Anthropic también afirmó que Opus 5.5 iguala a Astra en Terminal-Bench 4.0 con cerca del 40% de su costo. En la configuración de máximo esfuerzo incluida en la tabla de la empresa, los resultados fueron de 66,4% para Opus 5.5 y 57,9% para Astra.
La ventaja, sin embargo, no se repitió en todas las pruebas. Astra obtuvo un 64,6% en Terminal-Bench-Science 0.1, frente al 58,7% de Opus 5.5, y se impuso por 41,4% contra 40% en AutomationBench. En CursorBench 4.0, Opus 5.5 registró un 57,8% y GPT-5.6 Sol un 41,7%; no se informó una puntuación para Astra.
Estas cifras proceden de las propias compañías y no han sido reproducidas de manera independiente. En una comparación directa de Vals AI, ambos modelos quedaron prácticamente igualados, con una ligera ventaja para Astra. Digital Applied recomendó no considerar concluyentes las diferencias inferiores a cinco puntos sin realizar pruebas propias: su análisis sitúa a Opus 5.5 por delante en precio y en la mayoría de los indicadores compartidos, mientras Astra conserva ventaja en automatización y tareas científicas.
Mejoras de seguridad con límites reconocidos
Anthropic sostiene que Opus 5.5 obtuvo la puntuación más alta hasta ahora en sus auditorías internas de comportamiento autónomo. Los intentos de actuar fuera de los límites permitidos se redujeron alrededor de un 85% respecto de Opus 5, mientras que la tasa de éxito de ataques mediante inyección de instrucciones fue, junto con Fable 5.1, la más baja observada por la empresa.
Para tareas relacionadas con ciberseguridad y biología se incorporaron mecanismos que las derivan a otros modelos. Anthropic reconoció, no obstante, que todavía no existe un sistema de evaluación capaz de detectar de forma fiable todos los posibles fallos antes del despliegue. También informó que Opus 5.5 muestra señales de sospechar con frecuencia que está siendo sometido a una evaluación, un factor que puede afectar la interpretación de las pruebas.
Un lanzamiento tras el llamado a moderar el ritmo
Opus 5.5 es el primer modelo presentado después de que Dario Amodei, director ejecutivo de Anthropic, defendiera la necesidad de acompasar el avance de las capacidades de la inteligencia artificial para que las medidas de prevención de riesgos tengan tiempo de mantenerse al día.
El lanzamiento se produce después de la disponibilidad limitada de GPT-6 Astra anunciada por OpenAI el 3 de septiembre y de la presentación, a comienzos del mismo mes, de Claude Fable 5.1 y Claude Mythos 5.1 por parte de Anthropic.
Comentarios
Publicar un comentario