
Imagen para ayudar a comprender el artículo
Anthropic presentó el 28 de septiembre de 2026 Claude Sonnet 5.5, una nueva versión de su modelo de inteligencia artificial enfocada en mejorar el rendimiento y la eficiencia económica frente a la generación anterior. Su identificador para desarrolladores es claude-sonnet-5-5.
La compañía sostiene que el modelo puede superar los mejores resultados de Sonnet 5 operando con niveles de esfuerzo bajo o medio y con un costo por tarea cercano a una décima parte. SiliconANGLE informó, además, que genera respuestas un 30% más rápido, utiliza menos tokens y reduce el costo efectivo alrededor de un 30% frente a su antecesor.
Precios y plataformas disponibles
Claude Sonnet 5.5 está disponible mediante Claude Platform, AWS, Google Cloud y Microsoft Azure, con soporte para configuraciones que no conservan los datos procesados.
La tarifa de la API es de 2 dólares por cada millón de tokens de entrada y 10 dólares por cada millón de tokens de salida. La lectura de caché cuesta 0,20 dólares por millón de tokens y la escritura, 2,50 dólares. Según VentureBeat, los precios coinciden con los de GPT-6 Sol y son inferiores a los de Opus 5.5, cuyo costo asciende a 4 dólares para la entrada y 20 dólares para la salida.
Resultados frente a Sonnet 5 y Opus 5.5
En las pruebas divulgadas por Anthropic, Sonnet 5.5 obtuvo un 70,6% en Terminal-Bench 4.0, por encima del 10,3% de Sonnet 5 y del 66,4% de Opus 5.5. En FrontierCode 1.1 Main alcanzó un 46,2% con el nivel máximo de esfuerzo: superó el 42,4% de Sonnet 5, pero quedó por debajo del 54,4% de Opus 5.5 y del 49,3% de GPT-6 Sol.
En GDPval-AA v2.1 registró 1.844 puntos, casi igualando los 1.846 de Opus 5.5 y por encima de los 1.449 de Sonnet 5 y los 1.487 de GPT-6 Sol. En Humanity's Last Exam consiguió un 64,5%, frente al 54,9% de Sonnet 5 y el 67,7% de Opus 5.5. En OSWorld 2.1 marcó un 80,1%, superior al 57% de Sonnet 5, aunque ligeramente inferior al 81,8% de Opus 5.5.
Los propios datos de Anthropic muestran que Opus 5.5 conserva la ventaja en FrontierCode, CursorBench, GDPval-AA, AA-Briefcase y Humanity's Last Exam. La empresa reconoce que su modelo de mayor capacidad sigue siendo claramente más sólido en tareas complejas y abiertas que exigen mantener el criterio durante periodos prolongados.
Las evaluaciones independientes matizan el avance
Artificial Analysis otorgó a Sonnet 5.5 una puntuación de 56 en su Intelligence Index, que lo situó en el tercer lugar entre 216 modelos y ampliamente por encima de la mediana de 26. La organización calculó un costo de 7,60 dólares por tarea y contabilizó 410 millones de tokens de salida, frente a una mediana de 88 millones, por lo que calificó al modelo como “muy verboso”.
En esa misma evaluación, la velocidad de salida fue de 141,9 tokens por segundo, suficiente para ocupar el puesto 28, mientras que el tiempo hasta el primer token llegó a 353,32 segundos.
Vals AI colocó al modelo en el segundo puesto entre 66 sistemas, con un Vals Index de 69,22% ± 0,96. Opus 5.5 lo aventajó por 0,47 puntos, con un 69,69%, pero tuvo un costo por prueba de 32,77 dólares, frente a los 20,80 dólares de Sonnet 5.5. El desempeño no fue uniforme: Sonnet 5.5 quedó en el puesto 31 de 41 modelos en CyberBench, con un 59,58%, y en el 36 de 70 en Harvey's Legal Agent Benchmark, con un 2,92%.
Pruebas empresariales y límites de seguridad
Yashodha Bhavnani, vicepresidenta de Box citada por VentureBeat, indicó que Sonnet 5.5 fue 2,4 veces más rápido y utilizó un 12% menos de tokens en sus pruebas. Un director del área de inteligencia artificial de Zendesk, citado por SiliconANGLE, señaló que el procesamiento de solicitudes de soporte se aceleró un 20%. Ese medio también informó que se convirtió en el primer modelo Sonnet capaz de completar Pokémon Red utilizando únicamente capturas de pantalla.
Anthropic advirtió que sus mecanismos de bioseguridad pueden bloquear por error determinadas consultas de microbiología y virología. Las protecciones también pueden activarse ante contenidos relacionados con ciberseguridad, biología o asuntos sensibles, aunque, según SiliconANGLE, la mayoría de las tareas de desarrollo de software y ciencias de la vida no deberían verse afectadas.
Comentarios
Publicar un comentario