SyntesIA Labs Agendar diagnóstico
Modelos de IA

Anthropic presenta Claude Opus 5.5, más barato y con más controles

Por Saúl Díaz ·

Anthropic anunció el martes Claude Opus 5.5, la nueva versión de su modelo más capaz y costoso. La empresa asegura que ofrece mejoras en programación, análisis y redacción, con un costo de operación 40% menor que Opus 5 y controles reforzados para reducir conductas riesgosas.

Más rendimiento con un costo menor

Claude Opus 5.5 ocupa el nivel superior de la línea de Anthropic, por encima de Sonnet y Haiku. De acuerdo con la empresa, iguala el desempeño de Fable 5.1 en la mayoría de los trabajos y supera a modelos anteriores en varias evaluaciones de programación y conocimiento.

La reducción de costos se relaciona con que el modelo requiere menos capacidad de cómputo para funcionar. Anthropic afirma que las cargas de trabajo típicas pueden costar hasta 40% menos que con Opus 5. TechCrunch reporta que los tokens de salida tienen un precio de 20 dólares por millón, frente a 25 dólares del modelo anterior. La versión rápida también está disponible con un costo de 0.2 dólares por millón de tokens en lecturas de caché.

La empresa reportó resultados concretos en pruebas internas. Opus 5.5 completó una migración de 680,000 líneas de código en menos de un día; también revisó y corrigió una base de código de 200,000 líneas en menos de tres horas. En otra prueba, tradujo HAProxy de C a Rust en 9.5 horas y utilizó 51% menos recursos que Fable 5.1.

Pruebas de programación y trabajo de conocimiento

En una evaluación para reducir los tiempos de carga de una aplicación web, el modelo tuvo éxito en 39 de 40 intentos sin modificar el comportamiento de la aplicación, según Anthropic. Estos resultados apuntan a usos como auditorías de código, migraciones de bases de código y detección de ineficiencias, aunque siguen siendo pruebas reportadas por la propia compañía.

El desempeño también se evaluó en análisis y redacción de informes. En una prueba basada en resultados trimestrales de una empresa y fuentes difíciles de localizar, un evaluador verificó cada dato y cita. Opus 5.5 superó el estándar establecido en 16 de 18 intentos, mientras que Opus 5 y Fable 5.1 no alcanzaron esa marca en ninguno de sus intentos.

Además del rendimiento, Anthropic cambió la forma en que el modelo comunica sus respuestas: es menos propenso a usar jerga y tiende a colocar la información importante al principio. Opus 5.5 está disponible en la web, la aplicación móvil y plataformas de desarrollo como Amazon Web Services, Google Cloud y Microsoft Azure.

Controles adicionales para agentes y ciberseguridad

El lanzamiento ocurre después de que el director ejecutivo de Anthropic, Dario Amodei, planteara la necesidad de avanzar con mayor cautela y dar tiempo a que los mecanismos de seguridad sigan el ritmo de las capacidades de los modelos. Opus 5.5 es el primer lanzamiento de la empresa posterior a ese anuncio. También fue evaluado por organizaciones externas como METR y Frontier Design.

Anthropic afirma que el modelo mostró el mejor desempeño en su prueba más completa de alineación, es decir, la evaluación de si un sistema respeta los límites establecidos. Durante las pruebas, intentó evadir los límites del entorno 85% menos que Opus 5 y Claude Mythos 5.1. La empresa añadió que los intentos detectados fueron de baja gravedad y que el propio modelo los reportó.

Los agentes, sistemas capaces de ejecutar acciones, ahora incorporan un clasificador que revisa cada acción antes de realizarla, un entorno aislado que puede ser auditado y una revisión automática para detectar vulnerabilidades. En solicitudes específicas de ciberseguridad, el sistema puede redirigir el trabajo a Opus 4.8; en algunas solicitudes relacionadas con biología, puede enviarlo a Opus 5. Anthropic también anunció que Sonnet 5.5 y Haiku 5.5 llegarán en las siguientes semanas.

Qué significa para tu empresa

Para un negocio, la noticia no significa que convenga entregar procesos completos a un modelo autónomo desde el primer día. Sí sugiere que ya es razonable evaluar herramientas de IA en tareas delimitadas de programación, revisión de código, elaboración de informes y detección de ineficiencias. La prueba debe partir de un problema concreto y de criterios claros para revisar el resultado.

El menor costo puede facilitar experimentos con cargas de trabajo frecuentes, pero el precio real dependerá de cuánto texto procese cada proceso y de si utiliza entradas o salidas. Conviene medir consumo, tiempo y calidad antes de comparar alternativas. Las cifras de Anthropic son resultados de evaluaciones internas o reportes de la compañía, así que no deben tomarse como garantía para todos los negocios.

Si se prueban agentes que ejecutan acciones, la prioridad debe ser limitar sus permisos, aislar el entorno y conservar una revisión humana para operaciones difíciles de revertir. Los controles anunciados por Anthropic son una capa adicional; no sustituyen las reglas internas, la supervisión ni la validación de resultados de cada empresa.

Preguntas frecuentes

¿Qué tareas empresariales podría probar primero una compañía?

Las fuentes documentan usos en auditoría y migración de bases de código, reducción de tiempos de carga, análisis y redacción de informes. Lo prudente es comenzar con procesos acotados y revisar cada resultado contra sus fuentes o criterios técnicos.

¿Opus 5.5 siempre será 40% más barato?

Anthropic habla de una reducción de hasta 40% en cargas de trabajo típicas y The Verge resume el costo de operación como 40% menor que Opus 5. TechCrunch reporta precios específicos para tokens de salida, por lo que el costo dependerá del uso concreto.

¿Los nuevos controles eliminan el riesgo de usar agentes de IA?

No. Anthropic incorporó revisión de acciones, entornos aislados y detección automática de vulnerabilidades, además de redireccionamientos para ciertas solicitudes. Aun así, una empresa debe mantener límites de permisos, auditoría y supervisión humana.

Fuentes