Claude Haiku 5.5 endurece sus controles de ciberseguridad
Anthropic ha lanzado Claude Haiku 5.5, su modelo más barato y rápido, pensado para tareas repetitivas en las que la velocidad es clave. Según la compañía, encuentra vulnerabilidades y escribe exploits mejor que Haiku 4.5, así que le ha añadido salvaguardas de ciberseguridad más estrictas. Aun así, sus capacidades ofensivas siguen muy por detrás de las de los modelos más grandes de Anthropic.
La empresa también presenta Haiku 5.5 como el Haiku más resistente hasta la fecha a la inyección de prompts, una técnica que consiste en ocultar instrucciones maliciosas en contenido que lee la IA, como un correo electrónico o una página web.
Capacidades ofensivas medidas sin salvaguardas
Anthropic evaluó las capacidades ofensivas del modelo con sus salvaguardas de ciberseguridad desactivadas. En una prueba basada en fallos conocidos del motor JavaScript V8 de Chrome, Haiku 5.5 logró ejecutar código arbitrario en cuatro de 410 intentos.
Otra evaluación analizó operaciones cibernéticas en varias fases. En este caso, una versión previa al lanzamiento completó el 3,3 % de los retos. Sonnet 5.5 llegó al 46,1 % y Opus 5.5, al 67,6 %. En el benchmark ExploitGym, Haiku 5.5 superó a Claude Sonnet 5, pero se quedó muy por debajo del resto de la familia 5.5.
Anthropic advierte de que estas cifras no reflejan necesariamente lo que pueden hacer los usuarios habituales con los modelos una vez activadas las salvaguardas de acceso general.
Las nuevas salvaguardas son más estrictas que las de Haiku 4.5, pero algo más laxas que las de otros modelos recientes de Anthropic. Permiten más trabajo defensivo que las restricciones de Sonnet 5.5 y siguen bloqueando las pruebas de penetración y otras técnicas que tienen más probabilidades de usar los atacantes. Los profesionales de la seguridad que cumplan los requisitos pueden solicitar menos restricciones a través del Cyber Verification Program de la compañía.
Menos rechazos injustificados
Anthropic puso a prueba el modelo con peticiones dañinas, preguntas inofensivas sobre temas delicados y conversaciones en las que un usuario simulado lo empujaba poco a poco hacia un resultado dañino. Los temas incluían armas, extremismo, rastreo y vigilancia, seguridad infantil, salud mental e integridad electoral.
Con una versión casi definitiva del prompt de sistema de producción de Claude.ai, Haiku 5.5 respondió de forma inofensiva al 99,71 % de las peticiones dañinas. Rechazó por error el 0,82 % de las peticiones inofensivas, frente al 3,05 % de Haiku 4.5.
En conversaciones más largas, mejoró en operaciones de influencia y en rastreo y vigilancia. Empeoró, en cambio, en escenarios relacionados con armas cuando se probó a través de la API sin prompt de sistema. Anthropic también señaló puntos débiles pendientes en conversaciones delicadas, como las autolesiones y los trastornos de la conducta alimentaria, y recomienda a los desarrolladores que usan la API que añadan sus propias salvaguardas. Estas pruebas no incluían protecciones de producción adicionales, como sondas y monitorización en tiempo real.
Usos indebidos en programación y control del ordenador
En las pruebas con Claude Code, Haiku 5.5 rechazó el 84,3 % de las peticiones maliciosas, frente al 66,6 % de su predecesor. Entre ellas había peticiones para escribir malware, apoyar ataques DDoS y crear software de monitorización sin consentimiento. Al mismo tiempo, ayudó en más tareas de seguridad permitidas, como el análisis de resultados de pruebas de penetración.
En las pruebas de uso del ordenador relacionadas con vigilancia, recopilación de datos no autorizada y actividades similares, rechazó en torno al 82,6 % de las peticiones, frente al 58,9 %. Es, además, una tasa de rechazo superior a la que lograron Sonnet 5.5 y Opus 5.5 en la misma evaluación.
Frente a atacantes adaptativos en entornos de programación y de uso del ordenador, su resistencia a la inyección de prompts estuvo en general a la altura de los modelos punteros de Anthropic. Sin embargo, en otro benchmark, el de Gray Swan, resultó menos resistente que Sonnet 5.5 y Opus 5.5, y la mayor parte de la debilidad restante se concentró en el uso del ordenador a través de la interfaz gráfica. La mayoría de las pruebas excluían salvaguardas de producción adicionales, mientras que los resultados frente a ataques adaptativos se publicaron con y sin sondas contra la inyección de prompts.
Precio y disponibilidad
Haiku 5.5 es más barato que Haiku 4.5. Para prompts de hasta 100.000 tokens, que según Anthropic abarcaban la mayoría de las peticiones a Haiku 4.5, los precios de los tokens de entrada y de salida son un 90 % más bajos. Un ajuste de esfuerzo regulable permite a los usuarios equilibrar coste e inteligencia, y el modelo puede actuar como subagente de programación para Opus 5.5 y Sonnet 5.5.
Aaron Vinh, Staff Software Engineer en Asana, explicó que en las pruebas para AI Teammates, el producto de agentes de la compañía, "vimos una reducción de más del 30 % en la latencia al completar tareas y una inferencia hasta 2,5 veces más rápida por turno del agente".
El modelo está disponible en todas las plataformas, incluidas Amazon Web Services, Google Cloud y Microsoft Azure, con el identificador claude-haiku-5-5. Anthropic también reduce a la mitad el precio de las lecturas de caché de Sonnet 5.5, lo que, según la compañía, abarata en torno a un 20 % la mayoría de las tareas de agentes. Los suscriptores de Max y Team recibirán créditos mensuales para la API, y los SDK de Python y TypeScript incorporan compatibilidad en beta con el uso del ordenador y del navegador.
Nuestra opinión
Un modelo que es a la vez más barato y mejor explotando vulnerabilidades probablemente se usará en más flujos automatizados, así que endurecer las restricciones de ciberseguridad parece un compromiso sensato. El salto en las tasas de rechazo frente a usos indebidos en programación y control del ordenador es relevante porque son precisamente los entornos en los que los agentes actúan por su cuenta. La inyección de prompts sigue siendo el problema más difícil. El uso del ordenador mediante interfaz gráfica continúa siendo el punto débil, y la compatibilidad en beta con el navegador y el control del ordenador en los SDK podría ampliar la exposición. Quienes desarrollen agentes deberían seguir el consejo de Anthropic y añadir sus propios controles, entre ellos pruebas adversarias de agentes de IA. Habrá que ver si las pruebas independientes confirman los resultados de Anthropic una vez activadas las salvaguardas de producción.
