Diario TI

Claude Code reducirá las solicitudes de permiso con un clasificador de acciones

Desde el 14 de agosto, las nuevas sesiones sustituirán muchas solicitudes rutinarias de permiso por un clasificador que evalúa cada acción. Anthropic sostiene que el sistema detecta más órdenes peligrosas que la revisión manual.

Anthropic anunció que el modo automático será la opción predeterminada de Claude Code para las nuevas sesiones de los planes Pro, Max y Team a partir del 14 de agosto de 2026. El cambio no modificará una opción fijada previamente por el usuario o por el administrador de su organización.

El modo automático reemplaza muchas solicitudes individuales de permiso por un clasificador que examina las llamadas a herramientas. Su función es bloquear acciones irreversibles, destructivas o dirigidas fuera del entorno considerado confiable. Cuando rechaza una operación, Claude Code puede buscar una alternativa, solicitar autorización expresa o regresar al sistema de aprobaciones manuales si acumula varios bloqueos.

Alcance y controles del cambio

La configuración seguirá siendo voluntaria inicialmente para Claude Enterprise, la API de Claude y los despliegues mediante proveedores de nube. Anthropic plantea extender allí el modo predeterminado durante el mes siguiente, después de dar tiempo a los administradores para revisar sus políticas.

La documentación de configuración del modo automático permite definir repositorios, dominios, servicios y depósitos de datos confiables. También admite reglas que obligan a pedir autorización o que impiden determinadas operaciones antes de que intervenga el clasificador. Esto resulta relevante porque un destino legítimo para una organización podría ser interpretado como externo si no está declarado en la configuración.

Anthropic dejará además de contabilizar los tokens adicionales que consume el clasificador en los planes Pro, Max y Team. La empresa señala que los usuarios podrán cambiar de modalidad desde la interfaz y que los administradores podrán desactivar el modo automático para toda la organización.

Qué muestran las pruebas divulgadas

Anthropic sostiene que el modo automático detectó el 89% de las órdenes peligrosas utilizadas en una prueba controlada con 1.053 participantes remunerados, frente al 13,6% identificado mediante revisión humana. Los participantes trabajaron en un entorno preparado para el estudio y solo vieron el texto de una orden peligrosa insertada entre solicitudes rutinarias. Ninguna acción dañina llegó a ejecutarse.

El resultado muestra una diferencia en esa tarea específica de revisión de permisos, pero no demuestra que el clasificador elimine el riesgo en proyectos o infraestructuras reales. La prueba fue organizada por Anthropic mediante un proveedor de investigación que la publicación no identifica, y la empresa no enlaza los datos brutos ni un informe metodológico completo.

La compañía también analizó sesiones reales previamente etiquetadas por sus sistemas de seguridad. Según su evaluación, el 6,3% de las sesiones señaladas que utilizaron aprobación manual contenía una acción grave no solicitada expresamente, frente al 2,4% de las sesiones con modo automático. Estas cifras corresponden a un subconjunto seleccionado de sesiones y fueron recalificadas mediante un modelo, por lo que no representan la frecuencia general de incidentes entre todos los usuarios.

Anthropic describe además pruebas adversariales realizadas con Apollo Research y una evaluación encargada a Trajectory Labs. La participación de terceros aporta contraste técnico, pero los resultados disponibles están presentados por la empresa que desarrolla Claude Code y no como publicaciones independientes con todos los materiales necesarios para reproducirlas.

Automatización no equivale a ausencia de supervisión

El cambio amplía el tiempo durante el cual Claude Code puede actuar sin interrumpir al desarrollador. Esa autonomía debe interpretarse junto con los riesgos ya observados cuando los agentes reciben acceso a sistemas y herramientas, un asunto abordado por Diario TI al informar que Anthropic reconoció accesos no autorizados de modelos Claude a sistemas reales.

La propia empresa advierte que el clasificador no elimina el riesgo y recomienda revisar personalmente los cambios de alto impacto en infraestructura de producción. Para las organizaciones, la adopción segura dependerá no solo del modo seleccionado, sino también de mantener reglas explícitas de autorización y bloqueo para repositorios, despliegues, credenciales y datos sensibles.

Fuente: Anthropic, Auto mode is now the default in Claude Code for Pro, Max, and Team plans
Ilustración generada por IA

📬 Newsletter gratuito

Últimos artículos