La ejecución segura de herramientas proviene de la aplicación externa de controles alrededor del modelo: llamadas restringidas, capacidades delimitadas, comprobaciones de políticas, aislamiento, aprobaciones, verificación de resultados y registros de auditoría duraderos.
Un agente autoalojado puede leer archivos del NAS, ejecutar comandos de shell, controlar luces o enviar mensajes, por lo que una respuesta plausible del modelo puede convertirse en un efecto real. El modelo debería proponer una operación, no heredar directamente credenciales sin restricciones. Una capa de ejecución confiable resuelve el objetivo, comprueba la identidad y la política, obtiene aprobación cuando es necesario, ejecuta dentro de unos límites y verifica el resultado.
Las llamadas a herramientas tipadas convierten la intención en solicitudes inspeccionables
Un esquema de herramienta define las operaciones permitidas, los argumentos obligatorios, los tipos, los rangos y las enumeraciones. La validación determinista rechaza los campos mal formados o desconocidos antes de la ejecución, mientras que la resolución del objetivo convierte un nombre descriptivo en el dispositivo, la ruta, el destinatario o el identificador de recurso actual.
La investigación sobre la seguridad de los sistemas agénticos plantea la seguridad de los agentes como un problema de sistemas que implica aislamiento, control de acceso, procedencia y límites de ejecución confiables. Esto respalda mantener la aplicación de controles fuera de la planificación y la generación probabilísticas. Esta distinción sigue siendo visible durante las pruebas posteriores en el hogar.
La salida estructurada es necesaria, pero no suficiente. Una solicitud perfectamente válida aún puede eliminar la carpeta equivocada o enviar un mensaje a la persona equivocada, por lo que los validadores semánticos comparan la acción propuesta con el estado actual, la identidad del usuario, el propósito del flujo de trabajo y la política explícita.
Las capacidades y los entornos aislados limitan el daño máximo
La puerta de enlace de ejecución concede capacidades limitadas y de corta duración, como acceso de lectura a un directorio o control de un grupo de luces. Después, un entorno aislado restringe las rutas del sistema de archivos, los procesos, los destinos de red, la CPU, la memoria, el tiempo y el tamaño de salida durante la ejecución.
Un análisis práctico de los entornos aislados de ejecución de agentes compara contenedores, microVM y WebAssembly, y destaca el acceso denegado de forma predeterminada a los recursos del host. La elección del aislamiento cambia el coste de inicio y la compatibilidad, pero todas las opciones necesitan concesiones explícitas. El resultado intermedio debe seguir siendo inspeccionable antes de que la automatización continúe.
Las credenciales permanecen fuera del contexto del modelo y solo se inyectan para una llamada autorizada. Los entornos aislados independientes protegen el host frente a la ejecución de código, mientras que las comprobaciones de capacidades protegen los servicios externos; ninguno de estos controles sustituye al otro. Ese límite debe medirse por separado en condiciones operativas realistas.
La aprobación y la verificación protegen frente a efectos secundarios importantes
La política clasifica las acciones según el riesgo y decide si debe permitirlas, denegarlas, simularlas o solicitar aprobación humana. La pantalla de aprobación debe mostrar el objetivo resuelto, los parámetros exactos, los cambios previstos y la procedencia, en lugar de una solicitud vaga para «continuar».
Las directrices de NVIDIA sobre el aislamiento de flujos de trabajo agénticos describen la aprobación manual como un control habitual y analizan la fricción que impulsa el uso selectivo de entornos aislados y mecanismos de aplicación de controles. Esto refuerza la idea de colocar la aprobación en el límite irreversible, en lugar de interrumpir cada paso de solo lectura.
El límite de fallo es una herramienta con privilegios excesivos o un resultado no verificado. La aprobación no puede hacer seguro un comando oculto, y un código de salida correcto no demuestra que el estado previsto haya cambiado. Los flujos de trabajo de alto impacto necesitan condiciones posteriores independientes, reintentos limitados, claves de idempotencia y un registro de auditoría de las propuestas, denegaciones, aprobaciones, ejecuciones y comprobaciones.
Prueba la capa de aplicación de controles, no la promesa del agente
Prepara casos para argumentos mal formados, traversal de rutas, archivos no autorizados, destinos de red bloqueados, instrucciones inyectadas mediante prompts, objetivos obsoletos, reintentos duplicados, manipulación de aprobaciones, tiempos de espera agotados y herramientas que informan falsamente de que han tenido éxito. Ejecútalos con los mismos permisos utilizados en producción.
Utiliza el principio de comprobación independiente de las comprobaciones independientes de resultados para verificar el estado después de cada acción permitida. Confirma que las operaciones denegadas nunca llegan a la herramienta, que las aprobaciones están vinculadas al hash exacto de la solicitud, que las credenciales no aparecen en los prompts ni en los registros y que las claves de reintento impiden efectos secundarios duplicados.
Realiza el despliegue solo después de comprobar que los controles adoptan una postura segura cuando el servicio de políticas, el canal de aprobación o el verificador no están disponibles. Si la seguridad depende de que el modelo recuerde una regla, incorpora esa regla a una política ejecutable antes de conceder acceso a la herramienta.
Centro de Tecnología e IA
Más para leer

¿Qué componentes permiten realizar búsquedas híbridas en archivos NAS?
Aprende cómo los identificadores exactos y el significado semántico conducen a un único resultado clasificado de búsqueda de NAS sin eludir los permisos ni...

¿Qué características permiten seleccionar de forma fiable la versión de los documentos en RAG?
Descubre cómo RAG selecciona la revisión aplicable en lugar de la copia obsoleta más similar y cómo probar actualizaciones explícitas, implícitas y superpuestas.

¿Qué factores hacen que los planes de los agentes diverjan de los permisos de herramientas disponibles?
Descubre cómo el descubrimiento, la delegación, la retroalimentación de políticas y la replanificación mantienen los pasos propuestos por un agente de IA alineados con...

