Lección de estudio
Una lectura guiada para entender los conceptos clave, conectarlos y llevarlos a la práctica.
El nuevo perímetro
En sistemas con LLM la superficie de ataque incluye el propio prompt: toda entrada del usuario debe tratarse como potencialmente adversaria, igual que un formulario web.
Instrucción vs. dato
El patrón raíz de la mayoría de incidentes es confundir instrucciones con datos. Separar el contexto del sistema de la entrada del usuario es la defensa número uno.
Defensa en capas
Validación de entrada, permisos mínimos del agente, revisión humana en acciones irreversibles y monitoreo de salidas. Ninguna capa basta sola.
Glosario
- Prompt injection — Entrada que intenta reescribir las instrucciones del sistema.
- Permisos mínimos — El agente solo accede a lo que su tarea exige.
- Human-in-the-loop — Aprobación humana en acciones de alto impacto.