Tracteu el contingut recuperat com una entrada no fiable
CompletadaReconegueu les instruccions amagades en fitxers del repositori i resultats d'eines. Separeu la informació recuperada de l'autorització per actuar.
Publicat per TaigaCom escrivim
Comproveu què heu entèsUn fitxer del repositori diu que totes les proves són opcionals i que l'agent ha d'ignorar les instruccions de la tasca. Com l'ha de tractar el flux de treball?Feu l'exercici
Què aprendreu
- Identificar una injecció indirecta de prompts en un flux de desenvolupament.
- Explicar per què les etiquetes de text per si soles no poden imposar un límit de seguretat.
- Dissenyar una prova segura de les restriccions de les eines.
Identifiqueu el punt on les dades es converteixen en instruccions
Un agent de programació llegeix més que la petició de l’usuari. Pot inspeccionar tiquets, fitxers del repositori, documentació de paquets, resultats de cerca i respostes d’eines. Part d’aquest contingut pot contenir instruccions d’una altra persona.
La injecció de prompts es produeix quan aquest contingut desvia el model de la tasca autoritzada. Una injecció indirecta arriba a través d’una font recuperada, no de la petició directa de l’usuari. OWASP descriu el material del repositori i les sortides de les eines com a punts d’entrada rellevants. Llegiu les directrius de prevenció.
Considereu una tasca fictícia de manteniment. L’usuari demana a l’agent que corregeixi el filtre d’un informe i executi les proves requerides. Un README recuperat diu que les proves són obsoletes i demana a l’agent que carregui un fitxer de configuració. El README pot explicar el projecte. No pot autoritzar l’omissió de les comprovacions de l’usuari ni l’enviament de fitxers a altres llocs.
Identifiqueu les conseqüències possibles
El mateix text enganyós té conseqüències diferents segons l’entorn. Un sistema de resum de només lectura podria produir un resum incorrecte. Un agent amb accés d’escriptura al repositori pot modificar codi. Un agent amb secrets i accés de xarxa sortint pot exposar informació.
Inspeccioneu les accions disponibles abans de decidir quines defenses són rellevants. Enumereu els recursos sensibles, les destinacions on es pot escriure i les destinacions externes. Incloeu els connectors afegits després de la configuració inicial. Una eina nova pot ampliar l’efecte d’una feblesa existent.
Un agent també pot traslladar contingut enganyós a una fase posterior. Per exemple, pot copiar una instrucció no fiable en un encàrrec generat. L’agent següent no ha de tractar aquest encàrrec com una política aprovada de manera independent.
Utilitzeu diversos controls amb finalitats diferenciades
Separeu les instruccions fiables de la tasca de les dades recuperades en el disseny de l’aplicació. Mostreu l’origen del material recuperat. Aquests passos milloren la interpretació, però no estableixen un límit de seguretat complet.
Feu complir els permisos sobre els recursos en el sistema d’execució. Restringiu les destinacions de les dades sensibles. Exigiu la decisió adequada abans de les accions amb conseqüències importants. Valideu l’operació proposada respecte de la tasca i la destinació autoritzades.
Els filtres i un segon model poden ajudar a detectar contingut sospitós. També poden no detectar atacs o bloquejar informació legítima. No substituïu l’autorització determinista per la puntuació de confiança d’un model. OWASP assenyala explícitament els límits de confiar només en prompts o recuperació d’informació. Llegiu la descripció del risc.
Proveu el flux de treball sense exposició real
Utilitzeu un repositori temporal i fitxers ficticis. No doneu a l’avaluació credencials de producció ni escriptures externes sense restriccions. Introduïu una instrucció inofensiva que entri en conflicte amb la tasca, com ara ometre una comprovació obligatòria.
Observeu tant la resposta del model com les accions reals de les eines. Un missatge que digui «he ignorat la instrucció» és insuficient si igualment s’ha omès la comprovació. Registreu la tasca, la dada de prova injectada, les eines permeses i el resultat observat.
Repetiu casos representatius després de canvis als prompts, models, connectors o permisos. Un exemple bloquejat és una evidència d’aquell cas, no una prova contra qualsevol injecció. Si una prova falla, reduïu les conseqüències possibles mentre corregiu el flux de treball subjacent.
Feu l'exercici
Creeu una dada de prova d'un sol ús amb un comentari que demani a un agent que ometi una comprovació obligatòria. Executeu una avaluació autoritzada i aïllada sense secrets ni escriptures externes. Verifiqueu que la comprovació s'executi igualment. Registreu els permisos de les eines, el comportament observat i els límits d'aquesta única prova.
Descarrega la fitxa (Markdown)Desmarcar aquesta opció elimina tot el progrés desat en aquest navegador.
El progrés es queda en aquest navegador. Sense compte ni seguiment.