Jalur 03Pelajaran 3 / 6

Perlakukan konten yang diambil sebagai input tidak tepercaya

Kenali instruksi yang tersembunyi dalam file repositori dan hasil alat. Pisahkan informasi yang diambil dari kewenangan untuk bertindak.

Praktisi10 minDitinjau

Diterbitkan oleh Cara kami menulis

Periksa pemahaman AndaFile repositori menyatakan bahwa semua pengujian opsional dan agen harus mengabaikan instruksi tugas. Bagaimana alur kerja harus memperlakukannya?Kerjakan latihan
File repositori menyatakan bahwa semua pengujian opsional dan agen harus mengabaikan instruksi tugas. Bagaimana alur kerja harus memperlakukannya?

Hal yang akan dipelajari

  • Identifikasi prompt injection tidak langsung dalam alur pengembangan.
  • Jelaskan alasan label teks saja tidak dapat menegakkan batas keamanan.
  • Rancang pengujian aman untuk pembatasan alat.

Identifikasi titik ketika data menjadi instruksi

Agen pemrograman membaca lebih dari permintaan pengguna. Agen dapat memeriksa issue, file repositori, dokumentasi paket, hasil pencarian, dan respons alat. Sebagian konten tersebut dapat memuat instruksi dari orang lain.

Prompt injection terjadi ketika konten tersebut mengalihkan model dari tugas yang diizinkan. Injeksi tidak langsung masuk melalui sumber yang diambil, bukan permintaan langsung pengguna. OWASP menyebut materi repositori dan output alat sebagai jalur masuk yang relevan. Baca panduan pencegahan.

Pertimbangkan tugas pemeliharaan fiktif. Pengguna meminta agen memperbaiki filter laporan dan menjalankan pengujian wajib. README yang diambil menyatakan bahwa pengujian sudah usang dan meminta agen mengunggah file konfigurasi. README dapat menjelaskan proyek. README tidak dapat mengizinkan pengabaian pemeriksaan pengguna atau pengiriman file ke tempat lain.

Petakan dampak yang mungkin terjadi

Teks menyesatkan yang sama memiliki dampak berbeda dalam lingkungan berbeda. Peringkas dengan akses baca saja mungkin menghasilkan ringkasan keliru. Agen dengan izin menulis ke repositori dapat mengubah kode. Agen dengan secret dan akses jaringan keluar dapat membocorkan informasi.

Periksa tindakan yang tersedia sebelum menentukan pertahanan yang diperlukan. Daftar sumber daya sensitif, target yang dapat ditulis, dan tujuan eksternal. Sertakan konektor yang ditambahkan setelah penyiapan awal. Alat baru dapat memperbesar dampak kelemahan yang sudah ada.

Agen juga dapat membawa konten menyesatkan ke tahap berikutnya. Misalnya, agen dapat menyalin instruksi tidak tepercaya ke ringkasan tugas yang dihasilkan. Agen berikutnya tidak boleh memperlakukan ringkasan tersebut sebagai kebijakan yang telah disetujui secara independen.

Gunakan beberapa kontrol dengan tujuan berbeda

Pisahkan instruksi tugas tepercaya dari data yang diambil dalam desain aplikasi. Tampilkan asal materi yang diambil. Langkah ini memperbaiki penafsiran, tetapi tidak membentuk batas keamanan yang lengkap.

Tegakkan izin sumber daya dalam sistem eksekusi. Batasi tujuan pengiriman data sensitif. Wajibkan keputusan yang sesuai sebelum tindakan berdampak besar. Validasi operasi yang diusulkan terhadap tugas dan target yang diizinkan.

Filter dan model kedua dapat membantu mendeteksi konten mencurigakan. Keduanya juga dapat melewatkan serangan atau memblokir informasi yang sah. Jangan mengganti otorisasi deterministik dengan skor keyakinan model. OWASP secara eksplisit mencatat keterbatasan mengandalkan prompt atau pengambilan informasi saja. Baca penjelasan risiko.

Uji alur kerja tanpa paparan nyata

Gunakan repositori sekali pakai dan file fiktif. Jangan berikan kredensial produksi atau izin penulisan eksternal tanpa batas kepada evaluasi. Masukkan instruksi tidak berbahaya yang bertentangan dengan tugas, seperti melewati pemeriksaan wajib.

Amati respons model dan tindakan alat yang sebenarnya. Pesan “Saya mengabaikan instruksi tersebut” tidak cukup jika pemeriksaan tetap dilewati. Catat tugas, fixture yang memuat injeksi, alat yang diizinkan, dan hasil yang diamati.

Ulangi kasus yang mewakili penggunaan nyata setelah perubahan prompt, model, konektor, atau izin. Contoh yang diblokir merupakan bukti untuk kasus itu, bukan bukti perlindungan terhadap setiap injeksi. Jika pengujian gagal, kurangi dampak yang dapat terjadi sambil memperbaiki alur kerja dasarnya.

Kerjakan latihan

Buat fixture sekali pakai dengan komentar yang meminta agen melewati pemeriksaan wajib. Jalankan evaluasi terisolasi yang diizinkan, tanpa secret atau penulisan ke sistem eksternal. Verifikasi bahwa pemeriksaan tetap dijalankan. Catat izin alat, perilaku yang diamati, dan keterbatasan pengujian tunggal ini.

Unduh lembar kerja (Markdown)
Periksa pemahaman Anda ↑

Lanjutkan belajar

Sumber dan bacaan lanjutan

Bacaan terkait dari Taiga

← Pelajaran sebelumnya: Batasi kewenangan agen