Jailbreak & injeksi tidak langsung
Tangkap upaya menjebol system prompt Anda, serta instruksi berbahaya yang diselundupkan lewat hasil tool dan konten yang diambil.
Ikhtisar
Dua guardrail sadar-konteks
Di luar pemeriksaan injeksi input wajib pada pesan pengguna, Anoman menyertakan dua guardrail terkait yang mengawasi serangan yang lebih halus. Masing-masing adalah mode per-policy-group.
jailbreak_detection_mode— mendeteksi upaya jailbreak dan gaya DAN untuk menimpa system prompt atau kebijakan ("abaikan semua instruksi sebelumnya", pelarian roleplay, probe kebocoran prompt).indirect_injection_mode— mendeteksi injeksi prompt TIDAK LANGSUNG: instruksi berbahaya yang datang bukan dari pesan langsung pengguna melainkan lewat hasil tool, dokumen yang diambil, atau konten tak tepercaya lain yang dibaca model di tengah tugas.
Perbedaannya
Berbeda dari injeksi input wajib
Ini BUKAN guardrail injeksi input yang selalu aktif. Guardrail itu (klasifikator DeBERTa pada prompt pengguna) bersifat wajib, tidak bisa dinonaktifkan per kunci, dan mengembalikan 403 pada injeksi langsung yang terdeteksi — lihat ikhtisar guardrails. Deteksi jailbreak dan injeksi tidak langsung adalah lapisan terpisah yang dapat dikonfigurasi dan default-nya monitor sehingga Anda mengamati upaya sebelum menegakkan.
Mode
off / monitor / block
Kedua guardrail berbagi tiga mode yang sama, dengan default monitor. Setel secara terpisah per policy group.
| Mode | Perilaku |
|---|---|
| off | Tanpa deteksi. Guardrail dilewati. |
| monitorDefault | Deteksi dan CATAT saja — tidak pernah memblokir. Upaya direkam ke Security Activity sehingga Anda bisa mengukur tingkatnya sebelum menegakkan. Ini adalah default. |
| block | Kembalikan HTTP 403 pada upaya yang terdeteksi. Permintaan tidak pernah dirutekan ke penyedia. |
// Policy group config (PATCH /anoman/v1/policy-groups/{id})
{
"jailbreak_detection_mode": "block", // off | monitor | block
"indirect_injection_mode": "monitor" // off | monitor | block
}Temuan
Di mana upaya direkam
Konfigurasi kedua mode per policy group di /dashboard/guardrails. Deteksi — termasuk yang dipantau tanpa memblokir — muncul di dashboard Security Activity pada /dashboard/security-activity, sehingga Anda bisa meninjau upaya nyata sebelum mengubah guardrail ke block.
Terkait: output DLP untuk memindai respons, dan policy group untuk cara konfigurasi per-grup dan override per-kunci berinteraksi.
Awasi jailbreak
Kedua detektor sudah memantau — tingkatkan ke block saat sinyalnya bersih.