anoman
Guardrails

Cara kerja guardrails.

Empat pengecekan pre-call dan dua pengecekan post-call berjalan pada setiap request. Request yang diblokir mengembalikan 403 — tidak pernah diantrekan, tidak pernah ditagih.

Urutan pipeline

Guardrails selalu berjalan sebelum routing

Cek auth + rate limit

→ [PRE-CALL GUARDRAILS]

1. Deteksi prompt injection (classifier ML, ~30ms)

2. Deteksi PII (~20ms)

3. Moderasi konten (keyword + ML, ~5ms)

4. Cek policy tool-call (allowlist/denylist, ~10ms)

↳ diblokir? Kembalikan 403. Request tidak pernah mencapai LLM. Tidak pernah ditagih.

Cek semantic cache → Routing → LLM call

→ [POST-CALL GUARDRAILS]

5. Filter konten response

6. Pemindaian PII response

Token metering → Response ke klien

Jenis guardrail

Empat lapisan pre-call

Prompt Injection

Classifier injeksi-prompt berbasis ML. Threshold: 0.85 — dapat dikonfigurasi per pelanggan. Latensi CPU ~30ms. Tidak dapat dinonaktifkan secara system-wide; threshold dapat disesuaikan.

Masking PII

Engine deteksi PII. Entitas: EMAIL, PHONE, CREDIT_CARD, SG NRIC, ID NIK, IP_ADDRESS, URL. Empat mode: redact, tokenize, synthetic, block.

Moderasi Konten

Classifier keyword + ML. English + Bahasa Indonesia. Latensi ~5ms. Dapat dikonfigurasi per policy group.

Conversational Guardrails

Konfigurasi YAML + aturan alur per policy group. Penegakan alur percakapan — memblokir topic steering, jailbreak, pengungkapan system-prompt.

Mode PII

Empat cara menangani PII yang terdeteksi

// Input: "My email is [email protected]"
// Output: "My email is [REDACTED]"

// API key setting:
{ "pii_mode": "redact" }

Override per-key

Override default guardrail per API key

// PATCH /anoman/v1/keys/{id}
{
  "guardrail_overrides": {
    "injectionEnabled": false,
    "piiEnabled": true,
    "contentModerationEnabled": false
  }
}

// Priority stack (highest → lowest):
// 1. System forced (ops emergency)
// 2. Per-key guardrail_overrides
// 3. Policy group defaults
// 4. System defaults

Conversational Guardrails

Penegakan alur percakapan

Konfigurasikan lewat tab Guardrails di dashboard. Konfigurasi YAML + aturan alur disimpan per policy group dan di-cache berdasarkan config hash untuk performa.

# Policy group conversational-guardrail config
models:
  - type: main
    engine: openai
    model: gpt-4o

rails:
  input:
    flows:
      - self check input
  output:
    flows:
      - self check output

Ikhtisar lengkap guardrails: Platform / Guardrails →

Amankan setiap panggilan AI dengan guardrails.