anoman
Panduan

Caching

Dua lapisan yang bertumpuk — cache respons semantik dan prompt caching sisi-provider — untuk memangkas biaya tanpa mengubah request Anda.

Ikhtisar

Dua lapisan cache

Anoman melakukan cache pada dua lapisan independen yang bertumpuk. Cache semantik dapat mengembalikan respons lengkap tanpa panggilan provider sama sekali, dan prompt caching sisi-provider membuat bagian input dari panggilan langsung jauh lebih murah. Setiap completion memberi tahu Anda mana (jika ada) yang diterapkan.

Cache semantik (Anoman)

Menyimpan respons lengkap untuk request yang identik. Saat hit, respons dikembalikan dari Redis tanpa panggilan provider — penghematan 100%. Opt-in per kunci API; otomatis aktif pada trafik batch/overflow.

Ditandai oleh X-Anoman-Cache: semantic

Cache prompt provider

Untuk system prompt besar, Anoman otomatis menyisipkan penanda cache sehingga provider hanya memproses ulang bagian yang berubah. Panggilan langsung tetap dilakukan — respons selalu segar — tetapi pemrosesan input jauh lebih murah. Diterapkan transparan pada tier berbayar.

Ditandai oleh X-Anoman-Cache: provider

Cache semantik

Per-pelanggan, opt-in, hit tanpa biaya

Cache semantik dipartisi per-pelanggan — kunci cache-nya adalah hash(customer_id + model + messages), jadi Anda tidak pernah melihat respons cache pelanggan lain. Aktifkan per kunci di Settings; TTL diatur per tier (Pro ~5 menit; Enterprise nonaktif secara default).

  • Hit mengembalikan respons tersimpan tanpa panggilan provider — dikenai 0% weighted token.
  • Terbaik untuk trafik non-interaktif yang berulang: loop dev/test, benchmark berulang, bot FAQ. Risiko: respons usang.
  • Lewati cache untuk satu request dengan header x-anoman-no-cache.
# Enable the semantic cache on a key (Settings → API keys → cache toggle),
# or bypass the cache for a single request with a header:
curl https://api.anoman.io/v1/chat/completions \
  -H "Authorization: Bearer anm-sk-..." \
  -H "Content-Type: application/json" \
  -H "x-anoman-no-cache: 1" \
  -d '{
    "model": "gpt-4o-mini",
    "messages": [{"role": "user", "content": "Summarize the Q3 report."}]
  }'

Cache prompt provider

Input lebih murah pada panggilan langsung

Ketika system prompt melebihi minimum provider, Anoman menyisipkan penanda cache agar provider menggunakan kembali prefiks yang sudah diproses. Respons selalu segar — hanya pemrosesan input yang didiskon. Ambang batas dan diskon berbeda per provider:

ProviderMinimumDiskon input
Anthropic2,048+ tokenshingga 90% off input (cache 5 menit)
OpenAIotomatishingga 90% off prefiks yang di-cache
Google32,768+ tokenshingga 97,5% off input

Anda tidak mengonfigurasi apa pun — penanda disisipkan transparan pada tier berbayar setiap kali prompt memenuhi syarat.

Diskon & penghematan

Bagaimana caching muncul di penagihan

Caching langsung memengaruhi penagihan weighted-token. Hit cache semantik dikenai 0%; hit cache prompt provider dikenakan sekitar 10% dari bobot normal — pengurangan weighted-token ~90% (lihat Kuota & overage).

# Cache + batch savings, aggregated for your account.
curl https://api.anoman.io/anoman/v1/usage/savings \
  -H "Authorization: Bearer anm-sk-..."

# {
#   "cache_savings_usd": "3.41",     # semantic + provider prompt cache
#   "batch_savings_usd": "12.08",
#   "window": "30d"
# }

Total penghematan cache + batch muncul di halaman Usage dan di blok _anoman.cache pada setiap respons.

Referensi

Header X-Anoman-Cache

Setiap completion membawa header X-Anoman-Cache — none, provider, atau semantic — plus blok _anoman.cache yang cocok dengan penghematan untuk request tersebut.

HTTP/1.1 200 OK
x-anoman-cache:  semantic
x-anoman-tier:   pro
content-type:    application/json

# semantic  → served from Anoman's Redis cache, zero provider call (100% saved)
# provider  → live provider call, but cached input prefix (up to 90–97.5% off input)
# none      → no cache applied

Terkait: Batch routing (penghematan ~50% lain pada pekerjaan non-interaktif) dan Kuota & overage (bagaimana diskon dipetakan ke alokasi Anda).

Lihat penghematan Anda

Penghematan cache dan batch dilacak per akun di halaman Usage.