Caching
Dua lapisan yang bertumpuk — cache respons semantik dan prompt caching sisi-provider — untuk memangkas biaya tanpa mengubah request Anda.
Ikhtisar
Dua lapisan cache
Anoman melakukan cache pada dua lapisan independen yang bertumpuk. Cache semantik dapat mengembalikan respons lengkap tanpa panggilan provider sama sekali, dan prompt caching sisi-provider membuat bagian input dari panggilan langsung jauh lebih murah. Setiap completion memberi tahu Anda mana (jika ada) yang diterapkan.
Cache semantik (Anoman)
Menyimpan respons lengkap untuk request yang identik. Saat hit, respons dikembalikan dari Redis tanpa panggilan provider — penghematan 100%. Opt-in per kunci API; otomatis aktif pada trafik batch/overflow.
Ditandai oleh X-Anoman-Cache: semantic
Cache prompt provider
Untuk system prompt besar, Anoman otomatis menyisipkan penanda cache sehingga provider hanya memproses ulang bagian yang berubah. Panggilan langsung tetap dilakukan — respons selalu segar — tetapi pemrosesan input jauh lebih murah. Diterapkan transparan pada tier berbayar.
Ditandai oleh X-Anoman-Cache: provider
Cache semantik
Per-pelanggan, opt-in, hit tanpa biaya
Cache semantik dipartisi per-pelanggan — kunci cache-nya adalah hash(customer_id + model + messages), jadi Anda tidak pernah melihat respons cache pelanggan lain. Aktifkan per kunci di Settings; TTL diatur per tier (Pro ~5 menit; Enterprise nonaktif secara default).
- Hit mengembalikan respons tersimpan tanpa panggilan provider — dikenai 0% weighted token.
- Terbaik untuk trafik non-interaktif yang berulang: loop dev/test, benchmark berulang, bot FAQ. Risiko: respons usang.
- Lewati cache untuk satu request dengan header x-anoman-no-cache.
# Enable the semantic cache on a key (Settings → API keys → cache toggle),
# or bypass the cache for a single request with a header:
curl https://api.anoman.io/v1/chat/completions \
-H "Authorization: Bearer anm-sk-..." \
-H "Content-Type: application/json" \
-H "x-anoman-no-cache: 1" \
-d '{
"model": "gpt-4o-mini",
"messages": [{"role": "user", "content": "Summarize the Q3 report."}]
}'Cache prompt provider
Input lebih murah pada panggilan langsung
Ketika system prompt melebihi minimum provider, Anoman menyisipkan penanda cache agar provider menggunakan kembali prefiks yang sudah diproses. Respons selalu segar — hanya pemrosesan input yang didiskon. Ambang batas dan diskon berbeda per provider:
| Provider | Minimum | Diskon input |
|---|---|---|
| Anthropic | 2,048+ tokens | hingga 90% off input (cache 5 menit) |
| OpenAI | otomatis | hingga 90% off prefiks yang di-cache |
| 32,768+ tokens | hingga 97,5% off input |
Anda tidak mengonfigurasi apa pun — penanda disisipkan transparan pada tier berbayar setiap kali prompt memenuhi syarat.
Diskon & penghematan
Bagaimana caching muncul di penagihan
Caching langsung memengaruhi penagihan weighted-token. Hit cache semantik dikenai 0%; hit cache prompt provider dikenakan sekitar 10% dari bobot normal — pengurangan weighted-token ~90% (lihat Kuota & overage).
# Cache + batch savings, aggregated for your account.
curl https://api.anoman.io/anoman/v1/usage/savings \
-H "Authorization: Bearer anm-sk-..."
# {
# "cache_savings_usd": "3.41", # semantic + provider prompt cache
# "batch_savings_usd": "12.08",
# "window": "30d"
# }Total penghematan cache + batch muncul di halaman Usage dan di blok _anoman.cache pada setiap respons.
Referensi
Header X-Anoman-Cache
Setiap completion membawa header X-Anoman-Cache — none, provider, atau semantic — plus blok _anoman.cache yang cocok dengan penghematan untuk request tersebut.
HTTP/1.1 200 OK
x-anoman-cache: semantic
x-anoman-tier: pro
content-type: application/json
# semantic → served from Anoman's Redis cache, zero provider call (100% saved)
# provider → live provider call, but cached input prefix (up to 90–97.5% off input)
# none → no cache appliedTerkait: Batch routing (penghematan ~50% lain pada pekerjaan non-interaktif) dan Kuota & overage (bagaimana diskon dipetakan ke alokasi Anda).
Lihat penghematan Anda
Penghematan cache dan batch dilacak per akun di halaman Usage.