Bagaimana Anoman menagih kuota langganan.
Satu formula memetakan raw token provider ke kuota paket bulanan Anda. Model premium menghabiskan lebih banyak weighted token; routing regional lebih murah; cache + batch gratis.
Kenapa weighted token
Satu kuota, semua model
Raw token provider adalah unit penagihan yang buruk. Satu token output GPT-5 berharga ~40× satu token output Gemma 2 9B. Jika kami menagih raw token, kuota bulanan Anda akan berarti sangat berbeda tergantung model yang Anda pilih, dan Anda harus punya kuota terpisah per tier atau model harga yang mustahil dianggarkan.
Weighted token menormalkan hal ini. Setiap raw token dikalikan dengan tier multiplier model, sehingga 1.000 raw token GPT-5 memotong kuota Anda jauh lebih banyak daripada 1.000 raw token Gemma. Anda bisa berpindah bebas antar model tanpa menegosiasi ulang kuota.
Formula
weighted_tokens = raw_tokens
× provider_multiplier (model's data-processing region)
× tier_multiplier (Pivot v2 model tier)
× quota_discount (cache + batch savings)Empat faktor dikalikan bersama. tier_multiplier model adalah pengungkit terbesar; keputusan routing (provider_multiplier, quota_discount) menguranginya. Cache hit menolkannya sepenuhnya.
Multiplier tier
Bracket Pivot v2
| Tier | Multiplier | Contoh model |
|---|---|---|
| budget | 1 | qwen-2.5-7b, llama-3.1-8b, gemma-2-9b |
| mid | 4 | claude-sonnet-4-6, gpt-4o, deepseek-v3, gemini-1.5-pro |
| premium | 17 | claude-opus-4-7, gpt-5.5, gpt-4-turbo |
| ultra | 42 | Tier flagship masa depan (reserved) |
Multiplier dipilih untuk mendekati rasio biaya antar provider. Premium ≈ 17 × budget; ultra ≈ 42 × budget. Tier setiap model terlihat di halaman detailnya.
Multiplier provider
Insentif regional
| Tipe provider | Multiplier | Alasan |
|---|---|---|
| cloud_direct | 1.0 | Default — model berjalan di region asal upstream |
| bedrock | 0.5 | Routing Bedrock-regional — insentif untuk tetap regional |
| self_hosted | 0.5 | Model yang di-host di data center Indonesia kami |
| local_id | 0.3 | Model open-source berdomisili Indonesia (varian sahabat-ai) |
Model yang sama bisa tersedia melalui beberapa tipe provider. Memilih varian regional memangkas pengeluaran weighted-token Anda.
Diskon kuota
Cache + batch mengurangi biaya kuota
- Semantic cache hit —
quota_discount = 0%. Nol kuota dipotong; response ter-cache dilayani. Tidak ada panggilan provider upstream. - Provider cache hit —
quota_discount = 90%. Kami tetap memanggil upstream tetapi hanya membayar (dan menagih) 10% dari normal. Anthropic + OpenAI + Google semuanya menawarkan prompt caching untuk prefix system prompt. - Routing batch —
quota_discount = 50%. Kuota dipotong setengah saat Anda opt-in ke batch via header. - Realtime + tanpa cache —
quota_discount = 100%. Biaya weighted-token penuh.
Contoh perhitungan
Cek ulang perhitungannya
Pro plan quota: 20,000,000 weighted tokens / month
Request: 1,000 raw tokens to claude-sonnet-4-6
(mid tier, cloud-direct US)
provider_multiplier: 1.0 (cloud_direct)
tier_multiplier: 4 (mid)
quota_discount: 100% (realtime, no cache hit)
weighted_tokens = 1000 × 1.0 × 4 × 1.0 = 4,000
Available budget: 20,000,000 / 4,000 = 5,000 such requests/monthDi mana melihat weighted token
- Setiap response —
_anoman.weighted_tokensfield pada body chat completion. - Traces — kolom weighted_tokens per-request di tabel Traces dashboard.
- Halaman Usage — pengeluaran weighted-token bulan berjalan yang diringkas per model + region.
- Halaman detail model — halaman detail setiap model menampilkan multiplier provider × tier sehingga Anda dapat memprediksi pengeluaran sebelum memanggil.
Lihat pengeluaran weighted-token Anda saat ini.
Dashboard Usage menampilkan tren MTD + 7d + 30d.