Weighted tokens
Satu formula memetakan raw token provider ke kuota paket bulanan Anda. Model premium menghabiskan lebih banyak weighted token; routing regional lebih murah; cache + batch gratis.
Sudah digantikan — referensi historis. Anoman kini menagih dengan harga provider asli (markup 0%) atas saldo prabayar — weighted token sudah tidak dipakai untuk penagihan pelanggan. Halaman ini disimpan sebagai latar teknis. Lihat paket & penagihan →
Satu kuota, semua model
Raw token provider adalah unit penagihan yang buruk. Satu token output GPT-5 berharga ~40× satu token output Gemma 2 9B. Jika kami menagih raw token, kuota bulanan Anda akan berarti sangat berbeda tergantung model yang Anda pilih, dan Anda harus punya kuota terpisah per tier atau model harga yang mustahil dianggarkan.
Weighted token menormalkan hal ini. Setiap raw token dikalikan dengan tier multiplier model, sehingga 1.000 raw token GPT-5 memotong kuota Anda jauh lebih banyak daripada 1.000 raw token Gemma. Anda bisa berpindah bebas antar model tanpa menegosiasi ulang kuota.
Formula
Empat faktor dikalikan bersama. tier_multiplier model adalah pengungkit terbesar; keputusan routing (provider_multiplier, quota_discount) menguranginya. Cache hit menolkannya sepenuhnya.
Bracket Pivot v2
| Tier | Multiplier | Contoh model |
|---|---|---|
| budget | 1 | qwen-2.5-7b, llama-3.1-8b, gemma-2-9b |
| mid | 4 | claude-sonnet-4-6, gpt-4o, deepseek-v3, gemini-1.5-pro |
| premium | 17 | claude-opus-4-7, gpt-5.5, gpt-4-turbo |
| ultra | 42 | Tier flagship masa depan (reserved) |
Multiplier dipilih untuk mendekati rasio biaya antar provider. Premium ≈ 17 × budget; ultra ≈ 42 × budget. Tier setiap model terlihat di halaman detailnya.
Insentif regional
| Tipe provider | Multiplier | Alasan |
|---|---|---|
cloud_direct | 1.0 | Default — model berjalan di region asal upstream |
bedrock | 1.0 | AWS Bedrock di Jakarta (ap-southeast-3) — diproses di Indonesia, ditagih seperti cloud_direct |
self_hosted | 0.5 | Model yang di-host di data center Indonesia kami |
local_id | 0.3 | Model open-source berdomisili Indonesia (varian sahabat-ai) |
Model yang sama bisa tersedia melalui beberapa tipe provider. Memilih varian regional memangkas pengeluaran weighted-token Anda.
Cache + batch mengurangi biaya kuota
- Semantic cache hit —
quota_discount = 0%. Nol kuota dipotong; response ter-cache dilayani. Tidak ada panggilan provider upstream. - Provider cache hit —
quota_discount = 90%. Kami tetap memanggil upstream tetapi hanya membayar (dan menagih) 10% dari normal. Anthropic + OpenAI + Google semuanya menawarkan prompt caching untuk prefix system prompt. - Routing batch —
quota_discount = 50%. Kuota dipotong setengah saat Anda opt-in ke batch via header. - Realtime + tanpa cache —
quota_discount = 100%. Biaya weighted-token penuh.
Cek ulang perhitungannya
Di mana melihat weighted token
- Setiap response —
_anoman.weighted_tokensfield pada body chat completion. - Traces — kolom weighted_tokens per-request di tabel Traces dashboard.
- Halaman Usage — pengeluaran weighted-token bulan berjalan yang diringkas per model + region.
- Halaman detail model — halaman detail setiap model menampilkan multiplier provider × tier sehingga Anda dapat memprediksi pengeluaran sebelum memanggil.
Lihat pengeluaran weighted-token Anda saat ini.
Dashboard Usage menampilkan tren MTD + 7d + 30d.