anoman
MasukDapatkan API Key
Concepts
Beranda Dokumentasi

Weighted tokens

Satu formula memetakan raw token provider ke kuota paket bulanan Anda. Model premium menghabiskan lebih banyak weighted token; routing regional lebih murah; cache + batch gratis.

Sudah digantikan — referensi historis. Anoman kini menagih dengan harga provider asli (markup 0%) atas saldo prabayar — weighted token sudah tidak dipakai untuk penagihan pelanggan. Halaman ini disimpan sebagai latar teknis. Lihat paket & penagihan →

Satu kuota, semua model

Raw token provider adalah unit penagihan yang buruk. Satu token output GPT-5 berharga ~40× satu token output Gemma 2 9B. Jika kami menagih raw token, kuota bulanan Anda akan berarti sangat berbeda tergantung model yang Anda pilih, dan Anda harus punya kuota terpisah per tier atau model harga yang mustahil dianggarkan.

Weighted token menormalkan hal ini. Setiap raw token dikalikan dengan tier multiplier model, sehingga 1.000 raw token GPT-5 memotong kuota Anda jauh lebih banyak daripada 1.000 raw token Gemma. Anda bisa berpindah bebas antar model tanpa menegosiasi ulang kuota.

Formula

weighted_tokens = raw_tokens
                  × provider_multiplier   (model's data-processing region)
                  × tier_multiplier       (Pivot v2 model tier)
                  × quota_discount        (cache + batch savings)

Empat faktor dikalikan bersama. tier_multiplier model adalah pengungkit terbesar; keputusan routing (provider_multiplier, quota_discount) menguranginya. Cache hit menolkannya sepenuhnya.

Bracket Pivot v2

TierMultiplierContoh model
budget1qwen-2.5-7b, llama-3.1-8b, gemma-2-9b
mid4claude-sonnet-4-6, gpt-4o, deepseek-v3, gemini-1.5-pro
premium17claude-opus-4-7, gpt-5.5, gpt-4-turbo
ultra42Tier flagship masa depan (reserved)

Multiplier dipilih untuk mendekati rasio biaya antar provider. Premium ≈ 17 × budget; ultra ≈ 42 × budget. Tier setiap model terlihat di halaman detailnya.

Insentif regional

Tipe providerMultiplierAlasan
cloud_direct1.0Default — model berjalan di region asal upstream
bedrock1.0AWS Bedrock di Jakarta (ap-southeast-3) — diproses di Indonesia, ditagih seperti cloud_direct
self_hosted0.5Model yang di-host di data center Indonesia kami
local_id0.3Model open-source berdomisili Indonesia (varian sahabat-ai)

Model yang sama bisa tersedia melalui beberapa tipe provider. Memilih varian regional memangkas pengeluaran weighted-token Anda.

Cache + batch mengurangi biaya kuota

  • Semantic cache hit — quota_discount = 0%. Nol kuota dipotong; response ter-cache dilayani. Tidak ada panggilan provider upstream.
  • Provider cache hit — quota_discount = 90%. Kami tetap memanggil upstream tetapi hanya membayar (dan menagih) 10% dari normal. Anthropic + OpenAI + Google semuanya menawarkan prompt caching untuk prefix system prompt.
  • Routing batch — quota_discount = 50%. Kuota dipotong setengah saat Anda opt-in ke batch via header.
  • Realtime + tanpa cache — quota_discount = 100%. Biaya weighted-token penuh.

Cek ulang perhitungannya

Pro plan quota:           20,000,000 weighted tokens / month
Request:                  1,000 raw tokens to claude-sonnet-4-6
                          (mid tier, cloud-direct US)

provider_multiplier:      1.0   (cloud_direct)
tier_multiplier:          4     (mid)
quota_discount:           100%  (realtime, no cache hit)

weighted_tokens = 1000 × 1.0 × 4 × 1.0 = 4,000

Available budget:         20,000,000 / 4,000 = 5,000 such requests/month
Same request, but routed via batch (50% discount) AND hit semantic cache:

provider_multiplier:      1.0
tier_multiplier:          4
quota_discount:           0%   (cache hit — fully discounted from quota)

weighted_tokens = 1000 × 1.0 × 4 × 0.0 = 0

Budget used:              0
Provider request:         skipped (cache served the response)

Provider cache hit (not semantic cache) only discounts 10%:
weighted_tokens = 1000 × 1.0 × 4 × 0.9 = 3,600

Di mana melihat weighted token

  • Setiap response — _anoman.weighted_tokens field pada body chat completion.
  • Traces — kolom weighted_tokens per-request di tabel Traces dashboard.
  • Halaman Usage — pengeluaran weighted-token bulan berjalan yang diringkas per model + region.
  • Halaman detail model — halaman detail setiap model menampilkan multiplier provider × tier sehingga Anda dapat memprediksi pengeluaran sebelum memanggil.

Lihat pengeluaran weighted-token Anda saat ini.

Dashboard Usage menampilkan tren MTD + 7d + 30d.

On this page