anoman
Konsep · Weighted Tokens

Bagaimana Anoman menagih kuota langganan.

Satu formula memetakan raw token provider ke kuota paket bulanan Anda. Model premium menghabiskan lebih banyak weighted token; routing regional lebih murah; cache + batch gratis.

Kenapa weighted token

Satu kuota, semua model

Raw token provider adalah unit penagihan yang buruk. Satu token output GPT-5 berharga ~40× satu token output Gemma 2 9B. Jika kami menagih raw token, kuota bulanan Anda akan berarti sangat berbeda tergantung model yang Anda pilih, dan Anda harus punya kuota terpisah per tier atau model harga yang mustahil dianggarkan.

Weighted token menormalkan hal ini. Setiap raw token dikalikan dengan tier multiplier model, sehingga 1.000 raw token GPT-5 memotong kuota Anda jauh lebih banyak daripada 1.000 raw token Gemma. Anda bisa berpindah bebas antar model tanpa menegosiasi ulang kuota.

Formula

weighted_tokens = raw_tokens
                  × provider_multiplier   (model's data-processing region)
                  × tier_multiplier       (Pivot v2 model tier)
                  × quota_discount        (cache + batch savings)

Empat faktor dikalikan bersama. tier_multiplier model adalah pengungkit terbesar; keputusan routing (provider_multiplier, quota_discount) menguranginya. Cache hit menolkannya sepenuhnya.

Multiplier tier

Bracket Pivot v2

TierMultiplierContoh model
budget1qwen-2.5-7b, llama-3.1-8b, gemma-2-9b
mid4claude-sonnet-4-6, gpt-4o, deepseek-v3, gemini-1.5-pro
premium17claude-opus-4-7, gpt-5.5, gpt-4-turbo
ultra42Tier flagship masa depan (reserved)

Multiplier dipilih untuk mendekati rasio biaya antar provider. Premium ≈ 17 × budget; ultra ≈ 42 × budget. Tier setiap model terlihat di halaman detailnya.

Multiplier provider

Insentif regional

Tipe providerMultiplierAlasan
cloud_direct1.0Default — model berjalan di region asal upstream
bedrock0.5Routing Bedrock-regional — insentif untuk tetap regional
self_hosted0.5Model yang di-host di data center Indonesia kami
local_id0.3Model open-source berdomisili Indonesia (varian sahabat-ai)

Model yang sama bisa tersedia melalui beberapa tipe provider. Memilih varian regional memangkas pengeluaran weighted-token Anda.

Diskon kuota

Cache + batch mengurangi biaya kuota

  • Semantic cache hitquota_discount = 0%. Nol kuota dipotong; response ter-cache dilayani. Tidak ada panggilan provider upstream.
  • Provider cache hitquota_discount = 90%. Kami tetap memanggil upstream tetapi hanya membayar (dan menagih) 10% dari normal. Anthropic + OpenAI + Google semuanya menawarkan prompt caching untuk prefix system prompt.
  • Routing batchquota_discount = 50%. Kuota dipotong setengah saat Anda opt-in ke batch via header.
  • Realtime + tanpa cachequota_discount = 100%. Biaya weighted-token penuh.

Contoh perhitungan

Cek ulang perhitungannya

Pro plan quota:           20,000,000 weighted tokens / month
Request:                  1,000 raw tokens to claude-sonnet-4-6
                          (mid tier, cloud-direct US)

provider_multiplier:      1.0   (cloud_direct)
tier_multiplier:          4     (mid)
quota_discount:           100%  (realtime, no cache hit)

weighted_tokens = 1000 × 1.0 × 4 × 1.0 = 4,000

Available budget:         20,000,000 / 4,000 = 5,000 such requests/month

Di mana melihat weighted token

  • Setiap response_anoman.weighted_tokens field pada body chat completion.
  • Traceskolom weighted_tokens per-request di tabel Traces dashboard.
  • Halaman Usagepengeluaran weighted-token bulan berjalan yang diringkas per model + region.
  • Halaman detail modelhalaman detail setiap model menampilkan multiplier provider × tier sehingga Anda dapat memprediksi pengeluaran sebelum memanggil.

Lihat pengeluaran weighted-token Anda saat ini.

Dashboard Usage menampilkan tren MTD + 7d + 30d.