Arahkan mudah → murah, sulit → premium.
Dua pola: classifier-first memilih model di awal, confidence-based hanya eskalasi saat diperlukan. Keduanya memangkas biaya 80%+ dibanding perutean naif ke satu model premium saja.
Kenapa perlu — Sebagian besar permintaan itu mudah
Distribusi trafik produksi sangat timpang. Di sebagian besar trafik chatbot + support, ~60% permintaan berupa pencarian faktual atau pemformatan sederhana — model kelas hemat menanganinya dengan sempurna. Mengarahkan itu ke claude-sonnet-4-6 berarti membayar ~15× lebih mahal dari yang diperlukan.
Triknya: model mungil untuk memutuskan model mana yang dipakai. Atau: coba yang murah dulu dan eskalasi saat confidence rendah.
Pola 1 — Classifier lebih dulu — Pilih model di awal
Model 7B mengklasifikasikan tingkat kesulitan pertanyaan. Classifier menambah ~$0.000_05 per permintaan — dapat diabaikan dibanding panggilan sonnet seharga $0.012.
Perutean classifier-first
Mode kegagalan: classifier salah mengarahkan pertanyaan sulit ke model murah. Setel system prompt agar cenderung eskalasi, atau gunakan pola hybrid di bawah.
Pola 2 — Eskalasi confidence — Coba murah, eskalasi saat menyerah
Menginstruksikan model murah untuk merespons dengan ESCALATE saat tidak yakin. Model murah mendapat kesempatan menangani setiap permintaan; kita hanya membayar premium saat ia secara eksplisit menyerah. Tingkat eskalasi ~5% umum untuk setup dengan prompt yang baik.
Eskalasi berbasis confidence
Pola 3 — Hybrid — Classifier + eskalasi
Gunakan classifier sebagai gerbang cepat untuk mengarahkan permintaan sulit yang jelas langsung ke premium (tanpa overhead panggilan ganda). Untuk selebihnya, jalur murah-dengan-eskalasi berlaku. Gabungan terbaik keduanya.
Hybrid — klasifikasi lalu eskalasi
Ekonomi — Perhitungan kasar
Ekonomi — perhitungan kasar per 10K permintaan
Tips produksi
- Lacak metadata — kirim
metadata: {difficulty, path}pada setiap panggilan agar halaman Usage di dashboard menampilkan distribusi perutean. Membantu Anda menyetel prompt classifier. - Pantau tingkat eskalasi — jika >15%, classifier Anda terlalu sering salah mengarahkan. Setel prompt atau pindah ke pola hybrid.
- Jalur sadar latensi — classifier menambah ~200 ms. Untuk UX yang sensitif latensi, pilih eskalasi confidence (jalur murah sekali panggil, eskalasi hanya saat diperlukan).
- Cache classifier — pertanyaan yang sama menghasilkan klasifikasi yang sama. Tambahkan
x-anoman-cache: semanticpada panggilan classifier agar pertanyaan berulang melewati bahkan hop classifier murah. - A/B test ambang batas — pisahkan 5% trafik ke "selalu pakai premium" sebagai kontrol kualitas. Bandingkan tingkat thumbs-up pengguna akhir vs kelompok yang dirutekan.
Lacak distribusi perutean Anda di dashboard.
Rincian per-model dengan biaya per rute.