Penyedia LLM menagih berdasarkan token, dan perhitungannya menjadi sederhana setelah Anda mengetahui empat faktor: model mana yang Anda gunakan, berapa banyak token input dan output yang dibutuhkan setiap permintaan, berapa banyak input yang dapat Anda cache, dan apakah pekerjaan dapat dijalankan dalam batch. Kalkulator ini mengubah tuas tersebut menjadi angka bulanan dan tahunan nyata dan memungkinkan Anda membandingkan model pada beban kerja yang sama. Panduan ini menjelaskan cara kerja setiap tuas dan di mana simpanan disembunyikan.
Cara kerja penetapan harga token
Setiap permintaan diberi harga dalam bentuk token — potongan sub-kata yang panjangnya kira-kira empat karakter. Penyedia memublikasikan dua tarif utama per model: harga per juta token input (semua yang Anda kirim) dan harga per juta token output (semua yang dihasilkan model). Biaya permintaan hanyalah setiap jumlah token dibagi satu juta, dikalikan dengan tarifnya, dan dijumlahkan.
Satu-satunya hal yang paling penting untuk diinternalisasi adalah bahwa keluaran jauh lebih mahal daripada masukan — biasanya 3 hingga 6 kali lipat biayanya. Pada Claude Sonnet 4.6, inputnya adalah US$3/1 juta dan outputnya adalah US$15/1 juta; pada GPT-5.5 harganya US$5 versus US$30. Artinya, model cerewet yang memberikan respons bisa lebih mahal dibandingkan model mahal yang menjawab dengan singkat. Jika ada tagihan yang mengejutkan Anda, lihat panjang keluarannya terlebih dahulu.
Biaya masukan vs. keluaran — dan mengapa pilihan model penting
Karena kedua tarif tersebut sangat berbeda, model termurah tidak selalu termurah untuk beban kerja Anda. Beban kerja yang mengirimkan perintah dalam jumlah besar namun mengharapkan jawaban singkat didominasi oleh biaya input, sehingga model tingkat menengah bisa menjadi pilihan yang murah. Beban kerja yang menghasilkan dokumen panjang didominasi oleh biaya keluaran, sehingga model yang lebih kecil dan lebih cepat dapat menghemat jauh lebih banyak daripada mencukur masukan.
Itulah gunanya tab Bandingkan Model: tab ini menjaga jumlah dan volume token Anda tetap dan menetapkan harga ulang pada tiga model sekaligus, membagi setiap batang menjadi masukan, masukan yang di-cache, dan keluaran sehingga Anda dapat melihat dengan tepat ke mana uang tersebut disalurkan. Seringkali model satu tingkat di bawah dapat menangani tugas tersebut dengan biaya yang lebih murah — satu-satunya cara untuk mengetahuinya adalah dengan membandingkan bilangan real Anda.
Caching cepat dan diskon batch
Dua fitur penyedia menghemat biaya tanpa mengubah model atau perintah Anda. Prompt caching menyimpan awalan stabil permintaan — perintah sistem, blok instruksi yang panjang, konteks yang diambil — sehingga permintaan berulang tidak memprosesnya ulang. Token yang di-cache dibaca kembali sekitar 10% dari harga input. Hasil tangkapannya adalah premium penulisan cache satu kali (sekitar 1,25× masukan pada Anthropic) pada permintaan pertama, sehingga cache akan terbayar ketika awalan yang sama digunakan kembali berkali-kali dalam jendela cache.
Batch API menjalankan permintaan secara asinkron menggunakan kecepatan batch yang dipublikasikan oleh penyedia. Banyak tarif token yang 50% dari harga standar, namun komponen seperti pembacaan cache dapat berbeda menurut penyedia. Jika tugas Anda dapat mentolerir latensi hitungan menit hingga jam — ringkasan massal, klasifikasi, evaluasi, pengayaan data — bandingkan tarif yang ditampilkan sebelum melakukan pengelompokan. Kedua fitur tersebut dapat ditumpuk: beban kerja yang di-cache, di-batch, dan berukuran tepat dapat menghabiskan biaya yang sangat kecil dibandingkan perkiraan naif.
Memperkirakan token dan menghindari kejutan
Untuk menganggarkan sebelum membangun, Anda memerlukan perkiraan token. Teks bahasa Inggris terdiri dari empat karakter atau 0,75 kata per token, jadi dokumen 2.000 kata kira-kira berisi 2.700 token. Tab Pengukur Token melakukan konversi ini dari teks yang ditempel atau hitungan mentah. Perlakukan ini sebagai panduan kasar — kode, JSON, teks non-Inggris, dan kosa kata yang tidak biasa diberi token secara berbeda, dan untuk angka pastinya, Anda harus menggunakan tokenizer atau titik akhir penghitungan token dari penyedia.
Dua kejutan umum: riwayat percakapan dikirim ulang (dan ditagih ulang) setiap kali kecuali Anda menyimpannya dalam cache atau memangkasnya, sehingga obrolan multi-putaran menjadi lebih mahal seiring bertambahnya panjang; dan konteks yang diambil dihitung sebagai masukan setiap kali meskipun pertanyaan pengguna kecil. Model dan harga pada alat ini telah diverifikasi pada tanggal 29 Agustus 2026 dan dipisahkan dalam satu tabel bertanggal dalam kode — selalu konfirmasikan dengan halaman harga milik penyedia sebelum membuat anggaran, karena tarif berubah.