Dua tahun lalu, jendela konteks model mainstream masih berada di kisaran 4K hingga 8K. Kini, jendela konteks sejuta token sudah menjadi standar pada model flagship.
Lanskap saat ini
- Gemini 2.5 Pro: 1 juta token (dapat diperluas hingga 2 juta)
- Claude Opus 4.6: 1 juta token (beta)
- GPT-5.4: 1 juta token (dukungan eksperimental)
- Llama 4 Scout: 10 juta token
- Kimi K2: 128K → 256K
Llama 4 Scout dengan 10 juta token terdengar mengesankan, namun seberapa baik ia dapat mempertahankan akurasi pencarian informasi dalam konteks sepanjang itu masih menjadi tanda tanya besar.
Apakah lebih panjang selalu lebih baik?
Panjang konteks dan kegunaan praktis adalah dua hal yang berbeda. Metrik kuncinya adalah akurasi pencarian konteks panjang — apakah model masih dapat menemukan informasi yang dibutuhkan secara akurat dalam teks yang sangat panjang.
Data Opus 4.6: akurasi pencarian 8-needle pada konteks 256K adalah 93%, turun menjadi 76% pada 1 juta token. 76% mungkin terdengar tidak rendah, tetapi itu berarti hampir seperempat informasi yang Anda masukkan berpotensi "terlupakan."
Masalah nyata lainnya adalah biaya. Memasukkan 1 juta token tidaklah gratis — dengan harga API saat ini, mengisi penuh jendela konteks dapat menelan biaya beberapa dolar hingga puluhan dolar. Tanpa kontrol, sebuah agen yang menjalankan puluhan putaran percakapan dapat menghasilkan tagihan token yang sangat besar.
Teknologi Compaction
Compaction API dari Anthropic dan mekanisme auto_compact GPT-5.4 mencoba mengatasi masalah ini: ketika konteks hampir penuh, mereka secara otomatis mengompresi konten awal sambil mempertahankan informasi kunci. Secara teori, ini mendukung "percakapan tanpa batas," namun efek sebenarnya tergantung pada seberapa banyak informasi yang hilang selama proses kompresi.
Jendela konteks yang lebih panjang bukanlah tujuan akhir; mempertahankan pengambilan informasi yang akurat dalam konteks panjang itulah yang penting. Garis akhir dari perlombaan senjata ini bukanlah "siapa yang angkanya lebih besar," melainkan "siapa yang tetap dapat diandalkan dengan konteks yang sangat panjang."
Sumber: Dokumentasi resmi Anthropic, CocoLoop, laporan rilis model