Anda pikir AI Agent bekerja secara otonom selama berjam-jam? Anthropic memiliki data nyata — sebagian besar tugas selesai dalam 45 detik.
Tapi angka lain lebih patut diperhatikan: sesi terpanjang bertambah dua kali lebih cepat.
Metodologi Penelitian
Anthropic menganalisis jutaan interaksi nyata di Claude Code dan API untuk memahami tiga hal: seberapa besar otonomi yang diberikan pengguna kepada agen, dalam skenario apa agen digunakan, dan risiko potensial apa yang ada.
Ini adalah pertama kalinya industri menggunakan data penggunaan nyata berskala besar untuk mengukur otonomi AI agent, bukan dengan mengandalkan tolok ukur atau eksperimen sandbox.
Data Paling Penting
Durasi sesi median: 45 detik
Sebagian besar tugas agen bersifat singkat dan cepat. Ini bukan proyek kompleks berjam-jam, melainkan tugas kecil yang spesifik.
Namun: Antara Oktober 2025 dan Januari 2026, durasi sesi persentil ke-99,9 di Claude Code meningkat dari di bawah 25 menit menjadi lebih dari 45 menit. Dengan kata lain, 0,1% tugas terpanjang berlipat ganda dalam tiga bulan.
Tren ini menunjukkan bahwa pengguna berat di puncak sedang mendorong AI Agent ke dalam alur kerja yang semakin panjang dan kompleks.
Digunakan di Mana
Rekayasa perangkat lunak mencakup 49,7% dari seluruh panggilan alat. Proporsi ini intuitif — programmer adalah kelompok pertama yang mengadopsi agen secara besar-besaran, dan Claude Code memang dirancang untuk skenario ini.
Tapi angka-angka di bawah ini lebih menarik:
| Skenario | Pangsa |
|---|---|
| Rekayasa perangkat lunak | 49,7% |
| Otomatisasi backend | 9,1% |
| Pemasaran/penulisan naskah | 4,4% |
| Penjualan/CRM | 4,3% |
| Keuangan/akuntansi | 4,0% |
| Analisis data | 3,5% |
Otomatisasi backend, keuangan, dan penjualan secara diam-diam merambah. Ini bukan demo laboratorium — perusahaan nyata menggunakan AI Agent untuk menangani proses bisnis aktual.
Apakah Pengawasan Manusia Masih Ada?
80% panggilan alat memiliki setidaknya satu tindakan pengaman. 73% melibatkan langkah manusia-dalam-loop. Hanya 0,8% operasi yang tidak dapat diubah.
Angka-angka ini secara umum optimistis — menunjukkan bahwa sebagian besar perusahaan masih mempertahankan katup pengaman saat menggunakan agen.
Tapi perilaku pengguna menunjukkan pola perubahan yang menarik:
- Pengguna baru: sekitar 20% tugas memilih persetujuan otomatis penuh
- Pengguna berpengalaman (750+ sesi): persetujuan otomatis penuh melebihi 40%
Ini terlihat seperti manusia yang melepaskan kendali seiring meningkatnya kepercayaan. Namun, tingkat interupsi juga meningkat — dari 5% menjadi 9% pada periode yang sama.
Ini menunjukkan bahwa pengguna berpengalaman tidak melepaskan kendali secara membabi buta, tetapi mengubah gaya pengawasan: dari menyetujui setiap tindakan langkah demi langkah, menjadi pemantauan menyeluruh dan intervensi hanya jika masalah muncul.
AI Agent Juga Berhenti Sendiri
Temuan yang tidak terduga: Claude Code meminta klarifikasi pada tugas kompleks lebih dari dua kali lebih sering dibandingkan pada tugas sederhana, dan frekuensi penghentian yang diprakarsai sendiri ini lebih tinggi daripada tingkat interupsi manual manusia.
Dengan kata lain, model itu sendiri dapat mengidentifikasi saat-saat ketika ia tidak yakin dan perlu bertanya. Ini lebih terperinci daripada hanya mengandalkan pengawasan manusia.
Deployment Overhang
Studi ini memperkenalkan sebuah konsep: deployment overhang.
Artinya: tingkat otonomi yang diberikan kepada model saat ini sebenarnya berada di bawah batas kemampuannya. Seiring waktu, pengguna secara bertahap akan mendorong tugas ke batas — sesi yang lebih panjang, lebih sedikit intervensi, rantai tugas yang lebih kompleks.
Implikasinya terhadap keamanan adalah: pengujian pra-rilis saja tidak cukup. Perlu membangun infrastruktur pemantauan berkelanjutan pasca-penyebaran. Sama seperti mengemudi yang tidak hanya bergantung pada inspeksi pabrik, tetapi juga pada dasbor kamera dan penegakan hukum lalu lintas.
Sumber: CocoLoop, Measuring AI agent autonomy in practice (Anthropic Research); The Autonomy Gap: What Anthropic Learned Watching Millions of AI Agent Interactions (Shashi.co)