Evaluasi dan Monitoring Agent
Agent perlu dievaluasi dan dimonitor karena ia mengambil beberapa langkah, memakai tools, dan bisa gagal di banyak titik. Materi ini membahas trace, test set, KPI, dan incident review.
- Membuat trace yang bisa dibaca
- Menentukan KPI agent
- Menganalisis failure mode
Sebelum mulai
- Paham agent, tool calling, dan orchestration.
- Punya satu workflow agent yang ingin diuji.
Konsep utama
01Tracing
Tracing merekam input, langkah, tool call, output, error, dan keputusan agent.
Kenapa penting: Trace membuat kegagalan agent bisa dicari penyebabnya.
Contoh: Trace menunjukkan agent memakai sumber yang salah sebelum membuat kesimpulan.
Yang sering keliru: Hanya menyimpan output akhir tanpa langkah dan tool call.
02Test set
Test set adalah kumpulan kasus yang dipakai untuk menguji apakah agent bekerja pada kondisi mudah, sulit, dan berisiko.
Kenapa penting: Agent yang tampak bagus di demo bisa gagal saat input nyata lebih berantakan.
Contoh: Support agent diuji dengan FAQ mudah, komplain emosional, data hilang, dan permintaan refund besar.
Yang sering keliru: Menguji hanya dengan happy path.
03KPI dan incident review
KPI mengukur performa seperti resolution rate, wrong-answer rate, latency, biaya, dan escalation. Incident review membaca kasus gagal untuk perbaikan.
Kenapa penting: Pemantauan mencegah sistem terus mengulang kesalahan yang sama.
Contoh: Jika wrong-answer rate naik, cek sumber, prompt, tool, dan perubahan data terbaru.
Yang sering keliru: Mengukur hanya jumlah request tanpa kualitas jawaban.
Cara kerjanya
Agent yang sudah dibangun perlu dievaluasi secara berkala. Tanpa evaluasi, kita tidak tau apakah agent benar-benar membantu atau justru menambah pekerjaan. Evaluasi bukan sekadar 'bisa jalan', tapi seberapa baik, seberapa cepat, dan seberapa murah.
Metrik utama: Task completion rate (berapa persen task selesai tanpa intervensi manusia), Token cost (berapa biaya LLM per task), Latency (berapa lama dari input sampai output final), dan Quality score (seberapa akurat dan berguna output-nya).
Observability adalah kemampuan melihat apa yang terjadi di dalam agent. Setiap step, decision, tool call, dan error harus dicatat. Ini penting untuk debugging ketika agent gagal, dan untuk mengidentifikasi pola yang bisa dioptimasi.
A/B testing agent melibatkan menjalankan dua versi agent dengan task yang sama, lalu membandingkan hasilnya. Ini membantu menentukan apakah perubahan prompt, tool, atau model benar-benar meningkatkan kualitas.
Contoh nyata
Coba sendiri
- 1
Jalankan agent dengan 10 task berbeda.
- 2
Catat: completion, cost, latency, error type.
- 3
Hitung metrik utama.
- 4
Identifikasi 3 perbaikan prioritas.
- 5
Implementasi perbaikan dan jalankan ulang.
Prompt yang bisa dipakai
Cek pemahaman
Jawab dengan bahasa sendiri. Kalau masih muter-muter, baca ulang bagian yang paling nyangkut.
- 1
Apa metrik paling penting untuk menilai agent?
- 2
Kapan agent dianggap 'cukup bagus' untuk production?
- 3
Apa beda latency dan throughput dalam konteks agent?