Agent Orchestration
Lesson 2 dari 3 · Lanjutan · 45 sampai 60 menit

Evaluasi dan Monitoring Agent

Agent perlu dievaluasi dan dimonitor karena ia mengambil beberapa langkah, memakai tools, dan bisa gagal di banyak titik. Materi ini membahas trace, test set, KPI, dan incident review.

Setelah selesai, kamu bisaLesson 2 dari 3
  • Membuat trace yang bisa dibaca
  • Menentukan KPI agent
  • Menganalisis failure mode

Sebelum mulai

  • Paham agent, tool calling, dan orchestration.
  • Punya satu workflow agent yang ingin diuji.
Target belajar: Setelah selesai, kamu bisa membuat test set dan log sederhana untuk menilai kualitas agent.

Konsep utama

01Tracing

Tracing merekam input, langkah, tool call, output, error, dan keputusan agent.

Kenapa penting: Trace membuat kegagalan agent bisa dicari penyebabnya.

Contoh: Trace menunjukkan agent memakai sumber yang salah sebelum membuat kesimpulan.

Yang sering keliru: Hanya menyimpan output akhir tanpa langkah dan tool call.

02Test set

Test set adalah kumpulan kasus yang dipakai untuk menguji apakah agent bekerja pada kondisi mudah, sulit, dan berisiko.

Kenapa penting: Agent yang tampak bagus di demo bisa gagal saat input nyata lebih berantakan.

Contoh: Support agent diuji dengan FAQ mudah, komplain emosional, data hilang, dan permintaan refund besar.

Yang sering keliru: Menguji hanya dengan happy path.

03KPI dan incident review

KPI mengukur performa seperti resolution rate, wrong-answer rate, latency, biaya, dan escalation. Incident review membaca kasus gagal untuk perbaikan.

Kenapa penting: Pemantauan mencegah sistem terus mengulang kesalahan yang sama.

Contoh: Jika wrong-answer rate naik, cek sumber, prompt, tool, dan perubahan data terbaru.

Yang sering keliru: Mengukur hanya jumlah request tanpa kualitas jawaban.

Cara kerjanya

Agent yang sudah dibangun perlu dievaluasi secara berkala. Tanpa evaluasi, kita tidak tau apakah agent benar-benar membantu atau justru menambah pekerjaan. Evaluasi bukan sekadar 'bisa jalan', tapi seberapa baik, seberapa cepat, dan seberapa murah.

Metrik utama: Task completion rate (berapa persen task selesai tanpa intervensi manusia), Token cost (berapa biaya LLM per task), Latency (berapa lama dari input sampai output final), dan Quality score (seberapa akurat dan berguna output-nya).

Observability adalah kemampuan melihat apa yang terjadi di dalam agent. Setiap step, decision, tool call, dan error harus dicatat. Ini penting untuk debugging ketika agent gagal, dan untuk mengidentifikasi pola yang bisa dioptimasi.

A/B testing agent melibatkan menjalankan dua versi agent dengan task yang sama, lalu membandingkan hasilnya. Ini membantu menentukan apakah perubahan prompt, tool, atau model benar-benar meningkatkan kualitas.

Contoh nyata

Contoh eval: Research agent menghasilkan 10 laporan. Dari 10, 7 akurat (70% completion rate). Biaya rata-rata $0.15 per laporan. Rata-rata waktu 45 detik. 3 laporan punya error: 1 timeout, 1 source tidak ditemukan, 1 output format salah.改进: tambah retry untuk timeout, perluas source coverage, perketat output format prompt.

Coba sendiri

  1. 1

    Jalankan agent dengan 10 task berbeda.

  2. 2

    Catat: completion, cost, latency, error type.

  3. 3

    Hitung metrik utama.

  4. 4

    Identifikasi 3 perbaikan prioritas.

  5. 5

    Implementasi perbaikan dan jalankan ulang.

Prompt yang bisa dipakai

Saya punya agent [NAMA AGENT]. Saya ingin mengevaluasi performanya. Task yang dijalankan: [CONTOH TASK]. Bantu saya buat: 1) Evaluation rubric, 2) Metrik yang perlu diukur, 3) Test cases, 4) Cara scoring, 5) Threshold untuk pass/fail.

Cek pemahaman

Jawab dengan bahasa sendiri. Kalau masih muter-muter, baca ulang bagian yang paling nyangkut.

  1. 1

    Apa metrik paling penting untuk menilai agent?

  2. 2

    Kapan agent dianggap 'cukup bagus' untuk production?

  3. 3

    Apa beda latency dan throughput dalam konteks agent?

Tugas

Buat evaluation framework untuk agent yang sudah ada. Tentukan minimal 4 metrik, 10 test cases, scoring rubric, dan threshold. Jalankan eval dan tulis laporan hasilnya.

Lanjut ke materi berikutnya

Setelah evaluasi, lanjut ke production safety dan deployment agar agent punya batas, log, dan proses rilis yang aman.
Lanjut: Agent di Production: Safety dan Deployment