RAG & Knowledge Base
Lesson 2 dari 2 · Lanjutan · 45 sampai 60 menit

Mendesain knowledge base yang bisa dibaca AI

Knowledge base untuk AI harus dirancang, bukan sekadar folder PDF. Materi ini membahas struktur dokumen, metadata, chunking, update routine, dan test questions.

Setelah selesai, kamu bisaLesson 2 dari 2
  • Membersihkan dokumen sumber
  • Menentukan metadata dan chunking
  • Membuat test questions untuk evaluasi

Sebelum mulai

  • Paham konsep dasar RAG.
  • Siapkan 3-5 dokumen atau halaman sumber.
Target belajar: Setelah selesai, kamu bisa menyiapkan knowledge base kecil yang rapi dan bisa diuji.

Konsep utama

01Dokumen sumber

Dokumen sumber perlu jelas pemiliknya, tanggalnya, statusnya, dan apakah masih berlaku.

Kenapa penting: RAG tidak bisa memperbaiki sumber yang usang atau bertentangan.

Contoh: Pisahkan SOP aktif, draft, arsip, dan kebijakan lama sebelum ingestion.

Yang sering keliru: Mencampur dokumen final dan draft tanpa label.

02Metadata dan chunking

Metadata memberi label seperti topik, tanggal, produk, atau versi. Chunking memotong dokumen menjadi bagian yang bisa dicari.

Kenapa penting: Retrieval lebih kuat saat potongan dokumen punya konteks yang cukup dan label yang tepat.

Contoh: FAQ produk diberi metadata kategori, produk, dan tanggal update.

Yang sering keliru: Memotong dokumen terlalu kecil sampai maknanya hilang.

03Test questions

Test questions adalah daftar pertanyaan untuk mengecek apakah knowledge base menemukan sumber dan menjawab dengan benar.

Kenapa penting: Tanpa test, kamu tidak tahu apakah chatbot benar-benar bisa dipakai.

Contoh: Buat pertanyaan mudah, ambigu, dan pertanyaan yang seharusnya dijawab 'tidak ada di dokumen'.

Yang sering keliru: Hanya mengetes pertanyaan yang jawabannya sudah jelas.

Cara kerjanya

RAG yang buruk sering bukan karena modelnya lemah, tapi karena knowledge base berantakan. Dokumen duplikat, versi lama, judul tidak jelas, tabel rusak, dan metadata kosong membuat retrieval gagal. Karena itu, sebelum bikin chatbot, rapikan dokumen.

Setiap dokumen sebaiknya punya metadata: title, topic, audience, version, date, owner, permission, source URL, dan status. Untuk course, metadata bisa berupa module, lesson, level, persona, skill, dan related project.

Evaluation penting: uji apakah sistem mengambil chunk yang benar, menjawab dengan akurat, menolak saat tidak ada data, dan memberi sumber. Jangan hanya menilai jawaban enak dibaca.

Contoh nyata

Jika ada tiga policy refund dengan tanggal berbeda, chatbot bisa salah jika metadata tidak jelas. Tandai versi aktif dan archive versi lama.

Coba sendiri

  1. 1

    Audit 10 dokumen.

  2. 2

    Tandai mana yang duplikat, stale, tidak punya judul, atau perlu metadata.

  3. 3

    Buat metadata schema.

Prompt yang bisa dipakai

Audit knowledge base berikut untuk RAG. Daftar dokumen: [list]. Beri rekomendasi: metadata, struktur folder, naming convention, risiko duplikasi, dan prioritas perbaikan.

Cek pemahaman

Jawab dengan bahasa sendiri. Kalau masih muter-muter, baca ulang bagian yang paling nyangkut.

  1. 1

    Kenapa knowledge base berantakan merusak RAG?

  2. 2

    Metadata apa yang wajib?

  3. 3

    Apa saja metrik evaluasi RAG sederhana?

Tugas

Buat metadata schema untuk semua materi course Nurai.

Lanjut ke materi berikutnya

Setelah knowledge base siap, lanjut ke AI agent untuk melihat sistem yang bisa memakai tools dan menjalankan beberapa langkah.
Lanjut ke AI Agent & Tool Calling