Mendesain knowledge base yang bisa dibaca AI
Knowledge base untuk AI harus dirancang, bukan sekadar folder PDF. Materi ini membahas struktur dokumen, metadata, chunking, update routine, dan test questions.
- Membersihkan dokumen sumber
- Menentukan metadata dan chunking
- Membuat test questions untuk evaluasi
Sebelum mulai
- Paham konsep dasar RAG.
- Siapkan 3-5 dokumen atau halaman sumber.
Konsep utama
01Dokumen sumber
Dokumen sumber perlu jelas pemiliknya, tanggalnya, statusnya, dan apakah masih berlaku.
Kenapa penting: RAG tidak bisa memperbaiki sumber yang usang atau bertentangan.
Contoh: Pisahkan SOP aktif, draft, arsip, dan kebijakan lama sebelum ingestion.
Yang sering keliru: Mencampur dokumen final dan draft tanpa label.
02Metadata dan chunking
Metadata memberi label seperti topik, tanggal, produk, atau versi. Chunking memotong dokumen menjadi bagian yang bisa dicari.
Kenapa penting: Retrieval lebih kuat saat potongan dokumen punya konteks yang cukup dan label yang tepat.
Contoh: FAQ produk diberi metadata kategori, produk, dan tanggal update.
Yang sering keliru: Memotong dokumen terlalu kecil sampai maknanya hilang.
03Test questions
Test questions adalah daftar pertanyaan untuk mengecek apakah knowledge base menemukan sumber dan menjawab dengan benar.
Kenapa penting: Tanpa test, kamu tidak tahu apakah chatbot benar-benar bisa dipakai.
Contoh: Buat pertanyaan mudah, ambigu, dan pertanyaan yang seharusnya dijawab 'tidak ada di dokumen'.
Yang sering keliru: Hanya mengetes pertanyaan yang jawabannya sudah jelas.
Cara kerjanya
RAG yang buruk sering bukan karena modelnya lemah, tapi karena knowledge base berantakan. Dokumen duplikat, versi lama, judul tidak jelas, tabel rusak, dan metadata kosong membuat retrieval gagal. Karena itu, sebelum bikin chatbot, rapikan dokumen.
Setiap dokumen sebaiknya punya metadata: title, topic, audience, version, date, owner, permission, source URL, dan status. Untuk course, metadata bisa berupa module, lesson, level, persona, skill, dan related project.
Evaluation penting: uji apakah sistem mengambil chunk yang benar, menjawab dengan akurat, menolak saat tidak ada data, dan memberi sumber. Jangan hanya menilai jawaban enak dibaca.
Contoh nyata
Coba sendiri
- 1
Audit 10 dokumen.
- 2
Tandai mana yang duplikat, stale, tidak punya judul, atau perlu metadata.
- 3
Buat metadata schema.
Prompt yang bisa dipakai
Cek pemahaman
Jawab dengan bahasa sendiri. Kalau masih muter-muter, baca ulang bagian yang paling nyangkut.
- 1
Kenapa knowledge base berantakan merusak RAG?
- 2
Metadata apa yang wajib?
- 3
Apa saja metrik evaluasi RAG sederhana?