RAG & Knowledge Base
Lesson 1 dari 2 · Lanjutan · 45 sampai 60 menit

Apa itu RAG dan kenapa penting?

RAG membantu AI menjawab dari sumber yang kamu berikan, bukan hanya dari pengetahuan umum model. Materi ini membahas retrieval, grounding, citation, dan evaluasi.

Setelah selesai, kamu bisaLesson 1 dari 2
  • Menjelaskan retrieval dan generation
  • Memahami grounding dan citation
  • Mengenali batas RAG

Sebelum mulai

  • Paham LLM dan context window.
  • Punya contoh dokumen yang ingin dijadikan sumber jawaban.
Target belajar: Setelah selesai, kamu bisa menjelaskan pipeline RAG dari dokumen sampai jawaban bersumber.

Konsep utama

01Retrieval sebelum generation

RAG mencari potongan sumber yang relevan lebih dulu, lalu memberikan potongan itu ke LLM untuk menyusun jawaban.

Kenapa penting: Jawaban lebih mudah dicek karena terkait dengan dokumen yang dipilih.

Contoh: Chatbot SOP mengambil bagian kebijakan refund sebelum menjawab pertanyaan pelanggan.

Yang sering keliru: Mengira RAG otomatis benar tanpa evaluasi retrieval.

02Grounding dan citation

Grounding mengikat jawaban pada sumber tertentu. Citation menunjukkan bagian sumber yang mendukung jawaban.

Kenapa penting: Citation membuat pengguna bisa memeriksa klaim, terutama untuk dokumen internal atau edukasi.

Contoh: Jawaban menyebut halaman SOP atau paragraf dokumen yang dipakai.

Yang sering keliru: Menampilkan citation palsu atau tidak relevan.

03Batas RAG

RAG tetap bergantung pada kualitas dokumen, chunking, metadata, retrieval, dan instruksi jawaban.

Kenapa penting: Dokumen usang atau terpotong buruk akan menghasilkan jawaban yang buruk juga.

Contoh: Jika kebijakan terbaru belum masuk knowledge base, chatbot masih bisa menjawab dari aturan lama.

Yang sering keliru: Memasukkan semua PDF tanpa membersihkan dan menguji.

Cara kerjanya

RAG atau Retrieval-Augmented Generation adalah teknik membuat model menjawab dengan mengambil informasi relevan dari knowledge base eksternal sebelum menghasilkan jawaban. AWS menjelaskan RAG sebagai proses mengoptimalkan output LLM agar merujuk pada basis pengetahuan otoritatif di luar data pelatihan model.

Masalah yang diselesaikan RAG: model tidak tau data internal, data terbaru, atau dokumen spesifik. Dengan RAG, dokumen perusahaan, FAQ, policy, course material, atau database komunitas bisa dicari lalu dipakai sebagai konteks jawaban.

Pipeline dasar RAG: kumpulkan dokumen -> pecah menjadi chunk -> ubah menjadi embedding -> simpan di vector database -> saat user bertanya, cari chunk relevan -> berikan ke LLM -> LLM menjawab dengan sumber. RAG bukan obat semua hallucination, tapi membantu grounding jika data dan retrieval bagus.

Contoh nyata

Chatbot course AI bisa memakai RAG untuk menjawab “lesson mana yang harus saya ambil kalau ingin belajar AI untuk konten?”. Sistem mengambil data lesson, roadmap, dan persona path sebelum menjawab.

Coba sendiri

  1. 1

    Ambil 3 dokumen pendek.

  2. 2

    Pecah menjadi chunk manual.

  3. 3

    Tulis 5 pertanyaan user.

  4. 4

    Tentukan chunk mana yang harus diambil untuk menjawab.

Prompt yang bisa dipakai

Saya ingin membuat RAG untuk dokumen berikut: [jenis dokumen]. Bantu rancang: struktur knowledge base, aturan chunking, metadata, contoh pertanyaan user, retrieval strategy, dan format jawaban dengan sumber.

Cek pemahaman

Jawab dengan bahasa sendiri. Kalau masih muter-muter, baca ulang bagian yang paling nyangkut.

  1. 1

    Apa kepanjangan RAG?

  2. 2

    Masalah apa yang diselesaikan RAG?

  3. 3

    Apa itu chunking dan embedding?

Tugas

Buat desain RAG chatbot untuk FAQ/course/company docs, lengkap dengan data source dan contoh query.

Lanjut ke materi berikutnya

Setelah tahu alur RAG, lanjut ke desain knowledge base agar dokumen siap dibaca dan dicari AI.
Lanjut: Mendesain knowledge base yang bisa dibaca AI