Skip to main content
Retrieval-Augmented Generation (RAG) menggabungkan pencarian vektor semantik dengan model generasi bahasa. Dokumen eksternal diubah menjadi representasi vektor floating-point, disimpan dalam basis data vektor, lalu bagian yang paling relevan disuntikkan ke dalam prompt model sebagai konteks referensi faktual. Alur RAG

Alur Eksekusi Cepat

Embeddings Capability

Spesifikasi parameter endpoint /v1/embeddings dan format output vektor.

Katalog Model Embedding

Daftar model embedding yang tersedia seperti nusa-embedding-0001 dan nv-embed-v1.

Implementasi Step-by-Step

1

Instalasi Dependensi

Instal pustaka Python yang diperlukan untuk OpenAI SDK dan ChromaDB:
2

Definisikan Embedding Function Kustom

ChromaDB mendukung custom embedding function untuk menghubungkan panggilan embedding ke endpoint /v1/embeddings Neosantara:
3

Indeks Dokumen ke Koleksi Chroma

Simpan sekumpulan dokumen ke dalam koleksi ChromaDB. Koleksi akan otomatis memanggil fungsi embedding Neosantara untuk menghasilkan vektor 768 dimensi:
4

Pencarian Vektor & Grounded Generation

Cari bagian yang paling relevan dengan kueri pengguna menggunakan pencarian kemiripan kosinus, lalu minta model chat menghasilkan jawaban yang didasari konteks tersebut:

Kode Lengkap & Pengujian

Berikut skrip lengkap yang menguji pertanyaan yang ada di dalam dokumen maupun pertanyaan di luar basis pengetahuan:
rag_chroma_complete.py
Gunakan parameter temperature=0.1 atau temperature=0 pada tahap generasi untuk meminimalkan halusinasi dan memastikan jawaban strictly grounded pada dokumen yang diambil.
Model nusa-embedding-0001 menghasilkan vektor embedding 768 dimensi dengan harga gratis/termasuk dalam kuota Neosantara.

Referensi Terkait