sub_lm) untuk penalaran semantik lokal, dan menyerahkan hasil akhir melalui SUBMIT().
Kode Cepat dengan Text Streaming
Gunakandspy.streamify agar token penalaran dan eksekusi kode langsung mengalir secara real-time ke terminal tanpa menunggu seluruh iterasi selesai:
Mengapa Menggunakan RLM?
Model bahasa standar mengalami degradasi performa (context rot) saat membaca dokumen berskala ratusan ribu hingga jutaan token. Selain itu, biaya inferensi meningkat drastis jika seluruh konteks harus diproses ulang pada setiap turn. RLM memecahkan masalah ini dengan memisahkan penyimpanan data dari context window aktif LLM:- Konteks sebagai Objek Eksternal: Dokumen atau dataset disimpan di memori Python REPL (variabel
context), bukan di dalam prompt LLM. - Pencarian Terprogram: Model menulis skrip Python (regex, slicing, filter data, kalkulasi numerik) untuk memeriksa bagian yang relevan.
- Pendelegasian Sub-Model (
llm_query): Jika potongan teks membutuhkan pemahaman bahasa alami, model menjalankan fungsillm_query(chunk)ke model pekerja yang lebih cepat atau lebih hemat biaya. - Iterasi Terarah: Output dari kode Python dimasukkan kembali ke percakapan berikutnya sampai model memanggil
SUBMIT(answer=...).