Skip to content

Raga Engine

Engine RAGA menangani inferensi multi-user secara concurrent dengan manajemen queue, konstruksi system prompt dinamis, dan dua jalur output utama. Halaman ini melengkapi Ringkasan Arsitektur dengan detail komponen inferensi.

Alur Kerja Engine

Komponen Engine

KomponenFungsi
MAX_VLLM_RUNNING (QUEUE 4)Antrian request user, membatasi maksimum 4 request aktif secara bersamaan
VLLM /metrics concurrent 2Menjalankan inferensi model dengan maksimum 2 concurrency paralel, dilengkapi metrics monitoring
System Prompt BuilderMengkonstruksi system prompt dinamis sesuai context window model (32k / 128k / xx)
API Context (100.000 char)Injeksi hasil pencarian API eksternal ke dalam konteks
Basic (10 items)Knowledge dasar workspace yang selalu disertakan
OCR (3 items)Dokumen terindeks via INDEX_OCR_KNOWLEDGE, INDEX_OCR_SUMMARIZE_CHUNK, INDEX_OCR_SUMMARIZE
RDBMS (10.000 char)Data relasional dari database, diproses via Text-to-SQL
Audio (20 rows)Transkrip audio terindeks via INDEX_AUDIO_KNOWLEDGE, INDEX_AUDIO_SUMMARIZE_CHUNK, INDEX_AUDIO_SUMMARIZE
History PromptRiwayat percakapan sebelumnya dalam session
Internal PromptSystem instruction internal RAGA (tidak terekspos ke user)
Time NowInjeksi timestamp real-time untuk konteks temporal
files_usersFile yang di-upload user dalam session aktif
PersonalizationPreferensi dan konteks spesifik user
Image ContextKonten gambar multimodal yang dikirim user
Text To APIMengubah pertanyaan user menjadi pemanggilan API terstruktur
Text To SQLMengubah pertanyaan user menjadi query SQL terstruktur
LLM ProviderBackbone inference bersifat multi-provider, dipilih per request lewat parameter llm: local (Qwen2.5-14B-Instruct-AWQ, default) dan local_v2 (Qwen2.5-32B-Instruct-AWQ) yang di-hosting sendiri via vLLM, serta provider eksternal kompatibel OpenAI — sambanova (Llama-3.3-70B), groq (Llama-3.3-70B-versatile), openai (gpt-4o-mini), dan alibaba (Qwen-plus)
Multimodal ProviderJalur terpisah untuk analisis gambar (Image Context): local (Qwen2.5-VL-32B-Instruct-AWQ) atau alibaba (Qwen-VL-Max)

Ringkasan

Engine RAGA membatasi concurrency lewat queue (maksimum 4 request aktif, 2 inferensi paralel di VLLM), lalu merakit system prompt secara dinamis dari sebelas jenis konteks — mulai dari knowledge dasar workspace hingga hasil Text-to-SQL dan Text-to-API — sebelum diteruskan ke salah satu LLM provider yang dikonfigurasi (vLLM lokal berbasis Qwen sebagai default, atau provider eksternal seperti SambaNova, Groq, OpenAI, dan Alibaba sebagai alternatif).