Raga Engine
Engine RAGA menangani inferensi multi-user secara concurrent dengan manajemen queue, konstruksi system prompt dinamis, dan dua jalur output utama. Halaman ini melengkapi Ringkasan Arsitektur dengan detail komponen inferensi.
Alur Kerja Engine
Komponen Engine
| Komponen | Fungsi |
|---|---|
| MAX_VLLM_RUNNING (QUEUE 4) | Antrian request user, membatasi maksimum 4 request aktif secara bersamaan |
| VLLM /metrics concurrent 2 | Menjalankan inferensi model dengan maksimum 2 concurrency paralel, dilengkapi metrics monitoring |
| System Prompt Builder | Mengkonstruksi system prompt dinamis sesuai context window model (32k / 128k / xx) |
| API Context (100.000 char) | Injeksi hasil pencarian API eksternal ke dalam konteks |
| Basic (10 items) | Knowledge dasar workspace yang selalu disertakan |
| OCR (3 items) | Dokumen terindeks via INDEX_OCR_KNOWLEDGE, INDEX_OCR_SUMMARIZE_CHUNK, INDEX_OCR_SUMMARIZE |
| RDBMS (10.000 char) | Data relasional dari database, diproses via Text-to-SQL |
| Audio (20 rows) | Transkrip audio terindeks via INDEX_AUDIO_KNOWLEDGE, INDEX_AUDIO_SUMMARIZE_CHUNK, INDEX_AUDIO_SUMMARIZE |
| History Prompt | Riwayat percakapan sebelumnya dalam session |
| Internal Prompt | System instruction internal RAGA (tidak terekspos ke user) |
| Time Now | Injeksi timestamp real-time untuk konteks temporal |
| files_users | File yang di-upload user dalam session aktif |
| Personalization | Preferensi dan konteks spesifik user |
| Image Context | Konten gambar multimodal yang dikirim user |
| Text To API | Mengubah pertanyaan user menjadi pemanggilan API terstruktur |
| Text To SQL | Mengubah pertanyaan user menjadi query SQL terstruktur |
| LLM Provider | Backbone inference bersifat multi-provider, dipilih per request lewat parameter llm: local (Qwen2.5-14B-Instruct-AWQ, default) dan local_v2 (Qwen2.5-32B-Instruct-AWQ) yang di-hosting sendiri via vLLM, serta provider eksternal kompatibel OpenAI — sambanova (Llama-3.3-70B), groq (Llama-3.3-70B-versatile), openai (gpt-4o-mini), dan alibaba (Qwen-plus) |
| Multimodal Provider | Jalur terpisah untuk analisis gambar (Image Context): local (Qwen2.5-VL-32B-Instruct-AWQ) atau alibaba (Qwen-VL-Max) |
Ringkasan
Engine RAGA membatasi concurrency lewat queue (maksimum 4 request aktif, 2 inferensi paralel di VLLM), lalu merakit system prompt secara dinamis dari sebelas jenis konteks — mulai dari knowledge dasar workspace hingga hasil Text-to-SQL dan Text-to-API — sebelum diteruskan ke salah satu LLM provider yang dikonfigurasi (vLLM lokal berbasis Qwen sebagai default, atau provider eksternal seperti SambaNova, Groq, OpenAI, dan Alibaba sebagai alternatif).