Šta je RAG? Najjednostavnije objašnjenje kako funkcioniše

RAG zvuči komplikovano, ali ideja je jednostavna: pre nego što AI odgovori, prvo potraži korisne informacije iz izvora znanja i daje te informacije jezičkom modelu. Ovaj vodič objašnjava RAG, LLM-ove, stanje, memoriju i alate koristeći jedan jednostavan mentalni model.
Objavljeno:
Aleksandar Stajić
Updated: 26. септембар 2026. 01:41
Šta je RAG? Najjednostavnije objašnjenje kako funkcioniše

RAG zvuči komplikovano jer je ime komplikovano. Ideja nije. RAG jednostavno znači: pre nego što AI odgovori, prvo pronađe relevantne informacije iz izvora znanja i daje te informacije jezičkom modelu.

Zamislite LLM kao pametnu osobu koja sedi za stolom. RAG je bibliotekar koji donosi pravu stranicu iz prave knjige. LLM zatim čita tu stranicu i odgovara vam.

Prvo: šta radi LLM?

LLM je deo koji razume jezik i proizvodi jezik. Može da pročita vaše pitanje, razume instrukcije, uporedi informacije, objasni nešto i napiše odgovor.

Ali LLM ne zna automatski šta se trenutno nalazi u bazi podataka vaše kompanije, vašoj igračkoj sesiji, vašim privatnim dokumentima ili datoteci koju ste kreirali pre pet minuta.

Zna samo ono što je već unutar modela plus sve informacije koje mu aplikacija pruži u trenutnom zahtevu.

Zatim: šta je baza znanja?

Baza znanja je jednostavno informacija koju aplikacija može da pretražuje.

Može da sadrži PDF-ove, priručnike, dokumentaciju proizvoda, članke podrške, ugovore, pravila igre, podatke o oružju, interne dokumente kompanije, zapise baze podataka ili drugi tekst.

Baza znanja može biti lokalna na vašem računaru. Može biti na serveru. Može biti u vektorskoj bazi podataka. Takođe može biti izgrađena od običnih datoteka. RAG ne znači Internet.

Dakle, šta RAG zapravo radi?

Ceo RAG proces

1
1. Postavljate pitanje
Na primer: Koju municiju koristi ovo oružje?
2
2. RAG pretražuje bazu znanja
Sistem traži male delove informacija koji su najrelevantniji za vaše pitanje.
3
3. RAG daje te delove LLM-u
LLM prima pitanje plus pronađene informacije.
4
4. LLM piše odgovor
Koristi pronađene informacije kao kontekst za odgovor.

To je RAG.

Puno ime je Retrieval-Augmented Generation. Retrieval znači pronalaženje relevantnih informacija. Augmented znači dodavanje tih informacija u kontekst modela. Generation znači da LLM piše konačni odgovor.

Vrlo jednostavan primer

Zamislite da imate lokalnu bazu znanja o igri.

Baza znanja sadržiPrimer
OružjaAKM koristi municiju 7.62 mm
Predmeti za lečenjeMed Kit obnavlja zdravlje
DodaciOvaj dodatak radi sa ovim oružjima
Pravila mapeOva zona se ponaša na ovaj način

Pitate: „Koju municiju koristi AKM?“

RAG pretražuje bazu znanja i pronalazi unos o AKM. Taj mali deo informacije daje LLM-u. LLM zatim odgovara: „AKM koristi municiju 7.62 mm.“

LLM nije bio potreban cela baza podataka. RAG je doneo samo koristan deo.

Sada važan deo: RAG nije trenutno stanje

Ovde mnoga objašnjenja postaju zbunjujuća.

RAG obično daje AI znanje. Sistem stanja daje AI činjenice o tome šta je istinito upravo sada.

Znanje naspram trenutnog stanja

RAG / znanjeTrenutno stanje
Oružje
Municija
Zdravlje
Neprijatelj

Šta je baza podataka stanja?

Baza podataka stanja ili skladište stanja je jednostavno mesto gde aplikacija čuva trenutne činjenice.

U igri, engine već zna stvari kao što su vaše zdravlje, pozicija, inventar, municija, trenutna misija, obližnji objekti i status neprijatelja. AI sistem može izložiti odabrane delove tog stanja modelu.

U poslovnoj aplikaciji, ista ideja može biti baza podataka narudžbina, zapis o kupcu, status projekta ili trenutna vrednost senzora.

Stanje kreira sama aplikacija dok se stvari dešavaju. Ako izgubite zdravlje, igra ažurira vrednost zdravlja. Ako pokupite municiju, inventar se menja. Ako je narudžbina plaćena, poslovni sistem menja status narudžbine.

Kako tri dela rade zajedno

LLM + stanje + RAG

1
1. Trenutno stanje
Aplikacija govori AI-ju šta je sada istina: zdravlje 41%, AKM opremljen, 23 metka.
2
2. RAG
Sistem pronalazi korisno znanje: kako oružje funkcioniše, koji predmet za lečenje je dostupan ili relevantno pravilo.
3
3. LLM
Model prima pitanje, trenutno stanje i pronađeno znanje.
4
4. Rezonovanje
LLM kombinuje te ulaze i odlučuje koji odgovor ili akcija na visokom nivou ima smisla.
5
5. Aplikacija
Ako je potrebna akcija, aplikacija ili game engine je izvršava i ponovo ažurira stanje.

Dakle, osnovna arhitektura je:

Da li RAG uvek koristi vektorsku bazu podataka?

Ne.

Vektorska baza podataka je uobičajen način za izgradnju semantičke pretrage, ali to nije definicija RAG-a.

Važan deo je pronalaženje: sistem pronalazi relevantne spoljne informacije i dodaje ih u kontekst LLM-a pre nego što se odgovor generiše.

OpenAI-jev File Search, na primer, može da radi sa fajlovima sačuvanim u vektorskim skladištima. Fajlovi se dele na manje delove kako bi sistem mogao da pronađe delove koji su relevantni za pitanje. To je jedna implementacija iste osnovne ideje.

Šta je embedding, jednostavno rečeno?

Ne morate da razumete embedding-e da biste razumeli RAG.

Ali jednostavna verzija je ovo: embedding je numerička reprezentacija značenja. Pomaže sistemu za pretragu da pronađe tekst koji je konceptualno sličan čak i kada reči nisu potpuno iste.

Na primer, obična pretraga po ključnim rečima može da traži tačne reči „popravka automobila“. Semantička pretraga takođe može da razume da se „popravi moje vozilo“ odnosi na sličnu temu.

To čini embedding-e korisnim za RAG, ali RAG takođe može da koristi pretragu po ključnim rečima, upite baze podataka ili hibrid nekoliko metoda.

RAG takođe nije memorija

Memorija je još jedan koncept koji se često meša sa RAG-om.

Memorija je obično informacija koju sistem čuva o prethodnim interakcijama ili prethodnim događajima. RAG je mehanizam koji se koristi za pronalaženje relevantnog znanja kada je potrebno.

DeoJednostavno značenje
LLMDeo koji razume i generiše jezik
RAGDeo koji traži relevantno znanje pre odgovora
Baza znanjaInformacije koje RAG može da pretražuje
StanjeŠta je trenutno istina u aplikaciji ili svetu
MemorijaInformacije sačuvane iz prethodnih interakcija ili događaja
Alat / akcijaNešto što AI sme da pozove ili zatraži od aplikacije da uradi
KontekstInformacije trenutno stavljene pred LLM za ovaj zahtev

Pravi primer iz igre: PUBG Ally

PUBG Ally je koristan primer jer čini razliku vidljivom.

KRAFTON opisuje stanje meča uživo kao poseban izvor istine. Igra izlaže trenutne činjenice kroz alate za posmatranje: trenutno oružje, municiju, zdravlje, status sigurne zone, obližnje predmete i borbenu situaciju.

Pretraga znanja je drugačiji posao. Sistem može da koristi pripremljeno znanje o oružju, dodacima, predmetima i pravilima. NVIDIA ACE Game Agent SDK takođe izlaže poseban RAG API za pronalaženje znanja iz baza koje su napravili programeri.

To nam daje jasnu podelu: game engine kaže šta se sada dešava, pretraga obezbeđuje relevantno znanje, a jezički model odlučuje šta informacije znače.

Jedan kompletan primer

Zamislite da kažete AI saigraču: „Nisko mi je zdravlje. Treba li da napadnemo?“

Šta se dešava dalje

1
Stanje
Igra prijavljuje: zdravlje 24%, jedan neprijatelj u blizini, dva predmeta za lečenje dostupna.
2
RAG
Sistem znanja pronalazi relevantna pravila za predmet za lečenje i možda informacije o trenutnom oružju ili taktičkom mehanizmu.
3
LLM
Model kombinuje vaš zahtev, trenutno stanje i pronađeno znanje.
4
Odluka
Zaključuje da je lečenje prvo sigurnije od trenutnog napada.
5
Alat / game engine
Agent zahteva legalnu akciju u igri kao što je premeštanje u zaklon ili korišćenje predmeta za lečenje.
6
Novo stanje
Igra izvršava akciju i prijavljuje ažuriranu situaciju nazad agentu.

RAG nije kontrolisao lika. Baza podataka o stanju nije rezonovala. LLM nije direktno menjao igru. Svaki deo je imao jedan zadatak.

Zašto uopšte koristiti RAG?

Zato što bi stavljanje svakog dokumenta, pravila i zapisa iz baze u svaki prompt bilo sporo, skupo i često zbunjujuće.

RAG omogućava sistemu da izabere samo informacije koje su korisne za trenutno pitanje.

Takođe vam omogućava da ažurirate bazu znanja bez ponovnog treniranja celog jezičkog modela. Promenite dokument ili bazu podataka, ponovo izgradite ili osvežite indeks kada je potrebno, i sledeća pretraga može da koristi novije informacije.

Šta RAG ne garantuje

RAG može da poboljša utemeljenje, ali ne čini odgovor automatski tačnim.

Korak pretrage može da pronađe pogrešan dokument. Tačan dokument može biti zastareo. LLM može da pogrešno razume dobre dokaze. Ili se trenutno stanje može promeniti.

Pouzdan sistem stoga mora odvojeno da validira pretragu, svežinu stanja i konačno rezonovanje modela.

Najlakši mentalni model za pamćenje

Zamislite AI sistem kao osobu za radnim stolom

AnalogijaAI sistem
Osoba koja razmišlja
Pronalaženje priručnika
Knjige na polici
Trenutna kontrolna tabla ili instrument tabla
Beleške sa ranijih sastanaka
Radi nešto u stvarnom svetu

Zaključak

RAG je mnogo manje misteriozan kada se delovi razdvoje.

LLM razume i generiše jezik. Aplikacija održava trenutno stanje. Baza znanja čuva informacije. RAG pronalazi korisni deo tih informacija i stavlja ga u kontekst LLM-a. Alati ili aplikacija obavljaju stvarne radnje.

To je osnovna arhitektura koja stoji iza mnogih modernih AI asistenata i agenata.

Često postavljana pitanja

RAG jednostavnim rečima

Šta je RAG jednostavno rečeno?

RAG je korak u kojem AI pretražuje izvor znanja radi relevantnih informacija pre nego što jezički model napiše svoj odgovor.

Da li je RAG-u potreban internet?

Ne. Baza znanja može biti potpuno lokalna na vašem računaru ili serveru.

Da li je RAG isto što i baza podataka?

Ne. Baza podataka ili datoteke sadrže informacije. RAG je proces pronalaženja koji pronalazi korisni deo i daje ga LLM-u.

Da li je RAG isto što i memorija?

Ne. Memorija obično čuva prethodne interakcije ili događaje. RAG pronalazi relevantno znanje kada je potrebno.

Da li je trenutno stanje aplikacije deo RAG-a?

Ne nužno. Trenutno stanje se obično dobija direktno iz aplikacije ili skladišta stanja. RAG je bolje razumeti kao pronalaženje iz izvora znanja.

Da li RAG čini AI odgovore tačnim?

Ne. Može pružiti bolje dokaze, ali pronalaženje i dalje može biti pogrešno ili zastarelo, a LLM i dalje može pogrešno da zaključuje.

Pojmovnik

Osnovni pojmovi

LLM
Jezički model koji razume i generiše tekst i može da zaključuje na osnovu informacija stavljenih u njegov kontekst.
RAG
Retrieval-Augmented Generation: pronalaženje relevantnih spoljnih informacija i njihovo dodavanje u kontekst modela pre generisanja odgovora.
Baza znanja
Datoteke, dokumenti, zapisi ili druge informacije koje pretraga može da pretražuje.
Stanje
Trenutne činjenice aplikacije, sistema ili sveta u određenom trenutku.
Kontekst
Informacije koje se trenutno dostavljaju jezičkom modelu za jedan zahtev ili korak zaključivanja.
Embedding
Numerička reprezentacija značenja koja može pomoći semantičkoj pretrazi da pronađe konceptualno slične informacije.

Primarni izvori

OpenAI — Datoteke vektorske memorije

Zvanična dokumentacija koja pokazuje kako se datoteke mogu priložiti vektorskim skladištima, podeliti na delove i učiniti dostupnim za pretragu datoteka.

OpenAI — Brzi početak za programere

Zvanična OpenAI dokumentacija koja opisuje alate kao što je pretraga datoteka za davanje modelima pristupa spoljnim informacijama.

NVIDIA Developer — ACE za igre

Zvanična NVIDIA dokumentacija koja opisuje odvojene Agent, Chat i RAG API-je za povezivanje likova u igrama sa stanjem igre, kontekstualnim znanjem i radnjama vođenim modelom.

NVIDIA Developer — Kako je KRAFTON napravio PUBG Ally

Zvanično tehničko objašnjenje koje razdvaja stanje uživo meča od pretrage znanja i zaključivanja jezičkog modela.

Related Articles

Pouzdanost AI agenata: Zašto konačni odgovor nije dovoljan

Pouzdanost AI agenata: Zašto konačni odgovor nije dovoljan

Tačan rezultat ne dokazuje ispravno razmišljanje, bezbedno izvršavanje ili pouzdan sistem.

Memorija AI agenta nije RAG: Kako razdvojiti memoriju, pronalaženje, stanje i kontekst

Memorija AI agenta nije RAG: Kako razdvojiti memoriju, pronalaženje, stanje i kontekst

Memorija agenta, RAG, stanje i kontekst često se koriste kao da su međusobno zamenjivi. Oni to nisu. Ovaj praktični arhitektonski model razdvaja ova četiri sloja, pokazuje gde svaki pripada i objašnjava šta se kvari kada ih sistemi stope u jedno.

Ovladavanje SEO radnim tokom: Ključne strategije optimizacije za organski rast

Ovladavanje SEO radnim tokom: Ključne strategije optimizacije za organski rast

Strukturiran SEO tok posla je ključan za održiv organski rast. Naučite deset osnovnih strategija, od istraživanja ključnih reči i tehničke optimizacije do kvaliteta sadržaja i analize performansi.

RAG nije uspeo — ali koji sloj je zapravo zakazao? Dijagnostička metoda

RAG nije uspeo — ali koji sloj je zapravo zakazao? Dijagnostička metoda

Kada je RAG odgovor pogrešan, kriviti pretragu ili model je previše neodređeno. Ova dijagnostička metoda izoluje pokrivenost izvora, konstrukciju upita, pretragu, rangiranje, sastavljanje konteksta, generisanje, pripisivanje dokaza i svežinu—tako da se stvarni kvar može reprodukovati i ispraviti.

Agenti za korišćenje računara: Zašto uspešan demo i dalje može biti nepouzdan sistem

Agenti za korišćenje računara: Zašto uspešan demo i dalje može biti nepouzdan sistem

Agenti za korišćenje računara sada mogu da završe impresivne radne tokove u pregledaču i na radnoj površini, ali jedno uspešno izvršavanje dokazuje sposobnost—ne pouzdanost. Ovaj članak pokazuje kako testirati ponovljivost, robusnost u odnosu na okruženje, kontrolu dugog horizonta, svest o stanju, verifikaciju ishoda i bezbedno upravljanje ciljevima.

GPU nije proizvod: Privatna AI arhitektura spremna za budućnost

GPU nije proizvod: Privatna AI arhitektura spremna za budućnost

Privatna AI infrastruktura ne bi trebalo da bude projektovana oko jednog GPU-a ili jednog modela. Otporniji pristup kombinuje brze GPU-ove za inferenciju, memorijski bogate AI sisteme, čvorove za fizički AI i opcione vodeće modele u oblaku iza sloja za rutiranje koji prepoznaje mogućnosti.

OpenAI Agents API vs Agents SDK vs Responses API: Na čemu bi trebalo da gradite u 2026?

OpenAI Agents API vs Agents SDK vs Responses API: Na čemu bi trebalo da gradite u 2026?

OpenAI-jev stek agenata promenio se u septembru 2026. Ovaj arhitekturni vodič razdvaja Agents API, Agents SDK, Responses API i Codex SDK prema vlasništvu nad izvršnim okruženjem—kako bi timovi mogli da izaberu pravu granicu kontrole umesto da porede nazive proizvoda.

MCP vs A2A vs UCP vs AP2 vs A2UI: Objašnjen stek agentskih protokola

MCP vs A2A vs UCP vs AP2 vs A2UI: Objašnjen stek agentskih protokola

MCP, A2A, UCP, AP2 i A2UI se često predstavljaju kao konkurentski standardi za agente. Oni uglavnom rešavaju različite probleme interoperabilnosti. Ovaj vodič mapira svaki protokol na granicu koju zapravo standardizuje—i pokazuje kako oni mogu da rade zajedno u jednom produkcionom sistemu.

Ollama nije proizvod: Izgradnja aplikacija spremnih za produkciju sa otvorenim LLM-ovima

Ollama nije proizvod: Izgradnja aplikacija spremnih za produkciju sa otvorenim LLM-ovima

Pokretanje lokalnog modela pomoću Ollama-e je jednostavno. Izgradnja Open-LLM aplikacije spremne za produkciju je teža: zahteva RAG, kontrolu pristupa, apstrakciju provajdera, evaluaciju, logovanje, disciplinu puštanja u rad i kontrolisani aplikativni sloj oko modela.

Zašto više konteksta može pogoršati AI odgovore

Zašto više konteksta može pogoršati AI odgovore

Veći kontekstni prozor ne garantuje bolji odgovor. Ovaj članak objašnjava kako razblaživanje signala, protivrečni dokazi, zastarelo stanje, osetljivost na poziciju i kompresija sa gubicima mogu smanjiti pouzdanost veštačke inteligencije—i uvodi praktičan test pritiska konteksta.

git-with-automatic-upload-and-synchronization-to-a-production-server

git-with-automatic-upload-and-synchronization-to-a-production-server

Granica valjanosti odgovora: Nedostajući sloj između relevantnosti i pouzdanih AI odgovora

Granica valjanosti odgovora: Nedostajući sloj između relevantnosti i pouzdanih AI odgovora

Izvor može biti relevantan, autoritativan i ipak pogrešan za pitanje koje se postavlja. Sloj koji nedostaje je primenljivost: uslovi pod kojima odgovor važi i promene koje ga primoravaju na preispitivanje. Ovaj članak predstavlja Granicu važenja odgovora kao obrazac za dizajn izvora za ljude, AI pretragu i RAG sisteme.