Kada lokalni model "zvuči" gluplje nego što jeste
"Skinuo sam taj model i — bljak, užasan je!" Ako ste ikada lokalno pokrenuli open source LLM i ostali razočarani, niste sami. Ali postoji velika šansa da problem nije u modelu, nego u načinu na koji ga pokrećete. To je suština tehničke analize koja je ove sedmice eksplodirala na Hacker Newsu sa preko 400 glasova.
Zašto se isti model ponaša drugačije?
Isti model — iste težine (weights) — može davati potpuno različite rezultate u zavisnosti od okruženja. Uzroci su brojni:
- Kvantizacija — većina lokalnih korisnika pokreće kvantizovane verzije (GGUF u Ollami, LM Studiju...) koje troše manje memorije, ali mijenjaju preciznost računanja
- Sampler postavke — temperatura, top-p i drugi parametri: model kartica obično precizira šta treba koristiti, ali većina alata ima generičke podešene vrijednosti. Previše niska temperatura je čest razlog zašto model "zaglavi" u ponavljanjima
- Inference engine — vLLM, llama.cpp, TensorRT-LLM i drugi imaju stotine paketa i konfigurabilnih dijelova; putanja kojom vaš zahtjev prolazi kroz taj softver je jedinstvena
- Hardver — različite GPU generacije izvršavaju matematiku malo drugačije, što se akumulira kroz hiljade koraka generisanja
Stručnjaci to mjere kroz KL divergenciju — koliko se distribucija vjerovatnoća vašeg modela udaljila od referentne implementacije. Manja divergencija ne znači automatski "pametniji" model, ali velika odstupanja objašnjavaju onaj osjećaj da "nešto nije u redu" u odgovorima.
Šta ne raditi
Najčešća greška: pokrenuti tri test upita na nuli temperature i donijeti zaključak. Zero-shot testovi nisu dobar analog stvarnih zadataka. Model koji izgleda "glup" na generičkom pitanju može biti odličan na dugotrajnim zadacima sa alatima (tool calling) ili na domenu za koji je treniran.
Kako pravilno ocijeniti lokalni model
- Koristite benchmarke reprezentativne za vaš radni zadatak — ne samo MMLU, nego i evaluacije koje simuliraju vaš stvarni slučaj upotrebe
- Provjerite preporučene sampler postavke sa model kartice (temperatura, top-p, chat template)
- Testirajte dugi kontekst i pozivanje alata — tu lokalni setupi najčešće otkazuju
- Usporedite sa referencijalnom implementacijom (npr. hosting kod samog laba) prije nego što krivite model
Šta to znači za firme u regionu
Za kompanije u BiH koje razmišljaju o lokalnom hostingu modela — bilo zbog GDPR-a, povjerljivosti podataka ili troškova — ova analiza je važna iz dva razloga.
Prvo: otvoreni modeli su često bolji nego što izgledaju na prvu. Banke, zdravstvene ustanove i javne institucije ne mogu slati osjetljive podatke u američke ili kineske API-je; lokalni model koji je dobro podešen može zadovoljiti većinu potreba.
Drugo: trošak implementacije je stvaran. Pravilno podešavanje inference okruženja, odabir prave kvantizacije i postavki — to je vještina koja se isplati. Loše podešen lokalni setup košta više u izgubljenom vremenu nego što štedi na API pozivima.
Konzervativna preporuka: počnite sa manjim modelom koji dobro poznajete, podesite ga pravilno, izmjerite na svom zadatku — pa tek onda zaključujte. Model nije kriv dok se ne dokaže suprotno.
Izvor: Level1Techs forum / Hacker News, 22. august 2026. — "Why your local LLM feels dumber than it is"