A bogami clanak vrijedi pretplate, daj.
- +/- sve poruke
- ravni prikaz
- starije poruke gore
Debilana, a zakljucak je - na neprocitano - ukoliko zelite necenzurirani pristup, bez nekih korporativnih filtera paranoje koji vam 98% ideja ogranicavaju, lokalni modeli su daleko bolji izbor.
Da, mozda su korak-dva iza mogucnosti velikih modela poput nano banane, chatgpt i slicnih, ali, sloboda nema cijene.
Its just the way of it, son. We all sell our souls sooner or later.
Poštovani Drago,
Solidan članak, uzeo sam pretplatu da ga pročitam. Zadnjih 9 mjeseci intenzivno proučavam AI, LLM, probao sam sve od Colaba, Notebook LM-a, do lokalnih modela linux, ollama backend, openwebui frontend, hibridi RAG prompt sa Gemini Ultrom...
Zaključak: lokalni LLM je fora igračka ali neupotrebljiv za bilo što ozbiljno. RX9070XT vrti modele do 27B sa prelijevanjem u system RAM, MoE pokazuje potencijal, ali je sve skupa neupotrebljivo zbog limita hardvera. Modeli su premali za kodiranje, debugging ill generalnog AI asistenta. Haluciniraju, navode na katastrofalne pogreške u kodu ili naredbe u Terminalu (savjetuje te da obrišeš kernel datoteke i sl.). Bilo kakav prompt i napredni parametri ne mogu ispraviti malenkost modela i nedostatan kontekst.
Jedino pravo rjesenje je, osim pretplate na Gemini Ultra ili model slicnog cjenovnog ranga, Vertex API postpaid kljuc (Google Cloud - ne ni AI Studio!) povezan sa OpenWebUI frontendom, dobrim promptom i po potrebi Funkcijama i Alatima (Tools).
GPU je jos samo za igrice dok ne zazivi unified graphic/system RAM PC sa 256+ GB RAM-a.
Ne bacajte pare na skup hardver jer je, iako najjaci za igrice, preslab za LLM.
Za coding agente ove dvije varijente su smijesne.
RTX 4080 sa 16 GB rama je premalo za ijedan ozbiljan model. GB10 ima 128 GB, ali propusnost od 300 GB/s je opet ogranicavajuca da tek manji modeli dobro rade.
Za ozbiljnog lokalnog AI agenta jedino je trenutno konkurentan je Mac Studio, a i oni su sad povukli modele s 512 GB unified memorije... Ko je jamio, jamio je.
Ili cekat M5 Ultra varijantu (ocekiva se veca propusnost od RTX 4080 i varijante s 768 GB unified memorije)
Današnji hardver još nije ni izblizu dovoljan za lokalni LLM, ali i s običnim PC-jem možete trenirati QUBIC-ov decentralizirani Aigarth model.
Za razliku od klasičnih LLM-ova koji moraju držati milijarde parametara u memoriji i raditi teške matrice, ovdje se evoluira relativno male neuralne mreže, pa je potrošnja resursa neusporedivo manja. Riječ je o tzv. Useful Proof-of-Work tehnologiji - umjesto repetitivnog SHA-256 hashinga (ili sličnog), računalo trenira manji evolucijski AI model i istovremeno rudari $QUBIC kriptovalutu. Potreban je AVX2 ili AVX-512 CPU, a od GPU-a je podržano sve od Turinga nadalje.
Poštovani Drago,
Solidan članak, uzeo sam pretplatu da ga pročitam. Zadnjih 9 mjeseci intenzivno proučavam AI, LLM, probao sam sve od Colaba, Notebook LM-a, do lokalnih modela linux, ollama backend, openwebui frontend, hibridi RAG prompt sa Gemini Ultrom...
Zaključak: lokalni LLM je fora igračka ali neupotrebljiv za bilo što ozbiljno. RX9070XT vrti modele do 27B sa prelijevanjem u system RAM, MoE pokazuje potencijal, ali je sve skupa neupotrebljivo zbog limita hardvera. Modeli su premali za kodiranje, debugging ill generalnog AI asistenta. Haluciniraju, navode na katastrofalne pogreške u kodu ili naredbe u Terminalu (savjetuje te da obrišeš kernel datoteke i sl.). Bilo kakav prompt i napredni parametri ne mogu ispraviti malenkost modela i nedostatan kontekst.
Jedino pravo rjesenje je, osim pretplate na Gemini Ultra ili model slicnog cjenovnog ranga, Vertex API postpaid kljuc (Google Cloud - ne ni AI Studio!) povezan sa OpenWebUI frontendom, dobrim promptom i po potrebi Funkcijama i Alatima (Tools).
GPU je jos samo za igrice dok ne zazivi unified graphic/system RAM PC sa 256+ GB RAM-a.
Ne bacajte pare na skup hardver jer je, iako najjaci za igrice, preslab za LLM.
O Nvidijinom Sparku (ovaj GX10 u Asusovoj izvedbi - ako si na to mislio u zadnjoj rečenici) imam jako loše mišljenje (Kako Nvidia i Microsoft dvaput prodaju istu propalu ideju - Komentar @ Bug.hr) nakon ovog testa koji je zapravo napravljen još na proljeće (zato se i spominju starije verzije Sonneta i Opusa). Zapravo je zaključak teksta o njegovom eventualnom korištenju i sa svim navedenim ogradama pretjerano pozitivan, posebno nakon samo par mjeseci od kada je rađen ovaj test. Dakle, ne savjetujem kupnju toga tipa hardvera nikome.
Ovo posebno vrijedi nakon što su sada dostupni ovi veliki open-weight kineski modeli u oblaku (ili će uskoro biti dotupne i open-wight verzije) tipa Kimi 3, GLM 5.2 s jedne strane ili OpenRouter Model Fusion (Model Fusion | OpenRouter) koji je paket modela i navodno usporediv s Fableom 5, a duplo jeftiniji po tokenu. Sam nisam probao pa ne mogu reći da sam siguran, ali ovi koji su ga probali kažu da jest.
Ne mislim da su lokalni modeli posve besmisleni, ako imaš već RTX 4080-5090 ili neki ekvivalentni Radeon. Primjerice, refaktoriranje i provjera koda radi lokalno vrlo ok i vrlo brzo na ovim karticama - nema tog shellcheka u bashu koji tako temeljito pogleda gotovu skriptu kao neki Qwen model, primjerice. Ili napiše novu, bilo bash, bat, powershell, python skripte, JS, html stranice...
Dakle, ako već radiš na računalu koje ionako ima potreban hardver, takve stvari možeš raditi lokalno praktički besplatno - sve što ti treba već imaš.
Naravno, ako se radi na nekom velikom projektu s hrpom međuzavisnih modula čini mi se nepraktičnim koristiti lokalni model jer je i najveći lokalni model "debil" u odnosu na sada dostupno u oblaku, ali za ovo šta zovu "boiler plate" kod koji točno znaš da ti treba, sigurno je brže dati lokalnom modelu da ga napravi nego da ga sam tipkaš, a jeftinije je od korištenja vanjskog modela.
Doduše, u pretplati od 20-tak eura mjesečno za najjeftiniju razinu pretplate, dakle manje od eura po radnom danu, upitno je koliko je zgodno imati na računalu pokrenut LMStudio ili nešto slično ili neko vlastito sučelje prema lokalnim modelima za taj tip malih zadataka.
Nadao sam se da ćemo se dočepati i nekog Mac Studija na kojem bi se onda mogli pokrenuti i veliki lokalni modeli koji bi bili još bolji, ali nismo imali sreće, a sada s povlačenjem nekih modela s tržišta i nestašicom memorije, za to više nema nikakve šanse, ali to više nije ni bitno.
Ovi veliki modeli u oblaku su toliko moćni da se ništa lokalno (osim blade servera s H100/H200 za veće firme + neki kineski open-weight golemi model) s njima ne može mjeriti ni po čemu.
Pitanje je samo za što ti treba. Mislim da lokalne skripte, održavanje web stranica, neka svakodnevna rutina koja ne uključuje velike projekte i koja je isključivo kodiranje - lokalno (kartica) još ima smisla.
Sve ostalo tipa veliki projekti, analiza podataka, "kreativno pisanje", ali i pisanje dopisa, izvještaja, uputa, posebno na hrvatskom gdje su lokalni modeli premali za kvalitetno baratanje jezikom na kojem nisu trenirani (i veliki modeli osim ChatGPT-ovih i novih Fablea i Opusa su uglavnom nepismeni na hrvatskom) je besmisleno. Famozni "long-chain reasoning" i te fore gdje ti treba hrpa konteksta + superjak model da bi "reasoning" imao ikakvu logiku lokalno ne radi. Analize logova sa servera ili konfiguracijsku datoteka - zavisno od veličine loga ili datoteke - opet problem s kontekstnim prozorom (veličinom).
Za firme za koje Claude traži korištenje po API-ju, lokalni model pokrenut na Nvidijinom H100/200 serveru vjerojatno ima smisla, posebno ako rade s osjetljivim podacima, odnosno ne žele da se Anthropic i OpenAI treniraju na njihovom kodu i rješenjima.
Za male developere/hobiste - pretplata od 20-100 eura (Claude Max u raznim varijantama mislim do 200 eura mjesečno - najskuplja pretplata) je optimalno rješenje jer doslovce plaćaš tek djelić cijene koju velikim firmama naplaćuju po tokenu ako ide preko API-ja.
Netko je izračunao da za 200 eura pretplate Claude Codea (
) možeš mjesečno potrošiti tokena u vrijednosti do 8.000 eura (što govori i koliko je sadašnji poslovni model AI-ja neodrživ), iako je ovo varijabilno jer Anthropic stalno mijenja obračune, potrošnju tokena po modelu, resetiranje sesije itd. Ukratko - s pretplatom kod njih nemaš pojma što si zapravo platio. Ponovo - govori i koliko je sadašnji poslovni model AI-ja neodrživ.
Usprkos tome - i dalje najbolja vrijednost za novac.
O privatnosti i zaštiti podataka - ovisi što radiš.
Mislim da za 99,99% korisnika to nije uopće bitno, odnosno, bitno je praktički samo za veće firme koje barataju osjetljivim podacima ili rade na posebnim projektima.
U svakom slučaju hvala na komentaru.


