Računar sa staklenom stranicom i plavim unutrašnjim osvetljenjem

AI kod kuće: kako sastaviti rig za lokalne LLM modele – grafičke, Mac ili DGX Spark?

6 min čitanja

Objavljeno 26. avgust 2026.

Pokretanje velikih jezičkih modela (LLM) kod kuće prešlo je put od hakerske egzotike do ozbiljnog hobija, a sve češće i do poslovne potrebe: privatnost (podaci ne idu nikud), rad bez pretplata i limita, i eksperimentisanje bez cloud računa. Hardversko pitanje pri tom ima neobičan odgovor: ne kupujete brzinu – kupujete memoriju. Ovaj vodič je teardown tri puta do kućnog AI riga: grafičke kartice, Apple računari i namenske kutije poput NVIDIA DGX Spark, sa realnim brojkama iz 2026.

Osnovna fizika: memorija i njen protok odlučuju sve

Dva pravila određuju ceo izbor:

  1. Model mora da stane u memoriju (VRAM kartice ili ujedinjenu memoriju Mac-a odnosno Sparka). Kvantizovan na 4 bita (Q4, standard kućne upotrebe), model traži ~0,5 GB po milijardi parametara: model od 8B → ~4-5 GB; 30B → ~15-16 GB; 70B → ~35 GB; 120B MoE → ~60+ GB.
  2. Brzina odgovora ≈ protok memorije ÷ veličina modela. Zato kartica sa 1.800 GB/s protoka melje male modele, a uređaj sa 128 GB spore memorije drži ogromne modele – sporo. Kapacitet određuje šta možete da pokrenete, a protok koliko brzo.

Iz ta dva pravila slede tri arhitekture.

Put 1: grafičke kartice – brzina, ekosistem i polovni adut

Zašto: najveći protok memorije (GDDR), pun CUDA ekosistem (svi alati rade prvo na NVIDIA-i, o čemu detaljnije u poređenju NVIDIA i AMD kartica) i nadogradnja deo po deo na običnoj PC platformi.

Zvezda polovnog tržišta: RTX 3090 (24 GB). Da, kartica iz 2020. i dalje je najbolja vrednost u kućnom AI svetu 2026, i to nije naše mišljenje nego konsenzus zajednice: 24 GB VRAM-a i ogroman protok za cenu polovne srednje klase. Jedna 3090 vozi modele do ~30B klase udobno, a dve 3090 (48 GB) ulaze u 70B teritoriju – i to je klasičan „kućni AI rig" recept sa foruma. Uz pun test pre kupovine, naravno, jer su ove kartice tražene i drže cenu.

Alternativa sa svežom garancijom su RTX 4090 i 5090 (24 odnosno 32 GB): brže su, ali cena po gigabajtu VRAM-a raste brutalno. 5090 sa 32 GB i ~1.800 GB/s melje modele do 30B klase (~60+ tokena/s), ali 70B ne staje u nju.

Mane puta: potrošnja i toplota (dve 3090 znače ozbiljno napajanje i letnje grejanje sobe), buka, i VRAM plafon: preko 70B klase ovaj put postaje egzotičan (četiri kartice, serverske ploče i slično).

Za koga: entuzijasta koji hoće najbrže odgovore na modelima do 30-70B, igra se i sa slikama (Stable Diffusion i društvo vole CUDA) i po mogućstvu već ima PC u koji kartica ulazi.

Put 2: Mac – tiha kutija sa ogromnom memorijom

Zašto: Apple ujedinjena memorija znači da GPU vidi ceo RAM, pa Mac sa 64-128 GB drži modele koje nijedna potrošačka kartica ne može, u kutiji koja je nečujna i vuče struju kao sijalica. Mac Studio (M3 Ultra i M4 klase, protok ~800 GB/s) tera 70B modele na sasvim upotrebljivih ~16-22 tokena/s, a MacBook Pro Max klase (~600 GB/s) daje više od polovine toga, i to u laptopu. Softver je sazreo (llama.cpp, MLX i Ollama rade odlično), mada bez CUDA sveta: neki alati stižu kasnije ili nikako.

Mane: cena novih je porasla (i Apple je žrtva memorijske krize – konfiguracije sa najviše RAM-a su poskupele ili povučene), memorija se bira jednom zauvek, a prefill na dugim kontekstima je sporiji nego kod NVIDIA kartica.

Za koga: za onoga ko hoće velike modele u tišini radne sobe, već je u Apple svetu ili traži jedan uređaj i za rad i za AI. Mac mini sa dosta memorije je najjeftiniji legitiman ulaz u lokalne LLM-ove uopšte, a polovni Mac Studio primerci sa velikom memorijom su tražena roba, pa ih pre kupovine proverite po vodiču za polovan MacBook.

Put 3: DGX Spark i namenske AI kutije – kapacitet u maloj kutiji

NVIDIA DGX Spark (~$4.000-5.000): 128 GB ujedinjene memorije i CUDA u kutiji veličine knjige, uz potrošnju od ~140 W. Teardown pošteno: protok memorije je ~273 GB/s, dakle četvrtina Mac Studija i petnaestina RTX kartice.

Prevod: Spark drži modele do ~200B klase (što ništa potrošačko ne može), ali dense 70B model vozi na ~5 tokena/s – čitljivo, ali sporo za interaktivan rad. Optimizovani frameworci i MoE modeli (koji aktiviraju samo deo parametara) popravljaju sliku značajno. Snaga Sparka je u spoju CUDA ekosistema i kapaciteta: fino podešavanje (fine-tuning), rad sa najvećim otvorenim modelima i razvoj koji se seli na prave servere.

Za koga: za developere i istraživače kojima kapacitet i CUDA znače više od brzine ćaskanja. Za čist „chat sa modelom kod kuće" je preskup i prespor – to je alat, ne igračka.

Matrica odluke – sažetak

ProfilPreporukaOkvirni budžet
Prvi koraci, modeli do 8-13BPostojeći PC + polovna kartica 12-16 GB VRAMnajniži
Ozbiljan hobi, 30B klasa, brzinaPolovna RTX 3090 (24 GB), value kraljumeren
70B klasa, maksimalna brzina2× polovna 3090 ili nova top kartica + jak PCvisok
70B klasa, tišina i jedan uređajMac Studio sa 64-128 GB (nov ili polovan)visok
Najveći modeli, fine-tuning, CUDA razvojDGX Spark ili više kartica na serverskoj platforminajviši

I podsetnik koji važi za sve puteve: kriza cena memorije pogađa upravo ovu kategoriju, jer VRAM-bogate kartice i visokomemorijski Mac-ovi drže i dižu cene, pa je polovno tržište (uz naše provere) postalo prirodno lovište AI entuzijasta. Softverski ulaz je, srećom, besplatan: Ollama ili LM Studio uz otvorene modele instalirate za jedno veče, a hardver birate po apetitu iz ove tabele.

Česta pitanja

Koji je najjeftiniji ulaz u lokalne LLM-ove?

Računar koji već imate: modeli od 4-8B rade i na 8-16 GB RAM-a bez namenske grafičke (sporo, ali upotrebljivo), a polovna kartica sa 12+ GB VRAM-a otvara 13B klasu udobno. Instalirajte Ollama ili LM Studio i probajte pre bilo kakve kupovine, jer se apetit najbolje meri korišćenjem.

Zašto svi preporučuju polovnu RTX 3090 za AI?

Zbog 24 GB VRAM-a, kapaciteta koji novije potrošačke kartice daju tek u najskupljim modelima, uz veliki protok i CUDA, i to za cenu polovne srednje klase. Za lokalne modele do 30B (i 70B u paru) to je neprikosnoveni odnos mogućnosti i cene u 2026.

Da li je Mac ozbiljna opcija za AI ili kompromis?

Sasvim je ozbiljna za pokretanje (inference) velikih modela: ujedinjena memorija drži ono što kartice ne mogu, uz tišinu i malu potrošnju. Kompromis je u ekosistemu (bez CUDA deo alata kasni) i u brzini na dugim kontekstima, a za treniranje i fino podešavanje NVIDIA ostaje teren.

Vredi li DGX Spark za kućnu upotrebu?

Za ćaskanje sa modelima ne: spor protok memorije čini velike dense modele tromim, a cena je visoka. Vredi za razvoj, jer je 128 GB uz CUDA u kutiji od 140 W mini-laboratorija za rad sa najvećim otvorenim modelima i za prototipe koji idu na servere.

Znate šta tražite?

Pogledajte aktuelne oglase u kategoriji Grafičke kartice.

Pogledajte oglase

Povezani vodiči