Što ako AI coding može biti potpuno besplatan, potpuno privatan, i raditi bez interneta? Može — s Ollama + lokalnim coding modelom poput Qwen3-Coder ili DeepSeek-R1. Trošak: 0 €. Količina API kreditra: 0. Količina koda koji odlazi u nečiji cloud: 0. Za hosting kupca koji ne želi platit AI subscription i ne želi dijelit svoj kod ni s kim, ovo je krajnja zero-cost AI coding configuracija.
U ovom vodiču pokazujem instalaciju Ollame, izbor pravog modela za tvoj laptop, integraciju s Continue.dev / Cline / Aider / OpenCode-om, i kako sa zero-cost workflow-om deploy-aš stranicu na WMD hosting.
Što je Ollama i zašto je važna
Ollama (ollama.com) je open source runtime za pokretanje LLM modela lokalno na tvojem laptopu ili desktopu. Tip osa: ollama pull qwen3-coder, čekaš 5-10 minuta da se model skine, i imaš API endpoint http://localhost:11434 koji govori isto kao OpenAI API.
Što ti to konkretno omogućuje:
- AI coding bez interneta — pišeš kod u avionu, na kampingu, na otoku gdje LTE pada
- Zero trošak — nema API kartice, nema mjesečnih račun-a, nema "free tier limit reached"
- Maximum privatnost — kod nikad ne napušta tvoju mašinu. Idealno za legal, healthcare, fintech, government projekte.
- Bez vendor lock-ina — prebacuješ modele 10 sekundi (Qwen3 → DeepSeek → Llama → svaki ima svoj feel)
- Kompatibilno sa svim AI coding alatima — Continue.dev, Cline, Aider, OpenCode, Cursor (preko OpenAI-compatible URL), svi razumiju Ollama
Hardverski zahtjevi — što ti stvarno treba
Ovo je realnost — performance Ollame direktno ovisi o tvojem hardveru. Tri tier-a:
Bazni laptop (8 GB RAM, integrirana grafika)
Modeli koji rade: do 3B parametara.
- qwen2.5-coder:1.5b — autocomplete, brz (200 tokens/sec na CPU-u)
- qwen2.5-coder:3b — chat, sporiji (40-60 tokens/sec)
Dovoljno za autocomplete u Continue.dev. Ne preporučam za chat ili agentni workflow — bit će prespor.
Srednji laptop (16 GB RAM, M-series Mac ili 8 GB VRAM GPU)
Modeli koji rade odlično: 7-8B parametara.
- qwen3-coder:7b — odličan general coder model (preporuka)
- deepseek-coder:6.7b — popularan, brz
- codellama:7b — Meta-in coder, dobar za Python i JS
Brzina: 30-60 tokens/sec. Usporedivo s Cursor / Claude iskustvom za 80 % zadataka. Ovo je sweet spot za većinu WMD kupaca.
Power laptop / desktop (32-64 GB RAM, 16+ GB VRAM)
Modeli koji rade: do 32B parametara.
- qwen2.5-coder:32b — performance vrlo blizu Claude Haikua, HumanEval 92.7 %
- deepseek-r1:32b — reasoning model, sporiji ali pametniji
- llama3.3:70b — GPT-4 razred lokalno (Mac s 64 GB RAM-a)
Brzina: 15-35 tokens/sec. Profesionalna kvaliteta, zero trošak. Idealno za freelance developere koji često pišu legal / fintech / healthcare projekte.
Instalacija Ollame
macOS
Preuzmi .dmg sa ollama.com/download i pokreni instalaciju. Alternativno preko Homebrew:
brew install ollama
Nakon instalacije, pokreni Ollama app — pojavljuje se u status traci. Provjeri preko terminala:
ollama --version
Linux
curl -fsSL https://ollama.com/install.sh | sh
# Ollama radi kao systemd servis
systemctl status ollama
Windows
Preuzmi .exe installer sa ollama.com/download, instaliraj, restart. Ollama se pokreće automatski na boot.
Skidanje prvog modela
Preporuka za većinu hosting kupaca: qwen3-coder:7b. Veličina datoteke: ~5 GB. Vrijeme: 5-15 minuta ovisno o vezi.
ollama pull qwen3-coder:7b
# Test
ollama run qwen3-coder:7b "Napiši PHP funkciju koja računa prosječnu cijenu iz niza"
Trebao bi dobit odgovor unutar 5-10 sekundi. Ako vidiš kod, sve radi.
Lista modela koje vrijedi imati
Praktičan setup za WMD developera:
# Chat model (general kvaliteta)
ollama pull qwen3-coder:7b
# Autocomplete model (mali, ultra-brz)
ollama pull qwen2.5-coder:1.5b
# Embeddings (za codebase search u Continue.dev / Cline)
ollama pull nomic-embed-text
# Bonus: reasoning model za komplekse Laravel arhitekture
ollama pull deepseek-r1:7b
Ukupno disk space: ~12 GB. Trajno, jednom skinuto, nikad više internet nije potreban.
Integracija s AI coding alatima
Continue.dev
U ~/.continue/config.json:
{
"models": [
{
"title": "Qwen3 Coder",
"provider": "ollama",
"model": "qwen3-coder:7b"
}
],
"tabAutocompleteModel": {
"provider": "ollama",
"model": "qwen2.5-coder:1.5b"
},
"embeddingsProvider": {
"provider": "ollama",
"model": "nomic-embed-text"
}
}
Detalje pokrivamo u Continue.dev vodiču.
Cline / Roo Code u VS Code-u
Cline Settings → Provider: Ollama, Base URL http://localhost:11434, Model ID qwen3-coder:7b. Detalji u Cline vodiču.
Aider
aider --model ollama/qwen3-coder:7b
OpenCode
OpenCode automatski detektira sve modele koje imaš pulled. Pri pokretanju Provider → Ollama → qwen3-coder:7b.
JetBrains IDE (PhpStorm, WebStorm)
Instaliraj Continue.dev plugin. Config je identičan kao u VS Code-u.
Praktičan primjer — kreiranje WordPress teme s Ollama-om
Imaš WMD hosting paket s WordPressom, želiš napravit custom temu. Koristim Continue.dev + Ollama.
1. Pripremi projekt
mkdir wp-content/themes/moja-tema
cd wp-content/themes/moja-tema
2. Otvori VS Code, pitaj Continue (s Ollama backend-om)
Napravi osnovne datoteke za WordPress temu "Moja Tema":
- style.css s theme header-om
- functions.php s enqueue stylesheets, support za featured image,
custom logo, menus, post thumbnails
- index.php, single.php, page.php, header.php, footer.php
- screenshot.png placeholder
Tema treba biti minimalna, Tailwind CSS preko CDN-a.
Continue + Qwen3-Coder generira sve datoteke unutar 1-2 minute. Brzina ovisi o tvojem hardveru — 16 GB RAM laptop tipično daje 30-50 tokens/sec.
3. Iteriraj na funkcionalnosti
@functions.php Dodaj custom post type "Reference" s poljima:
- klijent (text)
- datum_zavrsetka (date)
- opis_projekta (textarea)
- naslovna_slika (custom field)
Dodaj rewrite slug "reference".
Continue čita functions.php (lokalno, kod ne odlazi nikamo), generira diff s registracijom custom post type-a, ti potvrdiš.
4. Deploy na WMD hosting
Tri opcije:
- FTP / SFTP: VS Code SFTP extension push-a temu direktno u
/wp-content/themes/moja-tema/ - Git Version Control: commit + push na GitHub, pa Pull or Deploy u cPanelu
- cPanel File Manager: zip-aj temu, upload, unzip — staromodno ali radi
Performance u brojkama — što Ollama može na realnom laptopu
Testirano na MacBook M2 16 GB (sredina raspona u 2026.):
| Zadatak | Qwen3-Coder 7B | Claude Sonnet (API) |
|---|---|---|
| Napravit landing stranicu (HTML/CSS/JS) | ~3 min | ~45 sek |
| WordPress custom post type + admin meta box | ~1.5 min | ~25 sek |
| Laravel REST API endpoint + tests | ~4 min | ~1 min |
| Debug PHP error u 200-redovom fileu | ~30 sek | ~10 sek |
| Autocomplete (qwen2.5-coder:1.5b) | ~100 ms | n/a (cloud latency) |
Ollama je 3-5× sporija od Claude API-a, ali za 0 € mjesečno i bez slanja koda u tuđi cloud. Za većinu kupaca, ta razmjena vrijedi.
Što Ollama ne može (još)
Realan pogled — lokalni LLM ima svoja ograničenja:
- Latencija — 3-5× sporiji od cloud API-a, što ti smanjuje "feel" iteriranja
- Veliki kontekst — lokalni 7B modeli često imaju 8-32k token context window, što je manje od Claudeovih 200k. Za malen do srednji projekt sasvim dovoljno; za monolitne Laravel projekte s 500+ datoteka, cloud API je bolji.
- Vrhunski reasoning — DeepSeek-R1 32B je odličan, ali za stvarno teške arhitekturne probleme, Claude Opus 4.1 ili GPT-5 su još uvijek 1-2 koraka ispred
- Battery drain — pokretanje 7B modela jede CPU/GPU, laptop battery traje 30-50 % kraće
Hibridni pristup — Ollama autocomplete + cloud chat
Najpametniji setup za većinu profesionalnih developera:
- Autocomplete: lokalni qwen2.5-coder:1.5b (brz, jeftin, ne troši API)
- Chat: Anthropic Claude API (kvaliteta) ili DeepSeek API (cijena)
- Embeddings: lokalni nomic-embed-text (privatan, brz)
Mjesečni trošak: 1-5 € (samo chat-ovi koji prelaze lokalni model). Performance: 90 % cloud iskustva. Privatnost: autocomplete + embeddings ostaju lokalno.
Sigurnosna napomena za production projekte
Ollama te ne štiti automatski ako koristiš cloud chat (Claude / DeepSeek) za sensitive kod. Ako radiš na legal / healthcare / financial projektima:
- Postavi Ollama kao jedini provider u Continue / Cline / Aider config-u
- Provjeri da nije slučajno setting koji govori "fallback na OpenAI" uključen
- Dodaj
.continueignore,.aiderignore,.opencodeignores ovim:
.env
.env.*
secrets/
keys/
*.pem
*.key
vendor/
node_modules/
storage/logs/
database/migrations/*.php # ako su senzitivni
Kome je Ollama lokalno pravi izbor
Ollama + lokalni model + WMD hosting + cPanel Git Deploy je preporuka broj 1 za:
- Developera koji ne plaća AI subscription — student, hobby, side project
- Freelancer-a koji radi za klijente s NDA (zdravstvo, pravo, financije, državne ustanove)
- Tim koji ne želi kod slati u nečiji cloud iz security razloga
- Developera u zonama s lošim internetom — Dalmatinska zaleđa, otoci, kamping
- Onog tko hoće naučit kako stvarno radi LLM — Ollama daje ti potpunu kontrolu nad modelom, parametrima, system promptom
Sažetak — kraj R39 free-tools serije
Ollama + lokalni model je krajnji izraz "AI coding bez kompromisa cijene i privatnosti". Zero subscription, zero API trošak, zero podataka koje šalješ u nečiji cloud. Trade-off: 3-5× sporiji od cloud API-a, treba ti laptop s 16+ GB RAM-a za udoban workflow.
S ovim postom završava R39 serija o besplatnim AI coding alatima za WMD hosting:
- OpenCode + WMD hosting — terminal AI coding bez Cursor pretplate
- Aider + cPanel Git Deploy — najbolji Git-native free AI workflow
- VS Code + Cline / Roo Code — besplatna zamjena Cursoru
- Continue.dev — najlakši free AI coding ulaz za početnika
- Ollama + lokalni LLM — ovaj post
Sve ove kombinacije rade savršeno s WMD hostingom — bilo da koristiš cPanel Git Version Control, FTP/SFTP, ili manualni upload. WMD podrška ti pomaže oko bilo kojeg koraka 24/7. Pripremili smo i posebnu uputu za cPanel Git Version Control korak po korak.
Sljedeća serija pokriva self-hosting AI coding tool-ova na WMD VPS-u (Tabby + suradničke alate) — tvoj vlastiti GitHub Copilot zamjena hostiran kod tebe.