Πριν ένα χρόνο, ο τίτλος αυτού του άρθρου θα ήταν wishful thinking. Ένα 30B parameter model στο laptop σου έδινε 2 tokens/δευτερόλεπτο και ο ανεμιστήρας ούρλιαζε σαν jet engine. Δεν ήταν productivity tool — ήταν tech demo.
Το 2026 είναι διαφορετικό. Το Qwen 3.5, τα Apple M-series chips, και το Ollama έχουν κάνει τους local LLMs τόσο πρακτικούς που developers ακυρώνουν API subscriptions και τρέχουν production agents από το γραφείο τους. Αυτός ο οδηγός σου δείχνει ακριβώς πώς.
Γιατί local agent το 2026;
Η ερώτηση δεν είναι πια «μπορώ να το κάνω;» — είναι «γιατί να μην το κάνω;» Οι λόγοι είναι τρεις και ο καθένας μόνος του αρκεί:
1. Κόστος
Ένα production coding agent που στέλνει 500K tokens/μέρα σε Claude ή GPT-5 κοστίζει €150–400/μήνα. Το ίδιο workload σε local 30B model: €0/μήνα, μετά το hardware. Το RTX 3090 αποσβένεται σε 3–4 μήνες αν το χρησιμοποιείς εντατικά.
2. Privacy
Κάθε prompt που στέλνεις σε cloud model περνάει από servers τρίτων. Κώδικας, business logic, credentials που τυχαία βρίσκονται σε context — όλα καταγράφονται κάπου. Local agent: τίποτα δεν φεύγει από το LAN σου. Ιδιαίτερα κρίσιμο για εταιρικά projects ή ευαίσθητα δεδομένα.
3. Latency & Offline
Σε αεροπλάνο, σε cabin χωρίς internet, σε VPN με restricted traffic — ο local agent δουλεύει πάντα. Και επειδή το model τρέχει στο LAN σου, το latency είναι μηδενικό σε σχέση με cloud calls.
Hardware: GPU & System
Το μοναδικό spec που έχει σημασία για local LLMs είναι το VRAM της GPU. Το model πρέπει να χωράει εξ ολοκλήρου στο VRAM για να τρέχει σε αξιοπρεπή ταχύτητα. Αν ξεχειλίσει στη RAM, η ταχύτητα πέφτει από 50 tokens/sec σε 2–3.
Υπόλοιπο σύστημα
CPU: Οποιοδήποτε modern Ryzen 5 ή Intel Core i5+ αρκεί — το bottleneck είναι πάντα η GPU. RAM: minimum 32GB system RAM. Storage: 2TB SSD NVMe — τα models πιάνουν 4–20GB το κάθε ένα και θες να έχεις μερικά στη διάθεσή σου.
Ollama — Model Runtime
Το Ollama είναι ο ευκολότερος τρόπος να τρέξεις local LLMs. Ένα command κατεβάζει
και εκτελεί το model, εκθέτει OpenAI-compatible REST API στο localhost:11434,
και διαχειρίζεται αυτόματα GPU detection και memory allocation.
Εγκατάσταση
# Εγκατάσταση Ollama curl -fsSL https://ollama.com/install.sh | sh # Κατέβασε το καλύτερο coding model (2026) ollama pull qwen3-coder # Για 24GB+ VRAM — full 30B ollama pull qwen3-coder:30b # Για budget setups (16GB RAM) ollama pull qwen3-coder:9b-q4_K_M # Test ότι δουλεύει ollama run qwen3-coder "Γράψε μου ένα Python hello world"
# Κατέβασε installer από ollama.com/download # Μετά από PowerShell: ollama pull qwen3-coder ollama serve
Expose στο home network
Το killer feature του Ollama: τρέχεις το model σε ένα μηχάνημα και το ρωτάς από οποιαδήποτε άλλη συσκευή στο LAN σου — laptop, tablet, phone.
# Άνοιξε Ollama σε όλες τις interfaces OLLAMA_HOST=0.0.0.0:11434 ollama serve # Ή βάλτο ως systemd service (Linux) # /etc/systemd/system/ollama.service [Service] Environment="OLLAMA_HOST=0.0.0.0:11434" ExecStart=/usr/local/bin/ollama serve
Επιλογή Μοντέλου
Τα models αλλάζουν γρήγορα. Αυτά είναι τα καλύτερα για coding agents το Ιούνιο 2026:
| Model | VRAM | Coding | Tool Calling | Ταχύτητα |
|---|---|---|---|---|
| qwen3-coder:30b | 24GB | 110 t/s | ||
| qwen3-coder:14b | 10GB | 55 t/s | ||
| llama4-scout:17b | 12GB | 70 t/s | ||
| deepseek-coder-v3 | 20GB | 40 t/s | ||
| qwen3-coder:9b-q4 | 6GB | 90 t/s |
RTX 3060 12GB: qwen3-coder:14b ή llama4-scout:17b
RTX 3090 / 4090 24GB: qwen3-coder:30b — αυτό θέλεις
Mac M4 Pro 48GB: qwen3-coder:30b χωρίς quantization
IDE Integration
Όλα τα σύγχρονα AI-enabled IDEs υποστηρίζουν custom OpenAI-compatible endpoints — άρα συνδέονται απευθείας στο Ollama σου.
Option A: VS Code + Continue.dev (recommended)
Το Continue.dev είναι το πιο feature-complete open-source AI plugin για VS Code. Autocomplete, chat, inline edits, codebase-aware context — όλα.
{
"models": [
{
"title": "Local Qwen3 Coder",
"provider": "ollama",
"model": "qwen3-coder:30b",
"apiBase": "http://localhost:11434"
}
],
"tabAutocompleteModel": {
"title": "Autocomplete",
"provider": "ollama",
"model": "qwen3-coder:9b-q4_K_M"
},
"contextLength": 32768
}
Option B: Cursor
Cursor → Settings → Models → Add Model → επίλεξε «OpenAI Compatible» →
Base URL: http://localhost:11434/v1 → Model: qwen3-coder:30b.
Δουλεύει out of the box, συμπεριλαμβανομένου του Composer (agentic mode).
Option C: Neovim (avante.nvim)
return { "yetone/avante.nvim", opts = { provider = "ollama", ollama = { model = "qwen3-coder:30b", endpoint = "http://127.0.0.1:11434", } } }
Agent Framework
Το IDE integration δίνει autocomplete και chat. Το agent framework δίνει αυτονομία — ο agent γράφει κώδικα, τον εκτελεί, βλέπει το output, το διορθώνει, επαναλαμβάνει. Αυτό είναι το «IDE Agent» του τίτλου.
OpenHands (πρώην OpenDevin)
Ο πιο ώριμος open-source coding agent. Τρέχει σε Docker, έχει web UI, και υποστηρίζει Ollama ως backend.
# Pull και τρέξε OpenHands docker pull ghcr.io/all-hands-ai/openhands:main docker run -it \ -e SANDBOX_RUNTIME_CONTAINER_IMAGE=docker.all-hands.dev/all-hands-ai/runtime:0.39-nikolaik \ -e LLM_BASE_URL=http://host.docker.internal:11434 \ -e LLM_MODEL=ollama/qwen3-coder:30b \ -v /var/run/docker.sock:/var/run/docker.sock \ -p 3000:3000 \ ghcr.io/all-hands-ai/openhands:main # Άνοιξε browser στο http://localhost:3000
Hermes Agent (για automation workflows)
Αν θέλεις scheduled tasks, morning briefings, και messaging integrations (Telegram, Slack, Discord), το Hermes Agent είναι ιδανικό.
# One-line install curl -fsSL https://raw.githubusercontent.com/NousResearch/hermes-agent/main/install.sh | sh # Config: ~/.hermes/config.yaml llm: provider: ollama model: qwen3-coder:30b base_url: http://localhost:11434 messaging: telegram: token: YOUR_BOT_TOKEN
Privacy & Security
Ο λόγος που φτιάχνεις local agent είναι ακριβώς η privacy. Δες τι πρέπει να κάνεις για να τη διασφαλίσεις πραγματικά:
-
1
Docker sandbox για code execution. Ο agent εκτελεί κώδικα — αυτόν που γράφει ο LLM. Βάλε το πάντα σε isolated Docker container. Το OpenHands το κάνει αυτόματα.
-
2
Firewall για το Ollama API. Το
0.0.0.0:11434πρέπει να είναι προσβάσιμο μόνο στο LAN σου, ποτέ από το internet. Βάλε κανόνα στο firewall:ufw deny 11434+ allow μόνο από 192.168.x.x. -
3
VPN για model downloads. Αν θέλεις ο ISP σου να μην ξέρει ποια models κατεβάζεις, κάνε το μέσω VPN (Mullvad ή ProtonVPN).
-
4
Τακτικά updates. Ollama, models, και agent frameworks παίρνουν security updates συχνά. Βάλε
ollama pull qwen3-coderσε weekly cron. -
5
GGUF format για Mac. Αν είσαι σε Apple Silicon, κατέβαζε μόνο GGUF format models — είναι βελτιστοποιημένα για Metal acceleration.
Local vs Cloud: Η αλήθεια
Δεν είναι all-or-nothing. Η καλύτερη στρατηγική το 2026 είναι hybrid: local για το 80% των tasks, cloud για τα δύσκολα.
| Local Agent (30B) | Cloud (Claude / GPT-5) | |
|---|---|---|
| Κόστος/token | €0 | €€–€€€ |
| Privacy | 100% local | Εξωτερικοί servers |
| Offline | ✓ Πάντα | ✗ Χρειάζεται internet |
| Latency | ~0ms (LAN) | 100–500ms |
| Ποιότητα reasoning | Πολύ καλή | Καλύτερη |
| Context window | 32K–128K | 200K–1M |
| Rate limits | Κανένα | Υπάρχουν |
| Setup complexity | Μέτρια | Μηδέν |
Cloud για: Αρχιτεκτονικές αποφάσεις, πολύπλοκα multi-file refactors, tasks που χρειάζονται 100K+ context, critical security code.
Troubleshooting Guide
Κάποια κοινά προβλήματα και οι λύσεις τους, για να μην κολλήσεις στο setup.
1. To model δεν τρέχει ή είναι πολύ αργό
Σύμπτωμα: ollama run qwen3-coder κάνει "timeout" ή 1 token/sec.
- Έλεγξε VRAM: Τρέξε
nvidia-smi(ή Activity Monitor σε Mac) — βλέπεις πόση VRAM διαθέτεις. Αν είναι λιγότερη από 24GB, χρησιμοποίησε 9B ή 14B model. - Διαγραφή προσωρινών αρχείων Ollama: Στον φάκελο
~/.ollama/modelsήC:\Users\USERNAME\.ollama\modelsδιαγράφεις τα models που δεν χρησιμοποιείς. - GPU Drivers: Ενημέρωσε τα NVIDIA drivers (ή Apple Silicon στο Mac) στην τελευταία έκδοση.
2. To Continue.dev δεν συνδέεται στο Ollama
Σύμπτωμα: Το VS Code λέει "Failed to connect to Ollama".
- Βεβαιώσου ότι το Ollama τρέχει:
ollama serveσε Linux/macOS ή απλά ανοίγει το Ollama app σε Windows. - Έλεγξε το port:
curl http://localhost:11434/api/tags— πρέπει να σου επιστρέψει τα models σου. - Σε Docker (OpenHands): Αντικατέστησε
host.docker.internalμε την IP του host μηχανισμού (Windows: ipconfig → Ethernet adapter, Linux: ip addr).
3. O agent δεν εκτελεί commands σωστά
Σύμπτωμα: Ο OpenHands γράφει κώδικα αλλά δεν το τρέχει ή βγάζει errors.
- Βεβαιώσου ότι το Docker Desktop τρέχει και έχεις allocated αρκετή RAM (minimum 8GB).
- Συνδέσου στο sandbox container με
docker exec -it [CONTAINER_ID] shκαι έλεγξε manually τι συμβαίνει. - Δοκίμασε ένα διαφορετικό model — κάποια models είναι καλύτερα στο tool calling απ' άλλα.
OLLAMA_DEBUG=1 ollama serve.
Advanced Use Cases
Παραδείγματα πιο προχωρημένων χρήσεων του local agent σου.
1. Automated Code Review Pipeline
Φτιάξε ένα shell script που τρέχει κάθε φορά που κάνεις commit σε git:
#!/bin/bash # Αυτός ο hook τρέχει πριν το commit # Γράφουμε τα changed files σε ένα temp file git diff --cached > /tmp/staged.diff # Ζητάμε από το agent να κάνει code review ollama run qwen3-coder:30b "Κάνε code review τα παρακάτω changes: $(cat /tmp/staged.diff). Επιστρέψει μόνο bullet points με προβλήματα και προτάσεις βελτιώσεων."
2. Local RAG (Retrieval-Augmented Generation)
Προσθέτει ιδιωτική γνώση (docs, internal wikis) στον agent σου, χωρίς να στείλεις τα δεδομένα σου στο cloud.
Χρησιμοποίησε το Ollama + LangChain + ChromaDB:
from langchain_ollama import OllamaLLM, OllamaEmbeddings from langchain_chroma import Chroma from langchain_core.prompts import ChatPromptTemplate llm = OllamaLLM(model="qwen3-coder:30b") embeddings = OllamaEmbeddings(model="nomic-embed-text") # Φόρτωσε τα docs σου σε ChromaDB db = Chroma(embedding_function=embeddings, persist_directory="./chroma_db") # RAG prompt prompt = ChatPromptTemplate.from_messages([ ("system", "Χρησιμοποίησε τα ακόλουθα docs για να απαντήσεις: {context}"), ("human", "{input}") ])
3. Multi-Agent System
Φτιάξε πολλούς agents με διαφορετικούς ρόλους:
- Architect Agent: Σχεδιάζει την αρχιτεκτονική.
- Coder Agent: Γράφει τον κώδικα.
- Reviewer Agent: Ελέγχει τον κώδικα.
AutoGen: Για multi-agent conversations.
Future Roadmap
Τι περιμένουμε το 2026-2027 για τα local AI agents:
| Τεχνολογία | Πότε | Τι αλλάζει |
|---|---|---|
| 40B+ models σε consumer GPUs | End of 2026 | Καλύτερη ποιότητα χωρίς να χρειάζεσαι server-grade hardware. |
| Native multimodal local agents | Mid 2026 | Agents που βλέπουν screenshot, διαβάζουν PDFs, και ακούνε voice commands. |
| Better quantization techniques | Q3 2026 | 70B models σε 24GB VRAM με σχεδόν καμία απώλεια ποιότητας. |
| Open-source agentic frameworks | Ongoing | Περισσότερα εργαλεία όπως OpenHands, με καλύτερη ενσωμάτωση με τα IDEs. |
Το setup σε 6 βήματα
- 1Αγόρασε GPU με minimum 12GB VRAM (RTX 3090 used = sweet spot)
- 2Εγκατάστησε Ollama:
curl -fsSL https://ollama.com/install.sh | sh - 3Κατέβασε model:
ollama pull qwen3-coder:30b - 4Σύνδεσε VS Code / Cursor μέσω Continue.dev στο
localhost:11434 - 5Στήσε OpenHands για agentic tasks μέσω Docker
- 6Lock down το API με firewall — μόνο LAN access
Το 2026 είναι η πρώτη χρονιά που ένας home AI coding agent δεν είναι απλώς «cool project» — είναι παραγωγικό εργαλείο που ανταγωνίζεται το cloud. Ο μόνος λόγος να μην το κάνεις είναι αν δεν σε πειράζει να πληρώνεις subscriptions για το υπόλοιπο της ζωής σου.