Οδηγός · Hardware · Software · Setup

Στήσε τον δικό σου
Home AI IDE Agent
από το μηδέν

Ο πλήρης τεχνικός οδηγός για το 2026: από την επιλογή GPU μέχρι το πρώτο agentic coding session — χωρίς cloud, χωρίς subscriptions, χωρίς να φεύγουν τα δεδομένα σου πουθενά.

€0 κόστος/token
110 tokens/sec (30B)
100% ιδιωτικά δεδομένα
6 βήματα setup
Περιεχόμενα

Πριν ένα χρόνο, ο τίτλος αυτού του άρθρου θα ήταν wishful thinking. Ένα 30B parameter model στο laptop σου έδινε 2 tokens/δευτερόλεπτο και ο ανεμιστήρας ούρλιαζε σαν jet engine. Δεν ήταν productivity tool — ήταν tech demo.

Το 2026 είναι διαφορετικό. Το Qwen 3.5, τα Apple M-series chips, και το Ollama έχουν κάνει τους local LLMs τόσο πρακτικούς που developers ακυρώνουν API subscriptions και τρέχουν production agents από το γραφείο τους. Αυτός ο οδηγός σου δείχνει ακριβώς πώς.

📌 Τι θα έχεις στο τέλος
Έναν local AI coding agent που τρέχει 24/7 στο σπίτι σου, συνδέεται σε VS Code / Cursor, εκτελεί agentic tasks με tool calling, και δεν στέλνει ούτε ένα byte σε εξωτερικό server.
💡
Εισαγωγή

Γιατί local agent το 2026;

Η ερώτηση δεν είναι πια «μπορώ να το κάνω;» — είναι «γιατί να μην το κάνω;» Οι λόγοι είναι τρεις και ο καθένας μόνος του αρκεί:

1. Κόστος

Ένα production coding agent που στέλνει 500K tokens/μέρα σε Claude ή GPT-5 κοστίζει €150–400/μήνα. Το ίδιο workload σε local 30B model: €0/μήνα, μετά το hardware. Το RTX 3090 αποσβένεται σε 3–4 μήνες αν το χρησιμοποιείς εντατικά.

2. Privacy

Κάθε prompt που στέλνεις σε cloud model περνάει από servers τρίτων. Κώδικας, business logic, credentials που τυχαία βρίσκονται σε context — όλα καταγράφονται κάπου. Local agent: τίποτα δεν φεύγει από το LAN σου. Ιδιαίτερα κρίσιμο για εταιρικά projects ή ευαίσθητα δεδομένα.

3. Latency & Offline

Σε αεροπλάνο, σε cabin χωρίς internet, σε VPN με restricted traffic — ο local agent δουλεύει πάντα. Και επειδή το model τρέχει στο LAN σου, το latency είναι μηδενικό σε σχέση με cloud calls.

⚠️ Honest caveat
Τα local models (ακόμα και 70B) δεν φτάνουν την ποιότητα των frontier models όπως Claude Opus ή GPT-5 σε πολύπλοκα reasoning tasks. Για 80% των coding workflows όμως, ένα καλό 30B είναι περισσότερο από αρκετό.
🖥️
Βήμα 01

Hardware: GPU & System

Το μοναδικό spec που έχει σημασία για local LLMs είναι το VRAM της GPU. Το model πρέπει να χωράει εξ ολοκλήρου στο VRAM για να τρέχει σε αξιοπρεπή ταχύτητα. Αν ξεχειλίσει στη RAM, η ταχύτητα πέφτει από 50 tokens/sec σε 2–3.

Setup
GPU / Hardware
Τι τρέχει άνετα
Budget
RTX 3060 12GB (~€280)
7B–14B models
Sweet Spot
RTX 3090 24GB (~€700 used)
32B models, Q4 quant
Serious
RTX 4090 24GB / RTX 5090 32GB
30B–70B με ταχύτητα
Apple
Mac Mini M4 Pro 48GB
Όλα, unified memory
🚫 Μην αγοράσεις
GPU με λιγότερο από 12GB VRAM. Τα 8GB γεμίζουν αμέσως με τα μεγαλύτερα models και δεν αφήνουν χώρο για context window. Δεν αξίζει η εξοικονόμηση.

Υπόλοιπο σύστημα

CPU: Οποιοδήποτε modern Ryzen 5 ή Intel Core i5+ αρκεί — το bottleneck είναι πάντα η GPU. RAM: minimum 32GB system RAM. Storage: 2TB SSD NVMe — τα models πιάνουν 4–20GB το κάθε ένα και θες να έχεις μερικά στη διάθεσή σου.

💡 Tip: Used market
Το RTX 3090 είναι το «sweet spot» της used αγοράς το 2026. 24GB VRAM, τρέχει Qwen3-Coder 30B άνετα, και βρίσκεται στα €650–800. Κοίτα σε eBay, σε Facebook Marketplace, και σε forums miners που ξεπουλάνε hardware.
⚙️
Βήμα 02

Ollama — Model Runtime

Το Ollama είναι ο ευκολότερος τρόπος να τρέξεις local LLMs. Ένα command κατεβάζει και εκτελεί το model, εκθέτει OpenAI-compatible REST API στο localhost:11434, και διαχειρίζεται αυτόματα GPU detection και memory allocation.

Εγκατάσταση

bash · Linux / macOS
# Εγκατάσταση Ollama
curl -fsSL https://ollama.com/install.sh | sh

# Κατέβασε το καλύτερο coding model (2026)
ollama pull qwen3-coder

# Για 24GB+ VRAM — full 30B
ollama pull qwen3-coder:30b

# Για budget setups (16GB RAM)
ollama pull qwen3-coder:9b-q4_K_M

# Test ότι δουλεύει
ollama run qwen3-coder "Γράψε μου ένα Python hello world"
bash · Windows (PowerShell)
# Κατέβασε installer από ollama.com/download
# Μετά από PowerShell:
ollama pull qwen3-coder
ollama serve

Expose στο home network

Το killer feature του Ollama: τρέχεις το model σε ένα μηχάνημα και το ρωτάς από οποιαδήποτε άλλη συσκευή στο LAN σου — laptop, tablet, phone.

bash
# Άνοιξε Ollama σε όλες τις interfaces
OLLAMA_HOST=0.0.0.0:11434 ollama serve

# Ή βάλτο ως systemd service (Linux)
# /etc/systemd/system/ollama.service
[Service]
Environment="OLLAMA_HOST=0.0.0.0:11434"
ExecStart=/usr/local/bin/ollama serve
ℹ️ LM Studio — εναλλακτικό UI
Αν προτιμάς γραφικό interface αντί για CLI, το LM Studio κάνει ακριβώς το ίδιο πράγμα με visual model browser, chat UI, και automatic GPU detection. Και τα δύο εκθέτουν OpenAI-compatible API — όλα τα IDEs συνδέονται και στα δύο.
🤖
Βήμα 03

Επιλογή Μοντέλου

Τα models αλλάζουν γρήγορα. Αυτά είναι τα καλύτερα για coding agents το Ιούνιο 2026:

Model VRAM Coding Tool Calling Ταχύτητα
qwen3-coder:30b 24GB
110 t/s
qwen3-coder:14b 10GB
55 t/s
llama4-scout:17b 12GB
70 t/s
deepseek-coder-v3 20GB
40 t/s
qwen3-coder:9b-q4 6GB
90 t/s
🎯 Σύσταση ανά hardware
16GB RAM (no GPU): qwen3-coder:9b-q4_K_M
RTX 3060 12GB: qwen3-coder:14b ή llama4-scout:17b
RTX 3090 / 4090 24GB: qwen3-coder:30b — αυτό θέλεις
Mac M4 Pro 48GB: qwen3-coder:30b χωρίς quantization
💻
Βήμα 04

IDE Integration

Όλα τα σύγχρονα AI-enabled IDEs υποστηρίζουν custom OpenAI-compatible endpoints — άρα συνδέονται απευθείας στο Ollama σου.

Option A: VS Code + Continue.dev (recommended)

Το Continue.dev είναι το πιο feature-complete open-source AI plugin για VS Code. Autocomplete, chat, inline edits, codebase-aware context — όλα.

json · ~/.continue/config.json
{
  "models": [
    {
      "title": "Local Qwen3 Coder",
      "provider": "ollama",
      "model": "qwen3-coder:30b",
      "apiBase": "http://localhost:11434"
    }
  ],
  "tabAutocompleteModel": {
    "title": "Autocomplete",
    "provider": "ollama",
    "model": "qwen3-coder:9b-q4_K_M"
  },
  "contextLength": 32768
}
💡 Tip: Δύο models ταυτόχρονα
Χρησιμοποίησε ένα μικρό, γρήγορο model (9B q4) για autocomplete και ένα μεγάλο, έξυπνο (30B) για chat και complex tasks. Έτσι έχεις και ταχύτητα και ποιότητα.

Option B: Cursor

Cursor → Settings → Models → Add Model → επίλεξε «OpenAI Compatible» → Base URL: http://localhost:11434/v1 → Model: qwen3-coder:30b. Δουλεύει out of the box, συμπεριλαμβανομένου του Composer (agentic mode).

Option C: Neovim (avante.nvim)

lua · ~/.config/nvim/lua/plugins/avante.lua
return {
  "yetone/avante.nvim",
  opts = {
    provider = "ollama",
    ollama = {
      model = "qwen3-coder:30b",
      endpoint = "http://127.0.0.1:11434",
    }
  }
}
🧠
Βήμα 05

Agent Framework

Το IDE integration δίνει autocomplete και chat. Το agent framework δίνει αυτονομία — ο agent γράφει κώδικα, τον εκτελεί, βλέπει το output, το διορθώνει, επαναλαμβάνει. Αυτό είναι το «IDE Agent» του τίτλου.

OpenHands (πρώην OpenDevin)

Ο πιο ώριμος open-source coding agent. Τρέχει σε Docker, έχει web UI, και υποστηρίζει Ollama ως backend.

bash
# Pull και τρέξε OpenHands
docker pull ghcr.io/all-hands-ai/openhands:main

docker run -it \
  -e SANDBOX_RUNTIME_CONTAINER_IMAGE=docker.all-hands.dev/all-hands-ai/runtime:0.39-nikolaik \
  -e LLM_BASE_URL=http://host.docker.internal:11434 \
  -e LLM_MODEL=ollama/qwen3-coder:30b \
  -v /var/run/docker.sock:/var/run/docker.sock \
  -p 3000:3000 \
  ghcr.io/all-hands-ai/openhands:main

# Άνοιξε browser στο http://localhost:3000

Hermes Agent (για automation workflows)

Αν θέλεις scheduled tasks, morning briefings, και messaging integrations (Telegram, Slack, Discord), το Hermes Agent είναι ιδανικό.

bash
# One-line install
curl -fsSL https://raw.githubusercontent.com/NousResearch/hermes-agent/main/install.sh | sh

# Config: ~/.hermes/config.yaml
llm:
  provider: ollama
  model: qwen3-coder:30b
  base_url: http://localhost:11434

messaging:
  telegram:
    token: YOUR_BOT_TOKEN
🚀 Agentic loop σε πράξη
Δίνεις task: «Φτιάξε μου ένα FastAPI endpoint που κάνει X». Ο agent: γράφει τον κώδικα → τον εκτελεί σε Docker sandbox → βλέπει τα errors → τα διορθώνει → τρέχει tests → σου παρουσιάζει το τελικό αποτέλεσμα. Εσύ απλώς εγκρίνεις ή ζητάς αλλαγές.
🔐
Βήμα 06

Privacy & Security

Ο λόγος που φτιάχνεις local agent είναι ακριβώς η privacy. Δες τι πρέπει να κάνεις για να τη διασφαλίσεις πραγματικά:

📊
Ανάλυση

Local vs Cloud: Η αλήθεια

Δεν είναι all-or-nothing. Η καλύτερη στρατηγική το 2026 είναι hybrid: local για το 80% των tasks, cloud για τα δύσκολα.

Local Agent (30B) Cloud (Claude / GPT-5)
Κόστος/token €0 €€–€€€
Privacy 100% local Εξωτερικοί servers
Offline ✓ Πάντα ✗ Χρειάζεται internet
Latency ~0ms (LAN) 100–500ms
Ποιότητα reasoning Πολύ καλή Καλύτερη
Context window 32K–128K 200K–1M
Rate limits Κανένα Υπάρχουν
Setup complexity Μέτρια Μηδέν
🎯 Η hybrid στρατηγική
Local agent για: Autocomplete, code review, refactoring, debugging, unit tests, documentation, μικρά features.

Cloud για: Αρχιτεκτονικές αποφάσεις, πολύπλοκα multi-file refactors, tasks που χρειάζονται 100K+ context, critical security code.
🔧
Συντήρηση

Troubleshooting Guide

Κάποια κοινά προβλήματα και οι λύσεις τους, για να μην κολλήσεις στο setup.

1. To model δεν τρέχει ή είναι πολύ αργό

Σύμπτωμα: ollama run qwen3-coder κάνει "timeout" ή 1 token/sec.

2. To Continue.dev δεν συνδέεται στο Ollama

Σύμπτωμα: Το VS Code λέει "Failed to connect to Ollama".

3. O agent δεν εκτελεί commands σωστά

Σύμπτωμα: Ο OpenHands γράφει κώδικα αλλά δεν το τρέχει ή βγάζει errors.

💡 Pro tip: Logs του Ollama
Για debug, τρέξε το Ollama με verbose logs: OLLAMA_DEBUG=1 ollama serve.
Επεκτάσεις

Advanced Use Cases

Παραδείγματα πιο προχωρημένων χρήσεων του local agent σου.

1. Automated Code Review Pipeline

Φτιάξε ένα shell script που τρέχει κάθε φορά που κάνεις commit σε git:

bash · .git/hooks/pre-commit
#!/bin/bash
# Αυτός ο hook τρέχει πριν το commit

# Γράφουμε τα changed files σε ένα temp file
git diff --cached > /tmp/staged.diff

# Ζητάμε από το agent να κάνει code review
ollama run qwen3-coder:30b "Κάνε code review τα παρακάτω changes: $(cat /tmp/staged.diff). Επιστρέψει μόνο bullet points με προβλήματα και προτάσεις βελτιώσεων."

2. Local RAG (Retrieval-Augmented Generation)

Προσθέτει ιδιωτική γνώση (docs, internal wikis) στον agent σου, χωρίς να στείλεις τα δεδομένα σου στο cloud.

Χρησιμοποίησε το Ollama + LangChain + ChromaDB:

python
from langchain_ollama import OllamaLLM, OllamaEmbeddings
from langchain_chroma import Chroma
from langchain_core.prompts import ChatPromptTemplate

llm = OllamaLLM(model="qwen3-coder:30b")
embeddings = OllamaEmbeddings(model="nomic-embed-text")

# Φόρτωσε τα docs σου σε ChromaDB
db = Chroma(embedding_function=embeddings, persist_directory="./chroma_db")

# RAG prompt
prompt = ChatPromptTemplate.from_messages([
    ("system", "Χρησιμοποίησε τα ακόλουθα docs για να απαντήσεις: {context}"),
    ("human", "{input}")
])

3. Multi-Agent System

Φτιάξε πολλούς agents με διαφορετικούς ρόλους:

🔍 Προτεινόμενα εργαλεία
LangGraph: Για multi-agent workflows.
AutoGen: Για multi-agent conversations.
🔭
Μέλλον

Future Roadmap

Τι περιμένουμε το 2026-2027 για τα local AI agents:

Τεχνολογία Πότε Τι αλλάζει
40B+ models σε consumer GPUs End of 2026 Καλύτερη ποιότητα χωρίς να χρειάζεσαι server-grade hardware.
Native multimodal local agents Mid 2026 Agents που βλέπουν screenshot, διαβάζουν PDFs, και ακούνε voice commands.
Better quantization techniques Q3 2026 70B models σε 24GB VRAM με σχεδόν καμία απώλεια ποιότητας.
Open-source agentic frameworks Ongoing Περισσότερα εργαλεία όπως OpenHands, με καλύτερη ενσωμάτωση με τα IDEs.
⚠️ Να προσέξεις
Μην αγνοείς τα ethical implications: Αν ο agent σου αυτοματοποιεί μια δουλειά, σιγουρέψου ότι ξέρεις τι κάνει και ότι είναι ευθύνη.

Το setup σε 6 βήματα

Το 2026 είναι η πρώτη χρονιά που ένας home AI coding agent δεν είναι απλώς «cool project» — είναι παραγωγικό εργαλείο που ανταγωνίζεται το cloud. Ο μόνος λόγος να μην το κάνεις είναι αν δεν σε πειράζει να πληρώνεις subscriptions για το υπόλοιπο της ζωής σου.