Το Lemonade 11.9 — το AMD-backed, open-source local AI server — κυκλοφόρησε στις 2 Σεπτεμβρίου 2026 με το πιο ενδιαφέρον χαρακτηριστικό της χρονιάς για το local AI: πειραματικό ROCm HRX backend για Llama.cpp. Το HRX είναι το νέο, ελαφρύτερο runtime της AMD (μέρος του Loom/Hyperloom stack, με Loom IR αντί LLVM IR), σχεδιασμένο για client GPUs. Πρώτα αποτελέσματα: +30–50% tok/s στο prefill έναντι των Vulkan/HIP backends, σε RX 7900 series (RDNA3) και Strix Halo (RDNA3.5), με reference model το Qwen3-30B-A3B-Instruct-2507 Q4_K_M.
01/Τι είναι το Lemonade
Το Lemonade είναι το AMD-backed, open-source local AI server που τρέχει σε Linux, Windows και macOS. Η φιλοσοφία του συνοψίζεται σε δύο λέξεις που η AMD τονίζουν συνέχεια: «100% free and private» — το AI σου τρέχει τοπικά, στο δικό σου hardware, χωρίς cloud, χωρίς συνδρομές, χωρίς να στέλνεις τα prompts σου πουθενά. Υποστηρίζει GPUs, CPUs και NPUs — και μάλιστα είναι από τα λίγα εργαλεία που παίρνουν στα σοβαρά και τα NPU των Ryzen AI laptops.
Το Lemonade 11.9, κυκλοφόρησε στις 2 Σεπτεμβρίου 2026 ως η νεότερη feature release, αλλά δεν είναι ένα ακόμα routine update: φέρνει τον πειραματικό ROCm HRX backend για Llama.cpp — και αυτό είναι, δυο λόγια, το πιο hot κομμάτι του local AI softwarestack αυτού του μήνα.
Εκτός HRX, το 11.9 προσθέτει και υποστήριξη Qwen3-Next στο pinned Llama.cpp backend του, μαζί με τις συνηθισμένες βελτιώσεις.
Αν έχεις RX 7900 XT/XTX ή laptop/mini-PC με Strix Halo και τρέχεις local LLMs, το HRX υπόσχεται αυτό που ζητούσες χρόνια: πιο γρήγορο prompt processing — δηλαδή λιγότερη αναμονή όταν «ταΐζεις» έγγραφα, codebases και μεγάλες συζητήσεις στο μοντέλο. Το prefill είναι εκεί που τα Radeon υπολείπονταν περισσότερο από το CUDA ecosystem.
02/Το HRX: το νέο παιδί του ROCm
Το HRX είναι νέα ανάπτυξη στο ROCm ecosystem και ανήκει στις προσπάθειες Loom/Hyperloom που ανακοινώθηκαν στο AMD Advancing AI event στο Σαν Φρανσίσκο, στα πλαίσια της βελτιστοποίησης agentic workloads. Η ιδέα: το ROCm χρησιμοποιούσε επί χρόνια το LLVM IR ως ενδιάμεση αναπαράσταση — το HRX βάζει στη θέση του το Loom IR, μια custom IR πιο «κομμένη και ραμμένη» στο AMD hardware, ώστε ο generated code να φτάνει γρηγορότερα σε βελτιστοποιημένο AMDGPU assembly.
Από το επίσημο hrx-system repository της ROCm:
"The HRX System is a collection of minimal runtime components
providing an alternative implementation of HIP as it presently
ships within ROCm. It provides a common substrate for low latency,
high performance integration with AMD's GPU, NPU, and CPU products."
Δες τι λέει αυτό: το HRX είναι εναλλακτική υλοποίηση του HIP (του CUDA-derived runtime layer της AMD), φτιαγμένο όχι για datacenter racks αλλά για client systems. Η μηχανικός της AMD Stella Laurenzo — που ξεκίνησε το RFC στο GGML discussion #27219 — το εξήγησε αναλυτικά: το ROCm γεννήθηκε για να σερβίρει το datacenter market και συχνά «χτυπάει το κεφάλι του» όταν προσπαθεί να φτάσει σε client operating systems με τον τρόπο που χρειάζονται εκεί. Η απάντηση της AMD: ένα ελαφρύτερο, πιο focused subset του ROCm — το HRX — συνο-αναπτυγμένο επί μήνες μαζί με ένα αφιερωμένο llama.cpp backend, με στόχο την ενσωμάτωση στο ROCm proper ως focused, redistributable set of libraries.
Για όσους παρακολουθούν το σκακιστικό της AMD: το HRX θυμίζει έντονα το παλιό όραμα του AMD Unified AI Software stack με MLIR και SPIR-V ως κοινές IR. Η διαφορά; Το Loom IR είναι custom και εξ ολοκλήρου προσαρμοσμένο στο AMD silicon — λιγότερο «γενικό», περισσότερο «γρήγορο».
03/Τα νούμερα: prefill που ανάβει
Τα νούμερα που ανακοινώθηκαν στο GGML discussion (από την ίδια την ομάδα της AMD, άρα πήγαινέ τα με την επιφύλαξη που αρμόζει σε vendor numbers — αλλά και η Phoronix χαρακτηρίζει το backend «super exciting»):
- Prefill: +30 έως +50% tok/s έναντι των υπαρχόντων Vulkan και HIP backends του Llama.cpp/GGML
- Decode (non-MTP): parity έως +10% tok/s uplift
- Ο HRX stack είναι και πιο απλός για development — λιγότερα στρώματα, πιο εύκολη βελτιστοποίηση kernel
/// Prefill throughput — ενδεικτική σύγκριση (baseline = existing backends, 100 = reference)
Σχηματική αναπαράσταση της σχετικής διαφοράς prefill uplift όπως ανακοινώθηκε — όχι επίσημα benchmark charts. Οι δύο πρώτες μπάρες αντιπροσωπεύουν το υπάρχον επίπεδο των Vulkan/HIP backends (reference).
Το decode (η ταχύτητα που «κατάλαβες» την απάντηση λέξη-λέξη) παίρνει τα φώτα, αλλά το prefill είναι που καθορίζει πόσο γρήγορα το μοντέλο «διαβάζει» το prompt σου: RAG έγγραφα, codebases, μεγάλα system prompts, ιστορικό συζητήσεων. Για agentic workloads — όπου κάθε βήμα ξαναστελνει τεράστια context — το prefill είναι το πραγματικό bottleneck. Γι' αυτό το Hyperloom της AMD στοχεύει ακριβώς εκεί.
04/Ποιο τρέχει που — και ποιο μοντέλο
Ο πειραματικός llamacpp-hrx backend του Lemonade 11.9 τρέχει σε Linux, για δύο GPU targets:
| Target | Hardware | Αρχιτεκτονική |
|---|---|---|
GFX1100 | Radeon RX 7900 series · Radeon Pro W7900 | RDNA3 (discrete) |
GFX1151 | Strix Halo APU (Ryzen AI Max) | RDNA3.5 (integrated, unified memory) |
Το reference model για το αρχικό RFC PR είναι το unsloth/Qwen3-30B-A3B-Instruct-2507-GGUF Q4_K_M — ένα MoE 30B με μόλις 3B ενεργές παραμέτρους, δηλαδή το γλυκό σημείο για το VRAM των consumer Radeon. Η AMD διευκρινίζει ότι η σειρά kernels που συνοδεύει το RFC είναι το ελάχιστο σετ για να τρέξει αυτό το μοντέλο performantly — και ότι το branch θα συνεχίσει να αναπτύσσεται για ευρύτερη κάλυψη μοντέλων, λειτουργικών και hardware.
# 1. Linux + GFX1100/GFX1151 + Lemonade 11.9+
pip install lemonade-server
# 2. ενεργοποίησε τον πειραματικό HRX backend του Llama.cpp
lemonade-server-dev serve --llamacpp --backend hrx
# 3. φόρτωσε το reference GGUF μοντέλο (Qwen3-30B-A3B Q4_K_M)
# 4. μέτρησε tok/s στο prefill vs το Vulkan/HIP backend
# Πηγές για setup: lemonade-sdk/lemonade · ROCm/hrx-system
# Discussion: ggml-org/llama.cpp discussions #27219
Το backend είναι RFC/early-stage: minimal kernel set, Linux only, δύο targets, ένα reference μοντέλο. Αν δεν έχεις ακριβώς GFX1100/GFX1151, η αναμονή είναι λογική στρατηγική — το roadmap μιλάει για σταδιακή επέκταση, όχι one-shot release.
05/Η λογική της AMD: χρόνια καθυστέρηση, σωστή κατεύθυνση
Ας το πούμε ευθέως, όπως και ο Michael Larabel στο Phoronix: το HRX είναι «extremely exciting από τεχνικής πλευράς» — αλλά ιδανικά θα έπρεπε να είχε έρθει χρόνια νωρίτερα, όχι πειραματικά στα τέλη του 2026. Το CUDA ecosystem της NVIDIA κερδίζει το client AI γιατί έχει δεκαετίες βελτιστοποίησης από top-down έως bottom-up. Η AMD είχε τα chips (το RX 7900 XTX έχει τεράστιο compute bandwidth) αλλά το software stack ήταν στραμμένο στο datacenter.
Το HRX είναι η πρώτη σοβαρή, δομημένη απάντηση σε αυτό το κενό για το local AI:
- Client-first σχεδίαση — όχι datacenter-first code που «παλτώνεται» σε desktops
- Ενιαίο runtime για GPU, NPU, CPU — το ίδιο substrate σε discrete Radeon, Ryzen AI NPUs και Zen cores
- Συνεργασία με το llama.cpp community — όχι another vendor lock-in framework, αλλά contribution εκεί που ζουν ήδη εκατομμύρια local LLM runs
- Loom IR — λιγότερο generic IR, πιο άμεσο optimized AMDGPU assembly
Και κάτι ακόμα που δείχνει σοβαρή πρόθεση: την ίδια εβδομάδα αποκαλύφθηκε ότι η AMD χτίζει «elite» ομάδα για να σπρώξει τη Rust βαθιά μέσα στο GPU stack — από firmware έως drivers και shader compilers. Πρόκειται για ολική ανασυγκρότηση του software stack, όχι παπαγαλίσματα marketing.
06/Τι σημαίνει για σένα
- Έχεις RX 7900 XT/XTX ή W7900: δοκίμασε το Lemonade 11.9 σε Linux με τον HRX backend — το prefill uplift είναι αισθητό σε RAG και μακριά prompts. Κράτα τα Vulkan/HIP backends για καθημερινή δουλειά· το HRX είναι ακόμα experimental.
- Έχεις Strix Halo (Ryzen AI Max): η unified memory του GFX1151 είναι το τελειότερο playground για 30B-class MoE μοντέλα — και το HRX το βελτιστοποιεί direct. Κοίτα το reference Qwen3-30B-A3B setup.
- Έχεις άλλη κάρτα (RDNA2, RDNA4, NPU-only): περίμενε — η AMD δηλώνει καθαρά ότι το RFC είναι το ελάχιστο σετ και η επέκταση είναι στο roadmap. Μην περιμένεις magic σε παλαιότερο hardware.
- Δεν είσαι developer: το Lemonade σερβίρει OpenAI-compatible API στο localhost — δηλαδή τα apps που ήδη χρησιμοποιείς (open-webui, IDE plugins, agents) μπορούν να μιλάνε στο τοπικό σου μοντέλο χωρίς αλλαγές ρυθμίσεων πέρα από το base URL.
- Σε απασχολεί το privacy: 100% τοπικό, 0% cloud. Τα prompts δεν εγκαταλείπουν το μηχάνημα — το HRX δεν αλλάζει αυτό, το ενισχύει (ταχύτερα τοπικά = λιγότερος λόγος να φύγεις στο cloud).
07/Το μεγάλο σκακιστικό: Loom, Hyperloom, Rust, UALink
Το HRX δεν έρχεται από το πουθενά. Δες το puzzle:
- Hyperloom — agentic workload optimization (AAI announcement): το prefill ως bottleneck των agents είναι το επίσημο αφήγημα της AMD
- Loom IR — custom IR που αντικαθιστά το LLVM IR στο path προς AMDGPU assembly
- HRX runtime — εναλλακτική του HIP, κοινό substrate για GPU/NPU/CPU, redistributable libraries
- Rust στο GPU stack — firmware, drivers, shader compilers: memory safety από κάτω μέχρι πάνω
- UALink / Helios — open interconnect για scale-up: το datacenter αντίστοιχο του ίδιου σχεδίου
Το μοτίβο είναι ξεκάθαρο: η AMD παύει να μιμείται το CUDA stack και χτίζει ιδία, κάθετα ενιαία stack — από την IR μέχρι το interconnect — με ανοιχτά standards εκεί όπου το NVIDIA κρατάει κλειστά. Για το local AI συγκεκριμένα, το Lemonade + HRX combo είναι η πρώτη φορά που η εμπειρία «Radeon + τοπικό LLM» δεν είναι σχόλιο υπογραφής του τύπου «δούλεψε, αλλά...».
Το Lemonade 11.9 με το HRX backend είναι το πιο σημαντικό software story για το local AI σε Radeon από την εποχή του ROCm on Windows. Πειραματικό, ναι — με δύο targets και ένα μοντέλο. Αλλά η αρχιτεκτονική κατεύθυνση (Loom IR, κοινό GPU/NPU/CPU runtime, client-first) είναι η πρώτη που μοιάζει φτιαγμένη από ανθρώπους που τρέχουν local LLMs σε Radeon, όχι από committee datacenter-roadmap. Παρακολουθήστε το ggml-hrx: αν τα +30–50% prefill επιβεβαιωθούν σε independent benchmarks, η συζήτηση «Radeon vs CUDA για local AI» αποκτά ξανά ενδιαφέρον.
Πηγές
- Lemonade 11.9 Local AI Server Released With Super Exciting AMD ROCm HRX Backend Phoronix — Michael Larabel · 2 Σεπτεμβρίου 2026
- Lemonade v11.9.0 — release notes github.com/lemonade-sdk/lemonade
- ROCm HRX System — minimal runtime components, alternative HIP implementation github.com/ROCm/hrx-system
- GGML discussion #27219 — ggml-hrx backend RFC (Stella Laurenzo, AMD) github.com/ggml-org/llama.cpp · Σεπτέμβριος 2026
Σημείωση: τα performance numbers (+30–50% prefill, parity έως +10% decode) προέρχονται από την AMD/το RFC discussion και καλύφθηκαν από το Phoronix — όχι ανεξάρτητα benchmarks (τη στιγμή της συγγραφής). Το «πείραμα» σημαίνει ακριβώς αυτό: GFX1100/GFX1151, Linux, minimal kernel set.