xrisotblogspot / Hardware / AMD / Local AI

🔥 HARDWARE ON FIRE ΦΡΕΣΚΟ — 2 ΣΕΠΤΕΜΒΡΙΟΥ 2026 11 ΛΕΠΤΑ ΔΙΑΒΑΣΜΑ

AMD Lemonade 11.9: πειραματικό HRX runtime για local AI σε Radeon — έως 50% γρηγορότερο prefill

Νέο Loom IR αντί LLVM, ελαφρύτερο ROCm για client GPUs, llamacpp-hrx backend σε RX 7900 και Strix Halo. Η AMD χτίζει το δικό της client AI stack — και τα πρώτα νούμερα είναι αυτό που περίμενε χρόνια ο local LLM κόσμος.

+0%
Prefill tok/s uplift
+0%
Decode (non-MTP) έως
0
Στόχοι: GPU · NPU · CPU
0 €
Κόστος — open source

Το Lemonade 11.9 — το AMD-backed, open-source local AI server — κυκλοφόρησε στις 2 Σεπτεμβρίου 2026 με το πιο ενδιαφέρον χαρακτηριστικό της χρονιάς για το local AI: πειραματικό ROCm HRX backend για Llama.cpp. Το HRX είναι το νέο, ελαφρύτερο runtime της AMD (μέρος του Loom/Hyperloom stack, με Loom IR αντί LLVM IR), σχεδιασμένο για client GPUs. Πρώτα αποτελέσματα: +30–50% tok/s στο prefill έναντι των Vulkan/HIP backends, σε RX 7900 series (RDNA3) και Strix Halo (RDNA3.5), με reference model το Qwen3-30B-A3B-Instruct-2507 Q4_K_M.

01/Τι είναι το Lemonade

Το Lemonade είναι το AMD-backed, open-source local AI server που τρέχει σε Linux, Windows και macOS. Η φιλοσοφία του συνοψίζεται σε δύο λέξεις που η AMD τονίζουν συνέχεια: «100% free and private» — το AI σου τρέχει τοπικά, στο δικό σου hardware, χωρίς cloud, χωρίς συνδρομές, χωρίς να στέλνεις τα prompts σου πουθενά. Υποστηρίζει GPUs, CPUs και NPUs — και μάλιστα είναι από τα λίγα εργαλεία που παίρνουν στα σοβαρά και τα NPU των Ryzen AI laptops.

Το Lemonade 11.9, κυκλοφόρησε στις 2 Σεπτεμβρίου 2026 ως η νεότερη feature release, αλλά δεν είναι ένα ακόμα routine update: φέρνει τον πειραματικό ROCm HRX backend για Llama.cpp — και αυτό είναι, δυο λόγια, το πιο hot κομμάτι του local AI softwarestack αυτού του μήνα.

Εκτός HRX, το 11.9 προσθέτει και υποστήριξη Qwen3-Next στο pinned Llama.cpp backend του, μαζί με τις συνηθισμένες βελτιώσεις.

Αν έχεις RX 7900 XT/XTX ή laptop/mini-PC με Strix Halo και τρέχεις local LLMs, το HRX υπόσχεται αυτό που ζητούσες χρόνια: πιο γρήγορο prompt processing — δηλαδή λιγότερη αναμονή όταν «ταΐζεις» έγγραφα, codebases και μεγάλες συζητήσεις στο μοντέλο. Το prefill είναι εκεί που τα Radeon υπολείπονταν περισσότερο από το CUDA ecosystem.

02/Το HRX: το νέο παιδί του ROCm

Το HRX είναι νέα ανάπτυξη στο ROCm ecosystem και ανήκει στις προσπάθειες Loom/Hyperloom που ανακοινώθηκαν στο AMD Advancing AI event στο Σαν Φρανσίσκο, στα πλαίσια της βελτιστοποίησης agentic workloads. Η ιδέα: το ROCm χρησιμοποιούσε επί χρόνια το LLVM IR ως ενδιάμεση αναπαράσταση — το HRX βάζει στη θέση του το Loom IR, μια custom IR πιο «κομμένη και ραμμένη» στο AMD hardware, ώστε ο generated code να φτάνει γρηγορότερα σε βελτιστοποιημένο AMDGPU assembly.

LLM Apps (Lemonade, Llama.cpp, OpenAI-compatible APIs)— τα apps σου
ggml-hrx backend ↔ HRX Runtime— το νέο στρώμα: ελαφρύ, client-first
Loom IR / Loom compiler stack— αντί LLVM IR: ταχύτερο path σε AMDGPU assembly
AMD GPU · NPU · CPU— κοινό substratum, ένα stack για όλα

Από το επίσημο hrx-system repository της ROCm:

ROCm/hrx-system — Η ΑΠΟΛΥΤΗ ΠΕΡΙΓΡΑΦΗ
"The HRX System is a collection of minimal runtime components
 providing an alternative implementation of HIP as it presently
 ships within ROCm. It provides a common substrate for low latency,
 high performance integration with AMD's GPU, NPU, and CPU products."

Δες τι λέει αυτό: το HRX είναι εναλλακτική υλοποίηση του HIP (του CUDA-derived runtime layer της AMD), φτιαγμένο όχι για datacenter racks αλλά για client systems. Η μηχανικός της AMD Stella Laurenzo — που ξεκίνησε το RFC στο GGML discussion #27219 — το εξήγησε αναλυτικά: το ROCm γεννήθηκε για να σερβίρει το datacenter market και συχνά «χτυπάει το κεφάλι του» όταν προσπαθεί να φτάσει σε client operating systems με τον τρόπο που χρειάζονται εκεί. Η απάντηση της AMD: ένα ελαφρύτερο, πιο focused subset του ROCm — το HRX — συνο-αναπτυγμένο επί μήνες μαζί με ένα αφιερωμένο llama.cpp backend, με στόχο την ενσωμάτωση στο ROCm proper ως focused, redistributable set of libraries.

Για όσους παρακολουθούν το σκακιστικό της AMD: το HRX θυμίζει έντονα το παλιό όραμα του AMD Unified AI Software stack με MLIR και SPIR-V ως κοινές IR. Η διαφορά; Το Loom IR είναι custom και εξ ολοκλήρου προσαρμοσμένο στο AMD silicon — λιγότερο «γενικό», περισσότερο «γρήγορο».

03/Τα νούμερα: prefill που ανάβει

Τα νούμερα που ανακοινώθηκαν στο GGML discussion (από την ίδια την ομάδα της AMD, άρα πήγαινέ τα με την επιφύλαξη που αρμόζει σε vendor numbers — αλλά και η Phoronix χαρακτηρίζει το backend «super exciting»):

/// Prefill throughput — ενδεικτική σύγκριση (baseline = existing backends, 100 = reference)

Vulkan
100
HIP (ROCm)
100
HRX (νέο)
+30–50%

Σχηματική αναπαράσταση της σχετικής διαφοράς prefill uplift όπως ανακοινώθηκε — όχι επίσημα benchmark charts. Οι δύο πρώτες μπάρες αντιπροσωπεύουν το υπάρχον επίπεδο των Vulkan/HIP backends (reference).

Το decode (η ταχύτητα που «κατάλαβες» την απάντηση λέξη-λέξη) παίρνει τα φώτα, αλλά το prefill είναι που καθορίζει πόσο γρήγορα το μοντέλο «διαβάζει» το prompt σου: RAG έγγραφα, codebases, μεγάλα system prompts, ιστορικό συζητήσεων. Για agentic workloads — όπου κάθε βήμα ξαναστελνει τεράστια context — το prefill είναι το πραγματικό bottleneck. Γι' αυτό το Hyperloom της AMD στοχεύει ακριβώς εκεί.

04/Ποιο τρέχει που — και ποιο μοντέλο

Ο πειραματικός llamacpp-hrx backend του Lemonade 11.9 τρέχει σε Linux, για δύο GPU targets:

TargetHardwareΑρχιτεκτονική
GFX1100Radeon RX 7900 series · Radeon Pro W7900RDNA3 (discrete)
GFX1151Strix Halo APU (Ryzen AI Max)RDNA3.5 (integrated, unified memory)

Το reference model για το αρχικό RFC PR είναι το unsloth/Qwen3-30B-A3B-Instruct-2507-GGUF Q4_K_M — ένα MoE 30B με μόλις 3B ενεργές παραμέτρους, δηλαδή το γλυκό σημείο για το VRAM των consumer Radeon. Η AMD διευκρινίζει ότι η σειρά kernels που συνοδεύει το RFC είναι το ελάχιστο σετ για να τρέξει αυτό το μοντέλο performantly — και ότι το branch θα συνεχίσει να αναπτύσσεται για ευρύτερη κάλυψη μοντέλων, λειτουργικών και hardware.

ΓΡΗΓΟΡΟ START — τι χρειάζεσαι για δοκιμή (σχηματικά)
# 1. Linux + GFX1100/GFX1151 + Lemonade 11.9+
pip install lemonade-server
# 2. ενεργοποίησε τον πειραματικό HRX backend του Llama.cpp
lemonade-server-dev serve --llamacpp --backend hrx
# 3. φόρτωσε το reference GGUF μοντέλο (Qwen3-30B-A3B Q4_K_M)
# 4. μέτρησε tok/s στο prefill vs το Vulkan/HIP backend

# Πηγές για setup: lemonade-sdk/lemonade · ROCm/hrx-system
# Discussion: ggml-org/llama.cpp discussions #27219

Το backend είναι RFC/early-stage: minimal kernel set, Linux only, δύο targets, ένα reference μοντέλο. Αν δεν έχεις ακριβώς GFX1100/GFX1151, η αναμονή είναι λογική στρατηγική — το roadmap μιλάει για σταδιακή επέκταση, όχι one-shot release.

05/Η λογική της AMD: χρόνια καθυστέρηση, σωστή κατεύθυνση

Ας το πούμε ευθέως, όπως και ο Michael Larabel στο Phoronix: το HRX είναι «extremely exciting από τεχνικής πλευράς» — αλλά ιδανικά θα έπρεπε να είχε έρθει χρόνια νωρίτερα, όχι πειραματικά στα τέλη του 2026. Το CUDA ecosystem της NVIDIA κερδίζει το client AI γιατί έχει δεκαετίες βελτιστοποίησης από top-down έως bottom-up. Η AMD είχε τα chips (το RX 7900 XTX έχει τεράστιο compute bandwidth) αλλά το software stack ήταν στραμμένο στο datacenter.

Το HRX είναι η πρώτη σοβαρή, δομημένη απάντηση σε αυτό το κενό για το local AI:

Και κάτι ακόμα που δείχνει σοβαρή πρόθεση: την ίδια εβδομάδα αποκαλύφθηκε ότι η AMD χτίζει «elite» ομάδα για να σπρώξει τη Rust βαθιά μέσα στο GPU stack — από firmware έως drivers και shader compilers. Πρόκειται για ολική ανασυγκρότηση του software stack, όχι παπαγαλίσματα marketing.

06/Τι σημαίνει για σένα

07/Το μεγάλο σκακιστικό: Loom, Hyperloom, Rust, UALink

Το HRX δεν έρχεται από το πουθενά. Δες το puzzle:

Το μοτίβο είναι ξεκάθαρο: η AMD παύει να μιμείται το CUDA stack και χτίζει ιδία, κάθετα ενιαία stack — από την IR μέχρι το interconnect — με ανοιχτά standards εκεί όπου το NVIDIA κρατάει κλειστά. Για το local AI συγκεκριμένα, το Lemonade + HRX combo είναι η πρώτη φορά που η εμπειρία «Radeon + τοπικό LLM» δεν είναι σχόλιο υπογραφής του τύπου «δούλεψε, αλλά...».

Το Lemonade 11.9 με το HRX backend είναι το πιο σημαντικό software story για το local AI σε Radeon από την εποχή του ROCm on Windows. Πειραματικό, ναι — με δύο targets και ένα μοντέλο. Αλλά η αρχιτεκτονική κατεύθυνση (Loom IR, κοινό GPU/NPU/CPU runtime, client-first) είναι η πρώτη που μοιάζει φτιαγμένη από ανθρώπους που τρέχουν local LLMs σε Radeon, όχι από committee datacenter-roadmap. Παρακολουθήστε το ggml-hrx: αν τα +30–50% prefill επιβεβαιωθούν σε independent benchmarks, η συζήτηση «Radeon vs CUDA για local AI» αποκτά ξανά ενδιαφέρον.

Πηγές

  1. Lemonade 11.9 Local AI Server Released With Super Exciting AMD ROCm HRX Backend Phoronix — Michael Larabel · 2 Σεπτεμβρίου 2026
  2. Lemonade v11.9.0 — release notes github.com/lemonade-sdk/lemonade
  3. ROCm HRX System — minimal runtime components, alternative HIP implementation github.com/ROCm/hrx-system
  4. GGML discussion #27219 — ggml-hrx backend RFC (Stella Laurenzo, AMD) github.com/ggml-org/llama.cpp · Σεπτέμβριος 2026

Σημείωση: τα performance numbers (+30–50% prefill, parity έως +10% decode) προέρχονται από την AMD/το RFC discussion και καλύφθηκαν από το Phoronix — όχι ανεξάρτητα benchmarks (τη στιγμή της συγγραφής). Το «πείραμα» σημαίνει ακριβώς αυτό: GFX1100/GFX1151, Linux, minimal kernel set.