Notebookcheck Logo

Meta Muse Glimmer funziona offline su una singola GPU, ma richiede 24 GB di VRAM

Meta logo con la scritta «Build with Muse» su sfondo scuro
ⓘ Meta
Muse Glimmer funziona interamente in locale, ma richiede almeno 24 GB di memoria video.
Meta ha rilasciato Muse Glimmer, un modello linguistico con circa 30 miliardi di parametri, distribuito sotto licenza Apache 2.0. Funziona interamente sul proprio computer, senza connessione a Internet e senza abbonamento. L’unico requisito: sono necessari 24 GB di memoria video, quindi una RTX 5090, una RTX 4090 o un Mac con chip M4 Max. I pesi sono disponibili gratuitamente su Hugging Face.

Il 10 agosto Meta ha rilasciato Muse Glimmer, un modello linguistico con circa 30 miliardi di parametri. Ciò che spicca non è tanto il modello in sé, quanto piuttosto la licenza e la macchina di destinazione. I pesi sono disponibili su Hugging Face sotto licenza Apache 2.0, pertanto è possibile scaricarli, modificarli e utilizzarli a fini commerciali. Inoltre, non è stato progettato per funzionare in un data center, bensì su una singola scheda grafica sotto la vostra scrivania.

Il modello proviene dal Meta Superintelligence Lab ed è derivato dal più ampio Muse Spark, il che significa che un modello di grandi dimensioni ha insegnato a uno più piccolo come fornire le risposte. Accetta testo e immagini come input ma produce solo testo, gestisce oltre 100 lingue e opera con una finestra di contesto di oltre 131.000 token. Le sue conoscenze si fermano al 4 gennaio 2026. Le ultime versioni rilasciate da Meta sono state l’agente Muse Code e il generatore di immagini Muse Image.

24 GB di VRAM rappresentano il requisito minimo

A piena precisione, il modello richiederebbe 64 GB di memoria video. Meta la comprime a circa 4 bit tramite quantizzazione, un metodo di memorizzazione dei numeri meno preciso che occupa molto meno spazio. Ciò riduce la parte dedicata al linguaggio a meno di 20 GB, lasciando spazio per l’encoder visivo e la cache necessaria alla conversazione in corso.

Sono incluse due varianti già pronte. K-Quant-Dynamic punta a 32 GB e perde in media lo 0,2% di precisione su 15 benchmark, mentre K-Quant-17GB si adatta a 24 GB e perde l’1,0%. In pratica, ciò significa una GeForce RTX 5090, RTX 4090, RTX 3090 o un Mac con chip M4 Max. Una scheda di fascia media da 12 GB non è sufficiente. Se disponete di meno memoria, la nostra guida tratta modelli più piccoli adatti al vostro portatile; persino l’iPhone ora è in grado di eseguire un modello linguistico utilizzabile.

Un acceleratore lo rende tre volte più veloce

Per evitare che un modello locale risulti lento, Meta fornisce uno strumento di supporto chiamato DFlash. Esso propone 16 token alla volta, e il modello di grandi dimensioni verifica l’intero blocco in un unico passaggio, correggendo solo ciò che è errato. Secondo le misurazioni effettuate da Meta stessa, la velocità di elaborazione su una RTX 5090 sale da 74,9 a 233,4 token al secondo, con un aumento di 3,1 volte. Un MacBook con processore M5 Max passa da 26,6 a 50,2 token, mentre l’M4 Max da 23,7 a 37,8.

AMD ha pubblicato i propri dati lo stesso giorno. Un mini PC con un Ryzen AI Max+ 395 raggiunge fino a 24 token al secondo e una Radeon AI PRO R9700 fino a 53, misurati su Windows con llama.cpp. AMD definisce tali cifre come preliminari.

Ottimo nella pianificazione, meno efficace nell’interfaccia

Meta mette a confronto Muse Glimmer con Gemma4-31B di Google e Qwen3.6-27B di Alibaba. Quando il modello richiama strumenti e pianifica in più fasi, è chiaramente in testa. Ottiene un punteggio di 75,5 su MCP Atlas contro 54,2 e 62,5, e 74,6 su DeepSearch QA contro 61,7 e 71,1.

Qwen prevale in altri ambiti. Nel controllo di un’interfaccia desktop reale il punteggio va da 65,9 a 75,6, mentre nel terminale da 51,7 a 60,7. Nel test di sicurezza Siren AgentDojo, che misura la facilità con cui un modello può essere manipolato tramite istruzioni nascoste all’interno di documenti esterni, il tasso di successo degli attacchi di Muse Glimmer, pari al 28,4%, supera quello di Qwen ma è inferiore a quello di Gemma4, pari al 25,6%. È bene tenerlo presente prima di applicare il modello ai propri file e alla propria posta elettronica.

Come ottenerlo

Su Hugging Face sono disponibili quattro pacchetti: il modello di base con i pesi BF16 completi, i file GGUF per llama.cpp, le build ExecuTorch per i dispositivi Apple e l’helper DFlash. Il modo più semplice è utilizzare LM Studio, dove il modello compare nei risultati di ricerca. AMD raccomanda per l’esecuzione più di 32 GB di memoria video o un’allocazione equivalente di memoria di sistema. Se si dispone di meno risorse, provider come Unsloth offrono quantizzazioni più ridotte, ma in tal caso è necessario trasferire parte del modello nella normale memoria di sistema, con una conseguente perdita di velocità significativa. La comunità si è mossa rapidamente. A meno di un giorno dal rilascio erano già disponibili 57 quantizzazioni aggiuntive e sei ottimizzazioni. Provare il modello in un browser, come era possibile fare con Kimi K3, non è un’opzione praticabile in questo caso. Senza l’hardware adeguato, Muse Glimmer rimane fuori portata.

Google LogoAdd as a preferred source on Google
Mail Logo
> Recensioni e prove di notebook, tablets e smartphones > News > Newsarchive 2026 08 > Meta Muse Glimmer funziona offline su una singola GPU, ma richiede 24 GB di VRAM
Steffen Zahn, 2026-08-11 (Update: 2026-08-11)