Modelli AI locali / Guida

Qwen3.8-27B: modello multimodale, contesto e uso locale

Qwen / Alibaba: cosa offre Qwen3.8-27B, come usarlo sul PC, memoria, compatibilità, limiti e fonti ufficiali.

Logo Qwen
Qwen / Alibaba / Marchio ufficiale

Che cos’è e chi lo sviluppa

Qwen3.8-27B è un modello denso della famiglia Qwen con capacità di leggere testo, immagini e video e generare risposte testuali. È anche la base dichiarata di Bonsai 2: il checkpoint originale e la variante ternaria non sono intercambiabili e vanno valutati separatamente.

Specifiche verificate

La scheda ufficiale indica un modello linguistico da 27B con encoder visivo, 64 strati e attenzione ibrida. Il contesto nativo dichiarato è 262.144 token; l’estensione oltre questo limite richiede configurazioni specifiche. La licenza è Apache 2.0. I benchmark pubblicati sono del team Qwen e dipendono dalle procedure riportate nella scheda.

Come funziona nell’uso locale

L’attenzione ibrida combina meccanismi diversi lungo la rete. Per il lettore il risultato da verificare è soprattutto operativo: il formato scelto deve essere supportato dal programma e, per le immagini, devono essere caricati anche i componenti visivi. Un server che risponde al testo non dimostra che sappia elaborare fotografie o video.

Utilizzi e valutazione pratica

Per usarlo su un PC con memoria limitata, una quantizzazione può essere necessaria. Non esiste però una dimensione universale per “Qwen 27B”: FP16, quantizzazioni convenzionali e packing speciali hanno costi diversi. Parti da una richiesta contenuta, registra la memoria e aumenta il contesto soltanto quando il compito lo richiede. Se il prompt non entra, riduci documenti e cronologia prima di attribuire l’errore al modello.

Esperienza personale e limiti

Negli appunti personali compare una variante Qwen3.8 indicata come XXS, ma il nome abbreviato non identifica con certezza autore, revisione e file. Non pubblichiamo quella prova come recensione di questo checkpoint ufficiale. Per un confronto con Bonsai proponiamo gli stessi errori di programmazione e le stesse domande su documenti, annotando correttezza e tempi senza trasferire risultati da una variante all’altra.

Da dove iniziare

  1. Apri la scheda ufficiale e identifica checkpoint, formato e revisione.
  2. Controlla la compatibilità del programma prima del download.
  3. Prova una richiesta breve e registra memoria, tempi e correttezza.
  4. Aumenta contesto e accesso agli strumenti soltanto dopo la prima verifica.

Download e fonti ufficiali

Scheda del modello, file e documentazione del produttore, consultati il 5 ottobre 2026. Specifiche ufficiali e proposte di valutazione sono distinte dalle eventuali prove informali del progetto.

Dal mio PC: perché conservo due velocità

In una sessione del 13 settembre 2026, Qwen3.8-27B LowGPU sulla RTX 5070 ha registrato 38,088 token/s in generazione e 9,060 token/s nell’elaborazione del prompt. Nei log della sessione compare uno slot di contesto da 131.072 token. In altri tentativi sono state annotate velocità intorno a 4 token/s, senza un riepilogo completo delle condizioni.

Per me questa differenza rende importante conservare la configurazione riuscita e misurare anche l’attesa prima della risposta. La variante LowGPU-NoMTP IQ3_XXS compare negli appunti del 15 settembre; non la attribuisco al log del 13 senza la conferma del file. Nel diario tengo separati questi tentativi.