Modelli AI locali / Guida

Come scegliere un modello AI per il proprio PC

Una guida pratica per scegliere fra Bonsai, GLM e modelli compatti, distinguendo memoria, qualità e velocità.

Immagine illustrativa del tema
Nemuel Sereti / Pexels

Partire dal lavoro che vuoi completare

Prima del download scrivi tre richieste che rappresentano il tuo uso: spiegare un errore, riassumere un documento o modificare una funzione. Salva anche il risultato atteso. La scelta di un modello cambia se cerchi una chat breve, lettura di immagini oppure un agente che lavori su più file. Una classifica generale non sostituisce queste prove.

Tre quantità da non confondere

La dimensione del file riguarda i pesi salvati; la RAM o VRAM occupata include il programma e strutture di esecuzione; il contesto misura quanto testo il modello gestisce nella richiesta. Servono misure separate. Se i pesi entrano nella GPU, non è ancora dimostrato che entrino anche la cronologia e i componenti visivi.

Una tabella per orientare le prime prove

EsigenzaModello da esplorareCosa verificare
Primo esperimento compattoQwen3.5-4B o Phi-4-miniItaliano, formato delle risposte e consumo
Testo e immaginiGemma 3 4B o Qwen multimodaleSupporto del percorso visivo nel programma
Classe 27B con pesi compressiBonsai 2 27BFormato e versione del runtime PrismML
Coding con strumentiGLM-4.7-FlashMemoria totale e parsing delle chiamate
Esercizi di ragionamentoDeepSeek R1 DistillRisposta finale e durata del ragionamento

È una proposta editoriale per iniziare, non una graduatoria di qualità. Ogni scelta va verificata sul proprio PC.

Come fare un confronto utile

  1. Annota hardware, sistema, checkpoint, formato e versione del programma.
  2. Usa gli stessi prompt e una cronologia nuova per ogni prova.
  3. Registra tempo alla prima risposta, durata totale e memoria.
  4. Valuta correttezza, formato e interventi necessari.
  5. Ripeti più volte prima di scegliere.

Per il codice usa test già esistenti o casi controllabili. Per i riassunti confronta nomi, date e numeri con l’originale. Per le immagini verifica dettagli visibili, senza affidarti soltanto al tono sicuro della risposta.

Il contesto lungo va guadagnato

Partire dalla finestra massima complica la diagnosi. Comincia con richieste brevi, poi aumenta testo e cronologia misurando il consumo. Gli appunti con 131.072 token configurati non dimostrano che una sessione abbia elaborato correttamente tutto quel testo. Un’impostazione è diversa da una prova completata.

Fonti e letture successive

Consulta le schede dei singoli modelli negli articoli collegati e la documentazione ufficiale llama.cpp. Guida aggiornata il 5 ottobre 2026.

Per un esempio pratico, leggi il diario delle prove AI.