Modelli AI locali / Guida

AI locale: modello, memoria e quantizzazione

Come preparare il primo esperimento con un LLM locale e leggere i risultati senza confondere modello e programma.

Immagine illustrativa del tema
Nemuel Sereti / Pexels

Modello e programma sono due cose diverse

Il modello contiene i parametri usati per generare le risposte. Il programma di esecuzione lo carica e gestisce richieste e memoria. Strumenti come llama.cpp e Ollama permettono di lavorare con modelli sul proprio computer; controlla formato, architettura supportata e licenza del modello scelto.

Il file non è tutta la memoria necessaria

La dimensione del modello sul disco è un punto di partenza. Durante l'esecuzione servono anche memoria per il contesto, cache e altre strutture. Il fabbisogno varia con modello, programma e impostazioni. Non promettere un certo numero di token al secondo sulla base della sola GPU.

Quantizzazione e contesto

Una quantizzazione riduce la precisione con cui sono rappresentati i parametri, con compromessi da verificare sul proprio compito. Confronta varianti dello stesso modello usando richieste identiche. Parti da un contesto contenuto e aumentalo soltanto quando serve: un limite massimo supportato non è una configurazione obbligatoria.

Un primo esperimento ripetibile

  1. Annota CPU, RAM, GPU, VRAM e sistema operativo.
  2. Scegli modello, formato e variante compatibili con il programma.
  3. Registra versione del programma, contesto e impostazioni.
  4. Ripeti gli stessi prompt, distinguendo elaborazione del testo in ingresso e generazione.
  5. Valuta correttezza e utilità delle risposte insieme alla velocità.

Locale significa controllare anche le connessioni

Verifica se stai usando un modello locale o un servizio cloud, e quali strumenti possono accedere alla rete. Non pubblicare un endpoint di inferenza senza le protezioni necessarie. Per iniziare, preferisci una configurazione accessibile soltanto dal tuo computer.

Fonti e prossimo passo

llama.cpp e FAQ Ollama, consultati il 4 ottobre 2026. Per l'hardware consulta Schede video.