Modello e programma sono due cose diverse
Il modello contiene i parametri usati per generare le risposte. Il programma di esecuzione lo carica e gestisce richieste e memoria. Strumenti come llama.cpp e Ollama permettono di lavorare con modelli sul proprio computer; controlla formato, architettura supportata e licenza del modello scelto.
Il file non è tutta la memoria necessaria
La dimensione del modello sul disco è un punto di partenza. Durante l'esecuzione servono anche memoria per il contesto, cache e altre strutture. Il fabbisogno varia con modello, programma e impostazioni. Non promettere un certo numero di token al secondo sulla base della sola GPU.
Quantizzazione e contesto
Una quantizzazione riduce la precisione con cui sono rappresentati i parametri, con compromessi da verificare sul proprio compito. Confronta varianti dello stesso modello usando richieste identiche. Parti da un contesto contenuto e aumentalo soltanto quando serve: un limite massimo supportato non è una configurazione obbligatoria.
Un primo esperimento ripetibile
- Annota CPU, RAM, GPU, VRAM e sistema operativo.
- Scegli modello, formato e variante compatibili con il programma.
- Registra versione del programma, contesto e impostazioni.
- Ripeti gli stessi prompt, distinguendo elaborazione del testo in ingresso e generazione.
- Valuta correttezza e utilità delle risposte insieme alla velocità.
Locale significa controllare anche le connessioni
Verifica se stai usando un modello locale o un servizio cloud, e quali strumenti possono accedere alla rete. Non pubblicare un endpoint di inferenza senza le protezioni necessarie. Per iniziare, preferisci una configurazione accessibile soltanto dal tuo computer.
Fonti e prossimo passo
llama.cpp e FAQ Ollama, consultati il 4 ottobre 2026. Per l'hardware consulta Schede video.
