Modelli AI locali / Guida

CLM-8B: scegliere azioni con un modello contrastivo locale

CLM-8B: autori, encoder Qwen3, apprendimento contrastivo e azioni per agenti. Uso locale, memoria, cache e limiti del checkpoint.

Schema CLM: encoder dello stato e delle azioni, confronto e classifica
NexastraTech / Schema editoriale · Fonte tecnica

Dal testo alla scelta di un’azione

Un agente ha spesso più mosse possibili: aprire un file, invocare uno strumento, scegliere un collegamento oppure verificare una soluzione. CLM-8B assegna punteggi alle alternative fornite. Si può immaginare come un componente di selezione accanto al modello che scrive: uno propone le soluzioni, l’altro aiuta a ordinarle.

Autori e architettura

La scheda del progetto cita Jacky Kwok, Hangoo Kang, Tarun Suresh, Jon Saad-Falcon, Marco Pavone, Christopher Ré e Azalia Mirhoseini. CLM significa Contrastive Language Model. La versione v0.1-8B usa Qwen3-8B come encoder congelato, con due teste di proiezione per stato e azione. L’obiettivo contrastivo avvicina le rappresentazioni delle coppie corrette e le separa dalle alternative. Codice e pesi pubblicano una licenza Apache-2.0.

Perché la cache è importante

Stato e azioni vengono rappresentati separatamente. Un insieme di alternative che resta identico può riutilizzare le proprie rappresentazioni mentre cambia il testo da valutare. Per esempio, i nomi e le descrizioni degli strumenti di un agente possono essere preparati una volta. Il vantaggio concreto va misurato sul proprio carico: cambiare continuamente le alternative riduce le occasioni di riuso.

Il percorso locale documentato

Il quickstart avvia Qwen3-8B in modalità pooling con vLLM sulla porta 8090 e il servizio clm-serve sulla 8700. Il secondo espone anche un playground nel browser. Il limite iniziale dell’esempio è 2048 token; per aumentarlo occorre allineare il limite dell’encoder e quello del servizio CLM. Il download della piccola testa non sostituisce quello del modello Qwen3-8B.

Quanta memoria mettere in conto

Come ordine di grandezza aritmetico, otto miliardi di pesi a due byte richiedono circa 16 GB decimali per i soli pesi. Il consumo reale comprende buffer e richieste: questa cifra non è una specifica minima di VRAM. Una quantizzazione GGUF consigliata per la chat non dimostra compatibilità con questo percorso di embedding. Anche cambiare encoder o pooling può rendere le teste incompatibili. Per iniziare conviene seguire lo stack documentato e registrare il picco di memoria prima di aumentare contesto o concorrenza.

Come leggere risultati e probabilità

La scheda precisa che CLM assegna punteggi alle alternative ricevute: le probabilità sono relative a quell’insieme. Se manca l’azione corretta, la prima classificata può comunque essere sbagliata. I risultati pubblicizzati come verificatore su DeepSWE e Terminal-Bench richiedono teste adattate, mentre il checkpoint di partenza ha un ruolo diverso. Non vanno interpretati come la percentuale di problemi che CLM scrive e risolve da solo.

Una prova che vale la pena fare

Costruisci un piccolo router con quattro strumenti e una quinta opzione “nessuno”. Prova messaggi che richiedono strumenti simili, richieste incomplete e casi estranei al dominio. Poi ripeti con le alternative già in cache. Annota correttezza, latenza a freddo e a caldo, memoria e dimensione dell’input. Questo esperimento risponde a una domanda utile: il selettore aggiunge valore al tuo agente, oppure gli basta una regola più semplice?

Per continuare

Jev · Colibrì · Selettore dei modelli AI per il PC

Fonti e approfondimenti

Documentazione consultata il 6 ottobre 2026.