Dal testo alla scelta di un’azione
Un agente ha spesso più mosse possibili: aprire un file, invocare uno strumento, scegliere un collegamento oppure verificare una soluzione. CLM-8B assegna punteggi alle alternative fornite. Si può immaginare come un componente di selezione accanto al modello che scrive: uno propone le soluzioni, l’altro aiuta a ordinarle.
Autori e architettura
La scheda del progetto cita Jacky Kwok, Hangoo Kang, Tarun Suresh, Jon Saad-Falcon, Marco Pavone, Christopher Ré e Azalia Mirhoseini. CLM significa Contrastive Language Model. La versione v0.1-8B usa Qwen3-8B come encoder congelato, con due teste di proiezione per stato e azione. L’obiettivo contrastivo avvicina le rappresentazioni delle coppie corrette e le separa dalle alternative. Codice e pesi pubblicano una licenza Apache-2.0.
Perché la cache è importante
Stato e azioni vengono rappresentati separatamente. Un insieme di alternative che resta identico può riutilizzare le proprie rappresentazioni mentre cambia il testo da valutare. Per esempio, i nomi e le descrizioni degli strumenti di un agente possono essere preparati una volta. Il vantaggio concreto va misurato sul proprio carico: cambiare continuamente le alternative riduce le occasioni di riuso.
Il percorso locale documentato
Il quickstart avvia Qwen3-8B in modalità pooling con vLLM sulla porta 8090 e il servizio clm-serve sulla 8700. Il secondo espone anche un playground nel browser. Il limite iniziale dell’esempio è 2048 token; per aumentarlo occorre allineare il limite dell’encoder e quello del servizio CLM. Il download della piccola testa non sostituisce quello del modello Qwen3-8B.
Quanta memoria mettere in conto
Come ordine di grandezza aritmetico, otto miliardi di pesi a due byte richiedono circa 16 GB decimali per i soli pesi. Il consumo reale comprende buffer e richieste: questa cifra non è una specifica minima di VRAM. Una quantizzazione GGUF consigliata per la chat non dimostra compatibilità con questo percorso di embedding. Anche cambiare encoder o pooling può rendere le teste incompatibili. Per iniziare conviene seguire lo stack documentato e registrare il picco di memoria prima di aumentare contesto o concorrenza.
Come leggere risultati e probabilità
La scheda precisa che CLM assegna punteggi alle alternative ricevute: le probabilità sono relative a quell’insieme. Se manca l’azione corretta, la prima classificata può comunque essere sbagliata. I risultati pubblicizzati come verificatore su DeepSWE e Terminal-Bench richiedono teste adattate, mentre il checkpoint di partenza ha un ruolo diverso. Non vanno interpretati come la percentuale di problemi che CLM scrive e risolve da solo.
Una prova che vale la pena fare
Costruisci un piccolo router con quattro strumenti e una quinta opzione “nessuno”. Prova messaggi che richiedono strumenti simili, richieste incomplete e casi estranei al dominio. Poi ripeti con le alternative già in cache. Annota correttezza, latenza a freddo e a caldo, memoria e dimensione dell’input. Questo esperimento risponde a una domanda utile: il selettore aggiunge valore al tuo agente, oppure gli basta una regola più semplice?
Per continuare
Jev · Colibrì · Selettore dei modelli AI per il PC
Fonti e approfondimenti
Documentazione consultata il 6 ottobre 2026.
