Cloudflare rende open source i modelli di decisione Clef

In questo articolo
Cloudflare ha reso open source Clef e Clef-flash, due modelli di decisione ospitati su Workers AI, e ha lanciato una piattaforma di apprendimento per rinforzo per il fine-tuning sui dati dei clienti.
Cloudflare ha rilasciato Clef e Clef-flash, modelli di decisione open source ospitati su Workers AI, più una piattaforma di apprendimento per rinforzo per il fine-tuning sui dati dei clienti. I modelli di decisione restituiscono output tipizzati con probabilità invece di testo generato, puntando ai passaggi di classificazione e routing che i team oggi eseguono su grandi LLM generalisti.
Smistamento dei ticket, rilevamento degli intent, moderazione dei contenuti, selezione degli strumenti: gran parte di ciò che i team affidano oggi a LLM generalisti di grandi dimensioni non è affatto generazione. È classificazione. Un modello legge uno stato e restituisce una decisione su cui il codice agisce. Eseguire questi passaggi su un modello generalista funziona, ma eredita la generazione token per token, latenza variabile, prezzi calcolati sull'output e testo da interpretare e validare prima che si possa agire. L'ultimo rilascio di Cloudflare interviene esattamente su questo livello.
Cosa ha annunciato Cloudflare
Il 1° ottobre 2026 Cloudflare ha presentato Clef e Clef-flash, due modelli di decisione addestrati internamente e ospitati su Workers AI, la piattaforma di inferenza dell'azienda. Entrambi sono open source su Hugging Face con licenza Apache 2.0, quindi possono girare anche fuori dall'infrastruttura di Cloudflare. Accanto ai modelli, Cloudflare ha lanciato un prodotto di apprendimento per rinforzo che consente ai clienti di fare fine-tuning di Clef sui propri dati. Secondo l'annuncio, Clef guida attualmente il Jev Decision Index, la suite di benchmark definita per questa categoria di modelli.

Un modello di decisione non scrive prosa. Gli si passa uno stato, come testo, JSON, immagini o video, e uno schema di domande tipizzate; restituisce una probabilità per ogni opzione ammessa di ogni domanda. Nell'esempio dei ticket di supporto tratto dall'annuncio, un messaggio del cliente viene valutato per urgenza, per il team che dovrebbe occuparsene e per un punteggio di gravità, e il codice chiamante instrada il ticket, lo escala o lo passa a un umano in base a quei numeri. La pagina del modello su Workers AI documenta tre tipi di domande (noul, choice e score), da 1 a 64 domande per richiesta e fino a quattro immagini incorporate per chiamata.
Perché non continuare a usare un LLM generalista?
La categoria è stata definita da TypeSafe AI, che ha rilasciato Jev il 15 settembre 2026 come primo System One Model. Nell'annuncio di TypeSafe, il fondatore Diogo Almeida sostiene che i modelli ottimizzati per le preferenze umane si adattano male all'automazione: gli output sono stringhe da interpretare e validare, le stime di confidenza sono incoerenti e il campionamento sequenziale limita il throughput. Jev invece restituisce valori strutturati type-safe con probabilità calibrate, generati in parallelo, con input prezzato a 0,042 $ per milione di token e token di output gratuiti. Clef è pienamente compatibile con l'API di Jev e produce output rigorosamente tipizzati, quindi le integrazioni esistenti possono sostituire il modello con modifiche minime al codice.
La latenza è un differenziatore importante. Sui 43 benchmark di valutazione eseguiti da Cloudflare, Clef ha registrato un tempo di risposta mediano di 209,3 ms e Clef-flash di 38,8 ms, contro i 524,1 ms di Jev. Laya, un altro modello concorrente, è ancora più veloce con 5,8 ms mediani, ma sacrifica qualità nei punteggi pubblicati. Per contesto, TypeSafe colloca i tempi di risposta end-to-end degli LLM di frontiera tra 3 e 329 secondi. Poiché Clef gira sulle GPU edge di Cloudflare, l'azienda lo posiziona per il percorso critico di un agente: decidere vicino all'utente, poi affidare l'azione a un LLM su Workers AI quando serve generazione.
L'annuncio include una misurazione interna concreta. Il team Threat Intelligence di Cloudflare usa Clef, insieme al rendering del browser, per classificare i domini dei siti web. Recuperare, renderizzare e classificare un sito richiedeva 2,2 secondi; lo stesso flusso con gpt-oss-120b, l'LLM generalista più veloce nel loro confronto, richiedeva 4,7 secondi e restituiva solo due classificazioni. Per le pipeline che classificano molti elementi in sequenza, questo divario si accumula.
Benchmark: forti in alcuni punti, non uniformi
Sulle selezioni del Jev Decision Index pubblicate nel post, Clef ottiene 98,47 su BFCL (case exact) contro il 95,75 di Jev, e 94,20 di macro-F1 su BANKING77 contro 79,74. Clef-flash guida BFCL con 98,76 e raggiunge 97,73 sul task Home appliances. Il quadro non è a senso unico. Jev fa meglio su When2Call (80,97 contro 72,37), sul retrieval BRIGHT (47,52 contro 45,91) e, nella suite di valutazione di quattro task di TypeSafe, sull'agent trace observability (71,6 contro 68,5). Clef ha prevalso negli altri tre task della suite: elaborazione delle fatture, customer service e incidenti di sicurezza.

La lettura pratica è che i benchmark pubblicati discordano sui margini e la classifica dipende dalla forma del task. Questi numeri funzionano come un segnale per la shortlist, non come sostituto della valutazione dei modelli candidati sul proprio traffico prima di reindirizzare un percorso di classificazione in produzione.
Come è costruito Clef
Clef è un modello multimodale da 27B con finestra di contesto da 65.536 token e un encoder visivo, il che lo distingue dall'input solo testuale di Jev. Cloudflare ha eseguito il post-training di un modello base Qwen per i compiti di decisione. L'approccio si basa sui precedenti esperimenti di Cloudflare, che avevano adattato DiffusionGemma a produrre probabilità deterministiche esponendo i logprob, e sui contributi indipendenti di Matt Mastracci che hanno rafforzato il supporto a DiffusionGemma nel motore di inferenza vLLM. All'inferenza il backbone esegue un passaggio di solo prefill e poi assegna un punteggio in parallelo a tutte le scelte valide dello schema. Il passo decisionale è non autoregressivo: non viene generato testo intermedio token per token, ed è ciò che rende Clef significativamente più veloce degli LLM autoregressivi.
Il ciclo di fine-tuning RL e il controllo dei dati
La seconda metà dell'annuncio è la piattaforma di apprendimento per rinforzo. I clienti possono fare fine-tuning di Clef per i propri carichi di lavoro; il servizio parte come un'attività affiancata dal team di ingegneri forward-deployed di Cloudflare e si aprirà in seguito come piattaforma self-serve per addestrare e ridistribuire il modello su Cloudflare. La pagina Clef di Cloudflare presenta la proposta combinata come agenti che classificano, instradano e agiscono senza un umano nel ciclo, calibrati sui dati del cliente.
Il controllo dei dati ha due livelli. Sul lato ospitato, Cloudflare dichiara di non leggere, archiviare né addestrare su richieste o risposte, con un'eccezione esplicita: il prodotto di fine-tuning, dove usare i dati è proprio lo scopo. Sul lato self-hosted, i pesi Apache 2.0 rendono possibile il deployment locale per i team i cui requisiti di compliance escludono l'inferenza di terze parti. Su Workers AI, la documentazione del modello indica un prezzo di 0,24 $ per milione di token di input per Clef.

Provarlo: la forma dell'API
Le richieste abbinano uno stato a uno schema di domande, e le risposte tornano indicizzate per id della domanda con probabilità per opzione. Il testo lungo dello stato viene troncato per rientrare nella finestra di contesto. Il nucleo del binding Workers AI documentato per JavaScript è questo:
const response = await env.AI.run("@cf/cloudflare/clef", {
model: "clef",
state: "Checkout has been failing for every customer for the last hour.",
questions: {
urgent: { type: "noul", instructions: "Is this support request urgent?" },
team: {
type: "choice",
instructions: "Which team should handle this request?",
criteria: {
billing: "Payments, invoices, and refunds",
technical: "Outages, errors, and configuration",
sales: "Plans and upgrades",
},
},
severity: {
type: "score",
instructions: "How severe is the customer impact?",
criteria: ["No impact", "Minor", "Major", "Critical"],
},
},
});
// response.answers.urgent -> probability the request is urgent
// response.answers.team -> chosen team with per-option probabilities
// response.answers.severity -> probability-weighted scoreCosa cambia e cosa valutare
Costi: la classificazione passa dal prezzo sull'output generato a un prezzo fisso sui token di input. TypeSafe afferma che il prezzo di input degli LLM generalisti va da 0,20 a 10 $ per milione di token, con output circa cinque volte superiore, quindi il divario sulla classificazione ad alto volume è strutturale.
Latenza: mediane sotto i 250 ms collocano le decisioni dentro i loop interattivi, dove le chiamate LLM di diversi secondi impongono batching o code.
Determinismo: output tipizzati con probabilità eliminano il livello di interpretazione e validazione e riducono l'insieme delle modalità di guasto che il codice applicativo deve gestire.
Controllo dei dati: i pesi aperti coprono il self-hosting, il servizio ospitato porta una garanzia di non addestramento, e il fine-tuning è un opt-in deliberato.
Fare inventario delle chiamate di classificazione e routing oggi servite da un LLM generalista.
Sperimentare Clef tramite l'API compatibile con Jev su una copia di quel traffico e misurare la concordanza con gli output attuali.
Instradare le decisioni critiche per latenza a Clef-flash e quelle critiche per precisione al modello Clef più grande.
Tenere l'LLM per i passaggi di generazione e usare soglie di probabilità per passare i casi a bassa confidenza agli umani.
Il compromesso è la portata. Un modello di decisione rinuncia alla generazione aperta: classifica, assegna punteggi e instrada, e ha bisogno di un LLM al fianco ogni volta che il passo successivo è scrivere testo o chiamare strumenti con argomenti in forma libera. Adottarne uno aggiunge anche un lavoro di ingegneria delimitato: schemi di domande da progettare, soglie di probabilità da calibrare e un ciclo di fine-tuning da governare. Resta comunque una superficie più piccola di quella necessaria a ottenere con i soli prompt un comportamento coerente da un modello generalista.
I modelli di decisione non sostituiscono gli LLM; si prendono in carico il livello decisionale, dove il volume è alto e la creatività bassa. Con Clef reso open source e un ciclo di fine-tuning ospitato abbinato, quel livello ha ora un'opzione sia self-hostable sia addestrabile su dati privati. Che si guadagni un posto in un determinato stack dipende dai tre numeri che l'hanno motivato: costo per decisione, latenza per decisione e dove è consentito inviare i dati.
Punti chiave
- Cloudflare ha rilasciato Clef e Clef-flash, modelli di decisione open source ospitati su Workers AI e pubblicati su Hugging Face con licenza Apache 2.0.
- I modelli di decisione restituiscono output tipizzati con probabilità invece di testo generato, pensati per classificazione e routing nei workflow agentici.
- Su 43 benchmark di valutazione, Clef ha registrato una latenza mediana di 209,3 ms e Clef-flash di 38,8 ms, contro i 524,1 ms di Jev di TypeSafe.
- I risultati dei benchmark sono misti: Clef guida su BFCL e BANKING77, mentre Jev ottiene punteggi più alti su When2Call, BRIGHT e agent trace observability.
- Clef è un modello multimodale da 27B con finestra di contesto da 65.536 token, al prezzo di 0,24 $ per milione di token di input su Workers AI.
- La nuova piattaforma RL consente di fare fine-tuning di Clef sui propri dati, prima con gli ingegneri forward-deployed di Cloudflare, poi come piattaforma self-serve.
- Cloudflare dichiara di non leggere, archiviare né addestrare su richieste o risposte, salvo adesione esplicita al prodotto di fine-tuning.
Domande frequenti
Che cos'è un modello di decisione?
Un modello che riceve uno stato e uno schema di domande tipizzate e restituisce una probabilità per ogni opzione ammessa, così che il codice applicativo possa instradare, escalare o passare la mano a un umano senza dover interpretare testo generato.
Quanto costa Clef su Workers AI?
La documentazione del modello su Workers AI indica 0,24 $ per milione di token di input per Clef.
Clef può girare fuori da Cloudflare?
Sì. I pesi sono pubblicati su Hugging Face con licenza Apache 2.0, quindi i team possono eseguire e sperimentare i modelli sulla propria infrastruttura.
In cosa Clef differisce da Jev?
Entrambi espongono un'API compatibile. Clef aggiunge un encoder visivo per l'input di immagini, una finestra di contesto da 64k token contro i 32k di Jev, e gira su Workers AI; Jev è il primo System One Model di TypeSafe AI.
Cosa offre la piattaforma di fine-tuning RL?
Permette ai clienti di fare fine-tuning di Clef per i propri casi d'uso. Parte come servizio affiancato dal team di ingegneri forward-deployed di Cloudflare e diventerà in seguito una piattaforma self-serve per addestrare e ridistribuire il modello.
Cloudflare addestra sui dati dei clienti?
Cloudflare dichiara di non leggere, archiviare né addestrare su richieste o risposte, a meno che non si usi il prodotto di fine-tuning, dove i dati servono proprio ad adattare il modello.
Quando un LLM generalista resta la scelta giusta?
Quando il compito richiede di generare testo o chiamate a strumenti in forma libera. Un modello di decisione copre classificazione e punteggio entro un perimetro delimitato; Cloudflare suggerisce di combinare Clef per le decisioni con un LLM su Workers AI per le azioni.












