Cloudflare lança o Clef, modelos de decisão abertos e multimodais no Workers AI
A Cloudflare anunciou o Clef em 1º de outubro de 2026: dois modelos de decisão, Clef (27B, a partir do Qwen3.8-27B) e Clef-flash (9B, a partir do Qwen3.5-9B). Os pesos subiram no Hugging Face na noite anterior sob Apache-2.0, e os dois rodam no Workers AI como @cf/cloudflare/clef (US$ 0,24 / M tokens de input) e @cf/cloudflare/clef-flash (US$ 0,09 / M), com contexto de 65.536 tokens, 1–64 perguntas por chamada e até quatro imagens.
Como funciona. Backbone Qwen congelado com LoRA rank 256 (publicado já fundido) e um head de schema conjunto separado que pontua todas as opções de todas as perguntas num único prefill. O treino usou cross-entropy com label smoothing mais loss de Brier, com RLCD como objetivo secundário, sobre dados sintéticos internos. A Cloudflare diz que a API é “totalmente compatível com Jev e SystemOne”. Fine-tuning e RL passam pelo time forward-deployed por enquanto. O @lucataco, que trabalha com modelos na Cloudflare, mostrou o Clef-flash rodando localmente num M5 Max e disse que o trabalho do Cog, da Replicate, agora move o fine-tuning e o redeploy no Workers AI.
Os números (UnverifiedClaim). No espelho do Decision Index 0.2.1 da Cloudflare, o Clef faz 61,21 e o Clef-flash 57,07, contra 57,91 oficiais do Jev. O Space oficial não é regenerado desde 28/09 e não lista o Clef. A frase “~13× mais rápido que o Jev” compara os 38,8 ms de GPU do Clef-flash com os 524 ms de ida e volta da API hospedada do Jev, que o próprio placar da Cloudflare chama de não comparáveis. No mesmo dia a Fastino declarou 64,81 para o GLiDE, também em rodada própria.
Como listamos. Catálogo (uma ficha para os dois tamanhos; o ponto do quadrante é o 27B), 6,7 de maturidade / 7,7 de capability / 26 de adoção.
