Clef / Clef-flash

Última atualização:

Aberto39–239ms$0.24/M input

Notas do quadrante

Ver o quadrante completo

Pontuação pela rubrica pública do quadrante (maturidade × capability; bolha = adoção). Revisamos conforme a evidência.

  • Maturidade7.2/10

    Pesos Apache-2.0 (27B, 9B) mais um endpoint pago e self-serve no Workers AI, com schema documentado. Em um dia: entradas na biblioteca oficial do Ollama em /v1/systemone, pacote do Ollaya e suporte no llama.cpp (PR com merge em 02/10). Sem GA nem SLA específico do modelo.

  • Capability7.5/10

    Noul / Choice / Score com até 4 imagens num único pass. Método de calibração publicado (Brier, label smoothing), sem ECE. Rodada da Cloudflare em GPU: mediana de 209 ms. Primeiro teste independente da API hospedada: mediana de 638–717 ms, p95 ~1 s. DI 61,21 é rodada própria, fora do placar oficial.

  • Adoção37/100

    610 pontos no Hacker News, post de lançamento do @CloudflareDev com 1.245 likes, 706 + 237 likes no Hugging Face, 33 quantizações (entre elas do ggml-org), pacotes no Ollama e no Ollaya e cerca de 15 repos da comunidade em 36 horas. Ainda sem caso externo de produção publicado.

Vendor claims

Leia antes

  1. “Líder do Decision Index” é rodada da própria Cloudflare. O Decision Index oficial ainda está com dados de 28/09 e não lista o Clef. No mesmo dia a Fastino declarou 64,81 para o GLiDE, também em rodada própria.
  2. A frase “13× mais rápido que o Jev” (no changelog da Cloudflare e de @lucataco, que trabalha com modelos na Cloudflare) mistura dois cenários. Os 38,8 ms do Clef-flash são tempo de GPU num único processo; os 524 ms do Jev são ida e volta pela API hospedada, e o próprio leaderboard da Cloudflare diz que os dois “não são comparáveis”. O primeiro teste independente dos endpoints hospedados (abaixo) achou a ordem inversa: Jev em ~100–170 ms, Clef em ~640–720 ms.
  3. O preço é só por token de input; não há preço de output (decisões não geram texto). Por token de input, o Clef custa cerca de 5,7× o Jev (US$ 0,24 vs US$ 0,042 por M) e o Clef-flash cerca de 2,1× (US$ 0,09). A janela de 65.536 tokens do Clef é o dobro dos 32K que o OpenRouter lista para o Jev.

O Clef é uma família de modelos de decisão da Cloudflare, anunciada no blog da Cloudflare em 1º de outubro de 2026. Os pesos subiram no Hugging Face na noite anterior (30/09, 18:15 BRT) sob Apache-2.0: Clef (27B, a partir do Qwen3.8-27B) e Clef-flash (9B, a partir do Qwen3.5-9B). Os dois rodam no Workers AI como @cf/cloudflare/clef e @cf/cloudflare/clef-flash e, desde 2 de outubro, estão na biblioteca oficial do Ollama.

O modelo lê um estado (texto, JSON, imagens ou vídeo) e um schema de perguntas tipadas, e devolve uma probabilidade para cada opção permitida num único forward pass, sem gerar texto. A Cloudflare diz que a API é “totalmente compatível com Jev e SystemOne”.

Especificações

Atributo Clef Clef-flash
Base Qwen/Qwen3.8-27B (mantém o encoder de visão) Qwen/Qwen3.5-9B
Treino Backbone congelado + LoRA de rank 256 (salvo mesclado), head de schema conjunto separado; cross-entropy com label smoothing + loss de Brier, RLCD como objetivo secundário; dados sintéticos internos mesma receita
Preço no Workers AI US$ 0,24 / M tokens de input US$ 0,09 / M tokens de input
Contexto 65.536 tokens 65.536 tokens
Perguntas por chamada 1–64 (Noul, Choice, Score) 1–64
Imagens até 4 por requisição (PNG/JPEG/WebP, embutidas) até 4
Rodar local Ollama clef (18 GB); Ollaya; llama.cpp (só texto) Ollama clef-flash (11 GB); Ollaya clef:flash; llama.cpp (só texto)
Licença Apache-2.0 Apache-2.0
Lançamento idem

O release no Hugging Face traz o backbone em safetensors fatiados mais joint_head.safetensors e um loader joint_schema_model.py com o helper systemone(). No Workers AI a chamada vai para /ai/run/@cf/cloudflare/clef, não para um caminho /v1/systemone; o Ollama serve os mesmos modelos em /v1/systemone.

Rodando por conta própria

  • Ollama. clef e clef-flash estão na biblioteca oficial, com suporte nativo que entrou no ollama#18741 em 1º de outubro (19:52 BRT). As requisições vão para /v1/systemone e aceitam imagens em base64. Dois detalhes da página ainda não batem: ela diz “requires Ollama 0.35.1 or later”, mas o suporte entrou depois da tag 0.35.1, e a lista de tags mostra contexto de 256K enquanto o readme diz 64K.
  • llama.cpp. O suporte entrou com o merge do #29831 em 2 de outubro (21:50 BRT): só texto, uma sequência por batch, em cima do endpoint /v1/systemone. Os arquivos ggml-org/Clef-GGUF precisam de um build que já inclua esse merge. Entrada de imagem ainda não é suportada lá.
  • Ollaya. O ollaya-dev/clef empacota o Clef-flash em grafos ONNX que apontam para os próprios arquivos de pesos da Cloudflare. O empacotador relata decisões idênticas às do código da Cloudflare em 571 perguntas (logits a menos de 4,3e-5; UnverifiedClaim).
  • GGUF puro num runtime de chat não é o mesmo modelo. O GGUF guarda só o backbone. Rodando como modelo de chat no Ollama 0.35.0, um teste de terceiro obteve JSON restrito, não as probabilidades do head de schema conjunto.

Evidências (UnverifiedClaim)

Do espelho do Decision Index 0.2.1 da Cloudflare (38 benchmarks, placar upstream de 28/09, linhas do Clef adicionadas em 01/10):

Modelo Índice Knowledge Language Retrieval Tools Arts Mediana / p95
Clef 61,21 51,2 61,2 62,5 81,2 47,8 209 / 239 ms
Jev 1.13 (linha oficial) 57,91 51,4 62,0 55,4 75,1 37,7 524 / 536 ms (API hospedada)
Clef-flash 57,07 50,4 52,6 52,3 82,0 49,9 39 / 122 ms

ECE e Brier estão em branco nesse placar. O blog também traz avaliações de workflow da TypeSafe em que o Clef vence o Jev em 3 de 4 tarefas.

Resultados independentes

As primeiras medições de fora saíram em menos de um dia. As duas são pequenas e de uma tarefa só: valem como evidência sobre essas tarefas, não como ranking geral.

  • Nicia, admissão de escrita em base de conhecimento (repo; 85 casos sintéticos, APIs hospedadas, rodadas em 1–2 de outubro). O Clef ficou perto do Jev em qualidade (recall 0,98 / 1,00, admissão de rotina 0,97), mas duas decisões mudaram quando os registros foram reordenados. O Clef-flash admitiu só cerca de dois terços das escritas inofensivas. Latência de ida e volta, uma requisição por vez: Jev com mediana de 98–167 ms, Clef-flash 429–533 ms, Clef 638–717 ms (p95 0,9–1,1 s), com cauda lenta de 9–26 s. Poucas horas depois do lançamento, cerca de um quinto das chamadas ao Clef com seis em paralelo voltou HTTP 429; nas rodadas seguintes, nenhuma. O Clef devolveu probabilidades idênticas para requisições idênticas; o Jev variou até 0,12.
  • Reid Marlow, decisões de um agente de código (DEV; 42 casos reais de um agente). Jev 71,4%, Clef-flash 66,7%; os dois concordaram em 35 de 42.

Para quem serve / para quem não serve

Serve: times que já estão no Cloudflare Workers e querem uma chamada de decisão hospedada perto do app; checagens multimodais (screenshots, documentos com imagens); quem quer os mesmos pesos hospedados, no Ollama e self-hosted.

Não serve: cargas que precisam de SLA hoje ou de nota verificada; chamadas hospedadas sensíveis a latência (a ida e volta independente fica em centenas de ms); uso drop-in do SDK da TypeSafe contra o endpoint do Workers AI sem adaptador.

Limites

  • Nenhum ECE ou número de confiabilidade publicado.
  • As respostas podem depender da ordem dos registros no estado (teste da Nicia).
  • “Ainda no começo”: o serviço de fine-tuning e RL roda pelo time de forward-deployed engineers da Cloudflare por enquanto; o self-serve vem depois.
  • Os dados de treino são internos e sintéticos, então não dá para auditar.

O Clef treina componentes de decisão próprios (LoRA mais um head de schema conjunto novo), publica os pesos e os serve por uma API tipada documentada que devolve probabilidades. O Clef-flash divide a página: mesma receita e mesma API, backbone menor. No quadrante, o ponto é o Clef 27B.

JevBench v1.5.7 (Benchmark Heaven, conferido em 5/10/2026)

No v1.5.7, o Clef-Flash está em #26 com oficial 55,1 e o Clef em #63 com 17,0 (medição só-texto de modelos multimodais). Ver news. Sem mudança de nota.