Winnow-12B

Última atualização:

Aberto22–53ms$0/M input

Notas do quadrante

Ver o quadrante completo

Pontuação pela rubrica pública do quadrante (maturidade × capability; bolha = adoção). Revisamos conforme a evidência.

  • Maturidade6.6/10

    Fine-tune GGUF Apache-2.0 do Gemma-4-12B-it no HF com servidor próprio baseado em llama.cpp que expõe POST /v1/systemone além de chat e visão. Card, BENCHMARKS.md e Quickstart muito detalhados. Autor independente, sem API hospedada nem SLA.

  • Capability8.4/10

    Noul, Choice e Score por leitura de logits em estado compartilhado. Tabelas de ECE/Brier do autor sem temperature ajustada nesses evals (ECE JevBench público 0,074). Mediana warm B1 22,1 ms Q8 numa RTX PRO 5000 [vendor]. JevBench v1.5.7 oficial #2 com 73,2 (capability 79,3) conferido no Benchmark Heaven — separado do…

  • Adoção11/100

    Cerca de 30 mil downloads e 48 likes no HF, e 22 estrelas no GitHub do winnow-inference (5/10). Servidor próprio, presets GGUF (Q8/BF16/NVFP4) e página no placar. Sem estudo de produção independente além da nota do Benchmark Heaven de que o Winnow alimenta o System1 Models s1-pro.

Vendor claims

Leia antes

  1. Dois números diferentes de JevBench. Os 85,71% do card são acurácia no subset público de 231 itens, medidos pelo Eldan Ring contra o Jev hospedado. O 73,2 no Benchmark Heaven v1.5.7 é o score composto oficial (#2, Q8). Não misture. O subset é UnverifiedClaim; o placar nós conferimos ao vivo.
  2. Use o servidor Winnow, não o snippet genérico do llama.cpp. Snippets genéricos do Hub não expõem /v1/systemone. Decisões são leituras nativas de logits; chat e visão compartilham o mesmo GGUF. Decisões diretas são o padrão — “reasoning” e MTP opcionais são fluxos experimentais do cliente.
  3. Dados de treino são privados. O autor diz que painéis Kev-v4 anteriores entraram no desenvolvimento; trate as suítes do autor como não held-out para essas famílias. A rodada oficial do v1.5.7 é outra medição.

O que é

O Winnow-12B é um fine-tune LoRA independente do Gemma 4 12B IT, mergeado e distribuído como GGUF (Q8_0 recomendado; também BF16 e NVFP4) sob Apache-2.0. O servidor winnow-inference (MIT, baseado em llama.cpp) serve decisões tipadas em POST /v1/systemone e chat/visão ordinários em /v1/chat/completions a partir do mesmo modelo carregado.

Tipo Como funciona
Choice / Noul / Score Prefill de estado compartilhado, ramos por pergunta, logits do token de resposta — sem gerar texto de resposta
Chat + visão Mesmos pesos; projector opcional mmproj-Winnow-12B.gguf para imagens

Ponto desta ficha = Winnow-12B Q8 (linha do placar e setup 64K+visão recomendado pelo autor). BF16 e NVFP4 são o mesmo fine-tune em outras precisões.

Specs

Atributo Valor
Autor Eldan Ring (independente)
Base Gemma-4-12B-it + LoRA mergeado
Licença Apache-2.0 (NOTICE cita Gemma 4 Apache upstream + modificações Winnow)
Pesos Só GGUF (sem safetensors) — HF
Runtime EldanRing/winnow-inference — CUDA e Apple Silicon
Lançamento (HF)
Latência Warm B1 22,1 ms Q8 mediana (RTX PRO 5000) — UnverifiedClaim
Preço Self-host (pesos grátis)
Contexto Q8 testado a 64K com visão em 16 GB (perfil 5070 Ti)

Números

Placar oficial (conferido por nós, 5/10/2026)

Edição Sistema Score oficial Capability Rank
JevBench v1.5.7 Winnow-12B Q8 73,2 79,3 #2

Co-líder estatístico com o Cygnet (73,7) segundo a nota do próprio site. Capability é manchete separada do score oficial.

Painéis do autor (UnverifiedClaim)

Suite Winnow Q8 Winnow BF16 Jev 1.13 hospedado (OpenRouter)
JevBench público 231 85,71% 85,28% 85,71%
Kev-v9 clean 1.046 81,55% 81,45% 87,00%
Typed teacher agreement 2.000 70,00% 70,20% 73,80%
ECE JevBench público (↓ melhor) 0,0742 0,0655 0,0474

Fonte: docs/BENCHMARKS.md (medido em 21/09/2026 numa RTX PRO 5000). Sem temperature ajustada nesses outputs de avaliação.

Fit / anti-fit

Serve quando você precisa: System One local forte numa GPU consumer/pro, /v1/systemone compatível com TypeSafe, e chat/visão opcionais dos mesmos pesos.

Não serve quando você precisa: API hospedada com SLA, serving safetensors/vLLM-first, ou garantia de que os benches do autor são held-out de todas as famílias relacionadas.

Alertas

  • GGUF-first: o snippet automático do Hub pode apontar para o arquivo pequeno de assistant MTP — escolha o GGUF alvo Winnow (Q8/BF16/NVFP4).
  • NVFP4 / reasoning / MTP: menor footprint e receitas adaptativas opcionais trocam qualidade; decisões nativas diretas são o contrato padrão.
  • s1-pro: o Benchmark Heaven nota o Winnow como modelo por trás do System1 Models s1-pro; não auditamos esse produto — trate como pista, não como prova de produção nesta ficha.

Conta das notas (5/10/2026)

  • Maturidade = disp. 8 × 0,30 + docs 9 × 0,25 + integr. 7 × 0,25 + suporte 1 × 0,20 = 2,40 + 2,25 + 1,75 + 0,20 = 6,60
  • Capability = tipos 10 × 0,30 + calib. 7 × 0,25 + latência 8 × 0,25 [vendor] + acurácia 8 × 0,20 = 3,00 + 1,75 + 2,00 + 1,60 = 8,35 → 8,4
  • Adoção = engaj. 20 × 0,35 + ecossistema 10 × 0,35 + produção 2 × 0,30 = 7,00 + 3,50 + 0,60 = 11,10 → 11

Acurácia 8: placar público oficial (#2 com 73,2), não o % do subset do autor. Calibração fica em 7 (ECE/método publicados, rodada do autor).