Winnow-12B
Notas do quadrante
Ver o quadrante completoPontuação pela rubrica pública do quadrante (maturidade × capability; bolha = adoção). Revisamos conforme a evidência.
- Maturidade6.6/10
Fine-tune GGUF Apache-2.0 do Gemma-4-12B-it no HF com servidor próprio baseado em llama.cpp que expõe POST /v1/systemone além de chat e visão. Card, BENCHMARKS.md e Quickstart muito detalhados. Autor independente, sem API hospedada nem SLA.
- Capability8.4/10
Noul, Choice e Score por leitura de logits em estado compartilhado. Tabelas de ECE/Brier do autor sem temperature ajustada nesses evals (ECE JevBench público 0,074). Mediana warm B1 22,1 ms Q8 numa RTX PRO 5000 [vendor]. JevBench v1.5.7 oficial #2 com 73,2 (capability 79,3) conferido no Benchmark Heaven — separado do…
- Adoção11/100
Cerca de 30 mil downloads e 48 likes no HF, e 22 estrelas no GitHub do winnow-inference (5/10). Servidor próprio, presets GGUF (Q8/BF16/NVFP4) e página no placar. Sem estudo de produção independente além da nota do Benchmark Heaven de que o Winnow alimenta o System1 Models s1-pro.
Vendor claims
- Subset público do JevBench (231 itens): Winnow-12B Q8 198/231 = 85,71%, empatando o Jev 1.13 hospedado via OpenRouter na comparação localhost do autor; BF16 85,28% — acurácia do subset, não o score composto oficial[Claim do fornecedor — não verificado independentemente]
- Kev-v9 clean (1.046): Q8 81,55%, BF16 81,45%; Typed teacher agreement (2.000): Q8 70,00%, BF16 70,20% — rodada do autor numa RTX PRO 5000[Claim do fornecedor — não verificado independentemente]
- Calibração (autor, sem temperature nestes outputs): ECE JevBench público 0,0742 (Q8) / 0,0655 (BF16); ECE Kev-v9 0,0980 / 0,0989[Claim do fornecedor — não verificado independentemente]
- Latência mediana warm short-state B1 Q8 22,1 ms, cold 52,7 ms numa RTX PRO 5000 Blackwell (localhost); pico 64K+visão Q8 15,01 GiB numa RTX 5070 Ti 16 GB[Claim do fornecedor — não verificado independentemente]
- JevBench v1.5.7 oficial (Benchmark Heaven): Winnow-12B Q8 score oficial 73,2 (#2), capability 79,3 — placar independente, não rodada do autor[Claim do fornecedor — não verificado independentemente]
Leia antes
- Dois números diferentes de JevBench. Os 85,71% do card são acurácia no subset público de 231 itens, medidos pelo Eldan Ring contra o Jev hospedado. O 73,2 no Benchmark Heaven v1.5.7 é o score composto oficial (#2, Q8). Não misture. O subset é UnverifiedClaim; o placar nós conferimos ao vivo.
- Use o servidor Winnow, não o snippet genérico do llama.cpp. Snippets genéricos do Hub não expõem
/v1/systemone. Decisões são leituras nativas de logits; chat e visão compartilham o mesmo GGUF. Decisões diretas são o padrão — “reasoning” e MTP opcionais são fluxos experimentais do cliente.- Dados de treino são privados. O autor diz que painéis Kev-v4 anteriores entraram no desenvolvimento; trate as suítes do autor como não held-out para essas famílias. A rodada oficial do v1.5.7 é outra medição.
O que é
O Winnow-12B é um fine-tune LoRA independente do Gemma 4 12B IT, mergeado e distribuído como GGUF (Q8_0 recomendado; também BF16 e NVFP4) sob Apache-2.0. O servidor winnow-inference (MIT, baseado em llama.cpp) serve decisões tipadas em POST /v1/systemone e chat/visão ordinários em /v1/chat/completions a partir do mesmo modelo carregado.
| Tipo | Como funciona |
|---|---|
| Choice / Noul / Score | Prefill de estado compartilhado, ramos por pergunta, logits do token de resposta — sem gerar texto de resposta |
| Chat + visão | Mesmos pesos; projector opcional mmproj-Winnow-12B.gguf para imagens |
Ponto desta ficha = Winnow-12B Q8 (linha do placar e setup 64K+visão recomendado pelo autor). BF16 e NVFP4 são o mesmo fine-tune em outras precisões.
Specs
| Atributo | Valor |
|---|---|
| Autor | Eldan Ring (independente) |
| Base | Gemma-4-12B-it + LoRA mergeado |
| Licença | Apache-2.0 (NOTICE cita Gemma 4 Apache upstream + modificações Winnow) |
| Pesos | Só GGUF (sem safetensors) — HF |
| Runtime | EldanRing/winnow-inference — CUDA e Apple Silicon |
| Lançamento | (HF) |
| Latência | Warm B1 22,1 ms Q8 mediana (RTX PRO 5000) — UnverifiedClaim |
| Preço | Self-host (pesos grátis) |
| Contexto | Q8 testado a 64K com visão em 16 GB (perfil 5070 Ti) |
Números
Placar oficial (conferido por nós, 5/10/2026)
| Edição | Sistema | Score oficial | Capability | Rank |
|---|---|---|---|---|
| JevBench v1.5.7 | Winnow-12B Q8 | 73,2 | 79,3 | #2 |
Co-líder estatístico com o Cygnet (73,7) segundo a nota do próprio site. Capability é manchete separada do score oficial.
Painéis do autor (UnverifiedClaim)
| Suite | Winnow Q8 | Winnow BF16 | Jev 1.13 hospedado (OpenRouter) |
|---|---|---|---|
| JevBench público 231 | 85,71% | 85,28% | 85,71% |
| Kev-v9 clean 1.046 | 81,55% | 81,45% | 87,00% |
| Typed teacher agreement 2.000 | 70,00% | 70,20% | 73,80% |
| ECE JevBench público (↓ melhor) | 0,0742 | 0,0655 | 0,0474 |
Fonte: docs/BENCHMARKS.md (medido em 21/09/2026 numa RTX PRO 5000). Sem temperature ajustada nesses outputs de avaliação.
Fit / anti-fit
Serve quando você precisa: System One local forte numa GPU consumer/pro, /v1/systemone compatível com TypeSafe, e chat/visão opcionais dos mesmos pesos.
Não serve quando você precisa: API hospedada com SLA, serving safetensors/vLLM-first, ou garantia de que os benches do autor são held-out de todas as famílias relacionadas.
Alertas
- GGUF-first: o snippet automático do Hub pode apontar para o arquivo pequeno de assistant MTP — escolha o GGUF alvo Winnow (Q8/BF16/NVFP4).
- NVFP4 / reasoning / MTP: menor footprint e receitas adaptativas opcionais trocam qualidade; decisões nativas diretas são o contrato padrão.
- s1-pro: o Benchmark Heaven nota o Winnow como modelo por trás do System1 Models s1-pro; não auditamos esse produto — trate como pista, não como prova de produção nesta ficha.
Conta das notas (5/10/2026)
- Maturidade = disp. 8 × 0,30 + docs 9 × 0,25 + integr. 7 × 0,25 + suporte 1 × 0,20 = 2,40 + 2,25 + 1,75 + 0,20 = 6,60
- Capability = tipos 10 × 0,30 + calib. 7 × 0,25 + latência 8 × 0,25
[vendor]+ acurácia 8 × 0,20 = 3,00 + 1,75 + 2,00 + 1,60 = 8,35 → 8,4 - Adoção = engaj. 20 × 0,35 + ecossistema 10 × 0,35 + produção 2 × 0,30 = 7,00 + 3,50 + 0,60 = 11,10 → 11
Acurácia 8: placar público oficial (#2 com 73,2), não o % do subset do autor. Calibração fica em 7 (ECE/método publicados, rodada do autor).
