bev-decider-0.4B
Notas do quadrante
Ver o quadrante completoPontuação pela rubrica pública do quadrante (maturidade × capability; bolha = adoção). Revisamos conforme a evidência.
- Maturidade5.1/10
Pesos abertos, pacote no PyPI (bev-decider 0.2.1) com servidor local /v1/systemone e dataset de treino público. Os pesos são CC-BY-NC-4.0, o que exclui uso comercial. Um único mantenedor, sem API hospedada nem SLA.
- Capability6.3/10
Noul / Choice / Score num único forward pass, invariante à ordem das opções por construção. ECE de 0,065 declarado sem método publicado. Sem número de latência. Acurácia rodada pelo autor no próprio split e em sets públicos; fora do Decision Index.
- Adoção3/100
Três dias de vida: ~115 downloads no HF, 10 likes, repo novo no GitHub sem estrelas. Nenhuma integração ou uso em produção reportado.
Vendor claims
- 74,7% vs 78,0% do Jev 1.13 em 5.000 perguntas held-out do split próprio bev-decision (Score 63,7 vs 59,3)[Claim do fornecedor — não verificado independentemente]
- JevBench 65,8% vs Laya 58,4%; sysone-bench v2 70,8% vs Laya 68,6% (Jev publicado: 90,7%)[Claim do fornecedor — não verificado independentemente]
- Erro de calibração esperado (ECE) de 0,065 no sysone-bench[Claim do fornecedor — não verificado independentemente]
- Invariante à ordem: em 960 embaralhamentos de 3–12 opções, nenhuma probabilidade mudou mais de 1e-5 (fp32)[Claim do fornecedor — não verificado independentemente]
Leia antes
- Pesos não comerciais. O modelo sai sob CC-BY-NC-4.0 porque parte das fontes de treino é não comercial. O código (GitHub, PyPI) é Apache-2.0, mas isso não cobre os pesos. Não use em produto comercial.
- A comparação principal com o Jev é no split do próprio autor (mesma distribuição dos dados de treino). No sysone-bench, o score publicado do Jev é 90,7% contra 70,8% do bev-decider. Todos os números são UnverifiedClaim.
O bev-decider-0.4B é um modelo de decisão aberto e pequeno do avbiswas, publicado no Hugging Face em 28 de setembro de 2026 (12:58 BRT). Ele mantém as 20 primeiras das 28 camadas do Qwen3-0.6B, funde nelas um LoRA de rank 8 e acrescenta um pequeno head de atenção de duas camadas que compara as opções. Toda opção começa na mesma posição e não enxerga as outras dentro do backbone, então embaralhar as opções não muda a resposta. Responde perguntas no formato do Jev (Noul, Choice, Score) num único forward pass e roda na CPU de um laptop.
Especificações
| Atributo | Valor |
|---|---|
| Autor | avbiswas (independente) |
| Base | Qwen/Qwen3-0.6B, 20 primeiras de 28 camadas, LoRA r=8 fundido |
| Head | Head de self-attention de 2 camadas, 512 dim, embedding de tipo de tarefa |
| Parâmetros | ≈0,4B segundo o card (477,6M na contagem do Hugging Face, com embeddings) |
| Dados de treino | ~940 mil perguntas; dataset avbiswas/bev-decision |
| Contexto | Treinado com estados de até 1.024 tokens; limite padrão de 2.048; 64 tokens por opção |
| Tipos de pergunta | Noul, Choice, Score |
| Serving | pip install "bev-decider[serve]" → bev-decider serve expõe /v1/systemone |
| Licença | CC-BY-NC-4.0 (pesos); Apache-2.0 (código) |
| Lançamento |
Evidências (UnverifiedClaim)
| Benchmark | bev-decider-0.4B | Jev 1.13 | Kev 0.8B | Laya |
|---|---|---|---|---|
| Split held-out próprio (5.000 perg.) | 74,7 | 78,0 | 56,6 | 50,4 |
| sysone-bench v2 (eval) | 70,8 | 90,7 (publicado) | — | 68,6 (publicado) |
| JevBench (itens públicos) | 65,8 | — | — | 58,4 |
O autor rodou Kev e bev-decider localmente; as linhas de Jev e Laya no sysone-bench são números publicados. ECE no sysone-bench: 0,065.
Quando usar / quando evitar
Usar: pesquisa, hobby e protótipos internos que precisam de um decisor local bem pequeno (roteamento de suporte, checagens simples de política) com escolhas independentes da ordem.
Evitar: qualquer uso comercial (licença); documentos longos (treinado com 1.024 tokens); verificação de respostas e raciocínio temporal, em que a própria tabela do autor mostra distância de 12–21 pontos para o Jev.
Limites
- Nenhum número de latência publicado.
- Só inglês.
- O método de calibração não é descrito; só o número de ECE.
Por que está no catálogo
Treina pesos de decisão próprios (LoRA fundido mais um head novo), devolve probabilidades no formato System One e traz um servidor local /v1/systemone. A licença não comercial limita quem pode usar, mas não muda o fato de ser um modelo de decisão; por isso entra com a ressalva no topo.
