Jev-Style-0.8B-Decision-v3
Notas do quadrante
Ver o quadrante completoPontuação pela rubrica pública do quadrante (maturidade × capability; bolha = adoção). Revisamos conforme a evidência.
- Maturidade5.6/10
Pesos abertos em torch, MLX e GGUF, pacote no PyPI (jev-style 0.2.0), servidor local no formato /v1/systemone, ferramentas MCP, um guard para o Claude Code e seis skills de agente. Tudo do próprio autor; o repo do runtime tem um dia. Só self-host, sem SLA.
- Capability6.8/10
noul / choice / score de primeira classe, temperaturas por grupo ajustadas em dados separados, entradas de 25,6k tokens. Avaliações fortes e bem documentadas, mas rodadas pelo autor; as vitórias são contra o Laya, e o autor diz que o Jev hospedado fica à frente onde há números.
- Adoção12/100
A família tem downloads de verdade (só o GGUF v1 de 2B soma ~6 mil), mas o v3 tem dois dias: ~790 downloads e 12 likes somando as builds, 3 estrelas no GitHub, nenhum post de lançamento encontrado. Nenhum uso em produção reportado.
Vendor claims
- Banking77 (77 intenções, nunca treinado): 68,2% vs 49,2% do melhor checkpoint oficial do Laya[Claim do fornecedor — não verificado independentemente]
- MASSIVE intent, 37 locales fora do treino: 65,5% vs 36,1% do Laya multilíngue; média de 71,7% em 51 locales[Claim do fornecedor — não verificado independentemente]
- JevBench v1.4.1, itens públicos, zero-shot, rodado pelo autor com o harness oficial: 64,1% (148/231, IC 95% 57,7–70,0%); não é entrada no leaderboard[Claim do fornecedor — não verificado independentemente]
- Decisões tipadas 79,2% (1.583/2.000), in-domain (treinado no split de treino); +2,6 pontos sobre o checkpoint tipado do Laya[Claim do fornecedor — não verificado independentemente]
- tweet_topic zero-shot: 75,5% vs 79,3% do Jev 1.13 (números de um estudo de terceiros); ECE 0,027 vs 0,063[Claim do fornecedor — não verificado independentemente]
- Até 25.600 tokens de entrada; 98,3% em 1.280 itens reais de 24K tokens; claim de contexto longo pré-registrado e aprovado[Claim do fornecedor — não verificado independentemente]
- Cerca de 0,15–0,2 s por request curto com MLX num Apple M1 Max, depois da primeira chamada[Claim do fornecedor — não verificado independentemente]
- O guard do Claude Code concorda com 77,6% de 49 chamadas de ferramenta rotuladas à mão; nenhuma chamada rotulada como deny foi liberada[Claim do fornecedor — não verificado independentemente]
Jev-Style-0.8B-Decision-v3 é um modelo de decisão pequeno e aberto, feito com fine-tune de todos os pesos do Qwen3.5-0.8B. Mande texto ou JSON com perguntas tipadas e ele devolve uma probabilidade para cada opção, numa passada, sem gerar texto. É a terceira geração de uma série independente (vieram antes duas versões LoRA de 2B) e a primeira que merece entrada própria no catálogo: menor, fine-tune completo, sem limite no número de opções e com um ferramental local de verdade em volta.
Não é TypeSafe, e o autor deixa claro que nenhum peso, código ou saída do Jev foi usado. “Jev-Style” descreve o tipo de modelo.
Pesos: Hugging Face chaoliangUNSW/Jev-Style-0.8B-Decision-v3 (Apache-2.0), mais builds MLX e GGUF. Runtime e ferramentas para agentes: github.com/lawrence3699/jev-style, que o card aponta como o GitHub do projeto. Demo: HF Space.
Especificações
| Atributo | Valor |
|---|---|
| Autor | chaoliangUNSW (independente) |
| Modelo base | Qwen/Qwen3.5-0.8B (só texto; torre de visão e cabeça MTP removidas) |
| Treino | Fine-tune completo em bf16, uma H100, ~96 min, 131,4M tokens, base de 321.756 linhas em 19 idiomas |
| Parâmetros | 752.393.024 (API do HF) |
| Leitura | “Verdict slot” por opção: logit(" yes") − logit(" no") no fim da linha de cada opção, usando os embeddings amarrados. Nenhum parâmetro novo |
| Calibração | 20 temperaturas por grupo mais uma global de 0,880, ajustadas em 15.655 linhas separadas |
| Tipos de decisão | noul (sim/não), choice (qualquer número de opções; 77 testadas numa passada), score (2–10 níveis) |
| Contexto | Até 25.600 tokens de entrada, cabeça até 2.048; entradas acima do limite são rejeitadas, nunca truncadas |
| Builds | safetensors bf16 1,50 GB · MLX bf16 / 8-bit · GGUF F16 / Q8_0 / Q4_K_M (0,53 GB) |
| Licença | Apache-2.0 (pesos e código); veja a ressalva sobre dados de treino abaixo |
| Lançamento | (HF) |
| Runtime | pip install "jev-style[torch]" ou [mlx] (PyPI 0.2.0); jev-style serve na porta 8765 |
Ferramental
O repo do runtime é o que diferencia este modelo da maioria dos peers pequenos:
jev-style serveé um servidor local que segue o formato público de request do/v1/systemone, com um Playground. Escolhe MLX no Apple Silicon e PyTorch no resto; llama.cpp é opcional.- Servidor MCP com as ferramentas
decide,noul,choiceescore. - Guard para o Claude Code, um hook
PreToolUseque devolve allow / ask / deny. Nas 49 chamadas rotuladas à mão que vêm no pacote, concorda 77,6% das vezes e nunca liberou uma chamada rotulada como deny (UnverifiedClaim). O autor o apresenta como segunda linha de defesa, não como sandbox. jev-style evalmostra acurácia, Brier, ECE e quanto daria para automatizar com orçamento de erro de 1, 5 ou 10%, nos seus próprios rótulos.- Seis skills de agente, instaláveis com
npx skills add lawrence3699/jev-style.
Benchmarks do autor
Todos os números vêm do card do modelo, que traz protocolos, intervalos de confiança e arquivos de dados. São reportados pelo autor → UnverifiedClaim.
| Benchmark | Jev-Style v3 | Comparação | Nota de protocolo |
|---|---|---|---|
| Banking77, 77 intenções | 68,2% | Melhor Laya 49,2% | Nunca treinado no Banking77; Laya rodado de novo pelo autor |
| MASSIVE intent, 37 locales fora do treino | 65,5% | Laya multilíngue 36,1% | Outros 14 locales estavam no treino |
| tweet_topic, zero-shot | 75,5% | Jev 1.13: 79,3% | Número do Jev tirado de um estudo de terceiros, não rodado de novo |
| JevBench v1.4.1 público (231 itens) | 64,1% | Laya 58,4% (board) | Rodado pelo autor; o Laya fica dentro do IC do v3 |
| Decisões tipadas (2.000) | 79,2% | Laya tipado 76,6% | In-domain para os dois; os 72,7% do Jev são zero-shot |
O card é bem franco sobre o que esses números mostram e o que não mostram. O Jev hospedado tem acurácia maior que o v3 em todos os conjuntos onde há número publicado do Jev, e o autor chama o v3 de “a opção pequena e local, não um substituto do modelo hospedado”. O número de decisões tipadas é in-domain, e o card explica que os rótulos-ouro ali vêm de um professor de ~4B, então nota alta mede em parte concordância com esse professor.
Limitações
- Avaliações rodadas pelo autor. Bem feitas, com pré-registro para o claim de contexto longo, mas ninguém de fora rodou de novo.
- Abaixo do Jev em toda comparação publicada, segundo o próprio autor.
- Licenças dos dados de treino. O card lista datasets com termos só para pesquisa ou indefinidos (DAIR Emotion, AG News, SST-5, MNLI e outros) e dados de treino escritos ou rotulados por modelos da OpenAI e da Anthropic. Os pesos são Apache-2.0, mas confira esses termos antes de uso comercial.
- Listas longas de opções são quebradas em pedaços. Listas de choice que não cabem na cabeça de 2.048 tokens são pontuadas em blocos, com um softmax único sobre todas as opções (atualização do runtime de 26/09).
- O modo em lote troca exatidão por velocidade. O caminho GGUF
many_mode="batched"pode inverter respostas quase empatadas; o modo padrão bate com uma chamada por pergunta. - Cedo. O repo do runtime foi criado em 25/09 e tem 3 estrelas; as APIs podem mudar.
- Sem opção hospedada nem SLA.
Quando usar / quando não usar
Usar quando precisar: um modelo de decisão local no notebook, gate para chamadas de ferramenta de agentes, muitas perguntas sobre um documento longo, intenção ou roteamento multilíngue, um servidor local para código escrito no formato /v1/systemone.
Não usar quando precisar: a acurácia do Jev hospedado, uma cadeia de licenças limpa nos dados de treino para uso comercial, ou SLA hospedado.
Por que está no catálogo
Passa no teste de pesos treinados: é um fine-tune completo para decisão tipada, com leitura própria e temperaturas ajustadas, não um wrapper de logits sobre um modelo congelado. Devolve decisões tipadas, é público e tem API documentada. Ocupa o espaço sub-1B local com Tiny-Jev, Lumma-fev e Laya, e traz o ferramental para agentes mais completo desse grupo.
