Jev-Style-0.8B-Decision-v3

Última atualização:

Aberto150–200ms$0/M input

Notas do quadrante

Ver o quadrante completo

Pontuação pela rubrica pública do quadrante (maturidade × capability; bolha = adoção). Revisamos conforme a evidência.

  • Maturidade5.6/10

    Pesos abertos em torch, MLX e GGUF, pacote no PyPI (jev-style 0.2.0), servidor local no formato /v1/systemone, ferramentas MCP, um guard para o Claude Code e seis skills de agente. Tudo do próprio autor; o repo do runtime tem um dia. Só self-host, sem SLA.

  • Capability6.8/10

    noul / choice / score de primeira classe, temperaturas por grupo ajustadas em dados separados, entradas de 25,6k tokens. Avaliações fortes e bem documentadas, mas rodadas pelo autor; as vitórias são contra o Laya, e o autor diz que o Jev hospedado fica à frente onde há números.

  • Adoção12/100

    A família tem downloads de verdade (só o GGUF v1 de 2B soma ~6 mil), mas o v3 tem dois dias: ~790 downloads e 12 likes somando as builds, 3 estrelas no GitHub, nenhum post de lançamento encontrado. Nenhum uso em produção reportado.

Vendor claims

Jev-Style-0.8B-Decision-v3 é um modelo de decisão pequeno e aberto, feito com fine-tune de todos os pesos do Qwen3.5-0.8B. Mande texto ou JSON com perguntas tipadas e ele devolve uma probabilidade para cada opção, numa passada, sem gerar texto. É a terceira geração de uma série independente (vieram antes duas versões LoRA de 2B) e a primeira que merece entrada própria no catálogo: menor, fine-tune completo, sem limite no número de opções e com um ferramental local de verdade em volta.

Não é TypeSafe, e o autor deixa claro que nenhum peso, código ou saída do Jev foi usado. “Jev-Style” descreve o tipo de modelo.

Pesos: Hugging Face chaoliangUNSW/Jev-Style-0.8B-Decision-v3 (Apache-2.0), mais builds MLX e GGUF. Runtime e ferramentas para agentes: github.com/lawrence3699/jev-style, que o card aponta como o GitHub do projeto. Demo: HF Space.

Especificações

Atributo Valor
Autor chaoliangUNSW (independente)
Modelo base Qwen/Qwen3.5-0.8B (só texto; torre de visão e cabeça MTP removidas)
Treino Fine-tune completo em bf16, uma H100, ~96 min, 131,4M tokens, base de 321.756 linhas em 19 idiomas
Parâmetros 752.393.024 (API do HF)
Leitura “Verdict slot” por opção: logit(" yes") − logit(" no") no fim da linha de cada opção, usando os embeddings amarrados. Nenhum parâmetro novo
Calibração 20 temperaturas por grupo mais uma global de 0,880, ajustadas em 15.655 linhas separadas
Tipos de decisão noul (sim/não), choice (qualquer número de opções; 77 testadas numa passada), score (2–10 níveis)
Contexto Até 25.600 tokens de entrada, cabeça até 2.048; entradas acima do limite são rejeitadas, nunca truncadas
Builds safetensors bf16 1,50 GB · MLX bf16 / 8-bit · GGUF F16 / Q8_0 / Q4_K_M (0,53 GB)
Licença Apache-2.0 (pesos e código); veja a ressalva sobre dados de treino abaixo
Lançamento (HF)
Runtime pip install "jev-style[torch]" ou [mlx] (PyPI 0.2.0); jev-style serve na porta 8765

Ferramental

O repo do runtime é o que diferencia este modelo da maioria dos peers pequenos:

  • jev-style serve é um servidor local que segue o formato público de request do /v1/systemone, com um Playground. Escolhe MLX no Apple Silicon e PyTorch no resto; llama.cpp é opcional.
  • Servidor MCP com as ferramentas decide, noul, choice e score.
  • Guard para o Claude Code, um hook PreToolUse que devolve allow / ask / deny. Nas 49 chamadas rotuladas à mão que vêm no pacote, concorda 77,6% das vezes e nunca liberou uma chamada rotulada como deny (UnverifiedClaim). O autor o apresenta como segunda linha de defesa, não como sandbox.
  • jev-style eval mostra acurácia, Brier, ECE e quanto daria para automatizar com orçamento de erro de 1, 5 ou 10%, nos seus próprios rótulos.
  • Seis skills de agente, instaláveis com npx skills add lawrence3699/jev-style.

Benchmarks do autor

Todos os números vêm do card do modelo, que traz protocolos, intervalos de confiança e arquivos de dados. São reportados pelo autor → UnverifiedClaim.

Benchmark Jev-Style v3 Comparação Nota de protocolo
Banking77, 77 intenções 68,2% Melhor Laya 49,2% Nunca treinado no Banking77; Laya rodado de novo pelo autor
MASSIVE intent, 37 locales fora do treino 65,5% Laya multilíngue 36,1% Outros 14 locales estavam no treino
tweet_topic, zero-shot 75,5% Jev 1.13: 79,3% Número do Jev tirado de um estudo de terceiros, não rodado de novo
JevBench v1.4.1 público (231 itens) 64,1% Laya 58,4% (board) Rodado pelo autor; o Laya fica dentro do IC do v3
Decisões tipadas (2.000) 79,2% Laya tipado 76,6% In-domain para os dois; os 72,7% do Jev são zero-shot

O card é bem franco sobre o que esses números mostram e o que não mostram. O Jev hospedado tem acurácia maior que o v3 em todos os conjuntos onde há número publicado do Jev, e o autor chama o v3 de “a opção pequena e local, não um substituto do modelo hospedado”. O número de decisões tipadas é in-domain, e o card explica que os rótulos-ouro ali vêm de um professor de ~4B, então nota alta mede em parte concordância com esse professor.

Limitações

  • Avaliações rodadas pelo autor. Bem feitas, com pré-registro para o claim de contexto longo, mas ninguém de fora rodou de novo.
  • Abaixo do Jev em toda comparação publicada, segundo o próprio autor.
  • Licenças dos dados de treino. O card lista datasets com termos só para pesquisa ou indefinidos (DAIR Emotion, AG News, SST-5, MNLI e outros) e dados de treino escritos ou rotulados por modelos da OpenAI e da Anthropic. Os pesos são Apache-2.0, mas confira esses termos antes de uso comercial.
  • Listas longas de opções são quebradas em pedaços. Listas de choice que não cabem na cabeça de 2.048 tokens são pontuadas em blocos, com um softmax único sobre todas as opções (atualização do runtime de 26/09).
  • O modo em lote troca exatidão por velocidade. O caminho GGUF many_mode="batched" pode inverter respostas quase empatadas; o modo padrão bate com uma chamada por pergunta.
  • Cedo. O repo do runtime foi criado em 25/09 e tem 3 estrelas; as APIs podem mudar.
  • Sem opção hospedada nem SLA.

Quando usar / quando não usar

Usar quando precisar: um modelo de decisão local no notebook, gate para chamadas de ferramenta de agentes, muitas perguntas sobre um documento longo, intenção ou roteamento multilíngue, um servidor local para código escrito no formato /v1/systemone.

Não usar quando precisar: a acurácia do Jev hospedado, uma cadeia de licenças limpa nos dados de treino para uso comercial, ou SLA hospedado.

Passa no teste de pesos treinados: é um fine-tune completo para decisão tipada, com leitura própria e temperaturas ajustadas, não um wrapper de logits sobre um modelo congelado. Devolve decisões tipadas, é público e tem API documentada. Ocupa o espaço sub-1B local com Tiny-Jev, Lumma-fev e Laya, e traz o ferramental para agentes mais completo desse grupo.