Bandits · receita Your own Jev

Última atualização:

MétodoNenhuma (sem arquivo LICENSE)~28 ★

⚠️ Por que não é um modelo

Entrega receita de treino, não modelo: LoRA no Qwen3.5-4B-Base, UI local de treino, placar vs Jev via /v1/systemone. Sem pesos publicados, sem licença.

Especificações técnicas

LLMs base
Qwen/Qwen3.5-4B-Base
Tipos de decisão
choice
Features
training-recipe, lora, local-training-ui, temperature-scaling, scorecard-vs-jev, agent-trace-judge, no-released-weights, no-server
Licença
Nenhuma (sem arquivo LICENSE)

Leia antes

  1. Ainda não há o que baixar. O repo entrega a receita e uma UI local de treino. Nenhum checkpoint treinado está no Hugging Face (buscas por bandr-ai, bandits e pelo autor não retornam nada, 30/09/2026), e o repo não tem arquivo LICENSE, então “completamente open source” não vale no sentido legal.
  2. A comparação principal é in-distribution. O 4B deles treinou em 135 tarefas do AgentProcessBench e foi testado em 36 tarefas held-out do mesmo benchmark. O Jev da TypeSafe viu o benchmark a frio, com um prompt escrito para o 4B.
  3. A thread de lançamento promete mais que o repo. Veja “Thread vs repo” abaixo.
  4. “Jev 4B” não é o Jev da TypeSafe. Uma imagem da thread chama o modelo da bandr.ai de “Jev 4B”. Para o modelo hospedado da TypeSafe, veja Jev.

O Bandits é o toolkit da bandr.ai para minerar traces de agentes para pós-treino. O pacote recipes/jev, lançado em 30 de setembro de 2026 como “Releasing Your Own Jev” (13:41 BRT), transforma passos de agente rotulados num modelo de decisão pequeno no estilo Jev, que você treina e roda. A thread dá crédito ao Nimble, ao Kev e ao AutoJev por provar a receita.

Como funciona

  1. Rótulos. Cada passo do agente recebe um rótulo: success (+1), unclear (0) ou failure (−1). Os rótulos vêm dos votos do verificador do Bandits ou de um JSONL seu (state, question, 2–26 options, target, group_id opcional para manter um trace num só split).
  2. Treino. LoRA rank 16 em todas as camadas lineares do Qwen/Qwen3.5-4B-Base, numa GPU de 48 GB (uma L40S). O melhor checkpoint é escolhido no split de dev.
  3. Leitura. Uma passada sobre um prompt fixo que termina em Answer:. Um softmax sobre os logits das letras das opções dá a probabilidade de cada opção.
  4. Calibração. Uma temperatura ajustada num split de calibração.
  5. Placar. jev report compara o verificador, a baseline majoritária, a base sem treino, o modelo treinado e calibrado e o Jev da TypeSafe (chamado via POST /v1/systemone com jev score-api), com intervalos de bootstrap pareados, custo e latência.

jev ui abre uma UI local no navegador para subir dados, treinar e ler o relatório. Não há servidor de inferência nem endpoint /v1/systemone próprio.

Não é um wrapper de logits congelados como o SemIf ou o open-alternative-jev: a receita treina pesos de decisão. Mas o que ela entrega é o método (código, prompt, loop de treino e placar), não um modelo que dê para baixar ou chamar. Todos os outros pares abertos do catálogo, como Nimble, Kev, AutoJev e NeoHorse-Jev, publicam pesos com licença. O schema não tem um kind “recipe”, então esta entrada usa method.

Gatilho de promoção: se a bandr.ai publicar o adapter treinado no Hugging Face com licença, ele vai para o catálogo como lora-adapter, com a ressalva in-distribution no topo.

Resultados do repo (UnverifiedClaim)

Dos resultados de teste travados do repo (28/09/2026, uma seed, Qwen3.5-4B-Base + LoRA). O conjunto de teste tem 1.920 passos held-out de 36 tarefas do AgentProcessBench, rotulados por humanos.

Sistema Acurácia Macro F1 ECE Latência p50
Rótulo majoritário 60,8% 25,2% 0,013 —
Qwen3.5-4B-Base, sem treino 60,7% 35,9% 0,106 0,092 s
Receita (4B + LoRA) 79,1% 52,6% 0,012 0,135 s
Jev 1.13.0 da TypeSafe (API) 66,8% 52,7% 0,073 0,449 s

A diferença é de +12,3 pontos (IC 95% +7,3 a +17,3). As ressalvas do próprio repo:

  • In-distribution: treinou nas outras tarefas do mesmo benchmark, e o Jev viu o benchmark a frio.
  • Prompt: os dois sistemas receberam a mesma entrada, escrita para o 4B. O Jev pode ir melhor com entradas escritas para ele.
  • Macro F1 empatado: o 4B nunca responde “unclear”, que são 5% dos rótulos humanos.
  • Latência não é comparável: a do Jev inclui rede, a do 4B é medida na GPU.
  • Custo: o Jev sai mais barato, cerca de US$ 0,058 vs US$ 0,077 por 1.000 decisões.
  • TRAIL: nenhum dos dois supera marcar todo passo como erro (F1 0,451 do Jev, 0,444 do 4B, 0,558 para “tudo erro”). O split GAIA está contaminado com perguntas do TRAIL.

Thread vs repo

Thread / vídeo de lançamento Repo
79,7% vs Jev 66,3% (+13,4) 79,1% vs 66,8% (+12,3)
Vence o DeepSeek-V4.1-Flash (763B, 65,3%) por 14 pontos Sem linha do DeepSeek nos resultados
Customer service 80,3% τ²-bench 78,8%
Pós-treinado com um verificador de 30B; iguala o verificador (77,9% vs 75,6% de autoconcordância), 36× mais rápido Listado em “Not claimed”: o verificador entrou em loop na temperatura 0 e precisou de novas rodadas com configurações alteradas em 51 dos 172 passos de teste
4B / 8B / 27B Só o 4B foi medido; o plano de lançamento deixa 27B+ fora do escopo
“Completely open source: recipe, data, training, evals” Sem arquivo LICENSE; predições brutas e relatórios estão no gitignore