Bandits publica receita para pós-treinar seu próprio juiz de traces no estilo Jev. Vence o Jev num benchmark, e nenhum peso é liberado

Última atualização:

Source

Em 30 de setembro de 2026 (13:41 BRT), Laxman, da bandr.ai, postou “Releasing Your Own Jev”: uma receita dentro do toolkit de mineração de traces Bandits para pós-treinar um modelo pequeno com os traces do seu próprio agente. O modelo julga cada passo do agente como success, unclear ou failure numa passada, com uma probabilidade para cada opção. A thread dá crédito ao Nimble, ao Kev e ao AutoJev por “provar a receita”.

O que é. O pacote recipes/jev faz LoRA (rank 16) no Qwen/Qwen3.5-4B-Base com decisões rotuladas, seja por votos do verificador do Bandits, seja por um JSONL seu. Ele lê os logits das letras das opções no Answer:, ajusta uma temperatura num split de calibração e gera um placar contra a baseline de classe majoritária, o modelo sem treino e o Jev da TypeSafe via API. As perguntas são Choice com 2–26 opções. Há uma UI local de treino, mas não há servidor de inferência nem endpoint /v1/systemone.

O que falta. Nenhum checkpoint treinado no Hugging Face (buscas por bandr-ai, bandits e pelo autor não retornam nada), e o repo não tem arquivo de licença, então “completamente open source” ainda não vale no sentido legal. A thread fala em 4B/8B/27B, mas os resultados publicados cobrem só o 4B, e o plano de lançamento do repo deixa 27B+ fora do escopo.

Os números (UnverifiedClaim). Os resultados de teste travados do repo (28/09/2026, uma seed) cobrem 1.920 passos held-out de 36 tarefas do AgentProcessBench. Eles reportam 79,1% de concordância com rótulos humanos contra 66,8% do Jev 1.13, +12,3 pontos (IC 95% +7,3 a +17,3). O modelo tem ECE 0,012 e roda com p50 de 0,135 s numa L40S. A thread e o vídeo dizem 79,7% vs 66,3% (+13,4) e acrescentam o DeepSeek-V4.1-Flash com 65,3%; o repo não tem linha do DeepSeek. Os números por fonte também divergem: o “customer service 80,3%” da thread aparece como 78,8% (τ²-bench) no repo.

As ressalvas do próprio repo valem a leitura:

  • O 4B treinou em 135 tarefas do AgentProcessBench, e o Jev viu o benchmark a frio.
  • Os dois receberam um prompt escrito para o 4B.
  • A latência do Jev inclui a rede.
  • O Jev sai mais barato por 1.000 decisões (US$ 0,058 vs US$ 0,077).
  • No TRAIL, nenhum dos dois supera marcar todo passo como erro.

O resultado da thread “iguala um verificador de 30B, 36× mais rápido” (77,9% contra 75,6% de autoconcordância do verificador) aparece no repo em “Not claimed”: o verificador entrou em loop na temperatura 0 e precisou de novas rodadas com configurações alteradas em 51 dos 172 passos de teste.

Como listamos. É news, não entrada de catálogo. Treina pesos de decisão de verdade, como Nimble, Kev ou AutoJev, mas não publica checkpoint, não tem licença e não oferece como servir um modelo. O resultado de benchmark também é de um juiz específico de tarefa, medido in-distribution. Fica listado em Runtimes como method (receita de treino sem modelo publicado) e segue na nossa lista de observação. Se o adapter aparecer no Hugging Face com licença, vai para o catálogo como lora-adapter.