AutoJev-27B
Notas do quadrante
Ver o quadrante completoPontuação pela rubrica pública do quadrante (maturidade × capability; bolha = adoção). Revisamos conforme a evidência.
- Maturidade5.1/10
Pesos públicos Apache-2.0 e código MIT com scripts de treino, servidor /v1/systemone e playground no navegador, então o SDK da TypeSafe funciona via base_url. Card curto, corpus de treino fora do pacote, só self-host.
- Capability7.2/10
Noul, Choice e Score numa passada. #4 no Decision Index 0.2.1 oficial (56,40 vs Jev 57,91), com ECE medido pelo índice de 0,018, melhor que o 0,043 do próprio autor. O ajuste de temperatura está documentado. Sem números de latência.
- Adoção11/100
Cerca de 47 likes e mil downloads no HF, 110 estrelas e 10 forks no GitHub, e um GGUF da comunidade com ~3 mil downloads que exige um fork do llama.cpp. Sem uso em produção reportado.
Vendor claims
- Acurácia geral de 84,60% vs Jev 82,79% e Qwen3.8-27B 69,83%; ECE 0,043 vs Jev 0,053 (conjunto held-out do próprio autor)[Claim do fornecedor — não verificado independentemente]
- Uma H200, SFT com todos os pesos, 73.000 exemplos únicos, 286 updates; o checkpoint publicado é o do passo 200[Claim do fornecedor — não verificado independentemente]
- Pesquisa, geração de dados, treino, avaliação e deploy executados por agentes autônomos[Claim do fornecedor — não verificado independentemente]
O AutoJev-27B é um modelo de decisão aberto publicado pelo usuário denis-pplx no Hugging Face e no GitHub em 19 de setembro de 2026. É um fine-tune com todos os pesos do Qwen/Qwen3.8-27B que devolve probabilidades sobre as opções que você manda, numa passada por pergunta. O repo traz um servidor que fala POST /v1/systemone com choice, noul e score, um playground no navegador e suporte opcional a imagens em base64.
O autor descreve o projeto como uma “independent implementation inspired by Jev”. Não é produto da TypeSafe e, pelo que o card diz, não foi treinado com saídas do Jev. Também não tem relação com o AutoTrust JEV, que tem nome parecido.
Ficha
| Atributo | Valor |
|---|---|
| Autor | denis-pplx (HF + GitHub) |
| Lançamento | 19/09/2026 (repo no HF às 16:54 BRT; repo no GitHub criado no mesmo dia) |
| Modelo base | Qwen/Qwen3.8-27B |
| Parâmetros | 26,1B (BF16, ~49 GiB de pesos) |
| Treino | SFT com todos os pesos numa H200, 73.000 exemplos únicos, 286 updates; publicado o checkpoint 200; temperatura escalar ajustada à parte |
| Dados de treino | Gerados e curados pelo pipeline de agentes do autor; o corpus exato não vem no pacote |
| API | POST /v1/systemone (choice, noul, score, images opcional); docs FastAPI em /docs |
| Licença | Pesos Apache-2.0, código MIT |
| Latência | Sem números publicados (0–0ms no frontmatter quer dizer “sem dado”) |
Decision Index 0.2.1 (Space oficial)
Medido pelo Space oficial do Decision Index (dados de 28/09/2026, 71 sistemas):
| Sistema | Index (balanced skill) | Posição |
|---|---|---|
| Jev 1.13 | 57,91 | #1 |
| Surogate Rune 26B-A4B v3 | 57,44 | #2 |
| AutoJev-27B | 56,40 | #4 |
| simple-jev (Qwen3.8-27B, runtime) | 55,74 | #5 |
O índice também mede calibração: para o AutoJev-27B, acurácia 0,730, confiança média 0,738, ECE 0,018 e Brier 0,361. É mais apertado que o ECE informado pelo próprio autor.
Vale notar a distância para o simple-jev, que usa a mesma base Qwen3.8-27B congelada: 0,66 ponto. A maior parte da acurácia do AutoJev vem do modelo base; o fine-tune acrescenta uma leitura de decisão treinada e calibração melhor.
Resultados do próprio autor (UnverifiedClaim)
| Modelo | Acurácia geral | ECE | Brier |
|---|---|---|---|
| Qwen3.8-27B | 69,83% | 0,0648 | 0,408 |
| AutoJev-27B | 84,60% | 0,0428 | 0,220 |
| Jev | 82,79% | 0,0527 | 0,254 |
Esses números vêm do conjunto held-out curado pelo autor (holdout-v3), que não é público. Ganhar do Jev no próprio conjunto de teste é outra afirmação, diferente de empatar com o Jev em suítes públicas; no índice oficial o AutoJev fica 1,5 ponto abaixo do Jev.
GGUF da comunidade
O thomasgauthier/autojev-27b-GGUF traz um quant Q4_K_M e o projetor de visão (~3 mil downloads). Ele não roda no llama.cpp oficial nem no LM Studio: é preciso o fork jev.cpp, que adiciona o head classificador do AutoJev e a flag --system-one no servidor. Outra cópia, arafathusayn/autojev-27b, é só um reupload.
Quando usar / quando não usar
Serve quando você precisa de: um endpoint local compatível com a TypeSafe e com calibração boa medida por terceiros, decisões de gating e roteamento de agentes, ou uma base para estudar (o código de treino é público).
Não serve quando você precisa de: GPU pequena (cerca de 49 GiB de pesos BF16 mais overhead), latência publicada, acurácia em imagens naturais (o autor diz que o suporte a imagem não é promessa de acurácia) ou acesso ao corpus de treino.
Limites
- O corpus de treino não é público; a acurácia de destaque é num held-out privado.
- O card ainda diz “while the weights are private, authenticate”; o repo estava público e sem gate quando checamos em 30/09/2026.
- “Feito por agentes autônomos” descreve o processo do autor; não muda a forma como o modelo é avaliado aqui.
- Sem números de latência ou throughput.
Por que está no catálogo
Os pesos passaram por fine-tune completo para decisão tipada e vêm com servidor aberto compatível com o System One que devolve probabilidades. Isso passa nos critérios do catálogo. O índice oficial coloca o modelo entre as melhores entradas abertas.
