AutoJev-27B

Última atualização:

Aberto—$0/M input

Notas do quadrante

Ver o quadrante completo

Pontuação pela rubrica pública do quadrante (maturidade × capability; bolha = adoção). Revisamos conforme a evidência.

  • Maturidade5.1/10

    Pesos públicos Apache-2.0 e código MIT com scripts de treino, servidor /v1/systemone e playground no navegador, então o SDK da TypeSafe funciona via base_url. Card curto, corpus de treino fora do pacote, só self-host.

  • Capability7.2/10

    Noul, Choice e Score numa passada. #4 no Decision Index 0.2.1 oficial (56,40 vs Jev 57,91), com ECE medido pelo índice de 0,018, melhor que o 0,043 do próprio autor. O ajuste de temperatura está documentado. Sem números de latência.

  • Adoção11/100

    Cerca de 47 likes e mil downloads no HF, 110 estrelas e 10 forks no GitHub, e um GGUF da comunidade com ~3 mil downloads que exige um fork do llama.cpp. Sem uso em produção reportado.

Vendor claims

O AutoJev-27B é um modelo de decisão aberto publicado pelo usuário denis-pplx no Hugging Face e no GitHub em 19 de setembro de 2026. É um fine-tune com todos os pesos do Qwen/Qwen3.8-27B que devolve probabilidades sobre as opções que você manda, numa passada por pergunta. O repo traz um servidor que fala POST /v1/systemone com choice, noul e score, um playground no navegador e suporte opcional a imagens em base64.

O autor descreve o projeto como uma “independent implementation inspired by Jev”. Não é produto da TypeSafe e, pelo que o card diz, não foi treinado com saídas do Jev. Também não tem relação com o AutoTrust JEV, que tem nome parecido.

Ficha

Atributo Valor
Autor denis-pplx (HF + GitHub)
Lançamento 19/09/2026 (repo no HF às 16:54 BRT; repo no GitHub criado no mesmo dia)
Modelo base Qwen/Qwen3.8-27B
Parâmetros 26,1B (BF16, ~49 GiB de pesos)
Treino SFT com todos os pesos numa H200, 73.000 exemplos únicos, 286 updates; publicado o checkpoint 200; temperatura escalar ajustada à parte
Dados de treino Gerados e curados pelo pipeline de agentes do autor; o corpus exato não vem no pacote
API POST /v1/systemone (choice, noul, score, images opcional); docs FastAPI em /docs
Licença Pesos Apache-2.0, código MIT
Latência Sem números publicados (0–0ms no frontmatter quer dizer “sem dado”)

Decision Index 0.2.1 (Space oficial)

Medido pelo Space oficial do Decision Index (dados de 28/09/2026, 71 sistemas):

Sistema Index (balanced skill) Posição
Jev 1.13 57,91 #1
Surogate Rune 26B-A4B v3 57,44 #2
AutoJev-27B 56,40 #4
simple-jev (Qwen3.8-27B, runtime) 55,74 #5

O índice também mede calibração: para o AutoJev-27B, acurácia 0,730, confiança média 0,738, ECE 0,018 e Brier 0,361. É mais apertado que o ECE informado pelo próprio autor.

Vale notar a distância para o simple-jev, que usa a mesma base Qwen3.8-27B congelada: 0,66 ponto. A maior parte da acurácia do AutoJev vem do modelo base; o fine-tune acrescenta uma leitura de decisão treinada e calibração melhor.

Resultados do próprio autor (UnverifiedClaim)

Modelo Acurácia geral ECE Brier
Qwen3.8-27B 69,83% 0,0648 0,408
AutoJev-27B 84,60% 0,0428 0,220
Jev 82,79% 0,0527 0,254

Esses números vêm do conjunto held-out curado pelo autor (holdout-v3), que não é público. Ganhar do Jev no próprio conjunto de teste é outra afirmação, diferente de empatar com o Jev em suítes públicas; no índice oficial o AutoJev fica 1,5 ponto abaixo do Jev.

GGUF da comunidade

O thomasgauthier/autojev-27b-GGUF traz um quant Q4_K_M e o projetor de visão (~3 mil downloads). Ele não roda no llama.cpp oficial nem no LM Studio: é preciso o fork jev.cpp, que adiciona o head classificador do AutoJev e a flag --system-one no servidor. Outra cópia, arafathusayn/autojev-27b, é só um reupload.

Quando usar / quando não usar

Serve quando você precisa de: um endpoint local compatível com a TypeSafe e com calibração boa medida por terceiros, decisões de gating e roteamento de agentes, ou uma base para estudar (o código de treino é público).

Não serve quando você precisa de: GPU pequena (cerca de 49 GiB de pesos BF16 mais overhead), latência publicada, acurácia em imagens naturais (o autor diz que o suporte a imagem não é promessa de acurácia) ou acesso ao corpus de treino.

Limites

  • O corpus de treino não é público; a acurácia de destaque é num held-out privado.
  • O card ainda diz “while the weights are private, authenticate”; o repo estava público e sem gate quando checamos em 30/09/2026.
  • “Feito por agentes autônomos” descreve o processo do autor; não muda a forma como o modelo é avaliado aqui.
  • Sem números de latência ou throughput.

Os pesos passaram por fine-tune completo para decisão tipada e vêm com servidor aberto compatível com o System One que devolve probabilidades. Isso passa nos critérios do catálogo. O índice oficial coloca o modelo entre as melhores entradas abertas.