AutoTrust JEV (Blocks of Experts)
Notas do quadrante
Ver o quadrante completoPontuação pela rubrica pública do quadrante (maturidade × capability; bolha = adoção). Revisamos conforme a evidência.
- Maturidade6.1/10
Pesos Apache-2.0 para 9B e 27B, card longo com relatórios de avaliação, blog no HF e quickstart em vLLM: um engine serve decisões por um módulo LoRA e geração comum pela base congelada. Sem endpoint /v1/systemone, então o SDK da TypeSafe não se aplica. Empresa, sem SLA.
- Capability7.5/10
Noul, Choice (2–16) e Score (0–5). É destilação do Jev fechado: KL 0,017 e ECE 0,0009 medem fidelidade ao professor, in-distribution. Mediana de 137 ms por decisão numa B200, rodada própria. Fora do Decision Index oficial; a rodada própria no índice dá 53,30 ao JEV-27B vs 57,91 do Jev.
- Adoção9/100
Cerca de 31 likes e 1,25 mil downloads no HF somando 9B e 27B, um blog no HF, um press release na PR Newswire e um GGUF de terceiro. Sem integrações além do vLLM e sem uso em produção reportado.
Vendor claims
- Seis benchmarks públicos de decisão: JEV-27B 84,07% vs TypeSafe Jev 1.13 83,85% (a AutoTrust rodou os dois; as outras linhas foram copiadas do NeoHorse)[Claim do fornecedor — não verificado independentemente]
- KL médio ≈ 0,017 em relação às distribuições de saída do Jev 1.13 em 25.376 linhas held-out; ECE 0,0009; concordância top-1 em choice com o Jev de 90,5%[Claim do fornecedor — não verificado independentemente]
- Uma decisão em 137 ms de mediana numa B200 (JEV-9B ≈ 90 ms); 4,2 ms por decisão em lote[Claim do fornecedor — não verificado independentemente]
- HumanEval de 78,0% com e sem o bloco de decisão; as 164 respostas idênticas byte a byte às do Qwen3.8-27B[Claim do fornecedor — não verificado independentemente]
- Rodadas próprias com o kit do Decision Index 0.2.1: JEV-Gemma4-26B-A4B 58,05, JEV-27B 53,30 (fora do leaderboard oficial)[Claim do fornecedor — não verificado independentemente]
- JEV-27B-VL: 78,3% no VL-RewardBench, 'o maior do leaderboard oficial' (rodada própria contra um placar atualizado pela última vez em maio de 2025)[Claim do fornecedor — não verificado independentemente]
Leia antes
- Isto é uma destilação do Jev 1.13 fechado da TypeSafe. A AutoTrust treinou o bloco de decisão no
SargeDev/jev-distill-corpus-v3, um dataset de terceiro cujo maior stream (yuri_v3, 498 mil linhas) tem rótulos “distilled from Jev 1.13 (TypeSafe) via OpenRouter”, segundo o card do dataset. Dos 29.955 alvos de teste, 25.376 são distribuições de saída do Jev. As métricas de fidelidade em destaque (KL ≈ 0,017, ECE 0,0009, 90,5% de concordância top-1) medem o quanto o modelo copia o professor, num split de teste desse mesmo corpus. Não são acurácia contra o gabarito. Não verificamos se esse uso de saídas do Jev respeita os termos da TypeSafe.- O “JEV” aqui não é o produto da TypeSafe. O próprio card da AutoTrust diz que o modelo “is not affiliated with, endorsed by, or a product of TypeSafe AI, and shares no weights or code with it” (não é afiliado, endossado nem produto da TypeSafe AI, e não compartilha pesos nem código com ela). Para o modelo hospedado da TypeSafe, veja o Jev. Esta ficha se chama “AutoTrust JEV” para separar os dois.
- Fora dos leaderboards oficiais. No snapshot de 28/09/2026, os modelos JEV não estão no Decision Index oficial nem no leaderboard do JevBench v1.4.2. A rodada da própria AutoTrust com o kit do índice dá 53,30 ao JEV-27B, 4,6 pontos abaixo dos 57,91 do Jev. Esse número não conversa bem com o destaque de “+0,22 sobre o Jev” da tabela de seis benchmarks.
O que é
A AutoTrust AI (Singapura) chama sua receita de Blocks of Experts. Um modelo pré-treinado forte fica congelado como um “bloco especialista”, e um bloco pequeno e destacável é treinado para uma única habilidade. Nos modelos JEV:
- System 1 (decisões tipadas) é um LoRA treinado mais um head de decisão de 24 slots. Responde
noul,choicecom 2 a 16 opções escorenuma escala fixa de 0 a 5, numa passada de prefill, com uma probabilidade por opção. - System 2 (geração e raciocínio comuns) é o modelo base, idêntico bit a bit ao lançamento. O HumanEval fica em 78,0% com e sem o bloco de decisão, e as 164 respostas são idênticas byte a byte, segundo o card.
Um único engine vLLM serve os dois. Requisições endereçadas ao módulo LoRA jev-decision passam pelo head de decisão como uma completion de um token restrita aos tokens das opções; todo o resto é o Qwen puro. A API é a compatível com OpenAI do vLLM, não o /v1/systemone.
Família
| Repo | Base | Bloco treinado | Criado (BRT) | Notas |
|---|---|---|---|---|
| autotrust/JEV-27B (principal) | Qwen3.8-27B | 108,9M parâmetros (0,4%), ≈ 9,2 horas de B200, ≈ 640 mil linhas | 25/09, 09:58 | KL ≈ 0,017; 137 ms de mediana por decisão |
| autotrust/JEV-9B | Qwen3.5-9B | 40,2M parâmetros, ≈ 3 horas de B200 | 23/09, 09:08 | Primeira geração; KL ≈ 0,019; ≈ 90 ms; HumanEval 70,7% |
| autotrust/JEV-27B-VL | Qwen3.8-27B (multimodal) | Mesmo adapter e head do JEV-27B | 30/09, 02:02 | Aceita imagem |
| autotrust/JEV-Gemma4-26B-A4B | gemma-4-26B-A4B-it | LoRA + head de 24 slots | 29/09, 09:34 | Rodada própria no índice: 58,05 |
Conversão de terceiro: prithivMLmods/JEV-27B-GGUF (28/09; BF16 e Q3_K_M–Q5_K_M). O caminho de decisão documentado pela AutoTrust é o vLLM com adapter_vllm/; o card do GGUF documenta o llama.cpp de forma genérica.
Números da AutoTrust (UnverifiedClaim)
Seis benchmarks públicos de decisão em texto. A AutoTrust rodou o JEV-27B e o Jev 1.13 hospedado (26–27/09). As demais linhas foram copiadas do card do NeoHorse-Jev-4B, sem nova rodada.
| Modelo | JevBench | Kev | OpenJev text | Nimble | VitaminC | MASSIVE-en | Média |
|---|---|---|---|---|---|---|---|
| JEV-27B | 88,70 | 83,75 | 73,89 | 92,91 | 77,46 | 87,71 | 84,07 |
| Jev 1.13 (rodada da AutoTrust) | 87,18 | 85,52 | 72,96 | 91,84 | 78,46 | 87,14 | 83,85 |
| NeoHorse-Jev-4B (como reportado) | 75,73 | 81,92 | 58,74 | 87,23 | 77,13 | 85,43 | 77,70 |
Outras afirmações: no benchmark de terceiro decision-models-under-pressure (gabarito humano, 16 opções), o JEV-27B chega a 96% da acurácia do professor (0,740 vs 0,769), em rodada própria. O card compara seus 137 ms de mediana com os 238–301 ms medidos por outros na API hospedada; os números da API incluem rede e fila. O JEV-27B-VL diz ter 78,3% no VL-RewardBench, acima de um leaderboard atualizado pela última vez em maio de 2025.
Quando usar / quando não usar
Serve quando você precisa de: comportamento parecido com o do Jev na sua própria GPU, um engine só para decisões tipadas e geração normal, ou um setup nativo em vLLM.
Não serve quando você precisa de: um modelo cujos dados de treino não dependam das saídas de um fornecedor fechado, acurácia verificada por terceiros, o contrato /v1/systemone, listas com mais de 16 opções ou escalas de score próprias, ou GPU pequena (o pacote do 27B tem cerca de 54 GB).
Limites
- Os erros do professor vêm junto: o card diz que a fidelidade “extends to the teacher’s mistakes”.
- As probabilidades são aprendidas das saídas do Jev, que o Jev arredonda para duas casas.
- O score é fixo em 0–5; o choice vai até 16 opções por grupo.
- Tudo acima é medição da própria AutoTrust; nada está em leaderboard oficial ainda.
Por que está no catálogo
Os pesos do bloco de decisão foram de fato treinados para decisão tipada (LoRA mais head) e são publicados abertos, com caminho de serving documentado que devolve probabilidades. Isso passa nos critérios do catálogo, com artifactKind: lora-adapter porque o backbone fica intocado. As ressalvas acima ficam na ficha até a questão dos dados de treino e a diferença nos leaderboards se resolverem.
Links
- Hugging Face: autotrust/JEV-27B · JEV-9B · JEV-27B-VL · JEV-Gemma4-26B-A4B
- Blog no HF: JEV-27B
- Press release na PR Newswire (29/09/2026)
- Corpus de treino: SargeDev/jev-distill-corpus-v3
- Rodadas próprias no Decision Index (dataset)
- News: Cinco modelos de decisão abertos do trending do HF
- Compare: Jev (TypeSafe AI) · AutoJev-27B (sem relação)
