AutoTrust JEV (Blocks of Experts)

Última atualização:

Aberto90–137ms$0/M input

Notas do quadrante

Ver o quadrante completo

Pontuação pela rubrica pública do quadrante (maturidade × capability; bolha = adoção). Revisamos conforme a evidência.

  • Maturidade6.1/10

    Pesos Apache-2.0 para 9B e 27B, card longo com relatórios de avaliação, blog no HF e quickstart em vLLM: um engine serve decisões por um módulo LoRA e geração comum pela base congelada. Sem endpoint /v1/systemone, então o SDK da TypeSafe não se aplica. Empresa, sem SLA.

  • Capability7.5/10

    Noul, Choice (2–16) e Score (0–5). É destilação do Jev fechado: KL 0,017 e ECE 0,0009 medem fidelidade ao professor, in-distribution. Mediana de 137 ms por decisão numa B200, rodada própria. Fora do Decision Index oficial; a rodada própria no índice dá 53,30 ao JEV-27B vs 57,91 do Jev.

  • Adoção9/100

    Cerca de 31 likes e 1,25 mil downloads no HF somando 9B e 27B, um blog no HF, um press release na PR Newswire e um GGUF de terceiro. Sem integrações além do vLLM e sem uso em produção reportado.

Vendor claims

Leia antes

  1. Isto é uma destilação do Jev 1.13 fechado da TypeSafe. A AutoTrust treinou o bloco de decisão no SargeDev/jev-distill-corpus-v3, um dataset de terceiro cujo maior stream (yuri_v3, 498 mil linhas) tem rótulos “distilled from Jev 1.13 (TypeSafe) via OpenRouter”, segundo o card do dataset. Dos 29.955 alvos de teste, 25.376 são distribuições de saída do Jev. As métricas de fidelidade em destaque (KL ≈ 0,017, ECE 0,0009, 90,5% de concordância top-1) medem o quanto o modelo copia o professor, num split de teste desse mesmo corpus. Não são acurácia contra o gabarito. Não verificamos se esse uso de saídas do Jev respeita os termos da TypeSafe.
  2. O “JEV” aqui não é o produto da TypeSafe. O próprio card da AutoTrust diz que o modelo “is not affiliated with, endorsed by, or a product of TypeSafe AI, and shares no weights or code with it” (não é afiliado, endossado nem produto da TypeSafe AI, e não compartilha pesos nem código com ela). Para o modelo hospedado da TypeSafe, veja o Jev. Esta ficha se chama “AutoTrust JEV” para separar os dois.
  3. Fora dos leaderboards oficiais. No snapshot de 28/09/2026, os modelos JEV não estão no Decision Index oficial nem no leaderboard do JevBench v1.4.2. A rodada da própria AutoTrust com o kit do índice dá 53,30 ao JEV-27B, 4,6 pontos abaixo dos 57,91 do Jev. Esse número não conversa bem com o destaque de “+0,22 sobre o Jev” da tabela de seis benchmarks.

O que é

A AutoTrust AI (Singapura) chama sua receita de Blocks of Experts. Um modelo pré-treinado forte fica congelado como um “bloco especialista”, e um bloco pequeno e destacável é treinado para uma única habilidade. Nos modelos JEV:

  • System 1 (decisões tipadas) é um LoRA treinado mais um head de decisão de 24 slots. Responde noul, choice com 2 a 16 opções e score numa escala fixa de 0 a 5, numa passada de prefill, com uma probabilidade por opção.
  • System 2 (geração e raciocínio comuns) é o modelo base, idêntico bit a bit ao lançamento. O HumanEval fica em 78,0% com e sem o bloco de decisão, e as 164 respostas são idênticas byte a byte, segundo o card.

Um único engine vLLM serve os dois. Requisições endereçadas ao módulo LoRA jev-decision passam pelo head de decisão como uma completion de um token restrita aos tokens das opções; todo o resto é o Qwen puro. A API é a compatível com OpenAI do vLLM, não o /v1/systemone.

Família

Repo Base Bloco treinado Criado (BRT) Notas
autotrust/JEV-27B (principal) Qwen3.8-27B 108,9M parâmetros (0,4%), ≈ 9,2 horas de B200, ≈ 640 mil linhas 25/09, 09:58 KL ≈ 0,017; 137 ms de mediana por decisão
autotrust/JEV-9B Qwen3.5-9B 40,2M parâmetros, ≈ 3 horas de B200 23/09, 09:08 Primeira geração; KL ≈ 0,019; ≈ 90 ms; HumanEval 70,7%
autotrust/JEV-27B-VL Qwen3.8-27B (multimodal) Mesmo adapter e head do JEV-27B 30/09, 02:02 Aceita imagem
autotrust/JEV-Gemma4-26B-A4B gemma-4-26B-A4B-it LoRA + head de 24 slots 29/09, 09:34 Rodada própria no índice: 58,05

Conversão de terceiro: prithivMLmods/JEV-27B-GGUF (28/09; BF16 e Q3_K_M–Q5_K_M). O caminho de decisão documentado pela AutoTrust é o vLLM com adapter_vllm/; o card do GGUF documenta o llama.cpp de forma genérica.

Números da AutoTrust (UnverifiedClaim)

Seis benchmarks públicos de decisão em texto. A AutoTrust rodou o JEV-27B e o Jev 1.13 hospedado (26–27/09). As demais linhas foram copiadas do card do NeoHorse-Jev-4B, sem nova rodada.

Modelo JevBench Kev OpenJev text Nimble VitaminC MASSIVE-en Média
JEV-27B 88,70 83,75 73,89 92,91 77,46 87,71 84,07
Jev 1.13 (rodada da AutoTrust) 87,18 85,52 72,96 91,84 78,46 87,14 83,85
NeoHorse-Jev-4B (como reportado) 75,73 81,92 58,74 87,23 77,13 85,43 77,70

Outras afirmações: no benchmark de terceiro decision-models-under-pressure (gabarito humano, 16 opções), o JEV-27B chega a 96% da acurácia do professor (0,740 vs 0,769), em rodada própria. O card compara seus 137 ms de mediana com os 238–301 ms medidos por outros na API hospedada; os números da API incluem rede e fila. O JEV-27B-VL diz ter 78,3% no VL-RewardBench, acima de um leaderboard atualizado pela última vez em maio de 2025.

Quando usar / quando não usar

Serve quando você precisa de: comportamento parecido com o do Jev na sua própria GPU, um engine só para decisões tipadas e geração normal, ou um setup nativo em vLLM.

Não serve quando você precisa de: um modelo cujos dados de treino não dependam das saídas de um fornecedor fechado, acurácia verificada por terceiros, o contrato /v1/systemone, listas com mais de 16 opções ou escalas de score próprias, ou GPU pequena (o pacote do 27B tem cerca de 54 GB).

Limites

  • Os erros do professor vêm junto: o card diz que a fidelidade “extends to the teacher’s mistakes”.
  • As probabilidades são aprendidas das saídas do Jev, que o Jev arredonda para duas casas.
  • O score é fixo em 0–5; o choice vai até 16 opções por grupo.
  • Tudo acima é medição da própria AutoTrust; nada está em leaderboard oficial ainda.

Os pesos do bloco de decisão foram de fato treinados para decisão tipada (LoRA mais head) e são publicados abertos, com caminho de serving documentado que devolve probabilidades. Isso passa nos critérios do catálogo, com artifactKind: lora-adapter porque o backbone fica intocado. As ressalvas acima ficam na ficha até a questão dos dados de treino e a diferença nos leaderboards se resolverem.