AutoTrust GEV-26B-Decide

Última atualização:

Aberto45–85ms$0/M input

Notas do quadrante

Ver o quadrante completo

Pontuação pela rubrica pública do quadrante (maturidade × capability; bolha = adoção). Revisamos conforme a evidência.

  • Maturidade6.3/10

    Adapter, head e arquivos de calibração Apache-2.0 sobre o Gemma-4-26B-A4B (termos do Gemma 4). Card muito detalhado, com relatórios, duas tabelas de calibração e declaração dos dados de treino. O servidor POST /v1/decide exige vLLM dev com patch e GPU de 80 GB; sem /v1/systemone. Empresa, sem SLA.

  • Capability7.8/10

    Noul, Choice (2–256) e Score (0–5) sobre texto e imagem. System 1: 45 ms de mediana numa B200, sem p99. ECE 0,035 contra gabarito em 1.754 perguntas fora do DI. O DI 62,48 é pontuação da AutoTrust: o modo adaptativo fura a regra de latência do placar, e splits de treino do DI foram usados.

  • Adoção10/100

    7 likes no repo novo e 13 no repo JEV-Gemma4 que ele republica; cerca de 156 likes na família AutoTrust, um blog no HF, um press release e um GGUF de terceiro do JEV-27B. Os downloads parecem anômalos (310 mil em dois dias) e não contam. Sem uso em produção reportado.

Vendor claims

Leia antes

  1. Nome novo, mesmos pesos, e não foi um rename no HF. A AutoTrust publicou o autotrust/GEV-26B-Decide como repositório novo em 2/10/2026 (01:20 BRT). O card diz que ele “was previously published as autotrust/JEV-Gemma4-26B-A4B; the weights are the same” (já foi publicado como JEV-Gemma4-26B-A4B; os pesos são os mesmos). Conferimos: o adapter, o head de decisão e os shards da base têm hashes sha256 do LFS idênticos. O repo antigo continua no ar, sem mudanças desde 29/09. O GEV traz ainda um LoRA para vLLM (adapter_vllm/), um servidor /v1/decide com pensamento adaptativo, um patch do vLLM, relatórios novos e vídeos de demonstração.
  2. Linhagem destilada. O System 1 “was trained on teacher distributions and ground-truth decision data” (foi treinado com distribuições de um professor e dados com gabarito), e “where the teacher is wrong, System 1 often is too” (onde o professor erra, o System 1 costuma errar também). O card do GEV não diz quem é o professor. Na família JEV é o Jev 1.13 fechado da TypeSafe, via SargeDev/jev-distill-corpus-v3 (rótulos “distilled from Jev 1.13 via OpenRouter”). Não verificamos se esse uso de saídas do Jev respeita os termos da TypeSafe.
  3. O 62,48 não é nota do placar. A própria AutoTrust pontuou com o kit do Decision Index. Conhecimento e Raciocínio rodou com pensamento adaptativo (mediana de 13,4 s por requisição, o que fura a regra de mediana ≤ 1.000 ms do placar), e as outras quatro áreas só com System 1. Os dados de treino também incluem os splits de treino de benchmarks cujos splits de teste o índice usa (entre eles BANKING77 e CLINC150); a AutoTrust diz ter mandado a lista aos mantenedores do índice. No snapshot de 28/09, nenhum modelo da AutoTrust está no Decision Index oficial.
  4. “JEV”/“GEV” não é produto da TypeSafe. O card da AutoTrust diz que o modelo “is not affiliated with, endorsed by, or a product of TypeSafe AI” (não é afiliado, endossado nem produto da TypeSafe AI). Para o modelo hospedado da TypeSafe, veja o Jev.

O que é

O GEV-26B-Decide segue a mesma receita dos outros modelos da AutoTrust, que ela chama de Blocks of Experts. A base, google/gemma-4-26B-A4B-it (26B de parâmetros, cerca de 4B ativos por token), fica congelada. Um LoRA treinado mais um head de decisão fp32 de 24 slots acrescentam a habilidade de decisão tipada.

Modo O que faz Saída
System 1 Noul (sim/não), Choice entre 2 e 256 opções, Score de 0 a 5, sobre texto e imagem; prompts de até 256K tokens Uma probabilidade por opção, num único forward pass
Pensamento adaptativo (opcional, thinking: "auto") Primeiro o System 1. Abaixo de 0,8 de confiança, o modelo base pensa e a resposta dele entra na mistura: p = ½ p1 + ½ p2 Probabilidades
System 2 O Gemma-4-26B-A4B-it sem modificação, com ou sem pensamento Texto

Leitura: o hidden state pós-norma do último token (2.816) passa pelo head linear até 24 slots, com soft-cap em 30. Os slots inativos são mascarados, e os logits são divididos por uma temperatura por tipo. Até 16 opções são lidas numa passada. Listas maiores rodam em torneio, em grupos de 16. Vêm duas tabelas de temperatura: calibration.json (1,003 / 1,017 / 0,999, usada na rodada do índice) e calibration_gold.json (1,214 / 1,098 / 1,000, ajustada no gabarito; a AutoTrust recomenda essa quando a confiança decide uma ação).

Como servir

  • vLLM: o serve.sh roda o serve_decide.py, que é o servidor OpenAI padrão do vLLM com uma rota POST /v1/decide. Requisições comuns vão para o System 2, e as endereçadas ao módulo LoRA jev-decision vão para o System 1. Exige um build do vLLM com suporte a Gemma 4, o patch incluído patches/vllm-gemma4-lm-head-lora.patch e uma GPU de 80 GB ou mais. A AutoTrust testou num build de desenvolvimento do vLLM de setembro de 2026.
  • transformers + peft: System 1 com o adapter mesclado na memória, até 16 opções por passada.
  • Não é /v1/systemone, então o SDK da TypeSafe não se aplica. Não há GGUF nem pacote Ollama/Ollaya do GEV em 4/10.

Números da AutoTrust (UnverifiedClaim)

Todos os números abaixo são rodadas da própria AutoTrust numa B200, tirados do card (lastModified 3/10, 08:00 BRT).

Decision Index 0.2.1 (pontuação própria).

Balanced skill Balanced raw Breadth
GEV-26B-Decide, adaptativo em C&R 62,48 70,66 62,00
Mesmos pesos, só System 1 (rodada de 29/09, como JEV-Gemma4-26B-A4B) 58,05 67,35 56,98
TypeSafe Jev 1.13 (placar, 28/09) 57,91 — —

Áreas: Conhecimento e Raciocínio 0,602 (System 1: 0,429), Linguagem 0,636, Recuperação e Classificação 0,679, Ferramentas e Automação 0,697, Artes e Gosto 0,415. Os resultados brutos estão em autotrust/jev-decision-index-results (runs/jev-gemma4-26b-a4b).

Conhecimento e Raciocínio, System 1 → adaptativo (acurácia %). GPQA Diamond 42,9 → 78,6 · CRUXEval 67,5 → 90,7 · CLadder 71,0 → 86,6 · MMLU-Pro 65,0 → 84,6 · BBH 75,0 → 92,0 · GSM8K 97,6 → 99,1. HLE: 8,4 → 17,8, abaixo do acaso (16,4) sem pensar e de volta ao nível do acaso pensando. Das perguntas do HLE respondidas sem pensar, só 1,6% estão certas. ChessBench não ganha nada.

Fora de C&R: pensar ajuda pouco (BFCL 94,4 → 96,0, CLINC150 93,3 → 94,4) e piora o BANKING77 (88,0 → 85,0), um conjunto cujo split de treino estava nos dados de treino.

Conjunto de validação (1.754 perguntas de seis conjuntos públicos fora do índice): System 1 73,3% → adaptativo 83,4%, ECE 0,035 nos dois. Pensa em 48% das perguntas. É o único número de calibração medido contra gabarito e não contra o professor.

Latência: System 1 com mediana de 45 ms por requisição, 257 decisões/s com 64 clientes. Modo adaptativo em C&R: mediana de 13,4 s, p90 de 33 s (7,7 s / 19 s com decodificação especulativa). Não há p99 publicado para o System 1.

Demos (3/10, System 1).

GEV-26B-Decide JEV-27B-VL JEV-9B
Uso de computador, 60 tarefas de navegador (caixas numeradas + texto dos elementos) 95% 95% 95%
Tempo por clique ≈ 85 ms ≈ 260 ms ≈ 200 ms
Braço robótico pega-e-solta, 20 cenas no MuJoCo 40% 75% 50%
Tempo por decisão do robô 61 ms 239 ms 163 ms

Sem o texto dos elementos, o uso de computador cai para 15%. Quando precisou escolher direto um entre 8 comandos de motor, o braço completou 0 de 10 cenas. São simulações pequenas, montadas pela própria AutoTrust.

Jogos (200 puzzles de um lance cada, System 1 → adaptativo): Campo Minado 21 → 86 · Wordle 52 → 100 · Lig 4 54 → 99,5 · Sudoku 76 → 99,5 · jogo do 24 89 → 100 · Labirinto 48,5 → 68 · mate em um no xadrez 46,5 → 78. Pensar não ajuda em partidas inteiras (2048, Flappy Bird) nem em reconhecer rabiscos.

Outros: imagens zero-shot no VL-RewardBench, 78,4% (o head de decisão foi treinado só com texto). Contexto longo: 10/10 de 4K a 128K (acima de 128K não foi testado). Muitas opções: MASSIVE com 59 opções 91,2%, BANKING77 81,5%, CLINC150 95,5%, 255 intenções misturadas 89,0% / 75,2%.

Família

Os outros repos da AutoTrust continuam no ar e não foram renomeados (4/10). Eles compartilham a receita e as ressalvas acima.

Repo Base Criado (BRT) Notas
autotrust/JEV-Gemma4-26B-A4B gemma-4-26B-A4B-it 29/09, 09:34 Mesmos pesos do GEV; só System 1; DI próprio 58,05; sem mudanças desde 29/09
autotrust/JEV-27B Qwen3.8-27B 25/09, 09:58 108,9M de parâmetros treinados; KL ≈ 0,017 em relação ao Jev; mediana de 137 ms; DI próprio 53,30
autotrust/JEV-9B Qwen3.5-9B 23/09, 09:08 Primeira geração; ≈ 90 ms; hospeda o código das demos
autotrust/JEV-27B-VL Qwen3.8-27B (multimodal) 30/09, 02:02 Mesmo adapter e head do JEV-27B; entrada de imagem

Evidências do JEV-27B, mantidas (UnverifiedClaim).

  • Tabela de seis benchmarks: 84,07% vs 83,85% do Jev 1.13. A AutoTrust rodou os dois modelos, e as outras linhas foram copiadas do card do NeoHorse-Jev-4B.
  • Fidelidade, não acurácia: KL ≈ 0,017, ECE 0,0009 e 90,5% de concordância top-1 são medidos contra o professor, num split de teste do corpus de destilação.
  • Modelo base intocado: o HumanEval fica em 78,0% com e sem o bloco, e as 164 respostas são idênticas byte a byte às da base.
  • GGUF de terceiro: prithivMLmods/JEV-27B-GGUF.
  • Lacuna no índice: a rodada própria no índice (53,30) fica 4,6 pontos abaixo do Jev, o que não combina com a manchete de “+0,22 sobre o Jev”.

Quando usar / quando não usar

Serve quando você precisa de: decisões tipadas na sua própria GPU grande, com um System 1 rápido e um caminho opcional de raciocínio para perguntas de lógica, matemática e ciência. Também serve para ter um engine só para decisões e geração normal do Gemma, ou para contextos longos e listas de mais de 16 opções.

Não serve quando você precisa de: respostas abaixo de um segundo com o pensamento ligado, o contrato /v1/systemone, uma GPU pequena (o caminho vLLM pede 80 GB), dados de treino que não dependam das saídas de um fornecedor fechado, ou acurácia verificada por terceiros. Evite ligar o pensamento em classificação e roteamento: ele piorou o BANKING77 e só levou o HLE de volta ao acaso.

Alertas que acompanhamos

  • Downloads: 310.028 no repo novo em dois dias, com 7 likes. O repo antigo tem 1.071 downloads e 13 likes. O mesmo padrão aparece no JEV-27B-VL (≈ 726 mil) e no JEV-9B (≈ 132 mil). Não contamos esses números na adoção.
  • Tag de licença: o metadata do HF diz apache-2.0, mas só o adapter, o head e os arquivos de calibração são Apache-2.0. Os pesos da base no repo seguem os termos do Gemma 4.
  • Dois repos, um modelo: benchmarks e links podem citar qualquer um dos dois nomes.

O bloco de decisão foi treinado para decisões tipadas e é distribuído abertamente. O caminho de serving documentado devolve uma probabilidade por opção. Isso passa nos critérios do catálogo como lora-adapter, porque o backbone fica intocado. Desde 4/10 esta é a ficha da AutoTrust no catálogo. Ela substitui a antiga ficha da família “AutoTrust JEV” (nota 6,1 / 7,5 / 9 com o JEV-27B como ponto), que agora é uma nota de troca de nome.

Conta das notas (4/10/2026)

  • Maturidade = disponibilidade 8 × 0,30 + docs 9 × 0,25 + integrações 5 × 0,25 + suporte 2 × 0,20 = 2,40 + 2,25 + 1,25 + 0,40 = 6,30
  • Capability = tipos 10 × 0,30 + calibração 7 × 0,25 + latência 8 × 0,25 [vendor] + acurácia 5 × 0,20 = 3,00 + 1,75 + 2,00 + 1,00 = 7,75 → 7,8
  • Adoção = engajamento 20 × 0,35 + ecossistema 8 × 0,35 + produção 2 × 0,30 = 7,00 + 2,80 + 0,60 = 10,40 → 10
  • Por que essas notas:
    • Calibração 7: temperaturas publicadas e ECE 0,035 contra gabarito, mas é rodada própria, e o HLE mostra erros confiantes.
    • Latência 8: mediana de 45 ms, mas numa B200 e sem p99.
    • Acurácia 5: um ponto abaixo do 6 que costumamos dar a um Decision Index de rodada própria, por causa da sobreposição com splits de treino do índice e de uma manchete que usa um modo que o placar rejeitaria.
    • Adoção: só likes e ecossistema; os downloads são anômalos.

Build NVFP4 (5/10/2026)

A AutoTrust publicou o GEV-26B-Decide-NVFP4 (cerca de 15 mil downloads / 150 likes até 7/10). Só os 3.840 experts roteados estão em NVFP4 (layout ModelOpt); o resto fica em bf16, inclusive o adapter, a head de decisão e as temperaturas. No vLLM ocupa 17,1 GiB em vez de 51,1 GiB (−66%), então cabe numa GPU de 24 GB.

Conferência da AutoTrust (UnverifiedClaim): só System 1, em GPQA Diamond (43,9% → 44,9%) e HLE (8,4% → 9,7%), dentro do ruído; o adaptive thinking não foi reavaliado. W4A4 nativo só foi testado em B200, e o build precisa do mesmo patch do vLLM do modelo bf16. As notas desta ficha não mudam.