AutoTrust GEV-26B-Decide
Notas do quadrante
Ver o quadrante completoPontuação pela rubrica pública do quadrante (maturidade × capability; bolha = adoção). Revisamos conforme a evidência.
- Maturidade6.3/10
Adapter, head e arquivos de calibração Apache-2.0 sobre o Gemma-4-26B-A4B (termos do Gemma 4). Card muito detalhado, com relatórios, duas tabelas de calibração e declaração dos dados de treino. O servidor POST /v1/decide exige vLLM dev com patch e GPU de 80 GB; sem /v1/systemone. Empresa, sem SLA.
- Capability7.8/10
Noul, Choice (2–256) e Score (0–5) sobre texto e imagem. System 1: 45 ms de mediana numa B200, sem p99. ECE 0,035 contra gabarito em 1.754 perguntas fora do DI. O DI 62,48 é pontuação da AutoTrust: o modo adaptativo fura a regra de latência do placar, e splits de treino do DI foram usados.
- Adoção10/100
7 likes no repo novo e 13 no repo JEV-Gemma4 que ele republica; cerca de 156 likes na família AutoTrust, um blog no HF, um press release e um GGUF de terceiro do JEV-27B. Os downloads parecem anômalos (310 mil em dois dias) e não contam. Sem uso em produção reportado.
Vendor claims
- Decision Index 0.2.1 62,48 (balanced raw 70,66, breadth 62,00) vs Jev 1.13 57,91: pontuação própria, Conhecimento e Raciocínio com pensamento adaptativo (0,602), as outras quatro áreas só System 1; não é entrada do placar[Claim do fornecedor — não verificado independentemente]
- Mesmos pesos, só System 1 (publicados em 29/09 como JEV-Gemma4-26B-A4B): Decision Index 0.2.1 58,05, rodada própria completa[Claim do fornecedor — não verificado independentemente]
- 1.754 perguntas de seis conjuntos públicos fora do Decision Index: System 1 73,3% → adaptativo 83,4%, ECE 0,035 nos dois[Claim do fornecedor — não verificado independentemente]
- System 1: mediana de 45 ms por requisição e 257 decisões/s com 64 clientes numa B200 (vLLM)[Claim do fornecedor — não verificado independentemente]
- Uso de computador: 95% de 60 tarefas de navegador em vários passos, ≈85 ms por clique (15% sem o texto dos elementos); braço robótico (MuJoCo): 40% de 20 cenas, 61 ms por decisão[Claim do fornecedor — não verificado independentemente]
- Puzzles de um lance, System 1 → adaptativo: Campo Minado 21 → 86%, Wordle 52 → 100%, Lig 4 54 → 99,5%, Sudoku 76 → 99,5%, mate em um no xadrez 46,5 → 78%[Claim do fornecedor — não verificado independentemente]
- Imagens zero-shot: VL-RewardBench 78,4% (JEV-27B-VL 78,3%); contexto longo 10/10 de 4K a 128K; conjuntos de 255 intenções 89,0% / 75,2%[Claim do fornecedor — não verificado independentemente]
Leia antes
- Nome novo, mesmos pesos, e não foi um rename no HF. A AutoTrust publicou o
autotrust/GEV-26B-Decidecomo repositório novo em 2/10/2026 (01:20 BRT). O card diz que ele “was previously published asautotrust/JEV-Gemma4-26B-A4B; the weights are the same” (já foi publicado como JEV-Gemma4-26B-A4B; os pesos são os mesmos). Conferimos: o adapter, o head de decisão e os shards da base têm hashes sha256 do LFS idênticos. O repo antigo continua no ar, sem mudanças desde 29/09. O GEV traz ainda um LoRA para vLLM (adapter_vllm/), um servidor/v1/decidecom pensamento adaptativo, um patch do vLLM, relatórios novos e vídeos de demonstração.- Linhagem destilada. O System 1 “was trained on teacher distributions and ground-truth decision data” (foi treinado com distribuições de um professor e dados com gabarito), e “where the teacher is wrong, System 1 often is too” (onde o professor erra, o System 1 costuma errar também). O card do GEV não diz quem é o professor. Na família JEV é o Jev 1.13 fechado da TypeSafe, via
SargeDev/jev-distill-corpus-v3(rótulos “distilled from Jev 1.13 via OpenRouter”). Não verificamos se esse uso de saídas do Jev respeita os termos da TypeSafe.- O 62,48 não é nota do placar. A própria AutoTrust pontuou com o kit do Decision Index. Conhecimento e Raciocínio rodou com pensamento adaptativo (mediana de 13,4 s por requisição, o que fura a regra de mediana ≤ 1.000 ms do placar), e as outras quatro áreas só com System 1. Os dados de treino também incluem os splits de treino de benchmarks cujos splits de teste o índice usa (entre eles BANKING77 e CLINC150); a AutoTrust diz ter mandado a lista aos mantenedores do índice. No snapshot de 28/09, nenhum modelo da AutoTrust está no Decision Index oficial.
- “JEV”/“GEV” não é produto da TypeSafe. O card da AutoTrust diz que o modelo “is not affiliated with, endorsed by, or a product of TypeSafe AI” (não é afiliado, endossado nem produto da TypeSafe AI). Para o modelo hospedado da TypeSafe, veja o Jev.
O que é
O GEV-26B-Decide segue a mesma receita dos outros modelos da AutoTrust, que ela chama de Blocks of Experts. A base, google/gemma-4-26B-A4B-it (26B de parâmetros, cerca de 4B ativos por token), fica congelada. Um LoRA treinado mais um head de decisão fp32 de 24 slots acrescentam a habilidade de decisão tipada.
| Modo | O que faz | Saída |
|---|---|---|
| System 1 | Noul (sim/não), Choice entre 2 e 256 opções, Score de 0 a 5, sobre texto e imagem; prompts de até 256K tokens | Uma probabilidade por opção, num único forward pass |
Pensamento adaptativo (opcional, thinking: "auto") |
Primeiro o System 1. Abaixo de 0,8 de confiança, o modelo base pensa e a resposta dele entra na mistura: p = ½ p1 + ½ p2 | Probabilidades |
| System 2 | O Gemma-4-26B-A4B-it sem modificação, com ou sem pensamento | Texto |
Leitura: o hidden state pós-norma do último token (2.816) passa pelo head linear até 24 slots, com soft-cap em 30. Os slots inativos são mascarados, e os logits são divididos por uma temperatura por tipo. Até 16 opções são lidas numa passada. Listas maiores rodam em torneio, em grupos de 16. Vêm duas tabelas de temperatura: calibration.json (1,003 / 1,017 / 0,999, usada na rodada do índice) e calibration_gold.json (1,214 / 1,098 / 1,000, ajustada no gabarito; a AutoTrust recomenda essa quando a confiança decide uma ação).
Como servir
- vLLM: o
serve.shroda oserve_decide.py, que é o servidor OpenAI padrão do vLLM com uma rotaPOST /v1/decide. Requisições comuns vão para o System 2, e as endereçadas ao módulo LoRAjev-decisionvão para o System 1. Exige um build do vLLM com suporte a Gemma 4, o patch incluídopatches/vllm-gemma4-lm-head-lora.patche uma GPU de 80 GB ou mais. A AutoTrust testou num build de desenvolvimento do vLLM de setembro de 2026. - transformers + peft: System 1 com o adapter mesclado na memória, até 16 opções por passada.
- Não é
/v1/systemone, então o SDK da TypeSafe não se aplica. Não há GGUF nem pacote Ollama/Ollaya do GEV em 4/10.
Números da AutoTrust (UnverifiedClaim)
Todos os números abaixo são rodadas da própria AutoTrust numa B200, tirados do card (lastModified 3/10, 08:00 BRT).
Decision Index 0.2.1 (pontuação própria).
| Balanced skill | Balanced raw | Breadth | |
|---|---|---|---|
| GEV-26B-Decide, adaptativo em C&R | 62,48 | 70,66 | 62,00 |
| Mesmos pesos, só System 1 (rodada de 29/09, como JEV-Gemma4-26B-A4B) | 58,05 | 67,35 | 56,98 |
| TypeSafe Jev 1.13 (placar, 28/09) | 57,91 | — | — |
Áreas: Conhecimento e Raciocínio 0,602 (System 1: 0,429), Linguagem 0,636, Recuperação e Classificação 0,679, Ferramentas e Automação 0,697, Artes e Gosto 0,415. Os resultados brutos estão em autotrust/jev-decision-index-results (runs/jev-gemma4-26b-a4b).
Conhecimento e Raciocínio, System 1 → adaptativo (acurácia %). GPQA Diamond 42,9 → 78,6 · CRUXEval 67,5 → 90,7 · CLadder 71,0 → 86,6 · MMLU-Pro 65,0 → 84,6 · BBH 75,0 → 92,0 · GSM8K 97,6 → 99,1. HLE: 8,4 → 17,8, abaixo do acaso (16,4) sem pensar e de volta ao nível do acaso pensando. Das perguntas do HLE respondidas sem pensar, só 1,6% estão certas. ChessBench não ganha nada.
Fora de C&R: pensar ajuda pouco (BFCL 94,4 → 96,0, CLINC150 93,3 → 94,4) e piora o BANKING77 (88,0 → 85,0), um conjunto cujo split de treino estava nos dados de treino.
Conjunto de validação (1.754 perguntas de seis conjuntos públicos fora do índice): System 1 73,3% → adaptativo 83,4%, ECE 0,035 nos dois. Pensa em 48% das perguntas. É o único número de calibração medido contra gabarito e não contra o professor.
Latência: System 1 com mediana de 45 ms por requisição, 257 decisões/s com 64 clientes. Modo adaptativo em C&R: mediana de 13,4 s, p90 de 33 s (7,7 s / 19 s com decodificação especulativa). Não há p99 publicado para o System 1.
Demos (3/10, System 1).
| GEV-26B-Decide | JEV-27B-VL | JEV-9B | |
|---|---|---|---|
| Uso de computador, 60 tarefas de navegador (caixas numeradas + texto dos elementos) | 95% | 95% | 95% |
| Tempo por clique | ≈ 85 ms | ≈ 260 ms | ≈ 200 ms |
| Braço robótico pega-e-solta, 20 cenas no MuJoCo | 40% | 75% | 50% |
| Tempo por decisão do robô | 61 ms | 239 ms | 163 ms |
Sem o texto dos elementos, o uso de computador cai para 15%. Quando precisou escolher direto um entre 8 comandos de motor, o braço completou 0 de 10 cenas. São simulações pequenas, montadas pela própria AutoTrust.
Jogos (200 puzzles de um lance cada, System 1 → adaptativo): Campo Minado 21 → 86 · Wordle 52 → 100 · Lig 4 54 → 99,5 · Sudoku 76 → 99,5 · jogo do 24 89 → 100 · Labirinto 48,5 → 68 · mate em um no xadrez 46,5 → 78. Pensar não ajuda em partidas inteiras (2048, Flappy Bird) nem em reconhecer rabiscos.
Outros: imagens zero-shot no VL-RewardBench, 78,4% (o head de decisão foi treinado só com texto). Contexto longo: 10/10 de 4K a 128K (acima de 128K não foi testado). Muitas opções: MASSIVE com 59 opções 91,2%, BANKING77 81,5%, CLINC150 95,5%, 255 intenções misturadas 89,0% / 75,2%.
Família
Os outros repos da AutoTrust continuam no ar e não foram renomeados (4/10). Eles compartilham a receita e as ressalvas acima.
| Repo | Base | Criado (BRT) | Notas |
|---|---|---|---|
| autotrust/JEV-Gemma4-26B-A4B | gemma-4-26B-A4B-it | 29/09, 09:34 | Mesmos pesos do GEV; só System 1; DI próprio 58,05; sem mudanças desde 29/09 |
| autotrust/JEV-27B | Qwen3.8-27B | 25/09, 09:58 | 108,9M de parâmetros treinados; KL ≈ 0,017 em relação ao Jev; mediana de 137 ms; DI próprio 53,30 |
| autotrust/JEV-9B | Qwen3.5-9B | 23/09, 09:08 | Primeira geração; ≈ 90 ms; hospeda o código das demos |
| autotrust/JEV-27B-VL | Qwen3.8-27B (multimodal) | 30/09, 02:02 | Mesmo adapter e head do JEV-27B; entrada de imagem |
Evidências do JEV-27B, mantidas (UnverifiedClaim).
- Tabela de seis benchmarks: 84,07% vs 83,85% do Jev 1.13. A AutoTrust rodou os dois modelos, e as outras linhas foram copiadas do card do NeoHorse-Jev-4B.
- Fidelidade, não acurácia: KL ≈ 0,017, ECE 0,0009 e 90,5% de concordância top-1 são medidos contra o professor, num split de teste do corpus de destilação.
- Modelo base intocado: o HumanEval fica em 78,0% com e sem o bloco, e as 164 respostas são idênticas byte a byte às da base.
- GGUF de terceiro:
prithivMLmods/JEV-27B-GGUF. - Lacuna no índice: a rodada própria no índice (53,30) fica 4,6 pontos abaixo do Jev, o que não combina com a manchete de “+0,22 sobre o Jev”.
Quando usar / quando não usar
Serve quando você precisa de: decisões tipadas na sua própria GPU grande, com um System 1 rápido e um caminho opcional de raciocínio para perguntas de lógica, matemática e ciência. Também serve para ter um engine só para decisões e geração normal do Gemma, ou para contextos longos e listas de mais de 16 opções.
Não serve quando você precisa de: respostas abaixo de um segundo com o pensamento ligado, o contrato /v1/systemone, uma GPU pequena (o caminho vLLM pede 80 GB), dados de treino que não dependam das saídas de um fornecedor fechado, ou acurácia verificada por terceiros. Evite ligar o pensamento em classificação e roteamento: ele piorou o BANKING77 e só levou o HLE de volta ao acaso.
Alertas que acompanhamos
- Downloads: 310.028 no repo novo em dois dias, com 7 likes. O repo antigo tem 1.071 downloads e 13 likes. O mesmo padrão aparece no JEV-27B-VL (≈ 726 mil) e no JEV-9B (≈ 132 mil). Não contamos esses números na adoção.
- Tag de licença: o metadata do HF diz
apache-2.0, mas só o adapter, o head e os arquivos de calibração são Apache-2.0. Os pesos da base no repo seguem os termos do Gemma 4. - Dois repos, um modelo: benchmarks e links podem citar qualquer um dos dois nomes.
Por que está no catálogo
O bloco de decisão foi treinado para decisões tipadas e é distribuído abertamente. O caminho de serving documentado devolve uma probabilidade por opção. Isso passa nos critérios do catálogo como lora-adapter, porque o backbone fica intocado. Desde 4/10 esta é a ficha da AutoTrust no catálogo. Ela substitui a antiga ficha da família “AutoTrust JEV” (nota 6,1 / 7,5 / 9 com o JEV-27B como ponto), que agora é uma nota de troca de nome.
Conta das notas (4/10/2026)
- Maturidade = disponibilidade 8 × 0,30 + docs 9 × 0,25 + integrações 5 × 0,25 + suporte 2 × 0,20 = 2,40 + 2,25 + 1,25 + 0,40 = 6,30
- Capability = tipos 10 × 0,30 + calibração 7 × 0,25 + latência 8 × 0,25
[vendor]+ acurácia 5 × 0,20 = 3,00 + 1,75 + 2,00 + 1,00 = 7,75 → 7,8 - Adoção = engajamento 20 × 0,35 + ecossistema 8 × 0,35 + produção 2 × 0,30 = 7,00 + 2,80 + 0,60 = 10,40 → 10
- Por que essas notas:
- Calibração 7: temperaturas publicadas e ECE 0,035 contra gabarito, mas é rodada própria, e o HLE mostra erros confiantes.
- Latência 8: mediana de 45 ms, mas numa B200 e sem p99.
- Acurácia 5: um ponto abaixo do 6 que costumamos dar a um Decision Index de rodada própria, por causa da sobreposição com splits de treino do índice e de uma manchete que usa um modo que o placar rejeitaria.
- Adoção: só likes e ecossistema; os downloads são anômalos.
Build NVFP4 (5/10/2026)
A AutoTrust publicou o GEV-26B-Decide-NVFP4 (cerca de 15 mil downloads / 150 likes até 7/10). Só os 3.840 experts roteados estão em NVFP4 (layout ModelOpt); o resto fica em bf16, inclusive o adapter, a head de decisão e as temperaturas. No vLLM ocupa 17,1 GiB em vez de 51,1 GiB (−66%), então cabe numa GPU de 24 GB.
Conferência da AutoTrust (UnverifiedClaim): só System 1, em GPQA Diamond (43,9% → 44,9%) e HLE (8,4% → 9,7%), dentro do ruído; o adaptive thinking não foi reavaliado. W4A4 nativo só foi testado em B200, e o build precisa do mesmo patch do vLLM do modelo bf16. As notas desta ficha não mudam.
Links
- Hugging Face: autotrust/GEV-26B-Decide · JEV-Gemma4-26B-A4B · JEV-27B · JEV-9B · JEV-27B-VL
- Rodadas próprias no Decision Index (dataset)
- Blog no HF: JEV-27B · Press release na PR Newswire (29/09/2026)
- Corpus de treino (família JEV): SargeDev/jev-distill-corpus-v3
- News: AutoTrust republica seu modelo Gemma como GEV-26B-Decide · Cinco modelos de decisão abertos do trending do HF
- Comparar: Jev (TypeSafe AI) · Decision 2.0 · AutoJev-27B (sem relação)
