AutoTrust republica seu modelo de decisão Gemma como GEV-26B-Decide, com pensamento adaptativo
A AutoTrust AI publicou o autotrust/GEV-26B-Decide em 2 de outubro de 2026, à 01:20 (horário de Brasília), e acrescentou resultados de demos no dia 3. O card diz que o modelo “was previously published as autotrust/JEV-Gemma4-26B-A4B; the weights are the same” (já foi publicado como JEV-Gemma4-26B-A4B; os pesos são os mesmos). Comparamos os arquivos: o adapter, o head de decisão e os shards da base têm hashes idênticos. É um repositório novo, e não um rename no Hugging Face. O repo antigo continua no ar, sem mudanças desde 29 de setembro, e o JEV-27B, o JEV-9B e o JEV-27B-VL mantêm os nomes.
O que há de novo. Os pesos de decisão são os mesmos; o que mudou foi tudo em volta deles:
- Pensamento adaptativo (opcional). O System 1 responde primeiro, numa passada (cerca de 45 ms numa B200). Se a opção mais provável fica abaixo de 0,8 de confiança, o modelo base Gemma pensa e a resposta dele entra na média.
- Um servidor vLLM com a rota
POST /v1/decide. Ele exige um build de desenvolvimento do vLLM com patch e uma GPU de 80 GB. - Duas demos: uso de computador (escolher o próximo clique a partir de um print de tela) e um braço robótico simulado.
Números da AutoTrust (UnverifiedClaim).
| Afirmação | Resultado | Observação |
|---|---|---|
| Decision Index 0.2.1 | 62,48 vs 57,91 do Jev | Pontuação própria. Conhecimento e Raciocínio usa pensamento adaptativo (mediana de 13,4 s por requisição; o placar exige ≤ 1 s). Os mesmos pesos tiveram 58,05 só com System 1 |
| Validação, 1.754 perguntas fora do índice | 73,3% → 83,4% pensando, ECE 0,035 | Pensa em 48% das perguntas |
| Benchmarks de raciocínio | GPQA Diamond 42,9 → 78,6, MMLU-Pro 65,0 → 84,6, BBH 75,0 → 92,0 | No HLE só sai de abaixo do acaso para o nível do acaso (8,4 → 17,8) |
| Uso de computador, 60 tarefas de navegador | 95% a ≈ 85 ms por clique | 15% sem o texto dos elementos; o JEV-27B-VL também faz 95%, a 260 ms |
| Braço robótico, 20 cenas simuladas | 40% a 61 ms por decisão | JEV-27B-VL 75%; 0/10 quando escolhe comandos de motor direto |
| Puzzles | Campo Minado 21 → 86%, Wordle 52 → 100%, Sudoku 76 → 99,5% | Pensar não ajuda em partidas inteiras nem em rabiscos |
O que levar em conta.
- Sobreposição de dados de treino. O card declara que o treino usou os splits de treino de benchmarks cujos splits de teste estão no Decision Index (entre eles BANKING77 e CLINC150). Pensar piorou o BANKING77 (88,0 → 85,0).
- Destilação de um professor. O System 1 aprendeu com “teacher distributions” (distribuições de um professor), e na família JEV da AutoTrust o professor é o Jev 1.13 fechado. As demos são simulações pequenas, montadas pela própria AutoTrust.
- Downloads. O repo novo mostra 310.028 downloads em dois dias contra 7 likes. Não contamos esse número.
- Licença. A tag de licença diz Apache-2.0, mas isso só cobre o adapter, o head e os arquivos de calibração. Os pesos da base seguem os termos do Gemma 4.
- Não é TypeSafe. A AutoTrust não tem vínculo com a TypeSafe.
O que muda aqui. A ficha da AutoTrust no catálogo agora é o GEV-26B-Decide, com nota 6,3 / 7,8 / 10 (maturidade / capability / adoção). Ela substitui a ficha da família, que tinha 6,1 / 7,5 / 9 com o JEV-27B como ponto. Os modelos JEV e suas ressalvas foram para a ficha nova. A URL antiga, /pt-br/models/autotrust-jev, continua funcionando como nota de troca de nome, mas não aparece mais no catálogo nem no quadrante.
