AutoTrust republica seu modelo de decisão Gemma como GEV-26B-Decide, com pensamento adaptativo

Última atualização:

Source

A AutoTrust AI publicou o autotrust/GEV-26B-Decide em 2 de outubro de 2026, à 01:20 (horário de Brasília), e acrescentou resultados de demos no dia 3. O card diz que o modelo “was previously published as autotrust/JEV-Gemma4-26B-A4B; the weights are the same” (já foi publicado como JEV-Gemma4-26B-A4B; os pesos são os mesmos). Comparamos os arquivos: o adapter, o head de decisão e os shards da base têm hashes idênticos. É um repositório novo, e não um rename no Hugging Face. O repo antigo continua no ar, sem mudanças desde 29 de setembro, e o JEV-27B, o JEV-9B e o JEV-27B-VL mantêm os nomes.

O que há de novo. Os pesos de decisão são os mesmos; o que mudou foi tudo em volta deles:

  • Pensamento adaptativo (opcional). O System 1 responde primeiro, numa passada (cerca de 45 ms numa B200). Se a opção mais provável fica abaixo de 0,8 de confiança, o modelo base Gemma pensa e a resposta dele entra na média.
  • Um servidor vLLM com a rota POST /v1/decide. Ele exige um build de desenvolvimento do vLLM com patch e uma GPU de 80 GB.
  • Duas demos: uso de computador (escolher o próximo clique a partir de um print de tela) e um braço robótico simulado.

Números da AutoTrust (UnverifiedClaim).

Afirmação Resultado Observação
Decision Index 0.2.1 62,48 vs 57,91 do Jev Pontuação própria. Conhecimento e Raciocínio usa pensamento adaptativo (mediana de 13,4 s por requisição; o placar exige ≤ 1 s). Os mesmos pesos tiveram 58,05 só com System 1
Validação, 1.754 perguntas fora do índice 73,3% → 83,4% pensando, ECE 0,035 Pensa em 48% das perguntas
Benchmarks de raciocínio GPQA Diamond 42,9 → 78,6, MMLU-Pro 65,0 → 84,6, BBH 75,0 → 92,0 No HLE só sai de abaixo do acaso para o nível do acaso (8,4 → 17,8)
Uso de computador, 60 tarefas de navegador 95% a ≈ 85 ms por clique 15% sem o texto dos elementos; o JEV-27B-VL também faz 95%, a 260 ms
Braço robótico, 20 cenas simuladas 40% a 61 ms por decisão JEV-27B-VL 75%; 0/10 quando escolhe comandos de motor direto
Puzzles Campo Minado 21 → 86%, Wordle 52 → 100%, Sudoku 76 → 99,5% Pensar não ajuda em partidas inteiras nem em rabiscos

O que levar em conta.

  • Sobreposição de dados de treino. O card declara que o treino usou os splits de treino de benchmarks cujos splits de teste estão no Decision Index (entre eles BANKING77 e CLINC150). Pensar piorou o BANKING77 (88,0 → 85,0).
  • Destilação de um professor. O System 1 aprendeu com “teacher distributions” (distribuições de um professor), e na família JEV da AutoTrust o professor é o Jev 1.13 fechado. As demos são simulações pequenas, montadas pela própria AutoTrust.
  • Downloads. O repo novo mostra 310.028 downloads em dois dias contra 7 likes. Não contamos esse número.
  • Licença. A tag de licença diz Apache-2.0, mas isso só cobre o adapter, o head e os arquivos de calibração. Os pesos da base seguem os termos do Gemma 4.
  • Não é TypeSafe. A AutoTrust não tem vínculo com a TypeSafe.

O que muda aqui. A ficha da AutoTrust no catálogo agora é o GEV-26B-Decide, com nota 6,3 / 7,8 / 10 (maturidade / capability / adoção). Ela substitui a ficha da família, que tinha 6,1 / 7,5 / 9 com o JEV-27B como ponto. Os modelos JEV e suas ressalvas foram para a ficha nova. A URL antiga, /pt-br/models/autotrust-jev, continua funcionando como nota de troca de nome, mas não aparece mais no catálogo nem no quadrante.