Surogate Rune 26B-A4B v3

Última atualização:

Aberto90–180ms$0/M input

Notas do quadrante

Ver o quadrante completo

Pontuação pela rubrica pública do quadrante (maturidade × capability; bolha = adoção). Revisamos conforme a evidência.

  • Maturidade5.8/10

    Pesos bf16 Apache-2.0 (gate com aprovação automática no HF), card detalhado, blog de lançamento e o engine aberto surogate, que treina e serve o modelo. O endpoint é /api/alpha/decisions, não /v1/systemone, então o SDK da TypeSafe não aponta para ele. Cita canais da empresa e API hospedada, mas sem SLA.

  • Capability7.9/10

    Noul, Choice e Score, com texto e imagem. #2 no Decision Index 0.2.1 oficial (57,44 vs Jev 57,91), rodada reproduzida pelos mantenedores. Superconfiante na temperatura padrão (ECE 0,12 no índice); o autor ajusta T=2. Latência de 90–180 ms por decisão é número do próprio autor.

  • Adoção11/100

    Cerca de 40 likes e 2,5 mil downloads no HF no primeiro mês, post de lançamento no LinkedIn com uma dúzia de reações e um espelho de terceiro. As 838 estrelas do surogate no GitHub são do engine, não do modelo. Sem uso em produção reportado.

Vendor claims

O Surogate Rune é um modelo de decisão de pesos abertos da Invergent, empresa europeia que também desenvolve o engine de treino e inferência surogate. É um fine-tune completo do google/gemma-4-26B-A4B-it: um mixture of experts de 26,5B parâmetros com cerca de 4B ativos por token, contexto de 262k e a torre de visão preservada. Você manda um estado (texto, dado estruturado ou imagem com texto) e perguntas tipadas, e recebe uma opção por pergunta com a probabilidade de todas as opções, numa única passada.

Não é produto da TypeSafe e não diz ter sido treinado com saídas do Jev. A Invergent chama os três tipos de pergunta de choice, noul e score, os mesmos nomes do Jev.

Ficha

Atributo Valor
Empresa Invergent (org surogate no HF)
Lançamento Repo no HF criado em 21/09/2026 (14:58 BRT) com os GGUF da v1; pesos bf16 da v3 e resultados do Decision Index até 26/09
Modelo base google/gemma-4-26B-A4B-it (MoE, 8 de 128 experts ativos)
Treino Fine-tune completo com o engine surogate; dados e receita não publicados
Pesos safetensors bf16, 51,6 GB, Apache-2.0. O repo tem gate de acesso com aprovação automática
Entradas Texto, estado JSON, imagens (--vision); contexto de 262k
Tipos de pergunta choice, noul (boolean no catálogo), score
Serving surogate serve → POST /api/alpha/decisions; também carrega como Gemma4ForConditionalGeneration padrão no transformers
Thinking Opcional por requisição: perguntas com confiança abaixo de 0,7 raciocinam até 512 tokens antes de responder
API hospedada Citada no blog de lançamento; ainda sem preço nem docs públicas

Nome do repositório e histórico

Apesar do nome, o repo canônico é o surogate/rune-26b-a4b-GGUF. Ele guardava primeiro os GGUF da v1 (compatíveis com llama.cpp, de JD-Q3_K_M a Q8_0, mais os projetores de visão). Esses arquivos agora só existem no histórico, na revisão 2a15504. Os arquivos atuais são a v3 em bf16, e o card diz que ainda não há GGUF da v3. A Invergent não tem outro repo sem GGUF.

Um espelho de terceiro, michaelfeil/rune-26b-a4b, republica os mesmos arquivos da v3 sem o gate (criado em 29/09/2026, 20:23 BRT). Não é lançamento oficial.

Decision Index 0.2.1 (Space oficial)

Medido pelo Space oficial do Decision Index (dados de 28/09/2026, 71 sistemas). A Invergent submeteu a rodada e diz que a reprodução dos mantenedores bateu bit a bit.

Sistema Index (balanced skill) Posição
Jev 1.13 57,91 #1
Surogate Rune 26B-A4B v3 57,44 #2
AutoJev-27B 56,40 #4

Áreas no card (valores do leaderboard): Knowledge & Reasoning 43,4, Language 63,1, Retrieval & Classification 63,5, Tools & Automation 71,2, Arts & Human Taste 41,9. O Rune fica à frente do Jev em linguagem, retrieval e artes, e bem atrás em conhecimento e raciocínio (Jev 51,3).

Na calibração, os números do próprio índice para o Rune são acurácia 0,748, confiança média 0,867, ECE 0,12 e Brier 0,370. Isso confirma a nota do autor de que o modelo é superconfiante na temperatura padrão.

UnverifiedClaim. O “59,2 com thinking” é estimativa da Invergent a partir de uma rodada completa própria com o scorer 0.2; não está no leaderboard. O ECE de 2,2% na temperatura 2, os resultados de imagem e todos os números de latência são medições do próprio autor.

Divergências entre fontes

  • LinkedIn vs card. O post de lançamento no LinkedIn (23/09) fala em “42ms to make a decision on a single RTX 5090 GPU” e “a 24B MoE with 4B activated per token”. O card e o blog dizem 26,5B parâmetros e 0,09–0,18 s de mediana por decisão numa RTX PRO 6000 (p90 de 0,2 s). Mantemos as duas versões como claim, sem escolher lado.
  • Linha de base do Jev. O card traz o Jev 1.13 com 57,89; o blog e o Space oficial dizem 57,91.
  • Edição anterior. O card da v1 dava Rune 57,24 vs Jev 59,51, numa rodada própria da Invergent com um build JD-Q6_K numa edição mais antiga do índice. Os números atuais são da v3 na edição 0.2.1.

Quando usar / quando não usar

Serve quando você precisa de: um modelo de decisão aberto perto da acurácia do Jev rodando no seu hardware, decisões sobre imagem (screenshots, documentos, gráficos), entradas longas ou dados que não podem sair do seu ambiente.

Não serve quando você precisa de: trocar direto pelo SDK da TypeSafe (endpoint diferente), GPU pequena (51,6 GB de pesos; a Invergent serve em placas de 96 GB), perguntas que dependem muito de conhecimento ou probabilidades calibradas sem ajustar a temperatura de decisão.

Limites

  • Dados e receita de treino não publicados.
  • As probabilidades padrão são superconfiantes; use --decision-temperature 2, que nunca muda a opção escolhida.
  • O surogate 1.5.3 pode cair sob carga contínua por um valor de roteador do MoE; o card manda usar um build com a correção #217.
  • Thinking ainda não funciona junto com imagens.

A Invergent treinou os pesos para decisão tipada (fine-tune completo, protocolo de decisão) e publica tudo aberto, com formato de requisição documentado que devolve probabilidades. Isso passa nos critérios do catálogo. Em 28/09/2026 é a entrada aberta mais forte no Decision Index oficial.