Gero-4B

Última atualização:

Aberto—$0/M input

Notas do quadrante

Ver o quadrante completo

Pontuação pela rubrica pública do quadrante (maturidade × capability; bolha = adoção). Revisamos conforme a evidência.

  • Maturidade4.6/10

    Fine-tune Apache-2.0 do Qwen3-4B no HF, com card longo e helpers de transformers prontos para colar. Sem runtime próprio, sem servidor /v1/systemone, sem API hospedada. Autor independente, sem SLA.

  • Capability6.1/10

    Choice (até 256 opções), Score (2–10 níveis) e sim/não, sem viés de posição por desenho. Calibração via estágio de RL descrito com scoring rule própria, mas sem ECE nem temperaturas publicadas. Sem números de latência e sem benchmark público.

  • Adoção2/100

    Cerca de 65 downloads e 6 likes no HF (5/10). Sem runtime no GitHub, sem integrações e sem uso em produção reportado.

Vendor claims

Leia antes

  1. Sem números publicados. O card descreve a arquitetura e uma receita de treino em três estágios, inclusive reinforcement learning para calibração, mas não reporta acurácia, ECE, latência nem nenhum benchmark público. Tudo sobre qualidade é claim de arquitetura até alguém medir.
  2. Não é /v1/systemone. A inferência é via helpers de AutoModelForSequenceClassification no card (um forward pass por opção e depois softmax). Não há servidor compatível com a TypeSafe no repo.
  3. Os campos de latência são 0–0 ms nesta ficha porque nenhum número foi publicado — é o sentinel do catálogo para “desconhecido”, não um claim de custo zero.

O que é

O Gero-4B é o primeiro modelo de uma família independente “Gero” (nome de Gerolamo Cardano). Parte do Qwen/Qwen3-4B e é reconstruído como scorer: a cabeça de linguagem some e um único scorer linear aprendido lê o token final de cada opção.

Tipo Objetivo Devolve
Choice Escolher uma entre até 256 opções Rótulo escolhido, probabilidades, confiança
Score Colocar o estado em 2–10 níveis ordenados Score esperado, probabilidades por nível, confiança
Sim/não Se uma afirmação vale P(sim)

Cross-encoder ramificado. O estado e a pergunta formam um prefixo compartilhado. Cada opção é um ramo próprio que atende a esse prefixo; as opções não se veem, e o prefixo não vê as opções. Um softmax entre os ramos transforma os scores numa distribuição. Consequências que o autor destaca: sem viés de posição, qualquer número de opções com um scorer só, e (com cache de prefixo) o estado é codificado uma vez.

Treino (como declarado)

  1. Readout — arquitetura ramificada e scorer compartilhado.
  2. Instrução e estrutura — dados feitos sob medida para os três tipos, conjuntos de 1 a 256 opções, escalas ordenadas, negação e atributos soltos.
  3. Reinforcement learning para decisões calibradas — desfechos amostrados da distribuição verdadeira de cada item; a recompensa combina a probabilidade do desfecho amostrado com a calibração da confiança da melhor resposta (descrita como proper scoring rule).

Não há dataset, orçamento de compute, ECE nem tabela de temperatura publicados. O inglês é a língua de treino.

Quando usar / quando não usar

Serve quando você precisa de: um scorer aberto que lida nativamente com listas longas de escolha (até 256) sem slot reservado por opção, e você topa medir a calibração você mesmo.

Não serve quando você precisa de: acurácia verificada, um endpoint /v1/systemone, latência publicada, ou qualquer coisa fora do inglês sem a sua própria eval.

Conta das notas (5/10/2026)

  • Maturidade = disponibilidade 8 × 0,30 + docs 6 × 0,25 + integrações 2 × 0,25 + suporte 1 × 0,20 = 2,40 + 1,50 + 0,50 + 0,20 = 4,60
  • Capability = tipos 10 × 0,30 + calibração 5 × 0,25 + latência 4 × 0,25 + acurácia 4 × 0,20 = 3,00 + 1,25 + 1,00 + 0,80 = 6,05 → 6,1
  • Adoção = engajamento 5 × 0,35 + ecossistema 2 × 0,35 + produção 0 × 0,30 = 1,75 + 0,70 + 0 = 2,45 → 2

Calibração 5: o método de RL é descrito (a faixa “claim + método” começa em 7 quando há números); sem ECE fica na base. Latência 4 e acurácia 4 seguem os precedentes de “sem números públicos”.