Gero-4B
Notas do quadrante
Ver o quadrante completoPontuação pela rubrica pública do quadrante (maturidade × capability; bolha = adoção). Revisamos conforme a evidência.
- Maturidade4.6/10
Fine-tune Apache-2.0 do Qwen3-4B no HF, com card longo e helpers de transformers prontos para colar. Sem runtime próprio, sem servidor /v1/systemone, sem API hospedada. Autor independente, sem SLA.
- Capability6.1/10
Choice (até 256 opções), Score (2–10 níveis) e sim/não, sem viés de posição por desenho. Calibração via estágio de RL descrito com scoring rule própria, mas sem ECE nem temperaturas publicadas. Sem números de latência e sem benchmark público.
- Adoção2/100
Cerca de 65 downloads e 6 likes no HF (5/10). Sem runtime no GitHub, sem integrações e sem uso em produção reportado.
Vendor claims
- Cross-encoder ramificado: prefixo compartilhado de estado/pergunta, um scorer linear por ramo de opção, softmax entre ramos; a ordem das opções não muda nenhuma probabilidade[Claim do fornecedor — não verificado independentemente]
- O estágio 3 do treino usa reinforcement learning para decisões calibradas, com uma proper scoring rule sobre desfechos amostrados da distribuição verdadeira[Claim do fornecedor — não verificado independentemente]
- Suporta até 256 opções de choice e escalas ordenadas de 2 a 10 níveis; o inglês é a língua de treino[Claim do fornecedor — não verificado independentemente]
Leia antes
- Sem números publicados. O card descreve a arquitetura e uma receita de treino em três estágios, inclusive reinforcement learning para calibração, mas não reporta acurácia, ECE, latência nem nenhum benchmark público. Tudo sobre qualidade é claim de arquitetura até alguém medir.
- Não é
/v1/systemone. A inferência é via helpers deAutoModelForSequenceClassificationno card (um forward pass por opção e depois softmax). Não há servidor compatível com a TypeSafe no repo.- Os campos de latência são 0–0 ms nesta ficha porque nenhum número foi publicado — é o sentinel do catálogo para “desconhecido”, não um claim de custo zero.
O que é
O Gero-4B é o primeiro modelo de uma família independente “Gero” (nome de Gerolamo Cardano). Parte do Qwen/Qwen3-4B e é reconstruído como scorer: a cabeça de linguagem some e um único scorer linear aprendido lê o token final de cada opção.
| Tipo | Objetivo | Devolve |
|---|---|---|
| Choice | Escolher uma entre até 256 opções | Rótulo escolhido, probabilidades, confiança |
| Score | Colocar o estado em 2–10 níveis ordenados | Score esperado, probabilidades por nível, confiança |
| Sim/não | Se uma afirmação vale | P(sim) |
Cross-encoder ramificado. O estado e a pergunta formam um prefixo compartilhado. Cada opção é um ramo próprio que atende a esse prefixo; as opções não se veem, e o prefixo não vê as opções. Um softmax entre os ramos transforma os scores numa distribuição. Consequências que o autor destaca: sem viés de posição, qualquer número de opções com um scorer só, e (com cache de prefixo) o estado é codificado uma vez.
Treino (como declarado)
- Readout — arquitetura ramificada e scorer compartilhado.
- Instrução e estrutura — dados feitos sob medida para os três tipos, conjuntos de 1 a 256 opções, escalas ordenadas, negação e atributos soltos.
- Reinforcement learning para decisões calibradas — desfechos amostrados da distribuição verdadeira de cada item; a recompensa combina a probabilidade do desfecho amostrado com a calibração da confiança da melhor resposta (descrita como proper scoring rule).
Não há dataset, orçamento de compute, ECE nem tabela de temperatura publicados. O inglês é a língua de treino.
Quando usar / quando não usar
Serve quando você precisa de: um scorer aberto que lida nativamente com listas longas de escolha (até 256) sem slot reservado por opção, e você topa medir a calibração você mesmo.
Não serve quando você precisa de: acurácia verificada, um endpoint /v1/systemone, latência publicada, ou qualquer coisa fora do inglês sem a sua própria eval.
Conta das notas (5/10/2026)
- Maturidade = disponibilidade 8 × 0,30 + docs 6 × 0,25 + integrações 2 × 0,25 + suporte 1 × 0,20 = 2,40 + 1,50 + 0,50 + 0,20 = 4,60
- Capability = tipos 10 × 0,30 + calibração 5 × 0,25 + latência 4 × 0,25 + acurácia 4 × 0,20 = 3,00 + 1,25 + 1,00 + 0,80 = 6,05 → 6,1
- Adoção = engajamento 5 × 0,35 + ecossistema 2 × 0,35 + produção 0 × 0,30 = 1,75 + 0,70 + 0 = 2,45 → 2
Calibração 5: o método de RL é descrito (a faixa “claim + método” começa em 7 quando há números); sem ECE fica na base. Latência 4 e acurácia 4 seguem os precedentes de “sem números públicos”.
