RSI-Jev v3.0
Notas do quadrante
Ver o quadrante completoPontuação pela rubrica pública do quadrante (maturidade × capability; bolha = adoção). Revisamos conforme a evidência.
- Maturidade5.3/10
Pesos abertos, código MIT com logs versionados, write-up de RL e servidor no shape /v1/systemone. Loader custom load_release; sem PyPI nem SLA hospedado.
- Capability8/10
choice / noul / score de primeira classe, confidence head reajustada (ECE da suite 0,066, autor), ~10 ms por decisão. v3.0 adiciona RL listwise; números da suite/typed continuam self-run e em parte in-domain.
- Adoção9/100
Cerca de 20 estrelas no GitHub após o v3.0; likes no HF ainda perto de zero. Tração de pesquisa, sem uso em produção reportado.
Vendor claims
- v3.0 typed-decisions 0,791; média da suite 0,756 (era 0,736 no v2.1 na suite de quinze benches); ECE da suite 0,066[Claim do fornecedor — não verificado independentemente]
- Primeiro release em que reinforcement learning funciona: reward listwise sobe hippo R@1 de 0,192 → 0,308 (p = 2,4e-13) vs pai supervisionado[Claim do fornecedor — não verificado independentemente]
- Held-out vs v2.1: +0,016 (p = 0,011); corpus data-scale-2 com 266.131 perguntas de 36 fontes[Claim do fornecedor — não verificado independentemente]
- Cerca de 10 ms por decisão em uma forward pass[Claim do fornecedor — não verificado independentemente]
- O checkpoint reproduz as predições do treino em 1,0000 após reload[Claim do fornecedor — não verificado independentemente]
RSI-Jev v3.0 é um modelo de decisão open de 2B treinado por um loop de pesquisa que se melhora sozinho — e o primeiro release em que um estágio de reinforcement learning ganhou o lugar. Você passa um documento e perguntas tipadas (choice, noul, score); uma forward pass devolve probabilidade calibrada por opção. Não gera texto.
É fine-tune completo do Qwen/Qwen3.5-2B-Base com cabeça de scoring treinada e confidence head (oof_head_scorefloor). O v3.0 amplia o corpus supervisionado (data-scale-2), troca o combine do readout por um MLP e adiciona RL listwise (Plackett-Luce / NDCG@5) focado em rerank de memória. Sistema de pesquisa: próxima versão do AutoScientists.
Pesos: Hugging Face shgao/rsi-jev-v3.0-qwen3.5-2b (Apache-2.0). Código: github.com/Shanghua-Gao/RSI-Jev (MIT, ~20★). Anteriores: v2.1, v2.0, v1.0-2B, v1.0-0.8B — histórico nesta ficha.
Specs
| Atributo | Valor |
|---|---|
| Autor | Shanghua Gao (independente; linhagem AutoScientists) |
| Base | Qwen/Qwen3.5-2B-Base |
| Parâmetros | ~2B (tower + cabeça de scoring) |
| Readout | Cabeça treinada + MLP xattn combine (v3.0) |
| Calibração | Confidence head oof_head_scorefloor |
| Tipos | noul, choice, score |
| Licença | Apache-2.0 (pesos); MIT (código) |
| Lançamento | (v3.0 no HF) |
| Runtime | load_release / serve → POST /v1/systemone local |
Serving
Servidor HTTP no shape Jev (python scripts/serve.py --ckpt …). Rotas: /v1/systemone, /v1/models, /v1/limits, /health. Alias jev-latest. Compatibilidade de fio é claim do autor, não endosso TypeSafe.
Benchmarks do autor
Números do registro v3.0 e do card. Autor → UnverifiedClaim.
| Sinal | v3.0 | Nota |
|---|---|---|
| Média da suite (15) | 0,756 | Era 0,736 no v2.1 nesta suite |
| Typed-decisions | 0,791 | In-domain relativo à cobertura de treino |
| ECE da suite | 0,066 | Confidence head reajustada após RL |
| MMLU-Pro 1k | 0,364 | |
| hippo R@1 (RL listwise) | 0,308 | vs 0,192 pai supervisionado |
| Held-out vs v2.1 | +0,016 | p = 0,011 |
| Latência | ~10 ms | Claim do autor |
O v1.0 segue como referência zero-shot mais limpa.
Limites
- Números de suite / typed-decisions são em parte in-domain.
- Evals self-run; loader custom; sem PyPI/SLA; não é TypeSafe.
Fit / anti-fit
Fit: 2B local com trilha RSI documentada, sinal de rerank listwise-RL, ou server no shape Jev.
Anti-fit: transformers drop-in, SLA hospedado, ou número de capa tratado como zero-shot sem ler o card.
Por que está no catálogo
Tower + cabeça de scoring (+ confidence head) treinadas para decisão tipada. Pesos/código públicos e superfície /v1/systemone. Perto de Jev-Style, Decider, Decily, Eikos, OpenDecider.
Release mais nova: v6.0-VL (6/10/2026)
shgao/rsi-jev-v6.0-vl-4b (Apache-2.0, 4,69B) é um fine-tune completo do Qwen3.5-4B-Base, não LoRA. Tem saídas antecipadas nas camadas 16, 20 e 32, escolhidas pelo parâmetro effort (low / medium / high / auto) e informadas em usage.depth. Aceita texto e até 4 imagens; com imagem, roda sempre as 32 camadas.
Números do autor (UnverifiedClaim): Decision Index 0.2.1 completo 46,24 (rodada própria; v5.0-VL 38,38), held-out 0,698, ECE 0,036 no padrão / 0,024 no auto, mediana de 23 / 27 / 40 ms numa H200 por nível de effort.
Ressalvas: cinco das fontes de imagem do treino são não comerciais ou só para pesquisa, enquanto os pesos saem como Apache-2.0, e não está resolvido se esses termos se propagam. A errata do v5.0-VL informa que cerca de 1.000 linhas de teste do Decision Index entraram no treino (o autor estima efeito de 0,04 ponto ou menos). Fora do Decision Index oficial e do JevBench. As notas desta ficha não mudam.
