RSI-Jev v3.0

Última atualização:

Aberto10–10ms$0/M input

Notas do quadrante

Ver o quadrante completo

Pontuação pela rubrica pública do quadrante (maturidade × capability; bolha = adoção). Revisamos conforme a evidência.

  • Maturidade5.3/10

    Pesos abertos, código MIT com logs versionados, write-up de RL e servidor no shape /v1/systemone. Loader custom load_release; sem PyPI nem SLA hospedado.

  • Capability8/10

    choice / noul / score de primeira classe, confidence head reajustada (ECE da suite 0,066, autor), ~10 ms por decisão. v3.0 adiciona RL listwise; números da suite/typed continuam self-run e em parte in-domain.

  • Adoção9/100

    Cerca de 20 estrelas no GitHub após o v3.0; likes no HF ainda perto de zero. Tração de pesquisa, sem uso em produção reportado.

Vendor claims

RSI-Jev v3.0 é um modelo de decisão open de 2B treinado por um loop de pesquisa que se melhora sozinho — e o primeiro release em que um estágio de reinforcement learning ganhou o lugar. Você passa um documento e perguntas tipadas (choice, noul, score); uma forward pass devolve probabilidade calibrada por opção. Não gera texto.

É fine-tune completo do Qwen/Qwen3.5-2B-Base com cabeça de scoring treinada e confidence head (oof_head_scorefloor). O v3.0 amplia o corpus supervisionado (data-scale-2), troca o combine do readout por um MLP e adiciona RL listwise (Plackett-Luce / NDCG@5) focado em rerank de memória. Sistema de pesquisa: próxima versão do AutoScientists.

Pesos: Hugging Face shgao/rsi-jev-v3.0-qwen3.5-2b (Apache-2.0). Código: github.com/Shanghua-Gao/RSI-Jev (MIT, ~20★). Anteriores: v2.1, v2.0, v1.0-2B, v1.0-0.8B — histórico nesta ficha.

Specs

Atributo Valor
Autor Shanghua Gao (independente; linhagem AutoScientists)
Base Qwen/Qwen3.5-2B-Base
Parâmetros ~2B (tower + cabeça de scoring)
Readout Cabeça treinada + MLP xattn combine (v3.0)
Calibração Confidence head oof_head_scorefloor
Tipos noul, choice, score
Licença Apache-2.0 (pesos); MIT (código)
Lançamento (v3.0 no HF)
Runtime load_release / serve → POST /v1/systemone local

Serving

Servidor HTTP no shape Jev (python scripts/serve.py --ckpt …). Rotas: /v1/systemone, /v1/models, /v1/limits, /health. Alias jev-latest. Compatibilidade de fio é claim do autor, não endosso TypeSafe.

Benchmarks do autor

Números do registro v3.0 e do card. Autor → UnverifiedClaim.

Sinal v3.0 Nota
Média da suite (15) 0,756 Era 0,736 no v2.1 nesta suite
Typed-decisions 0,791 In-domain relativo à cobertura de treino
ECE da suite 0,066 Confidence head reajustada após RL
MMLU-Pro 1k 0,364
hippo R@1 (RL listwise) 0,308 vs 0,192 pai supervisionado
Held-out vs v2.1 +0,016 p = 0,011
Latência ~10 ms Claim do autor

O v1.0 segue como referência zero-shot mais limpa.

Limites

  • Números de suite / typed-decisions são em parte in-domain.
  • Evals self-run; loader custom; sem PyPI/SLA; não é TypeSafe.

Fit / anti-fit

Fit: 2B local com trilha RSI documentada, sinal de rerank listwise-RL, ou server no shape Jev.

Anti-fit: transformers drop-in, SLA hospedado, ou número de capa tratado como zero-shot sem ler o card.

Tower + cabeça de scoring (+ confidence head) treinadas para decisão tipada. Pesos/código públicos e superfície /v1/systemone. Perto de Jev-Style, Decider, Decily, Eikos, OpenDecider.

Release mais nova: v6.0-VL (6/10/2026)

shgao/rsi-jev-v6.0-vl-4b (Apache-2.0, 4,69B) é um fine-tune completo do Qwen3.5-4B-Base, não LoRA. Tem saídas antecipadas nas camadas 16, 20 e 32, escolhidas pelo parâmetro effort (low / medium / high / auto) e informadas em usage.depth. Aceita texto e até 4 imagens; com imagem, roda sempre as 32 camadas.

Números do autor (UnverifiedClaim): Decision Index 0.2.1 completo 46,24 (rodada própria; v5.0-VL 38,38), held-out 0,698, ECE 0,036 no padrão / 0,024 no auto, mediana de 23 / 27 / 40 ms numa H200 por nível de effort.

Ressalvas: cinco das fontes de imagem do treino são não comerciais ou só para pesquisa, enquanto os pesos saem como Apache-2.0, e não está resolvido se esses termos se propagam. A errata do v5.0-VL informa que cerca de 1.000 linhas de teste do Decision Index entraram no treino (o autor estima efeito de 0,04 ponto ou menos). Fora do Decision Index oficial e do JevBench. As notas desta ficha não mudam.