NeoHorse-Jev-4B
Notas do quadrante
Ver o quadrante completoPontuação pela rubrica pública do quadrante (maturidade × capability; bolha = adoção). Revisamos conforme a evidência.
- Maturidade6.1/10
Pacote Apache-2.0 no HF e no ModelScope (backbone, head de decisão, wheel do runtime), repo GGUF oficial, guia DEPLOYMENT, adapters para vLLM e SGLang e endpoint /v1/systemone no servidor nativo. Tem empresa por trás, mas sem SLA.
- Capability5.7/10
Noul, Choice e Score, com texto e uma imagem. O card não traz calibração nem latência. O Decision Index 0.2.1 oficial dá 36,75 (#30 de 71, ECE 0,10), longe da média de seis grupos de 77,70 informada pelo autor.
- Adoção9/100
Cerca de 20 likes e 2,2 mil downloads no HF, mais 2,4 mil no repo GGUF. O projeto-mãe NeoHorse-1 é popular (1,3 mil estrelas no GitHub), mas isso não é deste modelo. Citado como baseline pela AutoTrust; sem uso em produção reportado.
Vendor claims
- 77,70 na média de seis grupos de texto (JevBench 75,73, Kev 81,92, OpenJev text 58,74, Nimble 87,23, VitaminC 77,13, MASSIVE 85,43), a maior entre quatro modelos abertos comparados[Claim do fornecedor — não verificado independentemente]
- 83,26% de acurácia média em Nimble, VitaminC e MASSIVE, 11,50 pontos acima da base NeoHorse-1-4B[Claim do fornecedor — não verificado independentemente]
- Demos em jogos (Tetris, Snake, Doom, Flappy, Minecraft, Mahjong, direção) com tabelas comparativas rodadas pelo autor[Claim do fornecedor — não verificado independentemente]
O NeoHorse-Jev-4B é um modelo de decisão de 4B da TokenRhythm, lançado em 23 de setembro de 2026. Ele parte do NeoHorse-1-4B, um pós-treino agêntico do Qwen3.5-4B feito pela própria empresa. Com um estado e perguntas definidas pela sua aplicação, ele devolve decisões com probabilidades, usando só prefill e três tipos: Choice, Noul e Score. As requisições também aceitam uma imagem.
Não é produto da TypeSafe. O “Jev” no nome se refere ao formato da interface.
Linhagem: arquitetura do Kev, treino próprio
O código de inferência traz model.py e schema.py do Kev, de Jared Palmer (Apache-2.0, com crédito no NOTICE.md do pacote e nos agradecimentos do card), e o model_manifest.json informa runtime_origin: github.com/jaredpalmer/kev. O desenho é o do Kev: um backbone com LoRA mesclado mais um head pointer separado (projeções q/k, dimensão 256).
Não é um reupload do Kev. Em 30/09/2026 comparamos os quatro tensores do pointer_head.safetensors do NeoHorse com o head.pt do jaredpalmer/kev-4b, e nenhum bate. O backbone também é outro (NeoHorse-1-4B em vez de Qwen3.5-4B-Base). Por isso ganha ficha própria, como aconteceu com o Jev-Omni e o this-that-model depois de adaptarem o Decider-2B.
A TokenRhythm não publica os dados nem a receita de treino do head de decisão e do LoRA. A torre de visão vem sem alteração do Qwen3.5-4B (vision_finetuning: false).
Ficha
| Atributo | Valor |
|---|---|
| Empresa | TokenRhythm (X: @opensquilla) |
| Lançamento | 23/09/2026 (repo no HF às 12:42 BRT); repo GGUF oficial em 24/09 |
| Modelo base | NeoHorse-1-4B (que vem do Qwen3.5-4B) |
| Arquitetura | Backbone com LoRA mesclado + head pointer de decisão separado (desenho do Kev) |
| Entradas | Texto, ou uma imagem mais texto |
| Tipos de pergunta | choice, noul (boolean no catálogo), score |
| Serving | Adapters para vLLM 0.28.0 ou SGLang 0.5.17 (GitHub), ou o runtime nativo neohorse_decision com /v1/decision e /v1/systemone |
| Pesos | Backbone de ~9,08 GB, Apache-2.0, no HF e no ModelScope |
| Calibração / latência | Não informadas pelo autor |
Resultados declarados vs índice oficial
O destaque do card é uma média de seis grupos de texto: 77,70 para o NeoHorse-Jev-4B, à frente do Open-Jev-9B (75,67), do Kev-4B (74,25) e do Laya English (58,24). Todas as rodadas são da TokenRhythm, com subconjuntos escolhidos por ela (por exemplo, 282 de 324 exemplos do Nimble). UnverifiedClaim.
O Space oficial do Decision Index (dados de 28/09/2026, 71 sistemas) mede bem menos:
| Sistema | Index (balanced skill) | Posição | ECE |
|---|---|---|---|
| Jev 1.13 | 57,91 | #1 | — |
| Bespoke Nimble 9B v2 | 39,57 | #24 | — |
| NeoHorse-Jev-4B | 36,75 | #30 | 0,104 |
| Kev 4B | 34,64 | #32 | — |
Ou seja, o modelo fica um pouco à frente do Kev 4B, o que combina com a linhagem, mas o índice não sustenta a leitura de “melhor modelo aberto” do card. O índice registra a base como Qwen3.5-4B-Base e o tipo como “head / adapter”; o card diz NeoHorse-1-4B.
Quando usar / quando não usar
Serve quando você precisa de: um modelo de decisão de 4B para servir em vLLM ou SGLang, decisões em loops de agentes e jogos, ou um modelo no estilo Kev com entrada de imagem.
Não serve quando você precisa de: probabilidades calibradas de fábrica (o índice mede ECE de 0,10; o autor manda ajustar limiares com seus próprios dados), latência publicada ou acurácia perto do Jev.
Limites
- O autor não informa NLL, Brier nem ECE, nem comparação de latência ou memória.
- Dados e receita de treino não publicados.
- Segundo o card, várias perguntas na mesma requisição não dividem uma única passada.
- Comportamento multilíngue e com entradas longas não avaliado.
Por que está no catálogo
O head de decisão e o LoRA foram treinados (o head é diferente do Kev) e vêm com runtime aberto que devolve decisões tipadas com probabilidades. Isso passa nos critérios do catálogo. O ponto no quadrante usa o índice oficial, não a média declarada.
