NeoHorse-Jev-4B

Última atualização:

Aberto—$0/M input

Notas do quadrante

Ver o quadrante completo

Pontuação pela rubrica pública do quadrante (maturidade × capability; bolha = adoção). Revisamos conforme a evidência.

  • Maturidade6.1/10

    Pacote Apache-2.0 no HF e no ModelScope (backbone, head de decisão, wheel do runtime), repo GGUF oficial, guia DEPLOYMENT, adapters para vLLM e SGLang e endpoint /v1/systemone no servidor nativo. Tem empresa por trás, mas sem SLA.

  • Capability5.7/10

    Noul, Choice e Score, com texto e uma imagem. O card não traz calibração nem latência. O Decision Index 0.2.1 oficial dá 36,75 (#30 de 71, ECE 0,10), longe da média de seis grupos de 77,70 informada pelo autor.

  • Adoção9/100

    Cerca de 20 likes e 2,2 mil downloads no HF, mais 2,4 mil no repo GGUF. O projeto-mãe NeoHorse-1 é popular (1,3 mil estrelas no GitHub), mas isso não é deste modelo. Citado como baseline pela AutoTrust; sem uso em produção reportado.

Vendor claims

O NeoHorse-Jev-4B é um modelo de decisão de 4B da TokenRhythm, lançado em 23 de setembro de 2026. Ele parte do NeoHorse-1-4B, um pós-treino agêntico do Qwen3.5-4B feito pela própria empresa. Com um estado e perguntas definidas pela sua aplicação, ele devolve decisões com probabilidades, usando só prefill e três tipos: Choice, Noul e Score. As requisições também aceitam uma imagem.

Não é produto da TypeSafe. O “Jev” no nome se refere ao formato da interface.

Linhagem: arquitetura do Kev, treino próprio

O código de inferência traz model.py e schema.py do Kev, de Jared Palmer (Apache-2.0, com crédito no NOTICE.md do pacote e nos agradecimentos do card), e o model_manifest.json informa runtime_origin: github.com/jaredpalmer/kev. O desenho é o do Kev: um backbone com LoRA mesclado mais um head pointer separado (projeções q/k, dimensão 256).

Não é um reupload do Kev. Em 30/09/2026 comparamos os quatro tensores do pointer_head.safetensors do NeoHorse com o head.pt do jaredpalmer/kev-4b, e nenhum bate. O backbone também é outro (NeoHorse-1-4B em vez de Qwen3.5-4B-Base). Por isso ganha ficha própria, como aconteceu com o Jev-Omni e o this-that-model depois de adaptarem o Decider-2B.

A TokenRhythm não publica os dados nem a receita de treino do head de decisão e do LoRA. A torre de visão vem sem alteração do Qwen3.5-4B (vision_finetuning: false).

Ficha

Atributo Valor
Empresa TokenRhythm (X: @opensquilla)
Lançamento 23/09/2026 (repo no HF às 12:42 BRT); repo GGUF oficial em 24/09
Modelo base NeoHorse-1-4B (que vem do Qwen3.5-4B)
Arquitetura Backbone com LoRA mesclado + head pointer de decisão separado (desenho do Kev)
Entradas Texto, ou uma imagem mais texto
Tipos de pergunta choice, noul (boolean no catálogo), score
Serving Adapters para vLLM 0.28.0 ou SGLang 0.5.17 (GitHub), ou o runtime nativo neohorse_decision com /v1/decision e /v1/systemone
Pesos Backbone de ~9,08 GB, Apache-2.0, no HF e no ModelScope
Calibração / latência Não informadas pelo autor

Resultados declarados vs índice oficial

O destaque do card é uma média de seis grupos de texto: 77,70 para o NeoHorse-Jev-4B, à frente do Open-Jev-9B (75,67), do Kev-4B (74,25) e do Laya English (58,24). Todas as rodadas são da TokenRhythm, com subconjuntos escolhidos por ela (por exemplo, 282 de 324 exemplos do Nimble). UnverifiedClaim.

O Space oficial do Decision Index (dados de 28/09/2026, 71 sistemas) mede bem menos:

Sistema Index (balanced skill) Posição ECE
Jev 1.13 57,91 #1 —
Bespoke Nimble 9B v2 39,57 #24 —
NeoHorse-Jev-4B 36,75 #30 0,104
Kev 4B 34,64 #32 —

Ou seja, o modelo fica um pouco à frente do Kev 4B, o que combina com a linhagem, mas o índice não sustenta a leitura de “melhor modelo aberto” do card. O índice registra a base como Qwen3.5-4B-Base e o tipo como “head / adapter”; o card diz NeoHorse-1-4B.

Quando usar / quando não usar

Serve quando você precisa de: um modelo de decisão de 4B para servir em vLLM ou SGLang, decisões em loops de agentes e jogos, ou um modelo no estilo Kev com entrada de imagem.

Não serve quando você precisa de: probabilidades calibradas de fábrica (o índice mede ECE de 0,10; o autor manda ajustar limiares com seus próprios dados), latência publicada ou acurácia perto do Jev.

Limites

  • O autor não informa NLL, Brier nem ECE, nem comparação de latência ou memória.
  • Dados e receita de treino não publicados.
  • Segundo o card, várias perguntas na mesma requisição não dividem uma única passada.
  • Comportamento multilíngue e com entradas longas não avaliado.

O head de decisão e o LoRA foram treinados (o head é diferente do Kev) e vêm com runtime aberto que devolve decisões tipadas com probabilidades. Isso passa nos critérios do catálogo. O ponto no quadrante usa o índice oficial, não a média declarada.