OneJev (0.8B / 4B / 9B / 27B)

Última atualização:

Aberto31–324ms$0/M input

Notas do quadrante

Ver o quadrante completo

Pontuação pela rubrica pública do quadrante (maturidade × capability; bolha = adoção). Revisamos conforme a evidência.

  • Maturidade5.4/10

    Pesos Apache-2.0 em quatro tamanhos (+27B-FP8), dados e receita de treino publicados, Space de demo e site. O servidor qev fala System One, então o SDK da TypeSafe funciona via base URL. O qev só instala pelo git (o nome no PyPI é de outro projeto). Sem API hospedada nem SLA.

  • Capability7.3/10

    Noul / Choice / Score com imagens e vídeo num único prefill. Loss de Brier e tabela de temperatura por tipo, mas sem ECE publicado. Latência de 31–324 ms é rodada dos autores numa H200, sem p99. Tabela de acurácia rodada pelos autores em sets próprios e públicos; fora do Decision Index.

  • Adoção10/100

    Quatro dias de vida: 106 estrelas no GitHub, ~2,3 mil downloads no HF oficial e quants da comunidade no primeiro dia (bartowski, mradermacher, onnx-community) com alguns milhares de downloads. Servidor companheiro (OpenDecisions) do mesmo autor. Sem casos de produção.

Vendor claims

Leia antes

  1. Todos os números abaixo são rodadas dos próprios autores (UnverifiedClaim). O OneJev não está no Decision Index oficial, cujos dados foram gerados pela última vez em 28/09.
  2. As linhas do Jev na tabela usam os scores publicados pela TypeSafe, só texto; as linhas de Jev-Omni e Qwen foram rodadas pelos autores. A comparação não é equivalente.
  3. pip install qev instala outro pacote, sem relação. O pacote do OneJev se instala pelo repo do GitHub (pip install git+https://github.com/OmniJev/OneJev).

O OneJev é uma família aberta de modelos de decisão multimodais da organização OmniJev, publicada no Hugging Face em 27 de setembro de 2026 (por volta das 13:15 BRT) em quatro tamanhos: 0.8B, 4B, 9B e 27B, além de um build 27B FP8. Cada um é um fine-tune completo de um modelo de visão e linguagem Qwen (Qwen3.5-0.8B / 4B / 9B e Qwen3.8-27B) com a torre de visão congelada. Como o Jev, responde perguntas tipadas num único prefill e devolve probabilidades, não texto. Diferente do Jev, o estado pode incluir imagens e vídeo junto com o texto.

Especificações

Atributo Valor
Autor OmniJev (mantenedor: unikcc)
Tamanhos 0.8B, 4B, 9B, 27B (+ 27B-FP8)
Base Qwen3.5-0.8B / 4B / 9B, Qwen3.8-27B (torre de visão congelada)
Treino 1 época, lr 5e-6, limite de 16.384 tokens, cross-entropy + loss de Brier sobre as respostas
Dados 99.193 perguntas; 94.707 publicadas como OneJev-Data (17,7 GB)
Tipos de pergunta Noul, Choice, Score
Entrada Estado em texto/JSON mais um campo media (imagens, vídeo)
Serving qev serve (endpoint System One, compatível com o SDK da TypeSafe), llama.cpp via GGUF, OpenDecisions
Licença Apache-2.0 (código e pesos)
Lançamento

Evidências (UnverifiedClaim)

Benchmark (27B) OneJev Jev 1.13 Jev-Omni Qwen3.8-27B thinking
Test set OneJev (held out) 77,4 — 60,8 71,6
DecisionBench medium 87,9 90,5 — —
DecisionBench hard 73,1 65,3 — —
TypeSafe evals 89,3 89,0 — —
MMBench 92,3 — — —
MMStar 72,2 — — —

Latência (uma H200, screenshot 1280×720, 1 / 10 perguntas): 0.8B 31 / 51 ms, 4B 64 / 104 ms, 9B 81 / 131 ms, 27B 189 / 324 ms. Não há p99 nem rodada de terceiros por enquanto.

Quando usar / quando evitar

Usar: decisões sobre screenshots, estados de UI, fotos ou vídeos curtos (checagem de passos de agente, triagem visual, filas de moderação) quando você quer pesos abertos e serving local; times que querem continuar o fine-tune (dados e configs são públicos).

Evitar: qualquer coisa que precise de SLA hospedado ou de score verificado de forma independente; uso comercial que não aceite a cadeia de licenças do Qwen; cargas só de texto em que um modelo menor já está medido no Decision Index.

Limites

  • Nenhuma métrica de calibração (ECE) publicada, embora o treino use loss de Brier e o qev aplique uma tabela de temperatura por tipo de pergunta.
  • Limite de treino de 16.384 tokens; o comportamento além disso não está documentado.
  • O repo tem quatro dias e um único mantenedor.

O OneJev treina pesos de decisão próprios (fine-tunes completos com loss de decisão), publica sob Apache-2.0 e serve por um endpoint System One que devolve probabilidades. Isso cumpre o critério do catálogo. A entrada multimodal é o diferencial: só o Jev-Omni e o Cloudflare Clef também aceitam imagens.