OneJev (0.8B / 4B / 9B / 27B)
Notas do quadrante
Ver o quadrante completoPontuação pela rubrica pública do quadrante (maturidade × capability; bolha = adoção). Revisamos conforme a evidência.
- Maturidade5.4/10
Pesos Apache-2.0 em quatro tamanhos (+27B-FP8), dados e receita de treino publicados, Space de demo e site. O servidor qev fala System One, então o SDK da TypeSafe funciona via base URL. O qev só instala pelo git (o nome no PyPI é de outro projeto). Sem API hospedada nem SLA.
- Capability7.3/10
Noul / Choice / Score com imagens e vídeo num único prefill. Loss de Brier e tabela de temperatura por tipo, mas sem ECE publicado. Latência de 31–324 ms é rodada dos autores numa H200, sem p99. Tabela de acurácia rodada pelos autores em sets próprios e públicos; fora do Decision Index.
- Adoção10/100
Quatro dias de vida: 106 estrelas no GitHub, ~2,3 mil downloads no HF oficial e quants da comunidade no primeiro dia (bartowski, mradermacher, onnx-community) com alguns milhares de downloads. Servidor companheiro (OpenDecisions) do mesmo autor. Sem casos de produção.
Vendor claims
- OneJev-27B: 77,4 no test set próprio (held out) vs 60,8 do Jev-Omni e 71,6 do Qwen3.8-27B thinking (rodadas dos autores)[Claim do fornecedor — não verificado independentemente]
- DecisionBench medium 87,9 vs Jev 90,5; DecisionBench hard 73,1 vs Jev 65,3; TypeSafe evals 89,3 vs 89,0 (Jev = scores publicados, só texto)[Claim do fornecedor — não verificado independentemente]
- MMBench 92,3 e MMStar 72,2 para o 27B[Claim do fornecedor — não verificado independentemente]
- Latência numa H200 com screenshot 1280×720, 1 / 10 perguntas: 0.8B 31 / 51 ms, 4B 64 / 104 ms, 9B 81 / 131 ms, 27B 189 / 324 ms[Claim do fornecedor — não verificado independentemente]
Leia antes
- Todos os números abaixo são rodadas dos próprios autores (UnverifiedClaim). O OneJev não está no Decision Index oficial, cujos dados foram gerados pela última vez em 28/09.
- As linhas do Jev na tabela usam os scores publicados pela TypeSafe, só texto; as linhas de Jev-Omni e Qwen foram rodadas pelos autores. A comparação não é equivalente.
pip install qevinstala outro pacote, sem relação. O pacote do OneJev se instala pelo repo do GitHub (pip install git+https://github.com/OmniJev/OneJev).
O OneJev é uma família aberta de modelos de decisão multimodais da organização OmniJev, publicada no Hugging Face em 27 de setembro de 2026 (por volta das 13:15 BRT) em quatro tamanhos: 0.8B, 4B, 9B e 27B, além de um build 27B FP8. Cada um é um fine-tune completo de um modelo de visão e linguagem Qwen (Qwen3.5-0.8B / 4B / 9B e Qwen3.8-27B) com a torre de visão congelada. Como o Jev, responde perguntas tipadas num único prefill e devolve probabilidades, não texto. Diferente do Jev, o estado pode incluir imagens e vídeo junto com o texto.
Especificações
| Atributo | Valor |
|---|---|
| Autor | OmniJev (mantenedor: unikcc) |
| Tamanhos | 0.8B, 4B, 9B, 27B (+ 27B-FP8) |
| Base | Qwen3.5-0.8B / 4B / 9B, Qwen3.8-27B (torre de visão congelada) |
| Treino | 1 época, lr 5e-6, limite de 16.384 tokens, cross-entropy + loss de Brier sobre as respostas |
| Dados | 99.193 perguntas; 94.707 publicadas como OneJev-Data (17,7 GB) |
| Tipos de pergunta | Noul, Choice, Score |
| Entrada | Estado em texto/JSON mais um campo media (imagens, vídeo) |
| Serving | qev serve (endpoint System One, compatível com o SDK da TypeSafe), llama.cpp via GGUF, OpenDecisions |
| Licença | Apache-2.0 (código e pesos) |
| Lançamento |
Evidências (UnverifiedClaim)
| Benchmark (27B) | OneJev | Jev 1.13 | Jev-Omni | Qwen3.8-27B thinking |
|---|---|---|---|---|
| Test set OneJev (held out) | 77,4 | — | 60,8 | 71,6 |
| DecisionBench medium | 87,9 | 90,5 | — | — |
| DecisionBench hard | 73,1 | 65,3 | — | — |
| TypeSafe evals | 89,3 | 89,0 | — | — |
| MMBench | 92,3 | — | — | — |
| MMStar | 72,2 | — | — | — |
Latência (uma H200, screenshot 1280×720, 1 / 10 perguntas): 0.8B 31 / 51 ms, 4B 64 / 104 ms, 9B 81 / 131 ms, 27B 189 / 324 ms. Não há p99 nem rodada de terceiros por enquanto.
Quando usar / quando evitar
Usar: decisões sobre screenshots, estados de UI, fotos ou vídeos curtos (checagem de passos de agente, triagem visual, filas de moderação) quando você quer pesos abertos e serving local; times que querem continuar o fine-tune (dados e configs são públicos).
Evitar: qualquer coisa que precise de SLA hospedado ou de score verificado de forma independente; uso comercial que não aceite a cadeia de licenças do Qwen; cargas só de texto em que um modelo menor já está medido no Decision Index.
Limites
- Nenhuma métrica de calibração (ECE) publicada, embora o treino use loss de Brier e o
qevaplique uma tabela de temperatura por tipo de pergunta. - Limite de treino de 16.384 tokens; o comportamento além disso não está documentado.
- O repo tem quatro dias e um único mantenedor.
Por que está no catálogo
O OneJev treina pesos de decisão próprios (fine-tunes completos com loss de decisão), publica sob Apache-2.0 e serve por um endpoint System One que devolve probabilidades. Isso cumpre o critério do catálogo. A entrada multimodal é o diferencial: só o Jev-Omni e o Cloudflare Clef também aceitam imagens.
