OpenJev 27B (openjev)

Última atualização:

Aberto80–227ms$0/M input

Notas do quadrante

Ver o quadrante completo

Pontuação pela rubrica pública do quadrante (maturidade × capability; bolha = adoção). Revisamos conforme a evidência.

  • Maturidade5.8/10

    Pesos abertos de 27B em CC BY-NC 4.0 (uso comercial exige licença à parte) com builds FP8, MLX e GGUF, cada um com acurácia medida. Helper /v1/systemone próprio sobre o vLLM e suporte oficial no llama.cpp (GGUF da ggml-org). README e guia de serving detalhados. Projeto independente, sem SLA.

  • Capability7/10

    Choice (até 52 opções por passada), Noul e Score com calibração fixa; a resposta muda em 2,3% ao embaralhar opções, sem ECE publicado. Cerca de 80 ms para texto curto e 227 ms para página de 1,1k tokens numa H100 FP8 (autor). 84,0% vs 85,4% do Jev hospedado nas mesmas 10.000 perguntas, rodada própria.

  • Adoção12/100

    98 likes no repo principal e cerca de 18 mil downloads nos cinco builds, mais 1.200 no GGUF da ggml-org. Um dos cinco modelos do lançamento do /v1/systemone no llama.cpp. Sem uso em produção relatado.

Vendor claims

Leia antes

  1. Pesos não comerciais. Os pesos são CC BY-NC 4.0. Uso comercial exige licença dos autores (o README aponta um endereço de suporte da Loop AI). O helper e o código de serving são Apache-2.0.
  2. Não é o mesmo modelo do openjev. Aquela ficha é a release MIT de Alex Wortega (4B e outros tamanhos). Esta é o modelo de 27B da organização openjev, o “OpenJev” que o llama.cpp suporta.
  3. Todo número é rodada dos autores. A comparação de 10.000 perguntas com o Jev hospedado é cuidadosa (mesmas perguntas e ordem de opções, falhas contadas), mas não está no Decision Index nem em outro board público.

O OpenJev é um modelo de decisão aberto publicado no Hugging Face em 20 de setembro de 2026 pela organização openjev, que se descreve como projeto independente, sem vínculo com a TypeSafe. É um fine-tune do Qwen3.8-27B que lê texto, JSON, páginas web e screenshots e responde perguntas tipadas com uma probabilidade por opção. Em 2 de outubro foi um dos cinco modelos do lançamento do /v1/systemone no llama.cpp, o único que lê imagens.

Como funciona

O modelo dá uma letra a cada opção e lê os scores exatamente dessas letras na primeira posição de saída, uma passada por pergunta para até 52 opções. Uma calibração fixa transforma os scores em probabilidades. O fine-tuning treina essa posição única para carregar a decisão e ficar estável quando as opções são reordenadas. É um modelo de decisão treinado, não leitura de um LLM congelado: o README compara o tempo todo com “o mesmo modelo base antes do ajuste”.

Especificações

Atributo Valor
Base Qwen/Qwen3.8-27B (fine-tuned)
Tipos de pergunta Choice (até 52 opções por passada; mais em várias passadas), Noul, Score
Entrada Texto, JSON, DOM, uma imagem por requisição; até 16.384 tokens
Idiomas Inglês, alemão, francês, hindi, chinês, japonês
Serving vLLM + a API de decisão helper/shim.py (POST /v1/systemone); llama.cpp (llama serve -hf ggml-org/OpenJev-GGUF, texto e imagens)
Builds bf16 (~54 GB), FP8 (~29 GB), MLX 8-bit / 4-bit (só texto), GGUF Q4_K_M–Q8_0 (só texto)
Licença Pesos CC BY-NC 4.0; helper / código de serving Apache-2.0
Lançamento

Evidências (UnverifiedClaim)

Do model card:

Teste OpenJev Jev hospedado Base antes do ajuste
10.000 perguntas de texto, 34 fontes 84,0% 85,4% 80,4%
Ciência / fatos / afirmações (1.558) 82,5% 89,0% 81,0%
Ética / julgamento de política (877) 78,1% 75,8% 65,5%
Próxima ação no desktop a partir de screenshot (2.000) 88,0% — 76,5%
MiniWoB, 100 tipos de tarefa 39 39 38
Trocas ao embaralhar opções (2.000) 2,3% — 18,5%

Os builds quantizados reportam a própria acurácia: FP8 84,2% e MLX 8-bit 84,0% nas mesmas 10.000 perguntas; GGUF Q4_K_M 82,8% vs 83,2% do bf16 num conjunto separado de 1.789 perguntas.

Fit / anti-fit

Fit: agentes de navegador e desktop escolhendo o próximo elemento ou ação; roteamento de texto e checagens de política em que você quer um modelo aberto perto da acurácia do Jev; pesquisa e outros usos não comerciais numa GPU de 80 GB, ou numa placa de 24 GB com o GGUF Q4.

Anti-fit: produtos comerciais sem licença à parte; deploys só com CPU ou GPU pequena (27B); perguntas que dependem de conhecimento, em que fica alguns pontos atrás do Jev.

O OpenJev ajusta pesos próprios para decisões tipadas, publica com uma API no formato do Jev que devolve uma probabilidade por opção e cobre Choice, Noul e Score. Não tinha ficha até agora. Tínhamos atribuído o “OpenJev” do llama.cpp à ficha do openjev, e esta ficha corrige isso.