JevK5

Última atualização:

Aberto9–50ms$0/M input

Notas do quadrante

Ver o quadrante completo

Pontuação pela rubrica pública do quadrante (maturidade × capability; bolha = adoção). Revisamos conforme a evidência.

  • Maturidade3.5/10

    Lançado no primeiro dia; pesos Apache-2.0 disponíveis; runtime publicado; sem inferência hospedada ou SLA.

  • Capability7/10

    Afirma JevBench standard 95.8% / hard 73.9% — forte se verificado. Choice+Score via runtime jevk5. Noul incerto.

  • Adoção12/100

    Lançamento recente (23 Set 2026). Página HF ativa; adoção da comunidade desconhecida.

Vendor claims

JevK5 é uma alternativa open-weight ao Jev baseada em Qwen3.5-4B com LoRA merged. Usa one-pass softmax readout — não gera texto, então não há nada para parsear e nada para alucinar. Licenciado sob Apache-2.0.

O autor afirma ser #2 geral no JevBench (atrás apenas do Jev) e #1 entre modelos open-weight. Esses números são auto-reportados — trate como UnverifiedClaim até confirmação independente.

Uma variante menor JevK5-2B (Qwen3.5-2B) está disponível na mesma família para deploys mais leves (~3.5GB bf16).

Especificações

Atributo Valor
Autor alibiserikbay (independente)
Modelo base Qwen3.5-4B + LoRA merged
Licença Apache-2.0
Lançamento
Status Pesos abertos (Hugging Face)
Latência ~9ms em H100 (UnverifiedClaim)
Preço Self-host apenas (pesos gratuitos)
Tipos de decisão Choice, Score (via runtime jevk5)
Contexto 32K (herdado do Qwen3.5)
Variante menor JevK5-2B — base Qwen3.5-2B
GGUF JevK5-GGUF

Arquitetura

JevK5 segue o padrão one-pass softmax: dado estado e perguntas tipadas, produz probabilidades sobre opções sem gerar tokens. O runtime Python jevk5 gerencia o loop de inferência e expõe tipos de pergunta Choice, Score e Noul (verificar suporte a Noul na documentação do runtime).

Scores JevBench (auto-reportados)

Dificuldade JevK5 JevK5-2B Jev (referência)
Easy 100% 100% 100%
Standard 95.8% 80.6% ~90%+
Hard 73.9% 60.4% ~73%

Esses números são do model card. Verificação independente pendente.

Quando usar / quando não usar

Usar quando precisar: decisões tipadas self-hosted, deploy Apache-2.0, roteamento sensível a latência em hardware capaz.

Não usar quando precisar: inferência hospedada, SLA de produção, geração, ou workflows que requerem saída de texto livre.