vLLM Jev

Última atualização:

RuntimeApache-2.0~94 ★

⚠️ Por que não é um modelo

Motor de serving para checkpoints Jev-style já existentes (vLLM no Linux, MLX/MPS no Mac). Sem treino de decisão — só escolhe o protocolo e roda inferência.

Especificações técnicas

LLMs base
ZefanCai/Open-Jev-2B, OpenJev-0.6B, Tiny-Jev, checkpoints Laya, Valen-Team/Valen-Preview-0923, vjev vision
Tipos de decisão
choice, boolean, score
Features
vllm, mlx, apple-silicon, multimodal, http-systemone, batching, kv-cache, laya-head, marker-scores
Licença
Apache-2.0

vLLM Jev serve checkpoints open de decisão compatíveis via vLLM em NVIDIA Linux, com preview em Apple Silicon via MLX ou PyTorch MPS. Você aponta um model ID do Hugging Face; ele prepara o checkpoint e expõe Choice, Noul e Score em HTTP. Não treina pesos.

uv pip install .
vllm-jev serve ZefanCai/Open-Jev-2B
# → http://127.0.0.1:8795  POST /v1/systemone

No Mac (macOS 15+): source scripts/install_mac.sh e depois vllm-jev serve Valen-Team/Valen-Preview-0923 para decisões texto/imagem.

Por que não é um modelo

Não há fine-tune de decisão neste repo. O runtime escolhe e verifica um protocolo nativo para um checkpoint suportado (ramos de candidatos, marker scores ou a decision head da Laya) e roda inferência com scheduling, batch, compilação e KV cache do vLLM — ou MLX/MPS no Apple Silicon. A qualidade vem do checkpoint que você sobe (Valen, Open-Jev-2B, Laya, Tiny-Jev, …).

Superfície suportada (docs do autor)

  • Linux NVIDIA: vLLM nativo para os checkpoints de texto e multimodais listados.
  • Preview Apple Silicon: Open-Jev-2B, OpenJev-0.6B, Tiny-Jev, Laya (MPS), Valen texto/imagem (MLX).
  • Multimodal: Valen e vjev vision aceitam texto e imagens na mesma API System One.
  • Readouts: ramos escalares, marker scores, decision head da Laya.

Tabelas de performance do autor (A800 / M5) alegam cortes grandes de latência vs os HTTP servers dos próprios checkpoints — trate todo multiplicador e milissegundo como UnverifiedClaim. Exemplo do README: em 500 perguntas de imagem Valen, mediana 231,9 → 77,3 ms (3,0×) com 86,8% de target-support accuracy nos dois caminhos.

Ressalvas

  • Depende do checkpoint. ID errado ou arquitetura sem suporte não vira modelo de decisão por mágica.
  • Não é o stack da TypeSafe. O shape /v1/systemone é compatibilidade da comunidade.
  • O caminho Mac é preview e em geral sequencial (concorrência enfileira).
  • Posts de amplificação (ex.: NFT_Chen 29/09) repetem claims de velocidade do autor — ainda UnverifiedClaim.