vLLM Jev
⚠️ Por que não é um modelo
Motor de serving para checkpoints Jev-style já existentes (vLLM no Linux, MLX/MPS no Mac). Sem treino de decisão — só escolhe o protocolo e roda inferência.
Especificações técnicas
- LLMs base
- ZefanCai/Open-Jev-2B, OpenJev-0.6B, Tiny-Jev, checkpoints Laya, Valen-Team/Valen-Preview-0923, vjev vision
- Tipos de decisão
- choice, boolean, score
- Features
- vllm, mlx, apple-silicon, multimodal, http-systemone, batching, kv-cache, laya-head, marker-scores
- Licença
- Apache-2.0
Links
vLLM Jev serve checkpoints open de decisão compatíveis via vLLM em NVIDIA Linux, com preview em Apple Silicon via MLX ou PyTorch MPS. Você aponta um model ID do Hugging Face; ele prepara o checkpoint e expõe Choice, Noul e Score em HTTP. Não treina pesos.
uv pip install .
vllm-jev serve ZefanCai/Open-Jev-2B
# → http://127.0.0.1:8795 POST /v1/systemone
No Mac (macOS 15+): source scripts/install_mac.sh e depois vllm-jev serve Valen-Team/Valen-Preview-0923 para decisões texto/imagem.
Por que não é um modelo
Não há fine-tune de decisão neste repo. O runtime escolhe e verifica um protocolo nativo para um checkpoint suportado (ramos de candidatos, marker scores ou a decision head da Laya) e roda inferência com scheduling, batch, compilação e KV cache do vLLM — ou MLX/MPS no Apple Silicon. A qualidade vem do checkpoint que você sobe (Valen, Open-Jev-2B, Laya, Tiny-Jev, …).
Superfície suportada (docs do autor)
- Linux NVIDIA: vLLM nativo para os checkpoints de texto e multimodais listados.
- Preview Apple Silicon: Open-Jev-2B, OpenJev-0.6B, Tiny-Jev, Laya (MPS), Valen texto/imagem (MLX).
- Multimodal: Valen e vjev vision aceitam texto e imagens na mesma API System One.
- Readouts: ramos escalares, marker scores, decision head da Laya.
Tabelas de performance do autor (A800 / M5) alegam cortes grandes de latência vs os HTTP servers dos próprios checkpoints — trate todo multiplicador e milissegundo como UnverifiedClaim. Exemplo do README: em 500 perguntas de imagem Valen, mediana 231,9 → 77,3 ms (3,0×) com 86,8% de target-support accuracy nos dois caminhos.
Ressalvas
- Depende do checkpoint. ID errado ou arquitetura sem suporte não vira modelo de decisão por mágica.
- Não é o stack da TypeSafe. O shape
/v1/systemoneé compatibilidade da comunidade. - O caminho Mac é preview e em geral sequencial (concorrência enfileira).
- Posts de amplificação (ex.: NFT_Chen 29/09) repetem claims de velocidade do autor — ainda UnverifiedClaim.
Links
- github.com/mode-io/vllm-jev (~94★)
- Vizinhos: Ollaya (UX pull-and-serve), Open Alternative to Jev (biblioteca, sem server)
