Valen
Notas do quadrante
Ver o quadrante completoPontuação pela rubrica pública do quadrante (maturidade × capability; bolha = adoção). Revisamos conforme a evidência.
- Maturidade5.8/10
Pesos e código Apache-2.0, demo no HF Space, notas técnicas e caminho nativo no vLLM Jev. O preview ainda precisa da base congelada Qwen3.5-2B; sem SLA hospedado.
- Capability7.3/10
Choice / Noul / Score de primeira classe em texto e visão, sem gerar tokens de resposta. Autor declara estágio RLCD e ~122 ms/passo no Sokoban; evals pesam jogo/VQA e parte é outcome-conditioned.
- Adoção43/100
Cerca de 479 estrelas no GitHub em cerca de uma semana desde o repo público (23/09), downloads do Preview no HF e demos via vLLM Jev. Ainda sem case de produção público.
Vendor claims
- Valen-Preview-0923: 87,60% de acurácia em 500 perguntas single-step de Sokoban; 38/100 jogos completos (≤200 movimentos) num conjunto easy/medium condicionado a sucessos do próprio 2B RLCD[Claim do fornecedor — não verificado independentemente]
- Quatro trajetórias Sokoban em paralelo: 7–10 decisões cada, média 122–128 ms por passo; as quatro terminam em 1,24 s[Claim do fornecedor — não verificado independentemente]
- Num nível Sokoban com teto de 10 passos: Valen resolve em 9 decisões / 1,13 s de latência acumulada vs Qwen3.8-27B-FP8 em 198,05 s no modo thinking (e falha no no-thinking)[Claim do fornecedor — não verificado independentemente]
- Caminho vLLM Jev em 500 perguntas de imagem Valen: mediana 231,9 → 77,3 ms (3,0×) com 86,8% de target-support accuracy nos dois caminhos[Claim do fornecedor — não verificado independentemente]
Valen traz visão para decisões System One. Você passa texto, imagens ou vídeo e perguntas tipadas (choice, noul, score); uma cabeça de decisão compartilhada devolve probabilidades sobre os candidatos. Não gera tokens de resposta.
O preview público Valen-Team/Valen-Preview-0923 é um checkpoint 2B treinado em Sokoban (mesmos pesos que Valen-Sokoban-RLCD-2B): cabeça de decisão com SFT no General 100k e depois RLCD experimental em 30k registros de Sokoban. A base congelada é Qwen/Qwen3.5-2B (revisão pinada) — os dois downloads são obrigatórios. Código, dados e trainers: github.com/Liuziyu77/Valen (Apache-2.0, ~479★ na checagem do radar). Demo: HF Space.
Independente da TypeSafe AI. Slogan no card: “System One Model, now with vision.”
Specs
| Atributo | Valor |
|---|---|
| Autor | Valen-Team / Liuziyu77 (independente) |
| Pesos flagship | Valen-Team/Valen-Preview-0923 (+ Qwen/Qwen3.5-2B congelado) |
| Modalidades | Texto, imagem, vídeo |
| Tipos de decisão | Choice, Noul, Score (catálogo choice / boolean / score) |
| Licença | Apache-2.0 |
| Lançamento | (HF Preview + GH) |
| Serving | Scripts do projeto; também vllm-jev serve Valen-Team/Valen-Preview-0923 (vLLM Jev) |
Benchmarks do autor
Todos os números abaixo são reportados pelo autor → UnverifiedClaim. O próprio card do Preview avisa que o conjunto de 100 jogos Sokoban reteve casos em que o 2B RLCD já tinha sucesso antes de completar — é outcome-conditioned, não um benchmark cheio sem viés.
| Sinal | Valor | Nota |
|---|---|---|
| Sokoban single-step (500) | 87,60% | Perguntas de ação |
| Sokoban jogos completos (100) | 38/100 | ≤200 movimentos; mix easy/medium |
| Latência por passo (demo) | ~122–128 ms | Quatro jogos em paralelo |
| Mediana imagem no vLLM Jev | 77,3 ms | vs 231,9 ms no caminho baseline; 500 perguntas |
Os painéis da família General no repo (5k perguntas estilo VQA) usam checkpoints treinados à parte — não este Preview de Sokoban.
Limites
- O preview é especializado em Sokoban. Não leia scores de jogo como leaderboard multimodal geral.
- Precisa da base congelada. Só o checkpoint não roda.
- RLCD marcado como experimental nos badges do projeto.
- Stack custom. Prefira o repo Valen ou o vLLM Jev; não é um
generatedrop-in de chat. - Não é TypeSafe. Compatibilidade de fio via servers da comunidade não é afiliação.
Fit / anti-fit
Fit quando você precisa: decisões tipadas multimodais open (sobretudo estado visual de jogo/UI), stack de pesquisa com receitas SFT+RLCD, ou um checkpoint já ligado ao vLLM Jev.
Anti-fit quando você precisa: roteador só-texto de negócio com números zero-shot limpos em typed-decisions, SLA hospedado, ou AutoModel de um arquivo só.
Por que está no catálogo
Pesos de decisão treinados (SFT + estágio RLCD) devolvem Choice/Noul/Score sobre state multimodal sem gerar texto de resposta. Pesos, docs e Space públicos passam no critério de inclusão. Fica perto de Jev-Omni e openjev no lado multimodal open, com foco mais forte em visão/jogo.
