Decision 2.0 (Kai-0.6B a Vega-27B)
Notas do quadrante
Ver o quadrante completoPontuação pela rubrica pública do quadrante (maturidade × capability; bolha = adoção). Revisamos conforme a evidência.
- Maturidade4.9/10
Seis tamanhos Apache-2.0 com heads de decisão treinados; system_one() e pipeline no Transformers via trust_remote_code. O Vega-27B é uma LoRA que exige o Qwen3.8-27B. Cards curtos: quickstart e uma tabela, sem método, dados ou calibração. Ports MLX / ONNX da comunidade. Sem API nem SLA.
- Capability6.7/10
Choice (até 255 opções) / Noul / Score numa passada. O manifesto marca calibração como não definida, sem ECE. Mediana de 4,9–71,4 ms por requisição de uma pergunta numa GPU não identificada (autores). O DI 56,5 do Vega vs 57,91 do Jev é rodada própria com o kit oficial, fora do board.
- Adoção7/100
Post de lançamento com ~740 curtidas / 39 mil views / 680 salvamentos; coleção com 24 upvotes; ~560 downloads nos seis repos em cerca de um dia; seis conversões MLX / ONNX da comunidade (incl. onnx-community). Sem integrações ou uso em produção relatados.
Vendor claims
- Decision-2.0-Vega-27B: Decision Index 0.2.1 56,5 (Jev 57,91 no board público), JevArena 74,0 vs AutoJev-27B 72,1, transferência rotulada por humanos 58,7; 'reprodução independente com o kit oficial 0.2.1' rodada pelos autores; '+11,2 sobre o Lux 2.0' (os scores publicados diferem em 10,2)[Claim do fornecedor — não verificado independentemente]
- Decision Index 1.0 → 2.0: Lux-9B 43,5 → 46,3, Nox-4B 34,4 → 43,8, Sol-2B 25,3 → 29,5, Eos-0.8B 18,4 → 20,1, Kai-0.6B 6,5 → 16,3 (valores 1.0 do board público, valores 2.0 de rodada própria)[Claim do fornecedor — não verificado independentemente]
- Latência mediana por requisição de uma pergunta numa GPU: Kai 4,9 ms, Eos 6,0, Sol 7,2, Nox 12,9, Lux 18,4, Vega 71,4[Claim do fornecedor — não verificado independentemente]
Leia antes
- Todo score 2.0 no índice é rodada do próprio time. Os cards chamam de “reprodução independente com o kit oficial 0.2.1”, mas quem rodou foram os autores; o Decision Index público ainda mostra os modelos 1.0 de 28 de setembro. O “+11,2 sobre o Lux 2.0” do card do Vega não bate com a própria tabela (56,5 − 46,3 = 10,2).
- Sem etapa de calibração. O manifesto da release lista a calibração como não definida, e os cards não trazem ECE. As probabilidades são a saída crua do head.
- As fichas 1.0 continuam. O Decision 1.0 Lux-9B e o Kai mantêm suas páginas porque os scores deles se apoiam no índice oficial. Esta ficha cobre a família 2.0 inteira.
O Decision 2.0 é a segunda família aberta de modelos de decisão do projeto vLLM Semantic Router, anunciada em 2 de outubro de 2026 (news). Os pesos subiram em 28–29 de setembro. São seis tamanhos, todos Apache-2.0: Kai-0.6B, Eos-0.8B, Sol-2B, Nox-4B, Lux-9B e um novo topo, o Vega-27B. Cada um recebe um estado e perguntas tipadas e devolve uma probabilidade por opção sem gerar texto, pela mesma chamada system_one() da 1.0.
Os seis tamanhos
| Modelo | Parâmetros | Construído a partir de | Decision Index (1.0 → 2.0) | Latência mediana |
|---|---|---|---|---|
| Kai-0.6B | 0,60B | Qwen3-0.6B-Base (o Kai 1.0 era um encoder da linhagem mmBERT) | 6,5 → 16,3 | 4,9 ms |
| Eos-0.8B | 0,75B | Decision 1.0 Eos | 18,4 → 20,1 | 6,0 ms |
| Sol-2B | 1,88B | Decision 1.0 Sol | 25,3 → 29,5 | 7,2 ms |
| Nox-4B | 4,21B | Qwen3.5-4B-Base | 34,4 → 43,8 | 12,9 ms |
| Lux-9B | 7,94B | Decision 1.0 Lux | 43,5 → 46,3 | 18,4 ms |
| Vega-27B | 29,37B | Qwen3.8-27B + LoRA de rank 512 (só o adapter; base baixada à parte) | — → 56,5 | 71,4 ms |
Os seis compartilham o desenho, segundo os configs: um head de decisão bilinear-MLP compartilhado que pontua cada opção contra uma query global, até 255 opções por pergunta. O contexto é de 16.384 tokens na maioria dos tamanhos, 8.192 no Kai e 32.768 no Vega.
Evidências (UnverifiedClaim)
Dos model cards:
| Modelo | JevArena | Transferência rotulada por humanos | Comparado com |
|---|---|---|---|
| Vega-27B | 74,0 | 58,7 | AutoJev-27B 72,1 / 58,7, Eikos-27B 69,3, Jebadiah-27B 65,5 |
| Lux-9B | 68,1 | 56,2 | Decision 1.0 Lux 65,8, Nimble v2 62,1 |
| Nox-4B | 63,6 | 52,3 | Decider 4B 61,9 / 55,5, Jet v6.2 60,4 |
| Sol-2B | 52,1 | 51,3 | Decider 2B 49,5, This-That 1.2 46,1 |
| Eos-0.8B | 53,9 | 50,3 | Intern-Decision-0.8B 43,5, Kev-0.8B 43,2 |
| Kai-0.6B | 48,6 | 45,9 | Decision 1.0 Kai 35,9 |
O JevArena é a comparação do próprio time entre modelos abertos do mesmo porte (prompts congelados, respostas inválidas contam como erro). Cada card lidera seu tamanho nessa tabela, mas o Nox-4B fica atrás do Decider 4B na coluna de transferência rotulada por humanos. Os cards dizem que os dados de treino foram “auditados linha a linha contra todos os itens de teste do Index”.
Claims do lançamento, como foram replicados (3/10)
O post de lançamento no LinkedIn, de Xunzhuo Liu, e um resumo bem compartilhado de David Hendrickson (@TeksEdge, 3/10, 16:00 BRT; cerca de 108 curtidas e 5,8 mil views) trazem afirmações que não estão nos cards (UnverifiedClaim):
- “#1 do seu tamanho no Jev Decision Index” em 0.6B, 0.8B, 2B e 4B, e “o 27B é o #3 geral”. Isso compara as rodadas do próprio time para a 2.0 com o placar de 28/09.
- O Nox-4B passa o JPT-4B por 0,8 ponto (43,8 vs 43,04), e o Sol-2B passa o Decider 2B por 0,5 (29,5 vs 28,97). Uma nova rodada pode apagar margens tão pequenas.
- O Eos-0.8B (20,1 vs 19,22 do JPT-0.8B) e o Kai-0.6B (16,3 vs 14,32 do Bosun 0.6B) lideram com mais folga.
- O Vega-27B (56,5) seria #3 entre os sistemas abertos, atrás do Surogate Rune (57,44) e do Decider chat Gemma-4-31B (57,33). Contando o Jev (57,91), seria #4.
- “64 perguntas sobre uma requisição, respondidas em 63 ms numa única GPU.” O post não diz qual tamanho nem qual GPU. Os cards só dizem que várias perguntas sobre a mesma entrada são respondidas numa passada.
- “20× mais rápido que a API do Jev para uma decisão.” Não diz tamanho nem setup. A mediana do Jev hospedado no índice é 524 ms, e isso inclui a rede.
- “Até 2,5× a nota do Decision 1.0 no mesmo tamanho.” Bate com o Kai: 6,5 → 16,3.
Sem mudança de nota: a acurácia fica em 6 até os modelos 2.0 entrarem no índice público. Em 4/10 a coleção tinha 49 upvotes e cerca de 1.960 downloads nos seis repos. Apareceu um sétimo repo, Decision-2.0-Sol-2B-Reasoning, ainda sem números no card.
Fit / anti-fit
Fit: roteamento e checagens self-hosted em que você quer escolher o tamanho pelo orçamento de latência (medianas de 5–70 ms numa GPU); testar um modelo aberto de 27B que o time coloca perto do Jev, com as fichas 1.0 como base de terceiro.
Anti-fit: casos que precisam de probabilidades calibradas de fábrica, API hospedada ou servidor /v1/systemone; times que exigem método e dados de treino documentados antes de adotar (os cards 2.0 não trazem nenhum dos dois).
Por que está no catálogo
Cada modelo 2.0 traz pesos de decisão treinados (fine-tune completo, ou LoRA no Vega) e um head de decisão próprio, devolve uma probabilidade por opção e cobre Choice, Noul e Score. Esse é o critério do catálogo. Uma ficha de família, como o StartLux-Decision, porque os seis compartilham receita e formato de card. A acurácia fica em 6 até os modelos 2.0 aparecerem no índice público ou numa rodada de terceiro.
Builds GGUF (8/10/2026)
O vLLM Semantic Router publicou builds GGUF dos seis tamanhos (por exemplo Vega-27B-GGUF e Kai-0.6B-GGUF). No Decision Index 0.3 oficial, o Vega 27B faz 55,88 (rank 13) e o Nox 4B 44,95 (rank 38). Um modo “System One Auto”, que roda o Kai primeiro e cai para o Vega, foi anunciado no X em 10/10; não conseguimos abrir fonte primária, então os números de custo e latência dele não entram aqui. Notas inalteradas.
