Decision 2.0 (Kai-0.6B a Vega-27B)

Última atualização:

Aberto5–71ms$0/M input

Notas do quadrante

Ver o quadrante completo

Pontuação pela rubrica pública do quadrante (maturidade × capability; bolha = adoção). Revisamos conforme a evidência.

  • Maturidade4.9/10

    Seis tamanhos Apache-2.0 com heads de decisão treinados; system_one() e pipeline no Transformers via trust_remote_code. O Vega-27B é uma LoRA que exige o Qwen3.8-27B. Cards curtos: quickstart e uma tabela, sem método, dados ou calibração. Ports MLX / ONNX da comunidade. Sem API nem SLA.

  • Capability6.7/10

    Choice (até 255 opções) / Noul / Score numa passada. O manifesto marca calibração como não definida, sem ECE. Mediana de 4,9–71,4 ms por requisição de uma pergunta numa GPU não identificada (autores). O DI 56,5 do Vega vs 57,91 do Jev é rodada própria com o kit oficial, fora do board.

  • Adoção7/100

    Post de lançamento com ~740 curtidas / 39 mil views / 680 salvamentos; coleção com 24 upvotes; ~560 downloads nos seis repos em cerca de um dia; seis conversões MLX / ONNX da comunidade (incl. onnx-community). Sem integrações ou uso em produção relatados.

Vendor claims

Leia antes

  1. Todo score 2.0 no índice é rodada do próprio time. Os cards chamam de “reprodução independente com o kit oficial 0.2.1”, mas quem rodou foram os autores; o Decision Index público ainda mostra os modelos 1.0 de 28 de setembro. O “+11,2 sobre o Lux 2.0” do card do Vega não bate com a própria tabela (56,5 − 46,3 = 10,2).
  2. Sem etapa de calibração. O manifesto da release lista a calibração como não definida, e os cards não trazem ECE. As probabilidades são a saída crua do head.
  3. As fichas 1.0 continuam. O Decision 1.0 Lux-9B e o Kai mantêm suas páginas porque os scores deles se apoiam no índice oficial. Esta ficha cobre a família 2.0 inteira.

O Decision 2.0 é a segunda família aberta de modelos de decisão do projeto vLLM Semantic Router, anunciada em 2 de outubro de 2026 (news). Os pesos subiram em 28–29 de setembro. São seis tamanhos, todos Apache-2.0: Kai-0.6B, Eos-0.8B, Sol-2B, Nox-4B, Lux-9B e um novo topo, o Vega-27B. Cada um recebe um estado e perguntas tipadas e devolve uma probabilidade por opção sem gerar texto, pela mesma chamada system_one() da 1.0.

Os seis tamanhos

Modelo Parâmetros Construído a partir de Decision Index (1.0 → 2.0) Latência mediana
Kai-0.6B 0,60B Qwen3-0.6B-Base (o Kai 1.0 era um encoder da linhagem mmBERT) 6,5 → 16,3 4,9 ms
Eos-0.8B 0,75B Decision 1.0 Eos 18,4 → 20,1 6,0 ms
Sol-2B 1,88B Decision 1.0 Sol 25,3 → 29,5 7,2 ms
Nox-4B 4,21B Qwen3.5-4B-Base 34,4 → 43,8 12,9 ms
Lux-9B 7,94B Decision 1.0 Lux 43,5 → 46,3 18,4 ms
Vega-27B 29,37B Qwen3.8-27B + LoRA de rank 512 (só o adapter; base baixada à parte) — → 56,5 71,4 ms

Os seis compartilham o desenho, segundo os configs: um head de decisão bilinear-MLP compartilhado que pontua cada opção contra uma query global, até 255 opções por pergunta. O contexto é de 16.384 tokens na maioria dos tamanhos, 8.192 no Kai e 32.768 no Vega.

Evidências (UnverifiedClaim)

Dos model cards:

Modelo JevArena Transferência rotulada por humanos Comparado com
Vega-27B 74,0 58,7 AutoJev-27B 72,1 / 58,7, Eikos-27B 69,3, Jebadiah-27B 65,5
Lux-9B 68,1 56,2 Decision 1.0 Lux 65,8, Nimble v2 62,1
Nox-4B 63,6 52,3 Decider 4B 61,9 / 55,5, Jet v6.2 60,4
Sol-2B 52,1 51,3 Decider 2B 49,5, This-That 1.2 46,1
Eos-0.8B 53,9 50,3 Intern-Decision-0.8B 43,5, Kev-0.8B 43,2
Kai-0.6B 48,6 45,9 Decision 1.0 Kai 35,9

O JevArena é a comparação do próprio time entre modelos abertos do mesmo porte (prompts congelados, respostas inválidas contam como erro). Cada card lidera seu tamanho nessa tabela, mas o Nox-4B fica atrás do Decider 4B na coluna de transferência rotulada por humanos. Os cards dizem que os dados de treino foram “auditados linha a linha contra todos os itens de teste do Index”.

Claims do lançamento, como foram replicados (3/10)

O post de lançamento no LinkedIn, de Xunzhuo Liu, e um resumo bem compartilhado de David Hendrickson (@TeksEdge, 3/10, 16:00 BRT; cerca de 108 curtidas e 5,8 mil views) trazem afirmações que não estão nos cards (UnverifiedClaim):

  • “#1 do seu tamanho no Jev Decision Index” em 0.6B, 0.8B, 2B e 4B, e “o 27B é o #3 geral”. Isso compara as rodadas do próprio time para a 2.0 com o placar de 28/09.
    • O Nox-4B passa o JPT-4B por 0,8 ponto (43,8 vs 43,04), e o Sol-2B passa o Decider 2B por 0,5 (29,5 vs 28,97). Uma nova rodada pode apagar margens tão pequenas.
    • O Eos-0.8B (20,1 vs 19,22 do JPT-0.8B) e o Kai-0.6B (16,3 vs 14,32 do Bosun 0.6B) lideram com mais folga.
    • O Vega-27B (56,5) seria #3 entre os sistemas abertos, atrás do Surogate Rune (57,44) e do Decider chat Gemma-4-31B (57,33). Contando o Jev (57,91), seria #4.
  • “64 perguntas sobre uma requisição, respondidas em 63 ms numa única GPU.” O post não diz qual tamanho nem qual GPU. Os cards só dizem que várias perguntas sobre a mesma entrada são respondidas numa passada.
  • “20× mais rápido que a API do Jev para uma decisão.” Não diz tamanho nem setup. A mediana do Jev hospedado no índice é 524 ms, e isso inclui a rede.
  • “Até 2,5× a nota do Decision 1.0 no mesmo tamanho.” Bate com o Kai: 6,5 → 16,3.

Sem mudança de nota: a acurácia fica em 6 até os modelos 2.0 entrarem no índice público. Em 4/10 a coleção tinha 49 upvotes e cerca de 1.960 downloads nos seis repos. Apareceu um sétimo repo, Decision-2.0-Sol-2B-Reasoning, ainda sem números no card.

Fit / anti-fit

Fit: roteamento e checagens self-hosted em que você quer escolher o tamanho pelo orçamento de latência (medianas de 5–70 ms numa GPU); testar um modelo aberto de 27B que o time coloca perto do Jev, com as fichas 1.0 como base de terceiro.

Anti-fit: casos que precisam de probabilidades calibradas de fábrica, API hospedada ou servidor /v1/systemone; times que exigem método e dados de treino documentados antes de adotar (os cards 2.0 não trazem nenhum dos dois).

Cada modelo 2.0 traz pesos de decisão treinados (fine-tune completo, ou LoRA no Vega) e um head de decisão próprio, devolve uma probabilidade por opção e cobre Choice, Noul e Score. Esse é o critério do catálogo. Uma ficha de família, como o StartLux-Decision, porque os seis compartilham receita e formato de card. A acurácia fica em 6 até os modelos 2.0 aparecerem no índice público ou numa rodada de terceiro.

Builds GGUF (8/10/2026)

O vLLM Semantic Router publicou builds GGUF dos seis tamanhos (por exemplo Vega-27B-GGUF e Kai-0.6B-GGUF). No Decision Index 0.3 oficial, o Vega 27B faz 55,88 (rank 13) e o Nox 4B 44,95 (rank 38). Um modo “System One Auto”, que roda o Kai primeiro e cai para o Vega, foi anunciado no X em 10/10; não conseguimos abrir fonte primária, então os números de custo e latência dele não entram aqui. Notas inalteradas.