Span-01 desafia o Jev em detecção de comportamento e julga 11 modelos de decisão

Última atualização:

Source

Em 24 de setembro de 2026, a Respan AI (empresa YC, antes conhecida como Keywords AI) anunciou o Span-01, um classificador de raciocínio proprietário, e o Span-01 Lite, uma variante gratuita. Em 25 de setembro o projeto publicou o post de lançamento no X, fixado no perfil da empresa. O acesso é por waitlist no momento desta verificação: sem pesos, sem contrato público de API, sem números de latência.

Aconteceram duas coisas no mesmo lançamento, e a segunda importa mais para este catálogo.

1. Um par comercial que diz bater o Jev

O Span-01 devolve probabilidades diretas de present / absent / not_observable para definições de comportamento em linguagem natural, em uma única forward pass non-autoregressive. A Respan treinou raciocínio de classificação geral com RLAIF, depois especializou em detecção de comportamento, e usa ramos hyper-parallel de definição mais hybrid attention para avaliar vários comportamentos não vistos sobre um mesmo trace longo.

Na suite própria ele reporta 84,3 de F1 overall, contra 71,5 do Jev 1.13.0, 81,5 da GPT-6 Luna e 83,7 da GPT-5.6-terra. A tabela por domínio é a leitura mais honesta: o Span-01 marca 0,806 overall, à frente do Jev (0,716) e do Sonnet 5 (0,719), mas atrás da GPT-6 Sol (0,885). O título de “primeiro classificador de raciocínio hyper-parallel” é claim de marketing; a categoria agora tem dois vendors comerciais e um incumbente funcionando.

O benchmark é bem documentado para os padrões da categoria. O respanai/behavior-benchmark traz 1.990 traces, 34.885 pares trace–behavior e 19 idiomas com splits core e multilingual, licença upstream por linha, um protocolo de avaliação explícito (F1 em present, bootstrap por task_id) e uma seção de limitações. Todos os números continuam UnverifiedClaim — e o card é franco ao dizer que os labels são labels de modelo, não ground truth, produzidos em boa parte pelo acuerdo entre gpt-5.6-sol e claude-opus-5.

2. O benchmark invertido: 11 modelos de decisão julgados

Depois a Respan virou o classificador para o outro lado. O Span-01 foi usado como camada de avaliação de 11 modelos de decisão emergentes, em acurácia, consistência, resistência a injeção e calibração. O Span-01 não aparece no próprio ranking.

Modelo Accuracy Paired flip rate Injection ASR ECE
Jev 1.13.0 0,932 0,021 0,063 0,045
Tev1 4B 0,901 0,052 0,042 0,031
Kev 4B 0,833 0,060 0,078 0,070
Decider 2B v10 0,747 0,128 0,208 0,074
AlexWortega OpenJev 4B v5 0,744 0,116 0,089 0,118
Bosun v3.1 1.7B 0,680 0,208 0,323 0,089
Tiny-Jev 0.6B 0,646 0,128 0,224 0,267
Laya 0,542 0,298 0,396 0,092
MoJev 0.85B 0,501 0,150 0,307 0,129
Open-Jev DeBERTa v3 large 0,472 0,194 0,385 0,147
Von 1.2 0,422 0,242 0,297 0,071

Leia com cuidado. Esta é a primeira avaliação externa da linha Jev que publica erro de calibração esperado, e o Jev hospedado se aguenta bem: o segundo menor flip rate sob variantes pareadas, a segunda melhor acurácia e um ECE competitivo contra pares bem menores. O 0,267 de ECE do Tiny-Jev e o 0,147 do Open-Jev DeBERTa são avisos de calibração úteis para quem roda esses localmente.

É também um vendor julgando concorrentes em um domínio para o qual foi especializado, sem prompt publicado, sem pin de versão e sem auditoria de terceiro. O juiz publica ECE dos onze e nenhum do próprio Span-01.

Por que isso é um evento de categoria

Três coisas mudaram em um único anúncio:

  • A categoria ganhou seu segundo vendor comercial, e o incumbent passou a ser medido contra alguém, não só contra LLMs.
  • Um modelo de decisão virou camada de avaliação. O Span-01 é posicionado como substituto do LLM-as-a-judge — exatamente o padrão que gerou o pi-jev v0.6.0 e o harness da LangChain do lado open.
  • O estado de decisão not_observable virou padrão de produto, não detalhe interno. Uma saída de primeira classe para “o input não tem evidência suficiente para decidir” é uma interface melhor do que forçar veredito binário em evidência incompleta.

Fontes