Span-01
Notas do quadrante
Ver o quadrante completoPontuação pela rubrica pública do quadrante (maturidade × capability; bolha = adoção). Revisamos conforme a evidência.
- Maturidade3.5/10
Anunciado atrás de waitlist, sem contrato público de API, sem schema de request/resposta e sem números de latência. Os docs e SDKs da própria plataforma Respan são sólidos, mas o modelo ainda não está no catálogo do gateway.
- Capability4.3/10
Probabilidades paralelas diretas para present/absent/not_observable em uma forward pass, mais benchmark público com dataset para download. Um único tipo de decisão, sem p50/p99 publicado e sem estudo de calibração do próprio Span-01.
- Adoção30/100
Sinal forte de lançamento para um produto em waitlist (29,4 mil views, 632 likes, 400 bookmarks, empresa YC), mas sem integração pública, sem pesos abertos e sem uso em produção reportável do modelo.
Vendor claims
- F1 overall de comportamento de 84,3, contra 81,5 da GPT-6 Luna e 71,5 do Jev 1.13.0[Claim do fornecedor — não verificado independentemente]
- 2× mais barato e 18% melhor que o Jev; 700× mais barato e 4% melhor que a GPT-6 Luna[Claim do fornecedor — não verificado independentemente]
- Benchmark de comportamento em produção com overall 0,806, contra Jev 0,716, Sonnet 5 0,719 e GPT-6 Sol 0,885[Claim do fornecedor — não verificado independentemente]
- O Span-01 Lite pontua acima do Jev e do Sonnet 5 e é gratuito[Claim do fornecedor — não verificado independentemente]
- Preço de US$ 0,02 por milhão de tokens de entrada com saída grátis; Span-01 Lite grátis nos dois[Claim do fornecedor — não verificado independentemente]
Span-01 é um classificador de raciocínio propriétaire da Respan AI (Keywords AI, Inc., empresa YC), anunciado em 24 de setembro de 2026. É o primeiro concorrente comercial direto do Jev na categoria: mesmo formato de produto — um classificador dedicado que devolve probabilidades em vez de texto — construído para um trabalho mais estreito e mais ligado à operação.
Você entrega um trace e uma ou mais definições de comportamento escritas em linguagem natural. Ele devolve a probabilidade direta de cada definição, em paralelo, em uma única forward pass, sem geração token-a-token.
A ideia
A parte difícil da classificação em produção não é emitir um label. É aplicar uma definição que o modelo nunca viu a um trace que ele nunca viu. O Span-01 foi treinado exatamente para isso: a Respan descreve raciocínio de classificação geral treinado com RLAIF e depois especialização em detecção de comportamento, para que o modelo execute definições novas em vez de memorizar uma taxonomia fixa.
Três detalhes de arquitetura são declarados:
- Ramos hyper-parallel de definição — vários comportamentos não vistos são avaliados sobre o mesmo contexto de trace de uma vez.
- Hybrid attention — usada para manter esse raciocínio intacto em traces de produção longos.
- Uma única forward pass — probabilidades diretas de
present,absentenot_observable, sem geração.
A saída not_observable é o detalhe de interface que vale copiar. A maioria dos modelos de decisão força um veredito mesmo quando o input não tem a evidência. O Span-01 tem um terceiro estado de primeira classe, que é funcionalmente o mesmo trabalho do noul do Jev, e ele aparece na própria distribuição de labels do benchmark.
Specs
| Atributo | Valor |
|---|---|
| Empresa | Respan AI / Keywords AI, Inc. (YC) |
| Autor do anúncio | Frank Chen |
| Lançamento | |
| Status | Early access, apenas waitlist |
| Variantes | Span-01, Span-01 Lite |
| Saída de decisão | Probabilidades present / absent / not_observable |
| Arquitetura | Non-autoregressive, ramos hyper-parallel de definição, hybrid attention |
| Treino | RLAIF e depois especialização em detecção de comportamento (termo do vendor) |
| Latência | Não publicada |
| Preço | US$ 0,02/M de entrada, saída grátis · Span-01 Lite grátis nos dois |
| Pesos | Fechados — nenhum repositório de modelo no Hugging Face |
| Benchmark | respanai/behavior-benchmark |
Benchmarks
Detecção de comportamento (suite própria da Respan)
| Sistema | Core | Multilingual | All |
|---|---|---|---|
| Span-01 | 0,784 | 0,902 | 0,843 |
| GPT-5.6-terra | 0,756 | 0,917 | 0,837 |
| deepseek-v4-flash | 0,743 | 0,885 | 0,814 |
| GPT-6-luna | 0,728 | 0,901 | 0,815 |
| Span-01 Lite | 0,673 | 0,848 | 0,761 |
| qwen3-235b | 0,584 | 0,772 | 0,678 |
| Sonnet 5 | 0,576 | 0,858 | 0,610 |
| jev | 0,574 | 0,856 | 0,715 |
| laya | 0,196 | 0,250 | 0,223 |
Todos os números são UnverifiedClaim. A GPT-5.6-terra na verdade bate o Span-01 no split multilíngue, e o slide que divulga “84,3 vs 81,5 vs 71,5” omite a GPT-6 Sol, que pontua mais alto na própria tabela de domínios do vendor.
Scores por domínio de comportamento em produção
| Domínio de comportamento | Span-01 | Jev | Sonnet 5 | GPT-6 Sol |
|---|---|---|---|---|
| Jailbreak e prompt injection | 0,779 | 0,752 | 0,709 | 0,878 |
| Safety e recusas | 0,803 | 0,751 | 0,785 | 0,911 |
| Privacidade e segredos | 1,000 | 0,948 | 0,901 | 0,935 |
| Alucinação e grounding | 0,796 | 0,673 | 0,756 | 0,903 |
| Confiabilidade de agente e ferramentas | 0,845 | 0,691 | 0,677 | 0,861 |
| Seguir tarefa e instrução | 0,702 | 0,671 | 0,621 | 0,821 |
| Qualidade da resposta | 0,771 | 0,691 | 0,722 | 0,956 |
| Overall | 0,806 | 0,716 | 0,719 | 0,885 |
Este é o número que importa. O Span-01 bate o Jev e o Sonnet 5, e um modelo frontier ainda define o teto. Os overalls daqui (0,806) e os F1s da tabela acima (0,843) são métricas diferentes e não devem ser misturados.
O benchmark não tem ground truth — leia antes de confiar no gap
O card do dataset é honesto de um jeito incomum, o que é um ponto a favor da Respan e um limite duro para a claim principal. Os labels vêm de três métodos:
| método | core |
multilingual |
|---|---|---|
gpt-5.6-sol e claude-opus-5 concordam |
24.074 | 5.541 |
Desempate: professores discordaram, gpt-6-astra decidiu |
2.421 | — |
| Construção: definido por como o trace foi construído | — | 2.851 |
O card diz diretamente: “These are model labels, not ground truth”, e os professores “can’t be fairly evaluated on this benchmark”.
Então “18% better than Jev” mede concordância com modelos frontier professores sobre labels de professor, não qualidade intrínseca de decisão. Um classificador pós-treinado para se aproximar desses professores tem vantagem estrutural sobre um concorrente que não foi. O dataset continua sendo genuinamente útil — 1.990 traces, 34.885 pares trace–behavior, 19 idiomas, protocolo de avaliação documentado, licença upstream por linha — mas é um benchmark de vendor.
Mais dois limites: labels positivos são 10,4% das linhas e o protocolo reporta F1 na classe present sem publicar recall nem matriz de confusão; e o gráfico de Pareto de custo normaliza para US$ 0,003/evento excluindo uma base de US$ 299/mês.
O Span-01 julgou 11 modelos de decisão
A Respan inverteu o próprio benchmark e usou o Span-01 como camada de avaliação de 11 modelos de decisão emergentes. O Span-01 não aparece no ranking — ele produziu o sinal.
| Modelo | Accuracy | Paired flip rate | Injection ASR | ECE |
|---|---|---|---|---|
| Jev 1.13.0 | 0,932 | 0,021 | 0,063 | 0,045 |
| Tev1 4B | 0,901 | 0,052 | 0,042 | 0,031 |
| Kev 4B | 0,833 | 0,060 | 0,078 | 0,070 |
| Decider 2B v10 | 0,747 | 0,128 | 0,208 | 0,074 |
| AlexWortega OpenJev 4B v5 | 0,744 | 0,116 | 0,089 | 0,118 |
| Bosun v3.1 1.7B | 0,680 | 0,208 | 0,323 | 0,089 |
| Tiny-Jev 0.6B | 0,646 | 0,128 | 0,224 | 0,267 |
| Laya | 0,542 | 0,298 | 0,396 | 0,092 |
| MoJev 0.85B | 0,501 | 0,150 | 0,307 | 0,129 |
| Open-Jev DeBERTa v3 large | 0,472 | 0,194 | 0,385 | 0,147 |
| Von 1.2 | 0,422 | 0,242 | 0,297 | 0,071 |
Paired flip rate mede consistência sob variantes equivalentes. Injection ASR é a taxa de sucesso de ataque. ECE é o erro de calibração esperado.
Esta é a primeira avaliação externa da linha Jev que publica erro de calibração, e o Jev hospedado sai com o segundo menor flip rate e um ECE competitivo — o melhor resultado da coluna entre os modelos maiores. Trate como claim de terceiro: o Span-01 está julgando concorrentes em um domínio para o qual foi especializado, e nenhum prompt ou versão é publicado. Onze modelos desta lista, nove estão catalogados neste site; não incorporamos esses números às fichas deles.
Fit / anti-fit
Fit: camada de detecção de comportamento sobre traces de LLM, avaliação no estilo judge da saída de um agente, telas de prompt injection ou privacidade, ou substituição barata por uma chamada LLM-as-a-judge em taxonomia estreita — quando a waitlist abrir.
Anti-fit: pesos abertos, self-hosting, contrato de API documentado, modelo de decisão geral fora de detecção de comportamento, semântica calibrada de Score, ou qualquer decisão pela qual você não possa esperar.
Limites
- Sem contrato público de API. Não há endpoint, schema de request ou formato de resposta publicado — só a tabela de preços e um playground com limite (10 comparações por IP a cada 10 minutos).
- Sem dados de latência. “At classifier speed” é o argumento inteiro e não vem com p50/p99. O valor
0–0msdo frontmatter é um sentinel de dado indisponível. - Sem pesos, sem licença, sem repo.
author=respanairetorna zero modelos no Hugging Face. Não é par dos itens open do catálogo. - Um tipo de decisão. Nada de
choicesobre opções arbitrárias, nada descoreem rubrica.not_observableé uma boa ideia de produto para copiar, não uma interface de decisão ampla. - O juiz não é auditado. A Respan publica o ECE dos 11 modelos que avaliou e nenhum do próprio Span-01.
- O benchmark do vendor é o único benchmark. Labels de professor, 10,4% de positivos, F1 em
presente um Pareto de custo que exclui a base. - Um modelo frontier ainda vence. A GPT-6 Sol marca 0,885 contra 0,806 do Span-01. O Span-01 substitui o juiz intermediário, não o teto frontier.
