Span-01

Última atualização:

Waitlist—$0.02/M input

Notas do quadrante

Ver o quadrante completo

Pontuação pela rubrica pública do quadrante (maturidade × capability; bolha = adoção). Revisamos conforme a evidência.

  • Maturidade3.5/10

    Anunciado atrás de waitlist, sem contrato público de API, sem schema de request/resposta e sem números de latência. Os docs e SDKs da própria plataforma Respan são sólidos, mas o modelo ainda não está no catálogo do gateway.

  • Capability4.3/10

    Probabilidades paralelas diretas para present/absent/not_observable em uma forward pass, mais benchmark público com dataset para download. Um único tipo de decisão, sem p50/p99 publicado e sem estudo de calibração do próprio Span-01.

  • Adoção30/100

    Sinal forte de lançamento para um produto em waitlist (29,4 mil views, 632 likes, 400 bookmarks, empresa YC), mas sem integração pública, sem pesos abertos e sem uso em produção reportável do modelo.

Vendor claims

Span-01 é um classificador de raciocínio propriétaire da Respan AI (Keywords AI, Inc., empresa YC), anunciado em 24 de setembro de 2026. É o primeiro concorrente comercial direto do Jev na categoria: mesmo formato de produto — um classificador dedicado que devolve probabilidades em vez de texto — construído para um trabalho mais estreito e mais ligado à operação.

Você entrega um trace e uma ou mais definições de comportamento escritas em linguagem natural. Ele devolve a probabilidade direta de cada definição, em paralelo, em uma única forward pass, sem geração token-a-token.

A ideia

A parte difícil da classificação em produção não é emitir um label. É aplicar uma definição que o modelo nunca viu a um trace que ele nunca viu. O Span-01 foi treinado exatamente para isso: a Respan descreve raciocínio de classificação geral treinado com RLAIF e depois especialização em detecção de comportamento, para que o modelo execute definições novas em vez de memorizar uma taxonomia fixa.

Três detalhes de arquitetura são declarados:

  • Ramos hyper-parallel de definição — vários comportamentos não vistos são avaliados sobre o mesmo contexto de trace de uma vez.
  • Hybrid attention — usada para manter esse raciocínio intacto em traces de produção longos.
  • Uma única forward pass — probabilidades diretas de present, absent e not_observable, sem geração.

A saída not_observable é o detalhe de interface que vale copiar. A maioria dos modelos de decisão força um veredito mesmo quando o input não tem a evidência. O Span-01 tem um terceiro estado de primeira classe, que é funcionalmente o mesmo trabalho do noul do Jev, e ele aparece na própria distribuição de labels do benchmark.

Specs

Atributo Valor
Empresa Respan AI / Keywords AI, Inc. (YC)
Autor do anúncio Frank Chen
Lançamento
Status Early access, apenas waitlist
Variantes Span-01, Span-01 Lite
Saída de decisão Probabilidades present / absent / not_observable
Arquitetura Non-autoregressive, ramos hyper-parallel de definição, hybrid attention
Treino RLAIF e depois especialização em detecção de comportamento (termo do vendor)
Latência Não publicada
Preço US$ 0,02/M de entrada, saída grátis · Span-01 Lite grátis nos dois
Pesos Fechados — nenhum repositório de modelo no Hugging Face
Benchmark respanai/behavior-benchmark

Benchmarks

Detecção de comportamento (suite própria da Respan)

Sistema Core Multilingual All
Span-01 0,784 0,902 0,843
GPT-5.6-terra 0,756 0,917 0,837
deepseek-v4-flash 0,743 0,885 0,814
GPT-6-luna 0,728 0,901 0,815
Span-01 Lite 0,673 0,848 0,761
qwen3-235b 0,584 0,772 0,678
Sonnet 5 0,576 0,858 0,610
jev 0,574 0,856 0,715
laya 0,196 0,250 0,223

Todos os números são UnverifiedClaim. A GPT-5.6-terra na verdade bate o Span-01 no split multilíngue, e o slide que divulga “84,3 vs 81,5 vs 71,5” omite a GPT-6 Sol, que pontua mais alto na própria tabela de domínios do vendor.

Scores por domínio de comportamento em produção

Domínio de comportamento Span-01 Jev Sonnet 5 GPT-6 Sol
Jailbreak e prompt injection 0,779 0,752 0,709 0,878
Safety e recusas 0,803 0,751 0,785 0,911
Privacidade e segredos 1,000 0,948 0,901 0,935
Alucinação e grounding 0,796 0,673 0,756 0,903
Confiabilidade de agente e ferramentas 0,845 0,691 0,677 0,861
Seguir tarefa e instrução 0,702 0,671 0,621 0,821
Qualidade da resposta 0,771 0,691 0,722 0,956
Overall 0,806 0,716 0,719 0,885

Este é o número que importa. O Span-01 bate o Jev e o Sonnet 5, e um modelo frontier ainda define o teto. Os overalls daqui (0,806) e os F1s da tabela acima (0,843) são métricas diferentes e não devem ser misturados.

O benchmark não tem ground truth — leia antes de confiar no gap

O card do dataset é honesto de um jeito incomum, o que é um ponto a favor da Respan e um limite duro para a claim principal. Os labels vêm de três métodos:

método core multilingual
gpt-5.6-sol e claude-opus-5 concordam 24.074 5.541
Desempate: professores discordaram, gpt-6-astra decidiu 2.421 —
Construção: definido por como o trace foi construído — 2.851

O card diz diretamente: “These are model labels, not ground truth”, e os professores “can’t be fairly evaluated on this benchmark”.

Então “18% better than Jev” mede concordância com modelos frontier professores sobre labels de professor, não qualidade intrínseca de decisão. Um classificador pós-treinado para se aproximar desses professores tem vantagem estrutural sobre um concorrente que não foi. O dataset continua sendo genuinamente útil — 1.990 traces, 34.885 pares trace–behavior, 19 idiomas, protocolo de avaliação documentado, licença upstream por linha — mas é um benchmark de vendor.

Mais dois limites: labels positivos são 10,4% das linhas e o protocolo reporta F1 na classe present sem publicar recall nem matriz de confusão; e o gráfico de Pareto de custo normaliza para US$ 0,003/evento excluindo uma base de US$ 299/mês.

O Span-01 julgou 11 modelos de decisão

A Respan inverteu o próprio benchmark e usou o Span-01 como camada de avaliação de 11 modelos de decisão emergentes. O Span-01 não aparece no ranking — ele produziu o sinal.

Modelo Accuracy Paired flip rate Injection ASR ECE
Jev 1.13.0 0,932 0,021 0,063 0,045
Tev1 4B 0,901 0,052 0,042 0,031
Kev 4B 0,833 0,060 0,078 0,070
Decider 2B v10 0,747 0,128 0,208 0,074
AlexWortega OpenJev 4B v5 0,744 0,116 0,089 0,118
Bosun v3.1 1.7B 0,680 0,208 0,323 0,089
Tiny-Jev 0.6B 0,646 0,128 0,224 0,267
Laya 0,542 0,298 0,396 0,092
MoJev 0.85B 0,501 0,150 0,307 0,129
Open-Jev DeBERTa v3 large 0,472 0,194 0,385 0,147
Von 1.2 0,422 0,242 0,297 0,071

Paired flip rate mede consistência sob variantes equivalentes. Injection ASR é a taxa de sucesso de ataque. ECE é o erro de calibração esperado.

Esta é a primeira avaliação externa da linha Jev que publica erro de calibração, e o Jev hospedado sai com o segundo menor flip rate e um ECE competitivo — o melhor resultado da coluna entre os modelos maiores. Trate como claim de terceiro: o Span-01 está julgando concorrentes em um domínio para o qual foi especializado, e nenhum prompt ou versão é publicado. Onze modelos desta lista, nove estão catalogados neste site; não incorporamos esses números às fichas deles.

Fit / anti-fit

Fit: camada de detecção de comportamento sobre traces de LLM, avaliação no estilo judge da saída de um agente, telas de prompt injection ou privacidade, ou substituição barata por uma chamada LLM-as-a-judge em taxonomia estreita — quando a waitlist abrir.

Anti-fit: pesos abertos, self-hosting, contrato de API documentado, modelo de decisão geral fora de detecção de comportamento, semântica calibrada de Score, ou qualquer decisão pela qual você não possa esperar.

Limites

  • Sem contrato público de API. Não há endpoint, schema de request ou formato de resposta publicado — só a tabela de preços e um playground com limite (10 comparações por IP a cada 10 minutos).
  • Sem dados de latência. “At classifier speed” é o argumento inteiro e não vem com p50/p99. O valor 0–0ms do frontmatter é um sentinel de dado indisponível.
  • Sem pesos, sem licença, sem repo. author=respanai retorna zero modelos no Hugging Face. Não é par dos itens open do catálogo.
  • Um tipo de decisão. Nada de choice sobre opções arbitrárias, nada de score em rubrica. not_observable é uma boa ideia de produto para copiar, não uma interface de decisão ampla.
  • O juiz não é auditado. A Respan publica o ECE dos 11 modelos que avaliou e nenhum do próprio Span-01.
  • O benchmark do vendor é o único benchmark. Labels de professor, 10,4% de positivos, F1 em present e um Pareto de custo que exclui a base.
  • Um modelo frontier ainda vence. A GPT-6 Sol marca 0,885 contra 0,806 do Span-01. O Span-01 substitui o juiz intermediário, não o teto frontier.

Fontes