Context7 testa o Jev no pipeline de parsing de docs
Em 18 de setembro de 2026, a Context7 (@Context7AI) publicou um bake-off interno: Jev 1.13.0 contra os modelos que já usam no pipeline de parsing de docs (família Gemini Flash e DeepSeek). Cinco tasks de classificação. Os números abaixo são da Context7 — não é eval independente do ModelSystem.One.
| Task | Resultado Jev (reportado) | Comparador | Enquadramento deles |
|---|---|---|---|
| Query relevance | 100/100 · 0.71s · $0.0232 | Gemini 3.7 Flash 100/100 · ~120s | Empate em acurácia; gap grande de velocidade/custo |
| Duplicate detection | 71/80 (88.8%) · 0.71s | Gemini 3.1 Flash Lite 69/80 (86.3%) | Quase empate / leve vantagem |
| Website suitability | 58/60 (96.7%) · 0.72s | Gemini 3.7 Flash 60/60 | Quase empate; Gemini na frente em acurácia |
| Page classification | 843/993 (84.9%) · 0.29s | DeepSeek V4 Flash 557/993 (56.1%) | Win claro do Jev |
| Crawl-root selection | 12/45 (26.7%) · 0.29s | Gemini 3.7 Flash 42/45 (93.3%) | Loss claro do Jev |
Resumo do post: 3 empates, 1 vitória (page classification), 1 derrota (crawl-root). Nos replies, o time da Context7 disse que vai manter um LLM comum no crawl-root e tratar o resto como candidato drop-in — roteamento por task, não um modelo único pra tudo.
Latência e custo no chart vêm da instrumentação da Context7. Trate como UnverifiedClaim frente à tabela pública da TypeSafe até alguém reproduzir a suite.
Por que entra no catálogo: um produto de docs em produção (Context7 / Upstash) já está colocando o Jev contra labels reais de pipeline — e mostrando onde System One ganha e onde ainda precisa de fallback System Two.
