Context7 testa o Jev no pipeline de parsing de docs

Última atualização:

Source

Em 18 de setembro de 2026, a Context7 (@Context7AI) publicou um bake-off interno: Jev 1.13.0 contra os modelos que já usam no pipeline de parsing de docs (família Gemini Flash e DeepSeek). Cinco tasks de classificação. Os números abaixo são da Context7 — não é eval independente do ModelSystem.One.

Task Resultado Jev (reportado) Comparador Enquadramento deles
Query relevance 100/100 · 0.71s · $0.0232 Gemini 3.7 Flash 100/100 · ~120s Empate em acurácia; gap grande de velocidade/custo
Duplicate detection 71/80 (88.8%) · 0.71s Gemini 3.1 Flash Lite 69/80 (86.3%) Quase empate / leve vantagem
Website suitability 58/60 (96.7%) · 0.72s Gemini 3.7 Flash 60/60 Quase empate; Gemini na frente em acurácia
Page classification 843/993 (84.9%) · 0.29s DeepSeek V4 Flash 557/993 (56.1%) Win claro do Jev
Crawl-root selection 12/45 (26.7%) · 0.29s Gemini 3.7 Flash 42/45 (93.3%) Loss claro do Jev

Resumo do post: 3 empates, 1 vitória (page classification), 1 derrota (crawl-root). Nos replies, o time da Context7 disse que vai manter um LLM comum no crawl-root e tratar o resto como candidato drop-in — roteamento por task, não um modelo único pra tudo.

Latência e custo no chart vêm da instrumentação da Context7. Trate como UnverifiedClaim frente à tabela pública da TypeSafe até alguém reproduzir a suite.

Por que entra no catálogo: um produto de docs em produção (Context7 / Upstash) já está colocando o Jev contra labels reais de pipeline — e mostrando onde System One ganha e onde ainda precisa de fallback System Two.