Tev1-4B-experimental

Última atualização:

Aberto—$0.042/M input

Notas do quadrante

Ver o quadrante completo

Pontuação pela rubrica pública do quadrante (maturidade × capability; bolha = adoção). Revisamos conforme a evidência.

  • Maturidade5.8/10

    Pesos abertos, receita completa de treino, endpoint serverless hospedado e exemplos públicos; ainda experimental, generativo e sem benchmark de latência publicado ou SLA.

  • Capability2.3/10

    Saída estruturada choice-only a partir de prompts com 2–24 opções. O modelo mantém a cabeça autoregressiva do Qwen e expõe logprobs como preferências, não probabilidades calibradas; os resultados de desenvolvimento são autorrelatados.

  • Adoção19/100

    4B: ~2,4 mil downloads e 24 likes no HF (eram 741 / 12); 0.8B: ~800 downloads; receita no GitHub com 177 stars. Desde 30/09 os dois tamanhos estão no Ollama (~2,7 mil pulls em ~14h). Ainda um lançamento experimental de nicho.

Vendor claims

Tev1-4B-experimental é um modelo de decisão open e Jev-inspired da Together AI. É um supervised fine-tune do Qwen3.5-4B treinado para escolher uma opção a partir de um state estruturado, uma question e uma lista de 2–24 choices.

O model card deixa o limite explícito: isto não é um runtime Jev non-autoregressive. O modelo mantém a cabeça padrão de language model do Qwen, e a aplicação mapeia a letra retornada para uma chave semântica. Por isso, a entrada de catálogo fica limitada a choice; não atribuímos ao modelo as interfaces calibradas de Score ou Boolean do Jev.

Receita de treino

O repositório público inclui a receita de dados e um exemplo de treino. O run new v1 combina 37.840 exemplos únicos de treino com 4.568 exemplos de validação, cobrindo classificação de linguagem, decisões de política, routing e classificação sintética de pesquisa. O exemplo usa supervised fine-tuning no Qwen3.5-4B.

O repositório alerta que a mistura de avaliação influenciou o desenvolvimento do modelo. Os 88,0% em 1.000 decisões principais e 300/300 em policy-transfer são resultados de bring-up, não benchmark independente. O card também diz que os logprobs são preferências do modelo, não confidence calibrada.

O irmão de 0.8B, Tev1-0.8B-experimental, ficou público no Hugging Face em 25 de setembro de 2026. Mesma receita e mesma interface, sobre o Qwen3.5-0.8B; o card diz que a licença dos pesos “is being finalized”. Ele é coberto aqui, não numa ficha separada.

No Ollama (30/09/2026)

Os dois tamanhos são modelos de lançamento do endpoint /v1/systemone do Ollama: ollama pull tev1 (4B, 4,5 GB Q8_0, 4,21B params) e ollama pull tev1:0.8b (812 MB Q8_0, 752M params). A página da library do Ollama lista três tipos de pergunta (choice, noul, score) e recomenda ficar entre 2 e 24 opções, a faixa em que o Tev1 foi treinado.

No catálogo, decisionTypes continua só choice. No Ollama, os formatos noul e score vêm do scoring de candidatos do próprio Ollama, não do treino do Tev1, e o card da Together segue descrevendo saída de uma letra com logprobs não calibrados.

UnverifiedClaim: a rodada do Ollama nos 13 datasets públicos com rótulo humano da Bespoke Labs (3.880 decisões) dá 73,3% para o Tev1 4B e 63,5% para o Tev1 0.8B, contra 76,0% do Jev 1.13 (número do Jev tirado da rodada publicada pela Bespoke). (blog · library)

Fit / anti-fit

Fit: classificador Jev-inspired open, receita reproduzível de fine-tuning ou decisão choice controlada dentro de um schema de aplicação.

Anti-fit: runtime System One non-autoregressive, probabilidades calibradas, semântica Boolean/Noul ou Score, ou decisões de produção sem sua própria avaliação holdout.

Limites

  • Não há benchmark público de latência p50/p99. O valor 0–0ms no frontmatter é um sentinel de dado indisponível.
  • Os números de 88% e 100% são de desenvolvimento e UnverifiedClaim.
  • O modelo continua sendo um checkpoint generativo do Qwen e pode produzir prosa fora da interface restrita.
  • Os preços de US$ 0,042/M de entrada e US$ 0/M de saída são claims do endpoint serverless da Together.

Fontes