Instinct Tuned 4B

Última atualização:

Aberto62–110ms$0.01/M input

Notas do quadrante

Ver o quadrante completo

Pontuação pela rubrica pública do quadrante (maturidade × capability; bolha = adoção). Revisamos conforme a evidência.

  • Maturidade6.3/10

    Pesos Apache-2.0 mesclados no HF, runtime aberto com POST /v1/systemone e API hospedada (preview grátis em api.zoowork.ai; ZooData pago a US$ 0,01/M de input). Card, docs da API e runtime no GitHub são detalhados. Produto de empresa, sem SLA público.

  • Capability7.8/10

    Noul, Choice (2–16) e Score (2–16). Temperaturas publicadas (T=2,80 choice/score, T=0,50 noul) e ECE próprio 0,04–0,11 no hard. p50 62 ms, p95 ≈110 ms estimado [vendor]. JevBench público autodeclarado 198/231 (85,71%) com o checkpoint escolhido nesse conjunto — não é held-out nem está no placar oficial.

  • Adoção6/100

    Cerca de 55 downloads e 4 likes no HF, e 9 estrelas no GitHub do runtime (5/10). Há um issue de bench-request no JevBench. Sem integrações de terceiro nem uso em produção além da própria API da ZooWork.

Vendor claims

Leia antes

  1. Os 85,71% não são score held-out. A ZooWork rodou os 231 itens públicos do JevBench com o cliente oficial e obteve 198/231. O card diz que esses mesmos itens públicos foram usados no desenvolvimento para escolher o checkpoint. Trate a tabela como referência, não como resultado independente. O modelo ainda não está no placar oficial do JevBench v1.5.7; um pedido de bench pede aos mantenedores que pontuem a API de produção.
  2. Não chame generate(). A decisão é lida nos logits dos tokens de rótulo, com prompt e temperatura fixos. Use o runtime de referência ou a API hospedada /v1/systemone.
  3. Família, não só este checkpoint. A ZooWork também hospeda o instinct (leitura do Qwen3.8-27B congelado, sem fine-tune) e o instinct-dual-4b (Qwen3.5-4B congelado com duas ordens de opções na média). Esses dois já aparecem no JevBench v1.5.7 (#60 com 18,3 e #30 com 47,0). Esta ficha cobre os pesos abertos com fine-tune.

O que é

O Instinct Tuned 4B é o modelo de decisão aberto da ZooWork: um fine-tune LoRA do Qwen/Qwen3.5-4B, mesclado nos pesos da base e liberado sob Apache-2.0. Você manda um estado compartilhado e perguntas tipadas; ele devolve uma probabilidade por candidato num único forward pass e não gera texto.

Tipo Faixa Saída
Choice 2–16 opções descritas Probabilidade por opção, argmax, confiança
Noul Proposição sim/não P(sim)
Score 2–16 níveis ordenados Probabilidade por nível e nível esperado

Leitura. O pedido é montado com um prompt fixo (instinct.prompt.v1), passa pelo chat template com o pensamento desligado e é pontuado a partir do último hidden state na profundidade cheia (camada 32), pelas linhas do LM-head dos tokens de rótulo. O softmax usa as temperaturas de decision_config.json: T = 2,80 para choice e score, T = 0,50 para noul (afiado porque o JevBench trata P(sim) em (0,2, 0,8) como abstenção).

Como servir

  • Runtime aberto: SerendipityOneInc/instinct (Apache-2.0, ~9★). CLI instinct-decide, Python InstinctModel e um servidor local de referência POST /v1/systemone. Pede GPU CUDA com BF16 (Ampere+); cerca de 8,5 GB de download, roda numa GPU de 24 GB. Fixa transformers==5.16.1.
  • API hospedada: o mesmo schema em duas rotas — preview grátis de avaliação em https://api.zoowork.ai/v1/systemone, ZooData pago em https://api.zoodata.ai/v1/systemone (US$ 0,01/M de input neste modelo; output grátis). Compatível com o adapter typesafe da TypeSafe, segundo o issue do bench-request.
  • Hospedar os pesos você mesmo não usa a cobrança do ZooData.

Números da ZooWork (UnverifiedClaim)

Afirmação Número Observação
JevBench público, 231 itens 198/231 (85,71%) Cliente oficial, profundidade cheia, bf16, ordem original; usado na seleção
Easy / standard / hard 48/48 · 69/72 · 81/111 Mesma rodada
ECE hard (após T) 0,04–0,11 Depende da ordem das opções; medido antes do T separado do noul
Latência p50 62 ms, p95 ≈110 ms (est.) Serial aquecido, direct-upstream; sem internet/TLS

Declaração de treino. Cerca de 9,4 mil itens de decisão (base ~5,9 mil mais ~900 exemplos hard sintéticos com upsample 4×). Descontaminação: todo item de treino tem <20% de sobreposição de 13-gramas com o conjunto público do JevBench — isso cobre só os dados de treino, não o uso do conjunto público na seleção. Os dados de treino ainda não foram liberados. T = 2,80 foi ajustado num conjunto de desenvolvimento held-out da mesma distribuição de tarefas do benchmark.

Limites

  • Sensibilidade à ordem das opções: a acurácia se mantém, mas o ECE do hard muda 0,04–0,07 entre ordens.
  • Só texto, limite de 8.192 tokens (entradas maiores são rejeitadas). Os pesos da torre de visão vêm da base, mas não são usados.
  • Avaliação sobretudo em inglês. O modelo decide; não explica.

Quando usar / quando não usar

Serve quando você precisa de: um modelo de decisão 4B aberto com caminho real /v1/systemone, inferência hospedada opcional a US$ 0,01/M e temperaturas publicadas.

Não serve quando você precisa de: acurácia verificada por terceiros, listas de escolha com mais de 16 opções, entrada de imagem, ou um modelo que não tenha sido ajustado contra o conjunto público do JevBench.

Conta das notas (5/10/2026)

  • Maturidade = disponibilidade 8 × 0,30 + docs 8 × 0,25 + integrações 6 × 0,25 + suporte 2 × 0,20 = 2,40 + 2,00 + 1,50 + 0,40 = 6,30
  • Capability = tipos 10 × 0,30 + calibração 7 × 0,25 + latência 8 × 0,25 [vendor] + acurácia 5 × 0,20 = 3,00 + 1,75 + 2,00 + 1,00 = 7,75 → 7,8
  • Adoção = engajamento 8 × 0,35 + ecossistema 8 × 0,35 + produção 0 × 0,30 = 2,80 + 2,80 + 0 = 5,60 → 6

A acurácia fica em 5 (abaixo do 6 usual para um score de placar próprio) porque o conjunto público foi usado na seleção do checkpoint e o modelo ainda não está no placar oficial.