Instinct Tuned 4B
Notas do quadrante
Ver o quadrante completoPontuação pela rubrica pública do quadrante (maturidade × capability; bolha = adoção). Revisamos conforme a evidência.
- Maturidade6.3/10
Pesos Apache-2.0 mesclados no HF, runtime aberto com POST /v1/systemone e API hospedada (preview grátis em api.zoowork.ai; ZooData pago a US$ 0,01/M de input). Card, docs da API e runtime no GitHub são detalhados. Produto de empresa, sem SLA público.
- Capability7.8/10
Noul, Choice (2–16) e Score (2–16). Temperaturas publicadas (T=2,80 choice/score, T=0,50 noul) e ECE próprio 0,04–0,11 no hard. p50 62 ms, p95 ≈110 ms estimado [vendor]. JevBench público autodeclarado 198/231 (85,71%) com o checkpoint escolhido nesse conjunto — não é held-out nem está no placar oficial.
- Adoção6/100
Cerca de 55 downloads e 4 likes no HF, e 9 estrelas no GitHub do runtime (5/10). Há um issue de bench-request no JevBench. Sem integrações de terceiro nem uso em produção além da própria API da ZooWork.
Vendor claims
- JevBench público (231 itens): 198/231 = 85,71% (easy 48/48, standard 69/72, hard 81/111); o checkpoint também foi usado na seleção do modelo — não é score held-out[Claim do fornecedor — não verificado independentemente]
- Latência de serving direct-upstream: p50 62 ms; p95 ≈110 ms estimado (aquecido, serial; sem internet/TLS/gateway)[Claim do fornecedor — não verificado independentemente]
- ECE no split hard após temperature scaling: 0,04–0,11 conforme a ordem das opções (medido com T=2,80 para todos os tipos, antes da temperatura separada do noul)[Claim do fornecedor — não verificado independentemente]
- API paga ZooData: instinct-tuned-4b a US$ 0,01 por milhão de tokens de input; preview grátis de avaliação em api.zoowork.ai[Claim do fornecedor — não verificado independentemente]
Leia antes
- Os 85,71% não são score held-out. A ZooWork rodou os 231 itens públicos do JevBench com o cliente oficial e obteve 198/231. O card diz que esses mesmos itens públicos foram usados no desenvolvimento para escolher o checkpoint. Trate a tabela como referência, não como resultado independente. O modelo ainda não está no placar oficial do JevBench v1.5.7; um pedido de bench pede aos mantenedores que pontuem a API de produção.
- Não chame
generate(). A decisão é lida nos logits dos tokens de rótulo, com prompt e temperatura fixos. Use o runtime de referência ou a API hospedada/v1/systemone.- Família, não só este checkpoint. A ZooWork também hospeda o
instinct(leitura do Qwen3.8-27B congelado, sem fine-tune) e oinstinct-dual-4b(Qwen3.5-4B congelado com duas ordens de opções na média). Esses dois já aparecem no JevBench v1.5.7 (#60 com 18,3 e #30 com 47,0). Esta ficha cobre os pesos abertos com fine-tune.
O que é
O Instinct Tuned 4B é o modelo de decisão aberto da ZooWork: um fine-tune LoRA do Qwen/Qwen3.5-4B, mesclado nos pesos da base e liberado sob Apache-2.0. Você manda um estado compartilhado e perguntas tipadas; ele devolve uma probabilidade por candidato num único forward pass e não gera texto.
| Tipo | Faixa | Saída |
|---|---|---|
| Choice | 2–16 opções descritas | Probabilidade por opção, argmax, confiança |
| Noul | Proposição sim/não | P(sim) |
| Score | 2–16 níveis ordenados | Probabilidade por nível e nível esperado |
Leitura. O pedido é montado com um prompt fixo (instinct.prompt.v1), passa pelo chat template com o pensamento desligado e é pontuado a partir do último hidden state na profundidade cheia (camada 32), pelas linhas do LM-head dos tokens de rótulo. O softmax usa as temperaturas de decision_config.json: T = 2,80 para choice e score, T = 0,50 para noul (afiado porque o JevBench trata P(sim) em (0,2, 0,8) como abstenção).
Como servir
- Runtime aberto:
SerendipityOneInc/instinct(Apache-2.0, ~9★). CLIinstinct-decide, PythonInstinctModele um servidor local de referênciaPOST /v1/systemone. Pede GPU CUDA com BF16 (Ampere+); cerca de 8,5 GB de download, roda numa GPU de 24 GB. Fixatransformers==5.16.1. - API hospedada: o mesmo schema em duas rotas — preview grátis de avaliação em
https://api.zoowork.ai/v1/systemone, ZooData pago emhttps://api.zoodata.ai/v1/systemone(US$ 0,01/M de input neste modelo; output grátis). Compatível com o adaptertypesafeda TypeSafe, segundo o issue do bench-request. - Hospedar os pesos você mesmo não usa a cobrança do ZooData.
Números da ZooWork (UnverifiedClaim)
| Afirmação | Número | Observação |
|---|---|---|
| JevBench público, 231 itens | 198/231 (85,71%) | Cliente oficial, profundidade cheia, bf16, ordem original; usado na seleção |
| Easy / standard / hard | 48/48 · 69/72 · 81/111 | Mesma rodada |
| ECE hard (após T) | 0,04–0,11 | Depende da ordem das opções; medido antes do T separado do noul |
| Latência | p50 62 ms, p95 ≈110 ms (est.) | Serial aquecido, direct-upstream; sem internet/TLS |
Declaração de treino. Cerca de 9,4 mil itens de decisão (base ~5,9 mil mais ~900 exemplos hard sintéticos com upsample 4×). Descontaminação: todo item de treino tem <20% de sobreposição de 13-gramas com o conjunto público do JevBench — isso cobre só os dados de treino, não o uso do conjunto público na seleção. Os dados de treino ainda não foram liberados. T = 2,80 foi ajustado num conjunto de desenvolvimento held-out da mesma distribuição de tarefas do benchmark.
Limites
- Sensibilidade à ordem das opções: a acurácia se mantém, mas o ECE do hard muda 0,04–0,07 entre ordens.
- Só texto, limite de 8.192 tokens (entradas maiores são rejeitadas). Os pesos da torre de visão vêm da base, mas não são usados.
- Avaliação sobretudo em inglês. O modelo decide; não explica.
Quando usar / quando não usar
Serve quando você precisa de: um modelo de decisão 4B aberto com caminho real /v1/systemone, inferência hospedada opcional a US$ 0,01/M e temperaturas publicadas.
Não serve quando você precisa de: acurácia verificada por terceiros, listas de escolha com mais de 16 opções, entrada de imagem, ou um modelo que não tenha sido ajustado contra o conjunto público do JevBench.
Conta das notas (5/10/2026)
- Maturidade = disponibilidade 8 × 0,30 + docs 8 × 0,25 + integrações 6 × 0,25 + suporte 2 × 0,20 = 2,40 + 2,00 + 1,50 + 0,40 = 6,30
- Capability = tipos 10 × 0,30 + calibração 7 × 0,25 + latência 8 × 0,25
[vendor]+ acurácia 5 × 0,20 = 3,00 + 1,75 + 2,00 + 1,00 = 7,75 → 7,8 - Adoção = engajamento 8 × 0,35 + ecossistema 8 × 0,35 + produção 0 × 0,30 = 2,80 + 2,80 + 0 = 5,60 → 6
A acurácia fica em 5 (abaixo do 6 usual para um score de placar próprio) porque o conjunto público foi usado na seleção do checkpoint e o modelo ainda não está no placar oficial.
