Decily
Notas do quadrante
Ver o quadrante completoPontuação pela rubrica pública do quadrante (maturidade × capability; bolha = adoção). Revisamos conforme a evidência.
- Maturidade5.2/10
Apache-2.0, docs excelentes (DESIGN.md, TRAINING.md, TRAIN-REPORT.md), quatro builds (bf16, MLX, MLX-4bit, ONNX-int8), mas dia zero (1 star, 7 downloads), sem servidor /v1/systemone, sem SLA.
- Capability7/10
Acurácia in-task 0,863 bate Decider-2B (0,811) em tarefas compartilhadas com menos parâmetros (1,7B vs 2B). Gap zero-shot (0,654 vs 0,700) atribuído a cobertura de tarefas (24 vs 95). Calibrado o suficiente para threshold: 93,3% de acurácia nos 5% mais confiantes.
- Adoção5/100
Lançamento dia zero: 1 star no GitHub, 7 downloads no HF, uma menção casual em reply thread. Nenhuma integração ou uso em produção reportado.
Vendor claims
- In-task shared: 0,863 acc / 0,390 NLL / 0,034 ECE (vs Decider-2B 0,811 / 0,453 / 0,032)[Claim do fornecedor — não verificado independentemente]
- Zero-shot fair suite (8 tasks × 300): 0,654 acc / 0,86 NLL / 0,092 ECE[Claim do fornecedor — não verificado independentemente]
- Route B explicit candidate-scorer: +10,6 pt held-out sobre route de letter-logits em comparação controlada[Claim do fornecedor — não verificado independentemente]
- ~75 ms por sentença em chips M-series com build MLX 4-bit[Claim do fornecedor — não verificado independentemente]
- Full fine-tune: 3000 steps ≈ 1,5h numa RTX 5090 32GB[Claim do fornecedor — não verificado independentemente]
Decily é um modelo de decisão de 1.7B que pontua candidatos arbitrários em uma forward pass. Usa uma arquitetura explicit candidate-scorer (o autor chama de “Route B”) em vez de ler logits de letras de um LM congelado. Você passa um state, uma pergunta e qualquer conjunto de opções; ele devolve uma distribuição de probabilidade calibrada sobre elas.
É um fine-tune completo do Qwen3-1.7B-Base com RLCD post-training para calibração. Os pesos são abertos (Apache-2.0), a receita de treino está documentada comando por comando, e o autor publicou quatro formatos de export para diferentes alvos de deploy.
Pesos: Hugging Face alexzhang0118/Decily-1.7B (+ MLX, MLX-4bit, ONNX-int8). Repo: github.com/arczhi/decily. Menção: reply ao @digitalix (26 set 2026).
Especificações
| Atributo | Valor |
|---|---|
| Autor | arczhi / Alex Zhang |
| Modelo base | Qwen3-1.7B-Base |
| Parâmetros | 1.7B |
| Licença | Apache-2.0 |
| Repo HF criado | |
| Status | Pesos abertos (Hugging Face) |
| Tipos de decisão | choice (conjuntos de candidatos arbitrários) |
| Arquitetura | Explicit candidate-scorer (Route B) — cada candidato pontuado diretamente, não via logits de letras |
Builds
| Variante | Formato | Tamanho | Alvo |
|---|---|---|---|
| Decily-1.7B | PyTorch bf16 safetensors | ~3.4 GB | servidor / GPU |
| Decily-MLX | MLX bf16 safetensors | ~3.4 GB | Apple Silicon |
| Decily-MLX-4bit | MLX 4-bit (group 64) | 968 MB | on-device / low memory |
| Decily-ONNX-int8 | ONNX int8 | 1.66 GB | CPU puro / Windows / edge |
O build 4-bit casa com as probabilidades bf16 até 0.003 na mesma velocidade. O backbone 1.7B é Qwen3 padrão (não a linear attention do Qwen3.5), então exporta limpo para ONNX para deploy em CPU.
Como funciona
Decily usa Route B — um candidate-scorer explícito que pontua cada opção diretamente — em vez da abordagem de letter-logits (Route A) usada pelo Decider e pela maioria das alternativas ao Jev. O autor afirma +10.6 pt held-out sobre Route A em comparação controlada no mesmo backbone.
Pipeline de treino (tudo documentado em TRAINING.md):
- 24 famílias de tarefas + 15% belief data — processos estocásticos sintéticos com leis de probabilidade conhecidas ensinam calibração, não só acurácia
- RLCD post-training — proper scoring e ordenação de confiança para selective prediction / abstention usáveis
- Ensemble em espaço de probabilidade → distillation — quatro modelos diversos (NLL 1.455) destilados em um (NLL 1.451) sem custo extra de inferência
- Hardware consumer — o fine-tune completo v5 são 3000 steps ≈ 1.5h numa RTX 5090 32GB
Benchmarks do autor
Tudo nesta seção é reportado pelo autor → UnverifiedClaim. Todos os números são reportados após temperature fitting (logits raw T=1 são over-confident).
| Avaliação | Decily (1.7B, 24 tasks) | Decider-2B (2B, 95 tasks) |
|---|---|---|
| In-task, tarefas de treino compartilhadas | 0,863 / 0,390 NLL / 0,034 ECE | 0,811 / 0,453 / 0,032 ECE |
| Zero-shot fair suite (8 tasks × 300) | 0,654 / 0,86 NLL / 0,092 ECE | 0,700 / 0,71 NLL / 0,047 ECE |
| Label sets não vistos (60/77-class intents) | 0,581 / 1,451 NLL / 0,068 ECE | — |
Como ler esses números:
- +5,2 pt em tarefas compartilhadas com modelo menor (1,7B vs 2B). O autor chama isso de “same-domain winner at a quarter of the task count.”
- Gap zero-shot de ~4,6 pt (0,654 vs 0,700). O autor atribui isso a cobertura de tarefas (24 vs 95), não capacidade do modelo, e espera que o gap feche se re-rodado com mais tarefas. Isso é hipótese, não resultado testado.
- Calibração para abstention: Os 5% de predições mais confiantes em label sets não vistos têm 93,3% de acurácia (vs 79% do baseline SFT).
A comparação com Decider-2B é feita só em tarefas held-out para ambos os modelos. TRAIN-REPORT.md §9.23 explica por que um número naive de held-out seria enganoso.
Latência (medida pelo autor)
| Dispositivo | Latência |
|---|---|
| Apple Silicon (M-series), MLX 4-bit | ~75 ms por sentença |
Todos os números de latência são UnverifiedClaim.
Limitações
- Dia zero. 1 star no GitHub, 7 downloads no HF na checagem. Nenhum uso em produção reportado.
- Só 24 tarefas. O gap zero-shot vs Decider-2B (95 tarefas) é reconhecido. Claim de scaling (“re-run with 60–95 tasks”) não foi testado.
- Sem servidor. Sem endpoint
/v1/systemonenem compatibilidade TypeSafe API de fábrica — você chama a API Python diretamente. - Só choice. O modelo pontua candidatos arbitrários mas não expõe
scoreoubooleancomo tipos de primeira classe na API. - Self-promotion. O autor mencionou isso em uma reply thread; o modelo é real e bem documentado, mas verificação independente está pendente.
Documentação
Incomumente completa para um modelo open de dia um:
DESIGN.md— decisões de arquiteturaTRAINING.md— receita completa command-level, reproduzívelTRAIN-REPORT.md— log de experimentos com referências de seção (§9.23–§9.25)MODEL_CARD.md— model card do Hugging Face
Por que está no catálogo
Pesos de decisão treinados (fine-tune completo + RLCD), saída de probabilidade calibrada, arquitetura explicit candidate-scorer, e receita de treino pública. Abre uma alternativa Route B à abordagem de letter-logits usada pela maioria das alternativas ao Jev. A documentação facilita verificar ou reproduzir.
