Decily

Última atualização:

Aberto75–75ms$0/M input

Notas do quadrante

Ver o quadrante completo

Pontuação pela rubrica pública do quadrante (maturidade × capability; bolha = adoção). Revisamos conforme a evidência.

  • Maturidade5.2/10

    Apache-2.0, docs excelentes (DESIGN.md, TRAINING.md, TRAIN-REPORT.md), quatro builds (bf16, MLX, MLX-4bit, ONNX-int8), mas dia zero (1 star, 7 downloads), sem servidor /v1/systemone, sem SLA.

  • Capability7/10

    Acurácia in-task 0,863 bate Decider-2B (0,811) em tarefas compartilhadas com menos parâmetros (1,7B vs 2B). Gap zero-shot (0,654 vs 0,700) atribuído a cobertura de tarefas (24 vs 95). Calibrado o suficiente para threshold: 93,3% de acurácia nos 5% mais confiantes.

  • Adoção5/100

    Lançamento dia zero: 1 star no GitHub, 7 downloads no HF, uma menção casual em reply thread. Nenhuma integração ou uso em produção reportado.

Vendor claims

Decily é um modelo de decisão de 1.7B que pontua candidatos arbitrários em uma forward pass. Usa uma arquitetura explicit candidate-scorer (o autor chama de “Route B”) em vez de ler logits de letras de um LM congelado. Você passa um state, uma pergunta e qualquer conjunto de opções; ele devolve uma distribuição de probabilidade calibrada sobre elas.

É um fine-tune completo do Qwen3-1.7B-Base com RLCD post-training para calibração. Os pesos são abertos (Apache-2.0), a receita de treino está documentada comando por comando, e o autor publicou quatro formatos de export para diferentes alvos de deploy.

Pesos: Hugging Face alexzhang0118/Decily-1.7B (+ MLX, MLX-4bit, ONNX-int8). Repo: github.com/arczhi/decily. Menção: reply ao @digitalix (26 set 2026).

Especificações

Atributo Valor
Autor arczhi / Alex Zhang
Modelo base Qwen3-1.7B-Base
Parâmetros 1.7B
Licença Apache-2.0
Repo HF criado
Status Pesos abertos (Hugging Face)
Tipos de decisão choice (conjuntos de candidatos arbitrários)
Arquitetura Explicit candidate-scorer (Route B) — cada candidato pontuado diretamente, não via logits de letras

Builds

Variante Formato Tamanho Alvo
Decily-1.7B PyTorch bf16 safetensors ~3.4 GB servidor / GPU
Decily-MLX MLX bf16 safetensors ~3.4 GB Apple Silicon
Decily-MLX-4bit MLX 4-bit (group 64) 968 MB on-device / low memory
Decily-ONNX-int8 ONNX int8 1.66 GB CPU puro / Windows / edge

O build 4-bit casa com as probabilidades bf16 até 0.003 na mesma velocidade. O backbone 1.7B é Qwen3 padrão (não a linear attention do Qwen3.5), então exporta limpo para ONNX para deploy em CPU.

Como funciona

Decily usa Route B — um candidate-scorer explícito que pontua cada opção diretamente — em vez da abordagem de letter-logits (Route A) usada pelo Decider e pela maioria das alternativas ao Jev. O autor afirma +10.6 pt held-out sobre Route A em comparação controlada no mesmo backbone.

Pipeline de treino (tudo documentado em TRAINING.md):

  1. 24 famílias de tarefas + 15% belief data — processos estocásticos sintéticos com leis de probabilidade conhecidas ensinam calibração, não só acurácia
  2. RLCD post-training — proper scoring e ordenação de confiança para selective prediction / abstention usáveis
  3. Ensemble em espaço de probabilidade → distillation — quatro modelos diversos (NLL 1.455) destilados em um (NLL 1.451) sem custo extra de inferência
  4. Hardware consumer — o fine-tune completo v5 são 3000 steps ≈ 1.5h numa RTX 5090 32GB

Benchmarks do autor

Tudo nesta seção é reportado pelo autor → UnverifiedClaim. Todos os números são reportados após temperature fitting (logits raw T=1 são over-confident).

Avaliação Decily (1.7B, 24 tasks) Decider-2B (2B, 95 tasks)
In-task, tarefas de treino compartilhadas 0,863 / 0,390 NLL / 0,034 ECE 0,811 / 0,453 / 0,032 ECE
Zero-shot fair suite (8 tasks × 300) 0,654 / 0,86 NLL / 0,092 ECE 0,700 / 0,71 NLL / 0,047 ECE
Label sets não vistos (60/77-class intents) 0,581 / 1,451 NLL / 0,068 ECE —

Como ler esses números:

  • +5,2 pt em tarefas compartilhadas com modelo menor (1,7B vs 2B). O autor chama isso de “same-domain winner at a quarter of the task count.”
  • Gap zero-shot de ~4,6 pt (0,654 vs 0,700). O autor atribui isso a cobertura de tarefas (24 vs 95), não capacidade do modelo, e espera que o gap feche se re-rodado com mais tarefas. Isso é hipótese, não resultado testado.
  • Calibração para abstention: Os 5% de predições mais confiantes em label sets não vistos têm 93,3% de acurácia (vs 79% do baseline SFT).

A comparação com Decider-2B é feita só em tarefas held-out para ambos os modelos. TRAIN-REPORT.md §9.23 explica por que um número naive de held-out seria enganoso.

Latência (medida pelo autor)

Dispositivo Latência
Apple Silicon (M-series), MLX 4-bit ~75 ms por sentença

Todos os números de latência são UnverifiedClaim.

Limitações

  • Dia zero. 1 star no GitHub, 7 downloads no HF na checagem. Nenhum uso em produção reportado.
  • Só 24 tarefas. O gap zero-shot vs Decider-2B (95 tarefas) é reconhecido. Claim de scaling (“re-run with 60–95 tasks”) não foi testado.
  • Sem servidor. Sem endpoint /v1/systemone nem compatibilidade TypeSafe API de fábrica — você chama a API Python diretamente.
  • Só choice. O modelo pontua candidatos arbitrários mas não expõe score ou boolean como tipos de primeira classe na API.
  • Self-promotion. O autor mencionou isso em uma reply thread; o modelo é real e bem documentado, mas verificação independente está pendente.

Documentação

Incomumente completa para um modelo open de dia um:

  • DESIGN.md — decisões de arquitetura
  • TRAINING.md — receita completa command-level, reproduzível
  • TRAIN-REPORT.md — log de experimentos com referências de seção (§9.23–§9.25)
  • MODEL_CARD.md — model card do Hugging Face

Pesos de decisão treinados (fine-tune completo + RLCD), saída de probabilidade calibrada, arquitetura explicit candidate-scorer, e receita de treino pública. Abre uma alternativa Route B à abordagem de letter-logits usada pela maioria das alternativas ao Jev. A documentação facilita verificar ou reproduzir.