Mica v0.1 4B

Última atualização:

Aberto54–552ms$0/M input

Notas do quadrante

Ver o quadrante completo

Pontuação pela rubrica pública do quadrante (maturidade × capability; bolha = adoção). Revisamos conforme a evidência.

  • Maturidade5.4/10

    Pesos BF16 mesclados Apache-2.0 mais seis quants GGUF, Dockerfile, scripts de build do llama.cpp e servidor /v1/systemone contra o qual o adapter typesafe do JevBench roda sem mudança. Card detalhado com tabela de quants. Só self-host, sem SLA.

  • Capability7.3/10

    Noul, Choice (2–255 opções) e Score (2–10 níveis). Temperatura 1,124 ajustada num conjunto de calibração, ECE de 5,4% no held-out. p50 de 54 ms / p95 de 552 ms numa RTX 3090 e saídas por item do JevBench público, tudo rodado pelo autor. Fora do Decision Index.

  • Adoção8/100

    Cerca de 37 likes e 4 mil downloads no HF (com GGUF) cinco dias após o lançamento, 27 estrelas no GitHub. Nenhum post de lançamento encontrado, sem integrações nem uso em produção reportados.

Vendor claims

O Mica v0.1 4B é um modelo de decisão aberto e pequeno, publicado no Hugging Face por sky7350 em 25 de setembro de 2026, com código e scripts no GitHub sob akivet. Você passa um estado, uma pergunta e as respostas permitidas; ele devolve uma probabilidade para cada resposta, sem gerar texto. Uma decisão custa um prefill, e várias perguntas sobre o mesmo estado dividem esse custo.

Ele fala o formato /v1/systemone da TypeSafe, então clientes do Jev funcionam sem mudança. Foi treinado em inglês e coreano. Não é produto da TypeSafe, não foi destilado do Jev e não deriva de outro modelo do catálogo: o card usa Kev, Laya, JevK5 e Nimble só como comparação.

Ficha

Atributo Valor
Autor sky7350 (HF) / akivet (GitHub)
Lançamento 25/09/2026 (repo no HF às 04:44 BRT)
Modelo base Qwen/Qwen3.5-4B (revisão 851bf6e), mesma arquitetura, sem heads novos
Treino LoRA rank 16 nas projeções de atenção e Gated DeltaNet, mesclado; uma época de cross-entropy nas respostas verificadas; melhor de três seeds
Dados Cerca de 34 mil decisões de origem / 78 mil linhas em 12 áreas (agentes de código, code review, uso de computador, políticas, roteamento, jogos, conhecimento geral…), checadas rodando código quando possível
Leitura Softmax sobre 255 rótulos fixos de um token (sim/não usa “No”/“Yes”), dividido por temperatura ajustada de 1,124
Tipos de pergunta noul (boolean no catálogo), choice (2–255 opções), score (2–10 níveis)
Arquivos safetensors BF16 mesclado; GGUF em BF16, Q8_0, Q6_K, Q5_K_M, Q4_K_M, Q4_0
Serving Imagem Docker ou build do llama.cpp b11010 → http://127.0.0.1:8010/v1/systemone; entradas acima de 8.192 tokens recebem HTTP 400
Licença Apache-2.0

Resultados do autor (UnverifiedClaim)

JevBench público (231 itens, pelo runner do próprio JevBench e o adapter typesafe sem alteração, com saída por item publicada): easy 1,000, original 1,000, hard 0,649, ECE 0,064. A avaliação do autor em PyTorch dá 69,5 no nível hard; o GGUF servido dá 64,9. Metade dos itens hard públicos foi usada para comparar receitas durante o desenvolvimento.

Conjunto n Mica JEV 1.13 Kev 4B Nimble 9B
SemIf 252 94,4 98,4 89,3 93,2
Kev transfer v9 1.264 69,2 82,0 73,5 –
MMLU-Pro 10.032 53,0 82,3 49,7 –
Held-out (EN + KO) 7.328 67,4 74,7 56,4 53,9
Entradas perturbadas 2.752 77,3 73,3 48,7 44,5

O held-out foi escrito depois que os dados de treino foram congelados. Alguns conjuntos próprios do autor (entradas longas, estilo de chat, conhecimento) são próximos da distribuição de treino, e o card pede que sejam lidos como números in-distribution. Calibração no held-out: ECE de 5,4%, com 2,5% das respostas erradas com confiança ≥ 0,9 (JEV: 3,8% e 2,0%).

Latência numa RTX 3090, uma requisição por vez: p50 de 54 ms / p90 de 526 ms (BF16) e 47 ms / 466 ms (Q4_K_M). O p90 vem dos itens hard, com até ~3,7 mil tokens.

Quantização: no conjunto de calibração de 1.402 itens do autor, o Q5_K_M mantém 96,1% das respostas do BF16 e é a sugestão para GPU de 8 GB.

Quando usar / quando não usar

Serve quando você precisa de: um modelo de decisão local e pequeno numa GPU doméstica, entradas em coreano ou mistura de inglês e coreano, decisões de agentes e code review, ou resistência a instruções plantadas dentro do estado.

Não serve quando você precisa de: perguntas que dependem de conhecimento (53,0 no MMLU-Pro vs 82,3 do Jev), documentos longos de política em inglês (o conjunto público mais fraco), entradas acima de 8 mil tokens ou números verificados por terceiros.

Limites

  • Todos os números foram rodados pelo autor; o Mica não está no Decision Index nem no leaderboard do JevBench v1.4.2.
  • Notas plantadas no estado ainda mexem um pouco nas respostas.
  • Versão única (v0.1) de um autor individual, sem opção hospedada.

O LoRA foi treinado para decisão tipada e mesclado em pesos publicados, com servidor compatível com o System One que devolve probabilidades. Isso passa nos critérios do catálogo.