Mica v0.1 4B
Notas do quadrante
Ver o quadrante completoPontuação pela rubrica pública do quadrante (maturidade × capability; bolha = adoção). Revisamos conforme a evidência.
- Maturidade5.4/10
Pesos BF16 mesclados Apache-2.0 mais seis quants GGUF, Dockerfile, scripts de build do llama.cpp e servidor /v1/systemone contra o qual o adapter typesafe do JevBench roda sem mudança. Card detalhado com tabela de quants. Só self-host, sem SLA.
- Capability7.3/10
Noul, Choice (2–255 opções) e Score (2–10 níveis). Temperatura 1,124 ajustada num conjunto de calibração, ECE de 5,4% no held-out. p50 de 54 ms / p95 de 552 ms numa RTX 3090 e saídas por item do JevBench público, tudo rodado pelo autor. Fora do Decision Index.
- Adoção8/100
Cerca de 37 likes e 4 mil downloads no HF (com GGUF) cinco dias após o lançamento, 27 estrelas no GitHub. Nenhum post de lançamento encontrado, sem integrações nem uso em produção reportados.
Vendor claims
- JevBench público de 231 itens via servidor llama.cpp: easy 1,000, original 1,000, hard 0,649, ECE 0,064, p50 54 ms, p95 552 ms (RTX 3090, GGUF BF16)[Claim do fornecedor — não verificado independentemente]
- Conjunto held-out (7.328 itens, EN + KO): Mica 67,4 vs JEV 1.13 74,7, Kev 4B 56,4, Nimble 9B 53,9[Claim do fornecedor — não verificado independentemente]
- Nota plantada no estado apontando a opção errada: Mica acerta 69,1% vs JEV 17,5% e Kev 31,4%[Claim do fornecedor — não verificado independentemente]
- Nenhum item do JevBench nas 77.732 linhas de treino (checagem por match exato e 8-gramas)[Claim do fornecedor — não verificado independentemente]
- Demo de Tetris: 223 linhas em três seeds vs 55 do Kev 4B e 17 do Laya[Claim do fornecedor — não verificado independentemente]
O Mica v0.1 4B é um modelo de decisão aberto e pequeno, publicado no Hugging Face por sky7350 em 25 de setembro de 2026, com código e scripts no GitHub sob akivet. Você passa um estado, uma pergunta e as respostas permitidas; ele devolve uma probabilidade para cada resposta, sem gerar texto. Uma decisão custa um prefill, e várias perguntas sobre o mesmo estado dividem esse custo.
Ele fala o formato /v1/systemone da TypeSafe, então clientes do Jev funcionam sem mudança. Foi treinado em inglês e coreano. Não é produto da TypeSafe, não foi destilado do Jev e não deriva de outro modelo do catálogo: o card usa Kev, Laya, JevK5 e Nimble só como comparação.
Ficha
| Atributo | Valor |
|---|---|
| Autor | sky7350 (HF) / akivet (GitHub) |
| Lançamento | 25/09/2026 (repo no HF às 04:44 BRT) |
| Modelo base | Qwen/Qwen3.5-4B (revisão 851bf6e), mesma arquitetura, sem heads novos |
| Treino | LoRA rank 16 nas projeções de atenção e Gated DeltaNet, mesclado; uma época de cross-entropy nas respostas verificadas; melhor de três seeds |
| Dados | Cerca de 34 mil decisões de origem / 78 mil linhas em 12 áreas (agentes de código, code review, uso de computador, políticas, roteamento, jogos, conhecimento geral…), checadas rodando código quando possível |
| Leitura | Softmax sobre 255 rótulos fixos de um token (sim/não usa “No”/“Yes”), dividido por temperatura ajustada de 1,124 |
| Tipos de pergunta | noul (boolean no catálogo), choice (2–255 opções), score (2–10 níveis) |
| Arquivos | safetensors BF16 mesclado; GGUF em BF16, Q8_0, Q6_K, Q5_K_M, Q4_K_M, Q4_0 |
| Serving | Imagem Docker ou build do llama.cpp b11010 → http://127.0.0.1:8010/v1/systemone; entradas acima de 8.192 tokens recebem HTTP 400 |
| Licença | Apache-2.0 |
Resultados do autor (UnverifiedClaim)
JevBench público (231 itens, pelo runner do próprio JevBench e o adapter typesafe sem alteração, com saída por item publicada): easy 1,000, original 1,000, hard 0,649, ECE 0,064. A avaliação do autor em PyTorch dá 69,5 no nível hard; o GGUF servido dá 64,9. Metade dos itens hard públicos foi usada para comparar receitas durante o desenvolvimento.
| Conjunto | n | Mica | JEV 1.13 | Kev 4B | Nimble 9B |
|---|---|---|---|---|---|
| SemIf | 252 | 94,4 | 98,4 | 89,3 | 93,2 |
| Kev transfer v9 | 1.264 | 69,2 | 82,0 | 73,5 | – |
| MMLU-Pro | 10.032 | 53,0 | 82,3 | 49,7 | – |
| Held-out (EN + KO) | 7.328 | 67,4 | 74,7 | 56,4 | 53,9 |
| Entradas perturbadas | 2.752 | 77,3 | 73,3 | 48,7 | 44,5 |
O held-out foi escrito depois que os dados de treino foram congelados. Alguns conjuntos próprios do autor (entradas longas, estilo de chat, conhecimento) são próximos da distribuição de treino, e o card pede que sejam lidos como números in-distribution. Calibração no held-out: ECE de 5,4%, com 2,5% das respostas erradas com confiança ≥ 0,9 (JEV: 3,8% e 2,0%).
Latência numa RTX 3090, uma requisição por vez: p50 de 54 ms / p90 de 526 ms (BF16) e 47 ms / 466 ms (Q4_K_M). O p90 vem dos itens hard, com até ~3,7 mil tokens.
Quantização: no conjunto de calibração de 1.402 itens do autor, o Q5_K_M mantém 96,1% das respostas do BF16 e é a sugestão para GPU de 8 GB.
Quando usar / quando não usar
Serve quando você precisa de: um modelo de decisão local e pequeno numa GPU doméstica, entradas em coreano ou mistura de inglês e coreano, decisões de agentes e code review, ou resistência a instruções plantadas dentro do estado.
Não serve quando você precisa de: perguntas que dependem de conhecimento (53,0 no MMLU-Pro vs 82,3 do Jev), documentos longos de política em inglês (o conjunto público mais fraco), entradas acima de 8 mil tokens ou números verificados por terceiros.
Limites
- Todos os números foram rodados pelo autor; o Mica não está no Decision Index nem no leaderboard do JevBench v1.4.2.
- Notas plantadas no estado ainda mexem um pouco nas respostas.
- Versão única (v0.1) de um autor individual, sem opção hospedada.
Por que está no catálogo
O LoRA foi treinado para decisão tipada e mesclado em pesos publicados, com servidor compatível com o System One que devolve probabilidades. Isso passa nos critérios do catálogo.
