Julia-1
Notas do quadrante
Ver o quadrante completoPontuação pela rubrica pública do quadrante (maturidade × capability; bolha = adoção). Revisamos conforme a evidência.
- Maturidade4.8/10
Pesos Apache-2.0, card detalhado com arquivos de proveniência e métricas, e API tipada em Python. Desde 02/10 roda no servidor /v1/systemone do llama.cpp (GGUF oficial da ggml-org), então clientes do Jev apontam para ele. Sem pacote no PyPI; API hospedada anunciada mas não no ar. Sem SLA.
- Capability6.5/10
choice / score / noul de primeira classe com 144M parâmetros em CPU. Avaliações do autor bem documentadas, mas rodadas por ele; os números do Jev são referências fornecidas, não uma rodada nova. Sem etapa de calibração (calibration: null). Fraco em listas longas.
- Adoção14/100
Post de lançamento em 26/09 (161 likes, ~2,7 mil views poucas horas depois), 13 likes e 0 downloads no HF na checagem. Nenhuma integração ou uso em produção reportado ainda.
Vendor claims
- Decisões tipadas 1.463/2.000 (73,15%) vs referência fornecida do Jev de 72,70%; Choice 428/600, Noul 484/600, Score 551/800 (H200 BF16, 24/09/2026)[Claim do fornecedor — não verificado independentemente]
- Pilotos de 100 exemplos: AG News 94 vs 91, DAIR Emotion 86 vs 48, Banking77 com shortlist de 72 rótulos 64 vs 87 (valores do Jev fornecidos pelo protocolo)[Claim do fornecedor — não verificado independentemente]
- Rodada em CPU de 25/09/2026: decisões tipadas 72,55% (1.451/2.000); Banking77 60/100 com 3 abstenções[Claim do fornecedor — não verificado independentemente]
- MASSIVE, classificação em 18 cenários: 71,50% (média macro) em 52 locales (pt-PT 86,25%, en-US 86,75%)[Claim do fornecedor — não verificado independentemente]
- Apple M4: mediana de 33,15 ms por decisão (uma por chamada); Intel i5-1235U: mediana de 294,81 ms em decisões tipadas; Samsung SM-X510 (ONNX Runtime): ~203 ms[Claim do fornecedor — não verificado independentemente]
- Cerca de R$540 (US$104,08) de gasto total com GPU em nuvem para treino e experimentos[Claim do fornecedor — não verificado independentemente]
- API hospedada planejada a US$0,025 por milhão de tokens de entrada, US$0 na saída (fora do ar em 26/09/2026)[Claim do fornecedor — não verificado independentemente]
- Julia 2, com arquitetura de base própria e sem mmBERT, está em desenvolvimento[Claim do fornecedor — não verificado independentemente]
Julia-1 é um modelo de decisão pequeno e aberto da Supersonic Labs, um laboratório brasileiro. Você passa um state, uma pergunta e de 2 a 20 respostas candidatas; ele pontua as candidatas e devolve uma escolha mais a probabilidade de cada opção. Não gera texto e não precisa de GPU.
É um fine-tune do mmBERT-small, da JHU CLSP, um encoder ModernBERT multilíngue, com uma cabeça de decisão por cima. O laboratório diz isso com todas as letras na página de lançamento, inclusive a frase “Julia 1 is not a fine-tuned Qwen model”. Não é TypeSafe e não fala o contrato /v1/systemone.
Pesos: Hugging Face SupersonicLabs/Julia-1 (Apache-2.0). Página de lançamento: supersoniclabs.ia.br/julia-1. Anúncio: @supersonicai (26 set 2026, 16h BRT).
Especificações
| Atributo | Valor |
|---|---|
| Autor | Supersonic Labs (Brasil) |
| Modelo base | jhu-clsp/mmBERT-small (encoder ModernBERT multilíngue) |
| Parâmetros | 144,3M (API do HF: 144.292.870, FP32) |
| Pesos | model.safetensors de 550,5 MiB, FP32 |
| Licença | Apache-2.0 (pesos e código de inferência; pipeline de treino não publicado) |
| Repo no HF criado em | |
| Lançamento público | |
| Status | Pesos abertos (Hugging Face) |
| Tipos de decisão | choice (2–20 opções), score (2–20 níveis ordenados), noul (sim/não) |
| Contexto | Avaliado com 1.024 tokens (contexto + pergunta + opções); o runtime agora usa 8.192 por padrão, só com smoke test nesse tamanho |
| Runtime | Python 3.11+, PyTorch em CPU (CUDA opcional); instalação a partir do snapshot do HF, sem pacote no PyPI |
| Outras builds | Julia-1-ONNX com adaptador WebGPU (criado em 25 set 2026) |
Como funciona
Cada pergunta vira uma linha state + pergunta + opções. O encoder lê a linha e uma cabeça de decisão de duas camadas pontua cada opção; um softmax transforma os scores em probabilidades. As perguntas de um mesmo request são pontuadas de forma independente, em lote, então uma não enxerga a outra.
A API tipada fica em julia/typed.py:
choicerecebe um mapa de IDs do chamador para descrições e devolve o ID vencedorscorerecebe uma rubrica ordenada e devolve o nível esperado (índice a partir de zero)noulnão recebe critérios e devolve P(true)
Para conjuntos com mais de 20 rótulos, o repo traz um Router hierárquico que afunila as candidatas em grupos e reordena as sobreviventes. O card avisa sem rodeio que esse afunilamento pode descartar a resposta certa e que as probabilidades finais cobrem só o último grupo, não o conjunto inteiro.
Benchmarks do autor
Tudo nesta seção vem do card, do arquivo de métricas e da página de lançamento da Supersonic Labs. São reportados pelo autor → UnverifiedClaim, não medições do ModelSystem.One.
Rodada de 24/09/2026, H200, BF16, encoding estrito, limite de 1.024 tokens. Protocolo fixado em AbdelStark/jev-benchmarks @ 0d610cc; casos tipados do LocalLLaMA/typed-decisions.
| Benchmark | Acertos / total | Julia-1 | Referência Jev (fornecida) |
|---|---|---|---|
| Decisões tipadas | 1.463 / 2.000 | 73,15% | 72,70% |
| AG News (4 rótulos, piloto) | 94 / 100 | 94% | 91% |
| DAIR Emotion (6 rótulos, piloto) | 86 / 100 | 86% | 48% |
| Banking77 (shortlist de 72 rótulos, piloto) | 64 / 100 | 64% | 87% |
Por tipo: Choice 428/600, Noul 484/600, Score 551/800. Uma nova rodada em CPU, em 25/09, deu 72,55% nas decisões tipadas e 60/100 no Banking77, com 3 abstenções contadas como erro. No MASSIVE (18 rótulos de cenário, não intenções), o autor reporta 71,50% de acurácia macro em 52 locales, 86,25% em pt-PT e 86,75% em en-US. Português do Brasil ainda não foi avaliado.
Como ler esses números:
- A coluna do Jev não é uma rodada nova do Jev. O protocolo fornece esses valores. O DecisionEval, independente, mediu o Jev 1.13.0 em 0,740 (IC 95% 0,721–0,759) no mesmo split de teste do typed-decisions, em 20/09/2026. Os 73,15% da Julia caem dentro desse intervalo, então “acima do Jev” nas decisões tipadas é, na prática, empate.
- Os pilotos são pequenos e talvez não sejam zero-shot. São 100 exemplos cada. O arquivo de proveniência lista AG News, Banking77, DAIR Emotion e MASSIVE entre as fontes de validação do checkpoint publicado, o que sugere que essas famílias de tarefa estavam no treino. As referências do Jev são zero-shot. O card não diz se as linhas dos pilotos foram excluídas.
- Banking77 é o ponto fraco conhecido. Passa pelo Router com shortlist, não por uma chamada nativa de 72 opções, e o próprio laboratório aponta isso como a principal falha.
- Os rótulos-ouro do typed-decisions vêm de um modelo professor, então acurácia ali é concordância com esse professor, não verdade absoluta.
Latência (medida pelo autor)
| Dispositivo e teste | Mediana | p95 |
|---|---|---|
| Apple M4, uma decisão por chamada (contexto de 100 palavras, 4 opções) | 33,15 ms | 44,23 ms |
| Apple M4, lote de 16 | 312,11 ms por lote | 313,44 ms |
| Intel Core i5-1235U, decisões tipadas | 294,81 ms | 428,49 ms |
| Intel Core i5-1235U, Banking77 (com afunilamento do Router) | 3.713,54 ms | 5.125,10 ms |
| Tablet Samsung SM-X510, ONNX Runtime em CPU | 203 ms | 205 ms |
A faixa de latência do catálogo (33–295 ms) vai da mediana do M4 com uma chamada por vez até a mediana do i5 em decisões tipadas. O caminho com Router é uma ordem de grandeza mais lento. Tudo isso é UnverifiedClaim.
Limitações
- Possível viés de concordância. Em um teste informal no X, um usuário rodou tanto o Jev quanto a Julia nos questionários Political Compass, 16Personalities e Big Five, em português. A Julia concordou com todas as 62 proposições do Political Compass e nunca discordou de nenhum item do 16Personalities, resultando em “autoritário de direita” e ENFJ-T respectivamente. O autor concluiu que “o Julia simplesmente concorda com qualquer coisa aparentemente”. É um ponto de dado (n=1, sem código compartilhado), mas sinaliza uma tendência sistemática potencial de escolher a opção afirmativa. Replicação independente seria valiosa.
- Benchmarks rodados pelo próprio autor, e a comparação com o Jev usa referências fornecidas. Veja as notas acima antes de repetir “bate o Jev”.
- Sem etapa de calibração. O
inference-policy.jsonvem com"calibration": null, e o card diz que as probabilidades “não são certeza garantida”. Não há ECE nem diagrama de confiabilidade publicado. Meça a calibração nos seus dados rotulados antes de usar threshold. - 2 a 20 opções por chamada nativa. Conjuntos maiores passam pelo Router, que pode perder a resposta certa.
- Contexto avaliado só em 1.024 tokens. A página de lançamento descreve uma configuração de 1.024 tokens; o card, atualizado em 26/09, diz que o runtime agora usa 8.192 por padrão, com apenas um smoke test em CPU nesse tamanho (cerca de 24 s para uma linha de 8.192 tokens). Acurácia em 8k não está estabelecida.
- Conhecimento e raciocínio em várias etapas estão fora do escopo, segundo o próprio laboratório. O arquivo de proveniência do checkpoint publicado mostra 26% numa amostra de MMLU e 28,5% no ARC-Challenge.
- Runtime próprio. O pacote Python em
julia/é obrigatório; não é um pipeline dotransformerse não tem servidor/v1/systemone. - A API hospedada é um plano. O preço de US$0,025/M de entrada foi anunciado, mas não está no ar.
- Dia zero. 0 downloads e 13 likes no HF na checagem de 26/09/2026.
Quando usar / quando não usar
Usar quando precisar: roteamento ou classificação baratos sobre uma lista curta e explícita de opções, inferência em CPU ou no edge, entradas multilíngues, um modelo pequeno para embarcar num app.
Não usar quando precisar: listas longas de rótulos, confiança calibrada de fábrica, documentos longos, perguntas que exigem conhecimento ou várias etapas, um substituto direto para código escrito contra a API da TypeSafe, ou SLA hospedado.
Por que está no catálogo
Pesos de decisão treinados (fine-tune mais uma cabeça de decisão dedicada), interface tipada aberta de choice / score / noul e avaliações públicas e documentadas. Abre o espaço sub-200M em CPU ao lado do Lumma-fev e do Tiny-Jev, e se junta ao Eikos entre as entradas feitas no Brasil. O tamanho de 144M e a proveniência publicada fazem dele um modelo fácil de checar de forma independente.
O laboratório tem um manifesto publicado que explica suas prioridades: inferência local em vez de depender da nuvem, sistemas pequenos que podem ser medidos contra resultados claros, e construir infraestrutura útil em vez de correr atrás de hype. O tagline é “Less distance. More possibility.” Esse enquadramento é consistente com o foco da documentação técnica em restrições, modos de falha honestos e reprodutibilidade.
Links
- llama.cpp:
llama serve -hf ggml-org/Julia-1-GGUFe depoisPOST /v1/systemone(blog da ggml-org, 02/10/2026) - Julia-1 no Hugging Face
- Julia-1-ONNX no Hugging Face
- Página de lançamento (Supersonic Labs)
- Site da Supersonic Labs
- Manifesto do laboratório
- Anúncio no X
- Protocolo de benchmark (fixado)
- News: lançamento da Julia-1
- Contribuir / discutir
