Julia-1

Última atualização:

Aberto33–295ms$0/M input

Notas do quadrante

Ver o quadrante completo

Pontuação pela rubrica pública do quadrante (maturidade × capability; bolha = adoção). Revisamos conforme a evidência.

  • Maturidade4.8/10

    Pesos Apache-2.0, card detalhado com arquivos de proveniência e métricas, e API tipada em Python. Desde 02/10 roda no servidor /v1/systemone do llama.cpp (GGUF oficial da ggml-org), então clientes do Jev apontam para ele. Sem pacote no PyPI; API hospedada anunciada mas não no ar. Sem SLA.

  • Capability6.5/10

    choice / score / noul de primeira classe com 144M parâmetros em CPU. Avaliações do autor bem documentadas, mas rodadas por ele; os números do Jev são referências fornecidas, não uma rodada nova. Sem etapa de calibração (calibration: null). Fraco em listas longas.

  • Adoção14/100

    Post de lançamento em 26/09 (161 likes, ~2,7 mil views poucas horas depois), 13 likes e 0 downloads no HF na checagem. Nenhuma integração ou uso em produção reportado ainda.

Vendor claims

Julia-1 é um modelo de decisão pequeno e aberto da Supersonic Labs, um laboratório brasileiro. Você passa um state, uma pergunta e de 2 a 20 respostas candidatas; ele pontua as candidatas e devolve uma escolha mais a probabilidade de cada opção. Não gera texto e não precisa de GPU.

É um fine-tune do mmBERT-small, da JHU CLSP, um encoder ModernBERT multilíngue, com uma cabeça de decisão por cima. O laboratório diz isso com todas as letras na página de lançamento, inclusive a frase “Julia 1 is not a fine-tuned Qwen model”. Não é TypeSafe e não fala o contrato /v1/systemone.

Pesos: Hugging Face SupersonicLabs/Julia-1 (Apache-2.0). Página de lançamento: supersoniclabs.ia.br/julia-1. Anúncio: @supersonicai (26 set 2026, 16h BRT).

Especificações

Atributo Valor
Autor Supersonic Labs (Brasil)
Modelo base jhu-clsp/mmBERT-small (encoder ModernBERT multilíngue)
Parâmetros 144,3M (API do HF: 144.292.870, FP32)
Pesos model.safetensors de 550,5 MiB, FP32
Licença Apache-2.0 (pesos e código de inferência; pipeline de treino não publicado)
Repo no HF criado em
Lançamento público
Status Pesos abertos (Hugging Face)
Tipos de decisão choice (2–20 opções), score (2–20 níveis ordenados), noul (sim/não)
Contexto Avaliado com 1.024 tokens (contexto + pergunta + opções); o runtime agora usa 8.192 por padrão, só com smoke test nesse tamanho
Runtime Python 3.11+, PyTorch em CPU (CUDA opcional); instalação a partir do snapshot do HF, sem pacote no PyPI
Outras builds Julia-1-ONNX com adaptador WebGPU (criado em 25 set 2026)

Como funciona

Cada pergunta vira uma linha state + pergunta + opções. O encoder lê a linha e uma cabeça de decisão de duas camadas pontua cada opção; um softmax transforma os scores em probabilidades. As perguntas de um mesmo request são pontuadas de forma independente, em lote, então uma não enxerga a outra.

A API tipada fica em julia/typed.py:

  • choice recebe um mapa de IDs do chamador para descrições e devolve o ID vencedor
  • score recebe uma rubrica ordenada e devolve o nível esperado (índice a partir de zero)
  • noul não recebe critérios e devolve P(true)

Para conjuntos com mais de 20 rótulos, o repo traz um Router hierárquico que afunila as candidatas em grupos e reordena as sobreviventes. O card avisa sem rodeio que esse afunilamento pode descartar a resposta certa e que as probabilidades finais cobrem só o último grupo, não o conjunto inteiro.

Benchmarks do autor

Tudo nesta seção vem do card, do arquivo de métricas e da página de lançamento da Supersonic Labs. São reportados pelo autor → UnverifiedClaim, não medições do ModelSystem.One.

Rodada de 24/09/2026, H200, BF16, encoding estrito, limite de 1.024 tokens. Protocolo fixado em AbdelStark/jev-benchmarks @ 0d610cc; casos tipados do LocalLLaMA/typed-decisions.

Benchmark Acertos / total Julia-1 Referência Jev (fornecida)
Decisões tipadas 1.463 / 2.000 73,15% 72,70%
AG News (4 rótulos, piloto) 94 / 100 94% 91%
DAIR Emotion (6 rótulos, piloto) 86 / 100 86% 48%
Banking77 (shortlist de 72 rótulos, piloto) 64 / 100 64% 87%

Por tipo: Choice 428/600, Noul 484/600, Score 551/800. Uma nova rodada em CPU, em 25/09, deu 72,55% nas decisões tipadas e 60/100 no Banking77, com 3 abstenções contadas como erro. No MASSIVE (18 rótulos de cenário, não intenções), o autor reporta 71,50% de acurácia macro em 52 locales, 86,25% em pt-PT e 86,75% em en-US. Português do Brasil ainda não foi avaliado.

Como ler esses números:

  • A coluna do Jev não é uma rodada nova do Jev. O protocolo fornece esses valores. O DecisionEval, independente, mediu o Jev 1.13.0 em 0,740 (IC 95% 0,721–0,759) no mesmo split de teste do typed-decisions, em 20/09/2026. Os 73,15% da Julia caem dentro desse intervalo, então “acima do Jev” nas decisões tipadas é, na prática, empate.
  • Os pilotos são pequenos e talvez não sejam zero-shot. São 100 exemplos cada. O arquivo de proveniência lista AG News, Banking77, DAIR Emotion e MASSIVE entre as fontes de validação do checkpoint publicado, o que sugere que essas famílias de tarefa estavam no treino. As referências do Jev são zero-shot. O card não diz se as linhas dos pilotos foram excluídas.
  • Banking77 é o ponto fraco conhecido. Passa pelo Router com shortlist, não por uma chamada nativa de 72 opções, e o próprio laboratório aponta isso como a principal falha.
  • Os rótulos-ouro do typed-decisions vêm de um modelo professor, então acurácia ali é concordância com esse professor, não verdade absoluta.

Latência (medida pelo autor)

Dispositivo e teste Mediana p95
Apple M4, uma decisão por chamada (contexto de 100 palavras, 4 opções) 33,15 ms 44,23 ms
Apple M4, lote de 16 312,11 ms por lote 313,44 ms
Intel Core i5-1235U, decisões tipadas 294,81 ms 428,49 ms
Intel Core i5-1235U, Banking77 (com afunilamento do Router) 3.713,54 ms 5.125,10 ms
Tablet Samsung SM-X510, ONNX Runtime em CPU 203 ms 205 ms

A faixa de latência do catálogo (33–295 ms) vai da mediana do M4 com uma chamada por vez até a mediana do i5 em decisões tipadas. O caminho com Router é uma ordem de grandeza mais lento. Tudo isso é UnverifiedClaim.

Limitações

  • Possível viés de concordância. Em um teste informal no X, um usuário rodou tanto o Jev quanto a Julia nos questionários Political Compass, 16Personalities e Big Five, em português. A Julia concordou com todas as 62 proposições do Political Compass e nunca discordou de nenhum item do 16Personalities, resultando em “autoritário de direita” e ENFJ-T respectivamente. O autor concluiu que “o Julia simplesmente concorda com qualquer coisa aparentemente”. É um ponto de dado (n=1, sem código compartilhado), mas sinaliza uma tendência sistemática potencial de escolher a opção afirmativa. Replicação independente seria valiosa.
  • Benchmarks rodados pelo próprio autor, e a comparação com o Jev usa referências fornecidas. Veja as notas acima antes de repetir “bate o Jev”.
  • Sem etapa de calibração. O inference-policy.json vem com "calibration": null, e o card diz que as probabilidades “não são certeza garantida”. Não há ECE nem diagrama de confiabilidade publicado. Meça a calibração nos seus dados rotulados antes de usar threshold.
  • 2 a 20 opções por chamada nativa. Conjuntos maiores passam pelo Router, que pode perder a resposta certa.
  • Contexto avaliado só em 1.024 tokens. A página de lançamento descreve uma configuração de 1.024 tokens; o card, atualizado em 26/09, diz que o runtime agora usa 8.192 por padrão, com apenas um smoke test em CPU nesse tamanho (cerca de 24 s para uma linha de 8.192 tokens). Acurácia em 8k não está estabelecida.
  • Conhecimento e raciocínio em várias etapas estão fora do escopo, segundo o próprio laboratório. O arquivo de proveniência do checkpoint publicado mostra 26% numa amostra de MMLU e 28,5% no ARC-Challenge.
  • Runtime próprio. O pacote Python em julia/ é obrigatório; não é um pipeline do transformers e não tem servidor /v1/systemone.
  • A API hospedada é um plano. O preço de US$0,025/M de entrada foi anunciado, mas não está no ar.
  • Dia zero. 0 downloads e 13 likes no HF na checagem de 26/09/2026.

Quando usar / quando não usar

Usar quando precisar: roteamento ou classificação baratos sobre uma lista curta e explícita de opções, inferência em CPU ou no edge, entradas multilíngues, um modelo pequeno para embarcar num app.

Não usar quando precisar: listas longas de rótulos, confiança calibrada de fábrica, documentos longos, perguntas que exigem conhecimento ou várias etapas, um substituto direto para código escrito contra a API da TypeSafe, ou SLA hospedado.

Pesos de decisão treinados (fine-tune mais uma cabeça de decisão dedicada), interface tipada aberta de choice / score / noul e avaliações públicas e documentadas. Abre o espaço sub-200M em CPU ao lado do Lumma-fev e do Tiny-Jev, e se junta ao Eikos entre as entradas feitas no Brasil. O tamanho de 144M e a proveniência publicada fazem dele um modelo fácil de checar de forma independente.

O laboratório tem um manifesto publicado que explica suas prioridades: inferência local em vez de depender da nuvem, sistemas pequenos que podem ser medidos contra resultados claros, e construir infraestrutura útil em vez de correr atrás de hype. O tagline é “Less distance. More possibility.” Esse enquadramento é consistente com o foco da documentação técnica em restrições, modos de falha honestos e reprodutibilidade.