Ollama ganha endpoint /v1/systemone local e três modelos de decisão no estilo Jev
O Ollama agora roda modelos de decisão na sua máquina. Num post no blog datado de 29 de setembro e num anúncio no X às 01:25 BRT de 30 de setembro, o time lançou um endpoint local /v1/systemone “based on TypeSafe’s Jev API”, disponível a partir do Ollama 0.35. A proposta: sem custo extra e com latência menor rodando local, para tarefas como triagem de tickets, roteamento de modelos e moderação de conteúdo.
ollama pull nimble
Três modelos no lançamento. O Nimble 9B, da Bespoke Labs (nimble), e o Tev1 da Together AI em 4B (tev1) e 0.8B (tev1:0.8b). O Ollama diz que vêm mais modelos de decisão, inclusive servidos pela nuvem do Ollama. Em cerca de 14 horas, as páginas do Nimble e do Tev1 na library já mostravam uns 2,7 mil pulls cada.
Mesmo contrato do Jev. A requisição leva o state e até 64 perguntas com nome, do tipo choice, noul ou score; a resposta traz a escolha, a probabilidade de cada opção e um confidence. O SDK oficial da TypeSafe em Python funciona sem mudança apontado para http://localhost:11434. A referência da API é franca sobre os limites: 64 KiB por requisição, sem streaming, imagens ou tools, só modelos GGUF, e o confidence mede quão concentrada está a distribuição, “not calibrated correctness”.
Números do vendor (UnverifiedClaim). O Nimble “averaged 91ms per decision” jogando uma demo de Pac-Man num MacBook Pro M5 Max. Nos 13 datasets públicos com rótulo humano da Bespoke Labs (3.880 decisões), o Ollama reporta acurácia média de 75,7% para o Nimble, 73,3% para o Tev1 4B e 63,5% para o Tev1 0.8B, contra 76,0% do Jev 1.13. O Ollama rodou Nimble e Tev1; o número do Jev vem da rodada publicada pela Bespoke Labs.
Por que importa. Até agora, rodar modelos de decisão abertos atrás da API System One exigia uma ferramenta à parte, como o Ollaya, projeto independente sem ligação com o Ollama. Com a base instalada do Ollama, o /v1/systemone vira interface local padrão, e modelos abertos como o Nimble ganham uma distribuição que só GitHub e Hugging Face não davam. Também consolida o formato de requisição da TypeSafe como padrão de fato: Ollama, Ollaya e agora o d1 hospedado da Liquid AI aceitam esse formato.
Como listamos. O Ollama não treina pesos de decisão, então entra em runtimes, fora do quadrante. As fichas do Nimble e do Tev1 agora citam a disponibilidade no Ollama. Maturidade e adoção do Nimble subiram um pouco; a adoção do Tev1 também. O Tev1 continua só com choice no catálogo: os formatos noul e score que o Ollama expõe para ele vêm do scoring de candidatos do Ollama, não do treino do Tev1.
