Ollama

Última atualização:

RuntimeMIT~182,000 ★

⚠️ Por que não é um modelo

Servidor de inferência. Desde a v0.35 serve modelos de decisão treinados por outros (Nimble, Tev1) num endpoint local /v1/systemone; não tem pesos de decisão próprios.

Especificações técnicas

LLMs base
Bespoke-Nimble-9B, Tev1-4B-experimental, Tev1-0.8B-experimental
Tipos de decisão
choice, noul, score
Features
local, systemone-endpoint, typesafe-sdk-compatible, gguf, multi-question, keep-alive, no-api-key
Licença
MIT

O Ollama, o runner local de LLMs mais popular, agora serve modelos de decisão. O post no blog (datado de 29/09/2026) e o anúncio do @ollama (30/09/2026, 01:25 BRT) apresentam um endpoint local /v1/systemone “based on TypeSafe’s Jev API”, disponível a partir do Ollama 0.35.

ollama pull nimble
curl http://localhost:11434/v1/systemone -d '{"model": "nimble", "state": "...", "questions": {...}}'

O que faz

  • Endpoint: POST /v1/systemone na porta de sempre, 11434. Você manda o state (texto, ou JSON serializado como texto) e de 1 a 64 questions com nome; recebe uma resposta por pergunta e o uso de tokens.
  • Tipos de pergunta: choice (2–26 opções; devolve a opção mais provável, a probabilidade de cada uma e um confidence), noul (probabilidade de verdadeiro) e score (2–26 níveis ordenados; devolve o nível ponderado por probabilidade, a legenda e as probabilidades).
  • O SDK da TypeSafe funciona sem mudança: TYPESAFE_BASE_URL=http://localhost:11434, TYPESAFE_API_KEY=ollama (qualquer valor) e TYPESAFE_DEFAULT_MODEL=nimble. Requisição local não precisa de chave.
  • Pontua, não gera: cada pergunta é avaliada separadamente contra o state inteiro; a resposta de uma não entra na seguinte. As probabilidades são normalizadas sobre os candidatos enviados.

Modelos no lançamento

Modelo Pull Autor Notas
Nimble 9B ollama pull nimble Bespoke Labs Fine-tune do Qwen3.5-9B; 9,5 GB; Apache-2.0
Tev1 4B ollama pull tev1 / tev1:4b Together AI Fine-tune do Qwen3.5-4B; 4,5 GB Q8_0 (4,21B params)
Tev1 0.8B ollama pull tev1:0.8b Together AI Fine-tune do Qwen3.5-0.8B; 812 MB Q8_0 (752M params)

O Ollama diz que vêm mais modelos de decisão, “including models served by Ollama’s cloud”. Por enquanto o endpoint recusa modelos de nuvem.

Limites (da referência da API)

  • Só local. Sem streaming, imagens, tools ou controles de geração.
  • Corpo da requisição até 64 KiB. Cada prompt renderizado precisa caber no contexto carregado; o input nunca é truncado.
  • Exige pesos GGUF compatíveis e um runner que faça scoring. Modelos MLX / Safetensors ainda não funcionam (aceleração MLX no Apple Silicon está no roadmap).
  • O confidence é 1 − H(p)/ln(N), uma medida de quão concentrada está a distribuição. A documentação do Ollama diz com todas as letras que isso não é probabilidade calibrada de acerto.
  • usage.output_tokens conta tokens gerados internamente para o scoring, então nem sempre é zero.

Números do vendor (UnverifiedClaim)

  • Latência: o Nimble 9B “averaged 91ms per decision” numa demo de Pac-Man num MacBook Pro M5 Max (blog); “under 100ms” na mesma máquina (página da library). Sem p50/p99 e sem outros hardwares.
  • Acurácia: média nos 13 datasets públicos com rótulo humano da Bespoke Labs (3.880 decisões): Jev 1.13 76,0%, Nimble 9B 75,7%, Tev1 4B 73,3%, Tev1 0.8B 63,5%. O Ollama rodou Nimble e Tev1; o número do Jev vem da rodada publicada pela Bespoke Labs nas mesmas decisões (suite).

Por que não é um modelo

O Ollama não treina pesos de decisão. É infraestrutura de inferência e distribuição: a qualidade das decisões vem inteira dos modelos que ele serve. Fica na mesma classe do Ollaya e do vllm-jev, e fora do quadrante.

Sobre o Tev1. O model card da Together diz que o Tev1 foi treinado para devolver a letra de uma opção e que seus logprobs são preferências, não confiança calibrada. No Ollama, os formatos noul e score do Tev1 vêm do scoring de candidatos do próprio Ollama, não de treino específico. No catálogo o Tev1 continua só com choice.

Não é o Ollaya

O Ollaya é um projeto independente (“Ollama para modelos de decisão”, porta 11435) que declara não ter ligação com o Ollama. Esta ficha é o suporte nativo do próprio Ollama. Os dois falam o formato /v1/systemone da TypeSafe, mas têm registries e listas de modelos diferentes.