Ollama
⚠️ Por que não é um modelo
Servidor de inferência. Desde a v0.35 serve modelos de decisão treinados por outros (Nimble, Tev1) num endpoint local /v1/systemone; não tem pesos de decisão próprios.
Especificações técnicas
- LLMs base
- Bespoke-Nimble-9B, Tev1-4B-experimental, Tev1-0.8B-experimental
- Tipos de decisão
- choice, noul, score
- Features
- local, systemone-endpoint, typesafe-sdk-compatible, gguf, multi-question, keep-alive, no-api-key
- Licença
- MIT
Links
O Ollama, o runner local de LLMs mais popular, agora serve modelos de decisão. O post no blog (datado de 29/09/2026) e o anúncio do @ollama (30/09/2026, 01:25 BRT) apresentam um endpoint local /v1/systemone “based on TypeSafe’s Jev API”, disponível a partir do Ollama 0.35.
ollama pull nimble
curl http://localhost:11434/v1/systemone -d '{"model": "nimble", "state": "...", "questions": {...}}'
O que faz
- Endpoint:
POST /v1/systemonena porta de sempre,11434. Você manda ostate(texto, ou JSON serializado como texto) e de 1 a 64questionscom nome; recebe uma resposta por pergunta e o uso de tokens. - Tipos de pergunta:
choice(2–26 opções; devolve a opção mais provável, a probabilidade de cada uma e umconfidence),noul(probabilidade de verdadeiro) escore(2–26 níveis ordenados; devolve o nível ponderado por probabilidade, a legenda e as probabilidades). - O SDK da TypeSafe funciona sem mudança:
TYPESAFE_BASE_URL=http://localhost:11434,TYPESAFE_API_KEY=ollama(qualquer valor) eTYPESAFE_DEFAULT_MODEL=nimble. Requisição local não precisa de chave. - Pontua, não gera: cada pergunta é avaliada separadamente contra o state inteiro; a resposta de uma não entra na seguinte. As probabilidades são normalizadas sobre os candidatos enviados.
Modelos no lançamento
| Modelo | Pull | Autor | Notas |
|---|---|---|---|
| Nimble 9B | ollama pull nimble |
Bespoke Labs | Fine-tune do Qwen3.5-9B; 9,5 GB; Apache-2.0 |
| Tev1 4B | ollama pull tev1 / tev1:4b |
Together AI | Fine-tune do Qwen3.5-4B; 4,5 GB Q8_0 (4,21B params) |
| Tev1 0.8B | ollama pull tev1:0.8b |
Together AI | Fine-tune do Qwen3.5-0.8B; 812 MB Q8_0 (752M params) |
O Ollama diz que vêm mais modelos de decisão, “including models served by Ollama’s cloud”. Por enquanto o endpoint recusa modelos de nuvem.
Limites (da referência da API)
- Só local. Sem streaming, imagens, tools ou controles de geração.
- Corpo da requisição até 64 KiB. Cada prompt renderizado precisa caber no contexto carregado; o input nunca é truncado.
- Exige pesos GGUF compatíveis e um runner que faça scoring. Modelos MLX / Safetensors ainda não funcionam (aceleração MLX no Apple Silicon está no roadmap).
- O
confidenceé1 − H(p)/ln(N), uma medida de quão concentrada está a distribuição. A documentação do Ollama diz com todas as letras que isso não é probabilidade calibrada de acerto. usage.output_tokensconta tokens gerados internamente para o scoring, então nem sempre é zero.
Números do vendor (UnverifiedClaim)
- Latência: o Nimble 9B “averaged 91ms per decision” numa demo de Pac-Man num MacBook Pro M5 Max (blog); “under 100ms” na mesma máquina (página da library). Sem p50/p99 e sem outros hardwares.
- Acurácia: média nos 13 datasets públicos com rótulo humano da Bespoke Labs (3.880 decisões): Jev 1.13 76,0%, Nimble 9B 75,7%, Tev1 4B 73,3%, Tev1 0.8B 63,5%. O Ollama rodou Nimble e Tev1; o número do Jev vem da rodada publicada pela Bespoke Labs nas mesmas decisões (suite).
Por que não é um modelo
O Ollama não treina pesos de decisão. É infraestrutura de inferência e distribuição: a qualidade das decisões vem inteira dos modelos que ele serve. Fica na mesma classe do Ollaya e do vllm-jev, e fora do quadrante.
Sobre o Tev1. O model card da Together diz que o Tev1 foi treinado para devolver a letra de uma opção e que seus logprobs são preferências, não confiança calibrada. No Ollama, os formatos noul e score do Tev1 vêm do scoring de candidatos do próprio Ollama, não de treino específico. No catálogo o Tev1 continua só com choice.
Não é o Ollaya
O Ollaya é um projeto independente (“Ollama para modelos de decisão”, porta 11435) que declara não ter ligação com o Ollama. Esta ficha é o suporte nativo do próprio Ollama. Os dois falam o formato /v1/systemone da TypeSafe, mas têm registries e listas de modelos diferentes.
