Ollaya

Última atualização:

RuntimeApache-2.0~935 ★

⚠️ Por que não é um modelo

Serve modelos de decisão abertos localmente (Laya, Decider, NLI, GLiClass, Kev, Von); não treina pesos próprios — é infra de distribuição e inferência.

Especificações técnicas

LLMs base
Tipos de decisão
choice, score, boolean
Features
local, ollama-style, typesafe-api, desktop-app, cli, docker, nvidia-gpu, apple-silicon, mlx, systemd, vision, images
Licença
Apache-2.0

Ollaya é o Ollama para modelos de decisão — um runtime local que baixa, cacheia e serve modelos de decisão abertos atrás de uma API compatível com o /v1/systemone da TypeSafe.

O que faz

Um binário, um comando: ollaya run laya. O runtime:

  1. Baixa pesos de modelo de um registry (como ollama pull)
  2. Serve em localhost:11435 com os shapes de request/response da TypeSafe
  3. Funciona com o SDK Python oficial da TypeSafe sem mudanças — basta apontar TYPESAFE_BASE_URL para o servidor local

Apps desktop para macOS, Windows e Linux, mais CLI e imagem Docker. GPUs NVIDIA (CUDA 13, driver R580+), Apple Silicon (MLX para Laya e NLI) ou fallback para CPU.

Por que não é um modelo

Ollaya não treina nenhum peso. É infraestrutura que distribui e roda modelos que outros treinaram. A capacidade de decisão vem inteiramente dos modelos que ele serve (Laya, Decider, Kev, etc.), não do Ollaya em si.

Modelos disponíveis

Modelo Autor Tamanhos Notas
laya Convai Innovations 322m, 421m Mais rápido; MLX no Apple Silicon
decider Mapika 0.75b, 1.9b, 4.2b Mais preciso nos testes do Ollaya
nli Moritz Laurer 396m, 435m Classificadores zero-shot por entailment
gliclass Knowledgator 439m Zero-shot com instrução
qwen3guard Qwen team 0.6b Guard de segurança, 119 idiomas
decision vLLM Semantic Router 0.75b Qwen3.5 fine-tuned + endpoint head
kev Jared Palmer 0.76b, 4.2b, 7.9b LoRA + pointer head
von Victor Hugo Panisa 395m ModernBERT-large, contexto de 8k

Latência (reportada pelo autor)

Todos os números são UnverifiedClaim — medidos pelo Ollaya em uma RTX 4090 via HTTP API.

Modelo Latência mediana
laya:multilingual 8.1 ms
laya:en 9.6 ms
gliclass 14.7 ms
nli 20.4 ms
decider:0.8b 155 ms
decider:2b 190 ms

Para comparação, o Ollaya cita benchmarks de terceiros para a API hospedada do Jev em 236–276 ms. Setups diferentes (GPU local vs round-trip de rede), então trate como contexto de ordem de grandeza.

Compatibilidade TypeSafe

O SDK funciona sem mudanças:

export TYPESAFE_BASE_URL=http://localhost:11435
export TYPESAFE_API_KEY=local        # qualquer valor serve
export TYPESAFE_DEFAULT_MODEL=laya

Ou chame o endpoint diretamente — mesmos shapes JSON da API hospedada da TypeSafe.

Plataformas

Plataforma App desktop CLI GPU
macOS (Apple Silicon, 14+) ✓ .dmg ✓ Apple GPU (MLX)
Windows 10/11 x64 ✓ .exe/.msi ✓ PowerShell NVIDIA CUDA 13
Linux x86-64 ✓ AppImage/.deb/.rpm ✓ systemd NVIDIA CUDA 13
Linux ARM64 — ✓ Só CPU
WSL 2 — ✓ NVIDIA CUDA 13
Docker (amd64/arm64) — ✓ GHCR NVIDIA :cuda image

Ressalvas

  • Não é afiliado ao Ollama nem à TypeSafe — projeto open-source independente. Desde 30/09/2026 o próprio Ollama tem suporte nativo a modelos de decisão na porta 11434 (ver Ollama); é outro produto, com lista de modelos própria
  • Comparações de latência misturam GPU local com API hospedada; leia como ordem de grandeza
  • Qualidade do modelo depende do modelo subjacente, não do Ollaya
  • Mantenedores anônimos (org ollaya-dev)

Visão (v0.7.5)

A partir da v0.7.5 o Ollaya serve decider:2b-vision (Mapika) e aceita o campo images (PNG em base64) na API/CLI. Latências de visão no release = UnverifiedClaim. Ver news /pt-br/news/ollaya-vision.