Ollaya
⚠️ Por que não é um modelo
Serve modelos de decisão abertos localmente (Laya, Decider, NLI, GLiClass, Kev, Von); não treina pesos próprios — é infra de distribuição e inferência.
Especificações técnicas
- LLMs base
- Tipos de decisão
- choice, score, boolean
- Features
- local, ollama-style, typesafe-api, desktop-app, cli, docker, nvidia-gpu, apple-silicon, mlx, systemd, vision, images
- Licença
- Apache-2.0
Links
Ollaya é o Ollama para modelos de decisão — um runtime local que baixa, cacheia e serve modelos de decisão abertos atrás de uma API compatível com o /v1/systemone da TypeSafe.
O que faz
Um binário, um comando: ollaya run laya. O runtime:
- Baixa pesos de modelo de um registry (como
ollama pull) - Serve em
localhost:11435com os shapes de request/response da TypeSafe - Funciona com o SDK Python oficial da TypeSafe sem mudanças — basta apontar
TYPESAFE_BASE_URLpara o servidor local
Apps desktop para macOS, Windows e Linux, mais CLI e imagem Docker. GPUs NVIDIA (CUDA 13, driver R580+), Apple Silicon (MLX para Laya e NLI) ou fallback para CPU.
Por que não é um modelo
Ollaya não treina nenhum peso. É infraestrutura que distribui e roda modelos que outros treinaram. A capacidade de decisão vem inteiramente dos modelos que ele serve (Laya, Decider, Kev, etc.), não do Ollaya em si.
Modelos disponíveis
| Modelo | Autor | Tamanhos | Notas |
|---|---|---|---|
| laya | Convai Innovations | 322m, 421m | Mais rápido; MLX no Apple Silicon |
| decider | Mapika | 0.75b, 1.9b, 4.2b | Mais preciso nos testes do Ollaya |
| nli | Moritz Laurer | 396m, 435m | Classificadores zero-shot por entailment |
| gliclass | Knowledgator | 439m | Zero-shot com instrução |
| qwen3guard | Qwen team | 0.6b | Guard de segurança, 119 idiomas |
| decision | vLLM Semantic Router | 0.75b | Qwen3.5 fine-tuned + endpoint head |
| kev | Jared Palmer | 0.76b, 4.2b, 7.9b | LoRA + pointer head |
| von | Victor Hugo Panisa | 395m | ModernBERT-large, contexto de 8k |
Latência (reportada pelo autor)
Todos os números são UnverifiedClaim — medidos pelo Ollaya em uma RTX 4090 via HTTP API.
| Modelo | Latência mediana |
|---|---|
| laya:multilingual | 8.1 ms |
| laya:en | 9.6 ms |
| gliclass | 14.7 ms |
| nli | 20.4 ms |
| decider:0.8b | 155 ms |
| decider:2b | 190 ms |
Para comparação, o Ollaya cita benchmarks de terceiros para a API hospedada do Jev em 236–276 ms. Setups diferentes (GPU local vs round-trip de rede), então trate como contexto de ordem de grandeza.
Compatibilidade TypeSafe
O SDK funciona sem mudanças:
export TYPESAFE_BASE_URL=http://localhost:11435
export TYPESAFE_API_KEY=local # qualquer valor serve
export TYPESAFE_DEFAULT_MODEL=laya
Ou chame o endpoint diretamente — mesmos shapes JSON da API hospedada da TypeSafe.
Plataformas
| Plataforma | App desktop | CLI | GPU |
|---|---|---|---|
| macOS (Apple Silicon, 14+) | ✓ .dmg | ✓ | Apple GPU (MLX) |
| Windows 10/11 x64 | ✓ .exe/.msi | ✓ PowerShell | NVIDIA CUDA 13 |
| Linux x86-64 | ✓ AppImage/.deb/.rpm | ✓ systemd | NVIDIA CUDA 13 |
| Linux ARM64 | — | ✓ | Só CPU |
| WSL 2 | — | ✓ | NVIDIA CUDA 13 |
| Docker (amd64/arm64) | — | ✓ GHCR | NVIDIA :cuda image |
Ressalvas
- Não é afiliado ao Ollama nem à TypeSafe — projeto open-source independente. Desde 30/09/2026 o próprio Ollama tem suporte nativo a modelos de decisão na porta 11434 (ver Ollama); é outro produto, com lista de modelos própria
- Comparações de latência misturam GPU local com API hospedada; leia como ordem de grandeza
- Qualidade do modelo depende do modelo subjacente, não do Ollaya
- Mantenedores anônimos (org ollaya-dev)
Links
- Site
- GitHub — 446★, Apache-2.0
- Imagem Docker
Visão (v0.7.5)
A partir da v0.7.5 o Ollaya serve decider:2b-vision (Mapika) e aceita o campo images (PNG em base64) na API/CLI. Latências de visão no release = UnverifiedClaim. Ver news /pt-br/news/ollaya-vision.
