Prosodia
⚠️ Por que não é um modelo
Especialista de modalidade áudio — não é um par Sistema Um baseado em texto; domínio de entrada completamente diferente.
Especificações técnicas
- LLMs base
- whisper-encoder
- Tipos de decisão
- choice, score, noul
- Features
- audio-native, no-asr, whisper-encoder
- Licença
- Research
Links
Prosodia (audio-jevlike) é um especialista nativo de áudio que fornece decisões em formato Jev (choice/score/noul) diretamente de input de áudio, sem rodar decode ASR para texto.
Como funciona
Ao invés de:
- Áudio → Transcrição Whisper → Texto → Modelo de decisão
Prosodia faz:
- Áudio → Encoder Whisper → Cabeça de decisão → Decisão tipada
O decoder Whisper nunca roda — decisões vêm diretamente das representações do encoder.
Por que está listado aqui (não em Modelos)
Prosodia é um especialista de modalidade:
- Domínio de entrada diferente (áudio, não texto)
- Não comparável com modelos Sistema Um baseados em texto
- Status de protótipo de pesquisa
- Distorceria o quadrante se incluído junto com modelos de texto
Tom de pesquisa
O projeto tem framing de pesquisa:
- Comparações de IIA vs Jev são UnverifiedClaim
- Ablações da Fase 1 são reportadas pelo autor
- Protótipo em estágio inicial
