Prosodia

Última atualização:

EspecialistaResearch

⚠️ Por que não é um modelo

Especialista de modalidade áudio — não é um par Sistema Um baseado em texto; domínio de entrada completamente diferente.

Especificações técnicas

LLMs base
whisper-encoder
Tipos de decisão
choice, score, noul
Features
audio-native, no-asr, whisper-encoder
Licença
Research

Prosodia (audio-jevlike) é um especialista nativo de áudio que fornece decisões em formato Jev (choice/score/noul) diretamente de input de áudio, sem rodar decode ASR para texto.

Como funciona

Ao invés de:

  1. Áudio → Transcrição Whisper → Texto → Modelo de decisão

Prosodia faz:

  1. Áudio → Encoder Whisper → Cabeça de decisão → Decisão tipada

O decoder Whisper nunca roda — decisões vêm diretamente das representações do encoder.

Por que está listado aqui (não em Modelos)

Prosodia é um especialista de modalidade:

  • Domínio de entrada diferente (áudio, não texto)
  • Não comparável com modelos Sistema Um baseados em texto
  • Status de protótipo de pesquisa
  • Distorceria o quadrante se incluído junto com modelos de texto

Tom de pesquisa

O projeto tem framing de pesquisa:

  • Comparações de IIA vs Jev são UnverifiedClaim
  • Ablações da Fase 1 são reportadas pelo autor
  • Protótipo em estágio inicial