Modelos de áudio no dispositivo
Modelos pequenos para fala, no dispositivo: som de estúdio, hesitações cortadas, o idioma identificado, quem disse o quê. Nada enviado.
Cada modelo de áudio roda no chip que já está no celular, então uma gravação de cinco minutos fica pronta em segundos e o áudio nunca sai do dispositivo. Sem conta por minuto, sem upload, sem fila.
Modelos disponíveis
Melhoria de voz no dispositivo que dá à sua gravação o som quente e captado de perto de um estúdio de podcast, processado 100% no dispositivo.
Detecção de hesitações no dispositivo que marca cada uma (“um”, “uh”, “hmm”) com precisão de 20 ms: uma hora de áudio em 12 s.
Marcações de tempo por palavra no dispositivo, para qualquer transcritor. Corte, legende e destaque na palavra, com metade do erro, de um modelo de 0,7 MB.
Seleção de clipes no dispositivo que transforma uma gravação longa em shorts e destaques ranqueados, a partir de uma transcrição. No iPhone ou no Mac.
Identificação de idioma falado no dispositivo em 99 idiomas, a partir de um curto trecho de áudio, antes de a transcrição começar.
Transcreva 10 minutos de áudio em 2 s em um iPhone, 4,7x mais rápido que o Whisper, com marcações de tempo precisas por palavra.
Em breve
Preços
Cada modelo é gratuito para até 100 mil dispositivos ativos mensais por SDK. Inferência ilimitada por usuário.