Voz.
Transcreva 10 minutos de áudio em 2 s em um iPhone, 4,7x mais rápido que o Whisper, com marcações de tempo precisas por palavra.
Transcreva 10 minutos de áudio em 2 s em um iPhone.
Transcreva um arquivo de áudio ou vídeo com o Voz e obtenha tempos de início e fim precisos para cada palavra. 10 minutos levam 2 s em um iPhone, no dispositivo, então nada é enviado e nada é cobrado por minuto.
No Apple silicon, o modelo roda no Neural Engine, então transcrever é rápido como um raio e consome menos energia. Em um Mac, um catálogo antigo de podcasts, entrevistas e aulas passa inteiro em uma só passagem, e nada é enviado.
As marcações são precisas o bastante para editar em cima delas. Os inícios de palavra caem a até 83 ms de um alinhador forçado e os finais a até 95 ms, para uma edição precisa baseada em transcrição. O Voz é uma versão do Parakeet TDT 0.6B v3 da NVIDIA otimizada para o Apple Neural Engine, com acurácia comparável à do Whisper large-v3-turbo na maior parte dos áudios, e um download de apenas 467 MB.
4,7x mais rápido que o Whisper.
10 minutos de narração em 2 s e 30 minutos em 6 s em um iPhone 17 Pro, 7 s em um iPhone 15 Pro. Em um Mac, 4,7x mais rápido que o whisper.cpp large-v3-turbo no mesmo áudio de podcast, com uma taxa de erro de palavra de 7,40% em seis conjuntos públicos em inglês onde o Whisper marca 7,00%.
Taxa de erro de palavra nos conjuntos do Open ASR Leaderboard, o Voz com o seu próprio normalizador de texto, os números do Whisper vindos do leaderboard
| Conjunto de dados | Voz | Whisper large-v3-turbo |
|---|---|---|
| LibriSpeech test-clean | 2,19% | 2,13% |
| LibriSpeech test-other | 3,86% | 3,70% |
| GigaSpeech | 9,70% | 8,47% |
| SPGISpeech | 3,86% | 2,79% |
| Earnings-22 | 12,97% | 11,07% |
| AMI | 11,84% | 13,87% |
| Average | 7,40% | 7,00% |
Leia a linha que corresponde ao seu áudio. Fala limpa e captada de perto fica em torno de 2% a 4% (LibriSpeech, SPGISpeech), podcasts e vídeo web em torno de 10% (GigaSpeech), e salas de reunião e chamadas telefônicas de 12% a 13% (AMI, Earnings-22), que é onde o modelo supera o Whisper. Os números por idioma, em 10 minutos de fala lida cada, estão no cartão do modelo, de 3,31% para o italiano a 39,46% para o grego. As medições no iPhone e a comparação com o whisper.cpp são execuções nossas e ainda não estão no cartão.
Transcreva qualquer arquivo de áudio ou vídeo
Grave um podcast ou um vídeo e a transcrição completa fica pronta antes de a exportação terminar. Texto pesquisável com uma marcação de tempo em cada palavra, em qualquer um de 25 idiomas, sem sair do dispositivo.
Processe um acúmulo de gravações
Um acervo de entrevistas, aulas ou gravações de reuniões fica pesquisável em uma só passagem em um Mac. Cem horas passam em 20 minutos, e nada é enviado.
Corte em uma palavra
Cada palavra carrega um início e um fim, então um intervalo selecionado na transcrição é um corte em um editor de vídeo. Combine-o com o Clips para os shorts e com o Title para nomeá-los.
Inspiração
Ideias para construir com o Voz. Copie um prompt para o seu agente de código e comece.
Build a podcast player that transcribes every episode and makes it searchable, on the device.
Build a podcast player. When an episode downloads, run Desert Ant's Voz on-device to transcribe it with word timestamps, index the text, and let the user search across a whole feed and tap a result to jump to that moment. No cloud transcription, no per-minute bill. Build it with the Desert Ant SDK. Voz (Swift). Install and API: https://desertant.com/docs/voz/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Build a meeting recorder that hands you a timestamped transcript before you leave the room.
Build a meeting recorder. When recording stops, Desert Ant's Voz transcribes the file in seconds on iPhone or Mac, so the timestamped transcript is ready right away and nothing is uploaded. Build it with the Desert Ant SDK. Voz (Swift). Install and API: https://desertant.com/docs/voz/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Turn voice memos into searchable, editable text notes, offline.
Build a voice-notes app where each memo is transcribed on-device with Desert Ant's Voz into editable, searchable text. Works on a plane, and the audio never leaves the phone. Build it with the Desert Ant SDK. Voz (Swift). Install and API: https://desertant.com/docs/voz/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Generate SRT subtitles for any video file on the Mac.
Build a small Mac tool that takes a video file, transcribes the audio with Desert Ant's Voz (Apple silicon), and writes a correctly timed .srt file. No upload, no API key. Build it with the Desert Ant SDK. Voz (Swift). Install and API: https://desertant.com/docs/voz/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Add captions to a video player that run on the device.
Transcribe the video's audio on-device with Desert Ant's Voz (a fast batch pass on iPhone or Mac), then render a synced caption track. Works offline and for private content that can't go to a cloud service. Build it with the Desert Ant SDK. Voz (Swift). Install and API: https://desertant.com/docs/voz/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Build an interview app for journalists where sources never leave the phone.
Build an interview-recording app that transcribes on-device with Desert Ant's Voz, so a source's audio and words stay on the reporter's phone. Add speaker-friendly formatting and export. Build it with the Desert Ant SDK. Voz (Swift). Install and API: https://desertant.com/docs/voz/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Build a full podcast studio: transcribe, clip, and title on the device.
Build a podcast tool that runs Desert Ant's Voz to transcribe an episode, Clips to pick the best moments as shorts, and Title to name and describe each clip, all on-device with no per-minute or per-token bill. Build it with the Desert Ant SDK. Voz (Swift). Install and API: https://desertant.com/docs/voz/. Clips (Swift). Install and API: https://desertant.com/docs/clips/. Title (Swift). Install and API: https://desertant.com/docs/title/. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Record, clean, transcribe, and clip: a whole creator pipeline, offline.
Build a creator pipeline: Desert Ant's Clear cleans the recording, Voz transcribes it, and Clips pulls the shorts, all on the device so a full episode never touches a server. Build it with the Desert Ant SDK. Clear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/clear/. Voz (Swift). Install and API: https://desertant.com/docs/voz/. Clips (Swift). Install and API: https://desertant.com/docs/clips/. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
O que o modelo faz
- Inícios de palavra a até 83 ms e finais a até 95 ms de um alinhador forçado, em média, com resolução de quadro de 80 ms.
- 10 minutos de áudio em 2 s e 30 minutos em 6 s em um iPhone 17 Pro; 290x o tempo real em um M3 Ultra. Clipes curtos avulsos rodam de 50x a 62x, porque cada clipe paga por uma janela completa de 15 s.
- Taxa de erro de palavra de 7,40% na média de seis conjuntos do Open ASR Leaderboard (Whisper large-v3-turbo: 7,00%), 2,83% em meia hora de narração (Whisper: 2,72%), 11,84% em reuniões do AMI (Whisper: 13,87%).
- O grafo inteiro roda no Neural Engine, sem fallback para CPU ou GPU; o pico de memória não cresce com a duração da gravação.
- 25 idiomas: búlgaro, croata, tcheco, dinamarquês, holandês, inglês, estoniano, finlandês, francês, alemão, grego, húngaro, italiano, letão, lituano, maltês, polonês, português, romeno, russo, eslovaco, esloveno, espanhol, sueco e ucraniano.
- 467 MB em disco, baixado sob demanda e guardado em cache; o primeiro carregamento após um download leva 20 s uma vez, enquanto o Core ML se especializa, e depois 0,2 s. Baixe durante o onboarding.
- Áudio mono em qualquer taxa de amostragem; o SDK reamostra e faz o downmix. Áudios mais longos são cortados em janelas de 15 s nas pausas e unidos pelas palavras em que janelas vizinhas concordam.
- Construído sobre o Parakeet TDT 0.6B v3 da NVIDIA, publicado sob CC BY 4.0. Os pesos não foram alterados; a conversão, a compressão e o runtime para o Neural Engine são nossos.
App de exemplo
Clipper
Feito com Voz, Clips, Title
Generate short clips from a video podcast or a long recording, fully on device. A macOS app and a command-line tool over the same core.
Voz transcribes with a time on every word, Clips ranks the best spans, and Title writes a title and description for each.
macOS 26 or later, Apple Silicon
brew tap desert-ant-labs/tap
brew install --cask clipper
Primeiros passos
Adicione reconhecimento de fala ao seu app iOS or macOS em poucas linhas de código. Docs do Voz.
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Voz", package: "desert-ant-core")
import Voz
let voz = try await Voz()
let result = try await voz.transcribe(url)
result.text // the transcript
result.words.first?.start // 80ms resolution
result.realtimeFactor // seconds of audio per second of wall clock
Add Voz from Desert Ant Labs to this Swift project (iOS, macOS). What it does: fala em texto no dispositivo, no Neural Engine. SDK: Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0") // target dependency .product(name: "Voz", package: "desert-ant-core") Reference: - Model page: https://desertant.com/models/voz/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Especificações
- Velocidade
- 10 minutos de áudio em 2 s em um iPhone 17 Pro, 30 minutos em 6 s (7 s em um iPhone 15 Pro); 30 minutos em 5,6 s em um M3 Ultra, 319x o tempo real
- Acurácia
- 7,40% de WER em seis conjuntos do Open ASR Leaderboard; 2,83% em formato longo; erro médio de 83 ms nos inícios de palavra e 95 ms nos finais
- Tamanho no dispositivo
- 467 MB de Core ML compilado, baixado sob demanda
- Idiomas
- 25 idiomas europeus; acurácia de 3,31% (italiano) a 39,46% (grego) em fala lida
- Modelo
- NVIDIA Parakeet TDT 0.6B v3 (CC BY 4.0), convertido para Core ML e comprimido pela Desert Ant Labs: frontend log-mel, encoder conformer, decoder transducer, tudo no Neural Engine
- Plataformas
- iOS, iPadOS, macOS, tvOS, visionOS (Core ML); apenas Apple
O Voz é apenas para Apple: o runtime aciona o Core ML diretamente para manter o grafo no Neural Engine, e não há build para Android, Linux ou web. O Voz não sabe qual dos seus 25 idiomas está ouvindo, e um idioma que ele não cobre produz bobagem com confiança, em vez de um erro, então combine-o com o Ear.
A acurácia varia muito por idioma, os finais de palavra são a metade mais difícil das marcações, e 467 MB é um download de verdade para baixar durante o onboarding.
FAQ
O que é o Voz?
Transcreva 10 minutos de áudio em 2 s em um iPhone, 4,7x mais rápido que o Whisper, com marcações de tempo precisas por palavra.
O Voz roda no dispositivo?
Sim. O Voz roda no dispositivo, sem chamada a servidor, então os dados ficam com o usuário.
Quais plataformas o Voz suporta?
O Voz é distribuído como um SDK nativo no dispositivo para Swift.
Quanto custa o Voz?
Cada modelo é gratuito para até 100 mil dispositivos ativos mensais por SDK. Inferência ilimitada por usuário. Fale conosco para licenças personalizadas.
Qual a precisão e a velocidade do Voz?
10 minutos de narração em 2 s e 30 minutos em 6 s em um iPhone 17 Pro, 7 s em um iPhone 15 Pro. Em um Mac, 4,7x mais rápido que o whisper.cpp large-v3-turbo no mesmo áudio de podcast, com uma taxa de erro de palavra de 7,40% em seis conjuntos públicos em inglês onde o Whisper marca 7,00%.
O Voz roda no Android ou no Windows?
Ainda não. Hoje o Voz roda no Apple silicon, onde o modelo inteiro roda no Neural Engine. Esperamos adicionar Android e Windows nos próximos meses. Conte para a gente o que você está construindo e avisaremos quando forem lançados.