Desert Ant Labs

Voz.

Reconhecimento de falaDisponível

Transcreva 10 minutos de áudio em 2 s num iPhone, 4,7x mais rápido que o Whisper, com marcações de tempo precisas por palavra.

Transcreva 10 minutos de áudio em 2 s num iPhone.

Transcreva um ficheiro de áudio ou vídeo com o Voz e obtenha tempos de início e fim precisos para cada palavra. 10 minutos levam 2 s num iPhone, no dispositivo, então nada é enviado e nada é cobrado por minuto.

No Apple silicon, o modelo corre no Neural Engine, então transcrever é rápido como um raio e consome menos energia. Num Mac, um catálogo antigo de podcasts, entrevistas e aulas passa inteiro numa só passagem, e nada é enviado.

As marcações são precisas o bastante para editar em cima delas. Os inícios de palavra caem a até 83 ms de um alinhador forçado e os finais a até 95 ms, para uma edição precisa baseada em transcrição. O Voz é uma versão do Parakeet TDT 0.6B v3 da NVIDIA otimizada para o Apple Neural Engine, com exatidão comparável à do Whisper large-v3-turbo na maior parte dos áudios, e um download de apenas 467 MB.

4,7x mais rápido que o Whisper.

10 minutos de narração em 2 s e 30 minutos em 6 s num iPhone 17 Pro, 7 s num iPhone 15 Pro. Num Mac, 4,7x mais rápido que o whisper.cpp large-v3-turbo no mesmo áudio de podcast, com uma taxa de erro de palavra de 7,40% em seis conjuntos públicos em inglês onde o Whisper marca 7,00%.

0.0s
0:00 / 30:00

Áudio: Ant Ventures, uma gravação da LibriVox, domínio público.

6 s
Meia hora de áudio
iPhone 17 Pro, no Neural Engine
4,7x
Mais rápido que o Whisper
large-v3-turbo via whisper.cpp, M3 Ultra
7,40%
Taxa de erro de palavra
seis conjuntos do Open ASR Leaderboard; Whisper large-v3-turbo 7,00%
467 MB
Em disco
Whisper large-v3-turbo: 1,6 GB em fp16

Taxa de erro de palavra nos conjuntos do Open ASR Leaderboard, o Voz com o seu próprio normalizador de texto, os números do Whisper vindos do leaderboard

Conjunto de dadosVozWhisper large-v3-turbo
LibriSpeech test-clean2,19%2,13%
LibriSpeech test-other3,86%3,70%
GigaSpeech9,70%8,47%
SPGISpeech3,86%2,79%
Earnings-2212,97%11,07%
AMI11,84%13,87%
Average7,40%7,00%

Leia a linha que corresponde ao seu áudio. Fala limpa e captada de perto fica em torno de 2% a 4% (LibriSpeech, SPGISpeech), podcasts e vídeo web em torno de 10% (GigaSpeech), e salas de reunião e chamadas telefônicas de 12% a 13% (AMI, Earnings-22), que é onde o modelo supera o Whisper. Os números por língua, em 10 minutos de fala lida cada, estão no model card, de 3,31% para o italiano a 39,46% para o grego. As medições no iPhone e a comparação com o whisper.cpp são execuções nossas e ainda não estão no cartão.

Transcreva qualquer ficheiro de áudio ou vídeo

Grave um podcast ou um vídeo e a transcrição completa fica pronta antes de a exportação terminar. Texto pesquisável com uma marcação de tempo em cada palavra, em qualquer um de 25 línguas, sem sair do dispositivo.

Processe um acúmulo de gravações

Um acervo de entrevistas, aulas ou gravações de reuniões fica pesquisável numa só passagem num Mac. Cem horas passam em 20 minutos, e nada é enviado.

Corte numa palavra

Cada palavra carrega um início e um fim, então um intervalo selecionado na transcrição é um corte num editor de vídeo. Combine-o com o Clips para os shorts e com o Title para nomeá-los.

Inspiração

Ideias para construir com o Voz. Copie um prompt para o seu agente de código e comece.

Voz

Build a podcast player that transcribes every episode and makes it searchable, on the device.

Voz

Build a meeting recorder that hands you a timestamped transcript before you leave the room.

Voz

Turn voice memos into searchable, editable text notes, offline.

Voz

Generate SRT subtitles for any video file on the Mac.

Voz

Add captions to a video player that run on the device.

Voz

Build an interview app for journalists where sources never leave the phone.

VozClipsTitle

Build a full podcast studio: transcribe, clip, and title on the device.

ClearVozClips

Record, clean, transcribe, and clip: a whole creator pipeline, offline.

Ver todas as 26 ideias

O que o modelo faz

  • Inícios de palavra a até 83 ms e finais a até 95 ms de um alinhador forçado, em média, com resolução temporal de 80 ms.
  • 10 minutos de áudio em 2 s e 30 minutos em 6 s num iPhone 17 Pro; 290x o tempo real num M3 Ultra. Clipes curtos avulsos correm de 50x a 62x, porque cada clipe paga por uma janela completa de 15 s.
  • Taxa de erro de palavra de 7,40% na média de seis conjuntos do Open ASR Leaderboard (Whisper large-v3-turbo: 7,00%), 2,83% em meia hora de narração (Whisper: 2,72%), 11,84% em reuniões do AMI (Whisper: 13,87%).
  • O grafo inteiro corre no Neural Engine, sem fallback para CPU ou GPU; o pico de memória não cresce com a duração da gravação.
  • 25 línguas: búlgaro, croata, checo, dinamarquês, neerlandês, inglês, estoniano, finlandês, francês, alemão, grego, húngaro, italiano, letão, lituano, maltês, polaco, português, romeno, russo, eslovaco, esloveno, espanhol, sueco e ucraniano.
  • 467 MB em disco, transferido a pedido e guardado em cache; o primeiro carregamento após um download leva 20 s uma vez, enquanto o Core ML se especializa, e depois 0,2 s. Transfira durante o onboarding.
  • Áudio mono em qualquer taxa de amostragem; o SDK reamostra e faz o downmix. Áudios mais longos são cortados em janelas de 15 s nas pausas e unidos pelas palavras em que janelas vizinhas concordam.
  • Construído sobre o Parakeet TDT 0.6B v3 da NVIDIA, publicado sob CC BY 4.0. Os pesos não foram alterados; a conversão, a compressão e o runtime para o Neural Engine são nossos.

Aplicação de exemplo

Clipper

Feito com Voz, Clips, Title

Generate short clips from a video podcast or a long recording, fully on device. A macOS app and a command-line tool over the same core.

Voz transcribes with a time on every word, Clips ranks the best spans, and Title writes a title and description for each.

macOS 26 or later, Apple Silicon

Instalar com o Homebrew
brew tap desert-ant-labs/tap
brew install --cask clipper

Primeiros passos

Adicione reconhecimento de fala ao seu app iOS or macOS em poucas linhas de código. Docs do Voz.

iOS, macOS
Instalação
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Voz", package: "desert-ant-core")
Exemplo - Swift
import Voz

let voz = try await Voz()
let result = try await voz.transcribe(url)
result.text                     // the transcript
result.words.first?.start       // 80ms resolution
result.realtimeFactor           // seconds of audio per second of wall clock
Crie com um prompt
Add Voz from Desert Ant Labs to this Swift project (iOS, macOS).

What it does: fala em texto no dispositivo, no Neural Engine.

SDK:

Swift (iOS, macOS)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Voz", package: "desert-ant-core")

Reference:
- Model page: https://desertant.com/models/voz/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
AndroidEm breve
Web, Node.jsEm breve

Especificações

Velocidade
10 minutos de áudio em 2 s num iPhone 17 Pro, 30 minutos em 6 s (7 s num iPhone 15 Pro); 30 minutos em 5,6 s num M3 Ultra, 319x o tempo real
Exatidão
7,40% de WER em seis conjuntos do Open ASR Leaderboard; 2,83% em formato longo; erro médio de 83 ms nos inícios de palavra e 95 ms nos finais
Tamanho no dispositivo
467 MB de Core ML compilado, transferido a pedido
Línguas
25 línguas europeias; exatidão de 3,31% (italiano) a 39,46% (grego) em fala lida
Modelo
NVIDIA Parakeet TDT 0.6B v3 (CC BY 4.0), convertido para Core ML e comprimido pela Desert Ant Labs: frontend log-mel, encoder conformer, decoder transducer, tudo no Neural Engine
Plataformas
iOS, iPadOS, macOS, tvOS, visionOS (Core ML); apenas Apple

O Voz é apenas para Apple: o runtime aciona o Core ML diretamente para manter o grafo no Neural Engine, e não há build para Android, Linux ou web. O Voz não sabe qual das suas 25 línguas está a ouvir, e uma língua que ele não cobre produz disparates com confiança, em vez de um erro, então combine-o com o Ear.

A exatidão varia muito por língua, os finais de palavra são a metade mais difícil das marcações, e 467 MB é um download considerável para transferir durante o onboarding.

FAQ

O que é o Voz?

Transcreva 10 minutos de áudio em 2 s num iPhone, 4,7x mais rápido que o Whisper, com marcações de tempo precisas por palavra.

O Voz é executado no dispositivo?

Sim. O Voz é executado no dispositivo, sem qualquer chamada a servidores, por isso os dados ficam com o utilizador.

Que plataformas suporta o Voz?

O Voz é distribuído como um SDK nativo no dispositivo para Swift.

Quanto custa o Voz?

Cada modelo é gratuito para até 100 mil dispositivos ativos mensais por SDK. Inferência ilimitada por utilizador. Contacte-nos para licenças personalizadas.

Qual é a precisão ou a rapidez do Voz?

10 minutos de narração em 2 s e 30 minutos em 6 s num iPhone 17 Pro, 7 s num iPhone 15 Pro. Num Mac, 4,7x mais rápido que o whisper.cpp large-v3-turbo no mesmo áudio de podcast, com uma taxa de erro de palavra de 7,40% em seis conjuntos públicos em inglês onde o Whisper marca 7,00%.

O Voz corre no Android ou no Windows?

Ainda não. Hoje o Voz corre no Apple silicon, onde o modelo inteiro corre no Neural Engine. Esperamos adicionar Android e Windows nos próximos meses. Diga-nos o que está a construir e avisaremos quando forem lançados.

Recursos