Align
Marcações de tempo por palavra no dispositivo, para qualquer transcritor. Corte, legende e destaque com cinco vezes mais precisão, a partir de 0,7 MB.

Marcações de tempo precisas por palavra para qualquer transcrição.
A Apple diz que «world» vai de 2,61 a 3,04 segundos. O Align diz de 2,57 a 2,98. Corte ali e o corte fica limpo, a legenda acende na palavra, e o destaque começa onde o orador começou.
Você mantém o transcritor da Apple. O Align lê o mesmo áudio que o SpeechAnalyzer já recebe e devolve as mesmas palavras com tempos de início e fim mais justos, em poucos milissegundos, a partir de um download de 0,7 MB. Em áudio limpo, isso reduz o erro médio da Apple de 113 ms para 45 ms.
Uma palavra que o Align não consegue melhorar mantém a marcação da Apple, então uma correção só pode ajudar ou deixar a palavra como está. Nove línguas, e um locale fora deles passa com as marcações da Apple intactas.
Cinco vezes mais preciso.
Os tempos por palavra da Apple no LibriSpeech test-clean erram em média 106,4 ms; o Align reduz isso para 20,2 ms, e 95% das palavras ficam a menos de 50 ms, a partir de um modelo de 0,7 MB.
Distância absoluta média em relação à fronteira de palavra de referência, numa amostra de 500 excertos de cada split oficial do LibriSpeech, sem qualquer falante partilhado entre treino e avaliação
| Split | Apple bruto | Align | Até 50 ms |
|---|---|---|---|
| test-clean | 106,4 ms | 20,2 ms | 95% |
| test-other | 111,6 ms | 24,8 ms | 92% |
Avaliado com os pesos v1.0.0. As referências são estimativas de alinhamento forçado por máquina, do Qwen3-ForcedAligner combinado com um segundo alinhador, e não anotações humanas: os números mostram uma redução grande e consistente do erro de tempo, não uma verdade absoluta ao nível da amostra. A exceção é a comparação com o WhisperX, medida em 258 fronteiras de palavra corrigidas à mão por uma pessoa sobre a forma de onda.
Casos de uso
Marcações de tempo precisas por palavra para qualquer transcrição.
Legendas palavra a palavra que acompanham
Acenda cada palavra conforme ela é dita num ecrã de legendas, num ecrã de letras em estilo karaokê ou num app de aprendizagem de línguas, a partir da transcrição da Apple. As marcações caem na palavra, em vez de a um décimo de segundo dela.
Corte um clipe numa palavra
Recorte uma gravação até uma citação num editor de podcast ou um app de vídeo e faça o corte começar onde a palavra começa. Sem um fotograma da palavra anterior, sem uma consoante cortada e sem ajuste manual na linha do tempo.
Destaque a palavra falada numa transcrição
Role uma transcrição em sincronia com a reprodução num gravador de reuniões ou um app de aulas, com o destaque a avançar na palavra em vez de se adiantar ao áudio.
Busca que cai no momento exato
Salte para o segundo em que uma palavra foi dita num acervo de gravações, no dispositivo. As marcações são precisas o bastante para o cursor de reprodução começar na palavra, e não no meio da anterior.
Inspiração
Ideias para construir com o Align. Copie um prompt para o seu agente de código e comece.
Highlight each word as it's spoken, timed to the audio.
Run Apple's SpeechTranscriber with Desert Ant's Align attached as a timestamp refiner, then highlight each word using its refined time range. Align tightens Apple's word timings on-device; iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Tighten a system transcriber's word timings so captions land on the word.
Attach Desert Ant's Align as a refiner to Apple's SpeechAnalyzer / SpeechTranscriber so its word-level timings tighten and captions and cuts land exactly on the word. iOS 26 / macOS 26, on-device. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Build a text-based video editor where selecting words trims the clip.
Transcribe with Apple's SpeechTranscriber and Desert Ant's Align refiner for word-exact timings, then let the user select words to trim the video to that span. Deleting a sentence deletes the footage. iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Add bouncing word-by-word captions to vertical videos.
Add animated word-by-word captions to short vertical videos, timed with Desert Ant's Align attached to Apple's SpeechTranscriber so each word pops exactly when it's said. On-device, iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Make transcript search jump the audio to the exact word.
In an Apple media app, transcribe with SpeechTranscriber and Desert Ant's Align refiner so a search result seeks the audio or video to the precise word, not the sentence. iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
O que o modelo faz
- Corrige as marcações no nível da palavra que o
SpeechTranscribere oSpeechAnalyzerda Apple retornam, sem substituí-los: as mesmas palavras, a mesma superfície de resultado, valores deaudioTimeRangemais justos. - Erro médio de tempo de 124,2 ms para 43,9 ms, com média macro entre os nove idiomas, para que nenhum idioma sozinho sustente o número. Em inglês vai mais longe: de 106,4 ms para 20,2 ms.
- Numa amostra de 500 excertos do LibriSpeech test-clean, 95% das palavras ficam a menos de 50 ms da referência, contra 37% antes. O pior décimo é o que mais melhora: de 230,7 ms para 33,0 ms, cerca de um fotograma de vídeo a 30 fps.
- Um fallback estrutural mantém a marcação original da Apple sempre que uma correção seria inválida, atinge o limite da janela de pesquisa ou não tem contexto de streaming.
- Nove línguas: inglês, espanhol, francês, italiano, português, alemão, japonês, coreano e chinês. Os demais locales passam sem alteração.
- Cerca de 0,7 MB de Core ML compilado em dois estágios, executados na CPU e no Neural Engine; um resultado típico é refinado em poucos milissegundos.
Primeiros passos
Adicione marcações de tempo por palavra ao seu app iOS or macOS em poucas linhas de código. Docs do Align.
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")
import Align
let refiner = try await SpeechTimestampRefiner(locale: locale)
try await analyzer.start(inputSequence: inputs.recordingAudio(for: refiner))
for try await result in transcriber.results.refiningTimestamps(with: refiner) {
result.words // [WordTiming]: text, start, end, refined
}
Add Align from Desert Ant Labs to this Swift project (iOS, macOS). What it does: marcações de tempo por palavra no dispositivo para qualquer transcrição. SDK: Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0") // target dependency .product(name: "Align", package: "desert-ant-core") Reference: - Model page: https://desertant.com/models/align/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Especificações
- Exatidão
- 20,2 ms de erro médio no LibriSpeech test-clean contra os 106,4 ms da Apple, e 43,9 ms nos nove idiomas contra os 124,2 ms da Apple
- Tamanho no dispositivo
- Cerca de 0,7 MB de Core ML compilado (dois estágios de 0,3 MB, mais o banco de filtros e o calibrador)
- Línguas
- Inglês, espanhol, francês, italiano, português, alemão, japonês, coreano, chinês
- Modelo
- Cascata de dois estágios, do grosseiro ao fino, sobre um espetrograma log-mel, com 121 mil parâmetros por estágio e um calibrador de árvores com gradient boosting
- Plataformas
- iOS 26, macOS 26, tvOS 26, visionOS 26 (Core ML), onde o SpeechAnalyzer vive
O Align corrige os tempos de um transcritor; não transcreve, e o SDK Swift precisa do SpeechAnalyzer da Apple, ou seja, iOS 26, macOS 26, tvOS 26 ou visionOS 26. O Align não promete melhorar todas as palavras.
O mecanismo de segurança que mantém o tempo original apanha correções que parecem arriscadas, não todas as erradas. Os números falados são o caso mais fraco: numa amostra pequena, o refinamento afastou as fronteiras dos dígitos da referência em vez de as deixar como estavam.
FAQ
O que é o Align?
Marcações de tempo por palavra no dispositivo, para qualquer transcritor. Corte, legende e destaque com cinco vezes mais precisão, a partir de 0,7 MB.
O Align é executado no dispositivo?
Sim. O Align é executado no dispositivo, sem qualquer chamada a servidores, por isso os dados ficam com o utilizador.
Que plataformas suporta o Align?
O Align é distribuído como um SDK nativo no dispositivo para Swift.
Quanto custa o Align?
Cada modelo é gratuito para até 100 mil dispositivos ativos mensais por SDK. Inferência ilimitada por utilizador. Contacte-nos para licenças personalizadas.
Qual é a precisão ou a rapidez do Align?
Os tempos por palavra da Apple no LibriSpeech test-clean erram em média 106,4 ms; o Align reduz isso para 20,2 ms, e 95% das palavras ficam a menos de 50 ms, a partir de um modelo de 0,7 MB.