Align
Marcações de tempo por palavra no dispositivo, para qualquer transcritor. Corte, legende e destaque com cinco vezes mais precisão, a partir de 0,7 MB.

Marcações de tempo precisas por palavra para qualquer transcrição.
A Apple diz que “world” vai de 2,61 a 3,04 segundos. O Align diz de 2,57 a 2,98. Corte ali e o corte fica limpo, a legenda acende na palavra, e o destaque começa onde o locutor começou.
Você mantém o transcritor da Apple. O Align lê o mesmo áudio que o SpeechAnalyzer já recebe e devolve as mesmas palavras com tempos de início e fim mais justos, em poucos milissegundos, a partir de um download de 0,7 MB. Em áudio limpo, isso reduz o erro médio da Apple de 113 ms para 45 ms.
Uma palavra que o Align não consegue melhorar mantém a marcação da Apple, então uma correção só pode ajudar ou deixar a palavra como está. Nove idiomas, e um locale fora deles passa com as marcações da Apple intactas.
Cinco vezes mais preciso.
Os tempos por palavra da Apple no LibriSpeech test-clean erram em média 106,4 ms; o Align reduz isso para 20,2 ms, e 95% das palavras ficam a menos de 50 ms, a partir de um modelo de 0,7 MB.
Distância absoluta média em relação ao limite de palavra de referência, numa amostra de 500 trechos de cada split oficial do LibriSpeech, sem nenhum falante partilhado entre treino e avaliação
| Split | Apple bruto | Align | Até 50 ms |
|---|---|---|---|
| test-clean | 106,4 ms | 20,2 ms | 95% |
| test-other | 111,6 ms | 24,8 ms | 92% |
Avaliado com os pesos v1.0.0. As referências são estimativas de alinhamento forçado por máquina, do Qwen3-ForcedAligner combinado com um segundo alinhador, e não anotações humanas: os números mostram uma redução grande e consistente do erro de tempo, não uma verdade absoluta ao nível da amostra. A exceção é a comparação com o WhisperX, medida em 258 limites de palavra corrigidos à mão por uma pessoa sobre a forma de onda.
Casos de uso
Marcações de tempo precisas por palavra para qualquer transcrição.
Legendas palavra a palavra que acompanham
Acenda cada palavra conforme ela é dita em uma tela de legendas, uma tela de letras em estilo karaokê ou um app de aprendizado de idiomas, a partir da transcrição da Apple. As marcações caem na palavra, em vez de a um décimo de segundo dela.
Corte um clipe em uma palavra
Recorte uma gravação até uma citação em um editor de podcast ou um app de vídeo e faça o corte começar onde a palavra começa. Sem um quadro da palavra anterior, sem uma consoante cortada e sem ajuste manual na linha do tempo.
Destaque a palavra falada em uma transcrição
Role uma transcrição em sincronia com a reprodução em um gravador de reuniões ou um app de aulas, com o destaque avançando na palavra em vez de se adiantar ao áudio.
Busca que cai no momento exato
Pule para o segundo em que uma palavra foi dita em um acervo de gravações, no dispositivo. As marcações são precisas o bastante para o cursor de reprodução começar na palavra, e não no meio da anterior.
Inspiração
Ideias para construir com o Align. Copie um prompt para o seu agente de código e comece.
Highlight each word as it's spoken, timed to the audio.
Run Apple's SpeechTranscriber with Desert Ant's Align attached as a timestamp refiner, then highlight each word using its refined time range. Align tightens Apple's word timings on-device; iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Tighten a system transcriber's word timings so captions land on the word.
Attach Desert Ant's Align as a refiner to Apple's SpeechAnalyzer / SpeechTranscriber so its word-level timings tighten and captions and cuts land exactly on the word. iOS 26 / macOS 26, on-device. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Build a text-based video editor where selecting words trims the clip.
Transcribe with Apple's SpeechTranscriber and Desert Ant's Align refiner for word-exact timings, then let the user select words to trim the video to that span. Deleting a sentence deletes the footage. iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Add bouncing word-by-word captions to vertical videos.
Add animated word-by-word captions to short vertical videos, timed with Desert Ant's Align attached to Apple's SpeechTranscriber so each word pops exactly when it's said. On-device, iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Make transcript search jump the audio to the exact word.
In an Apple media app, transcribe with SpeechTranscriber and Desert Ant's Align refiner so a search result seeks the audio or video to the precise word, not the sentence. iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
O que o modelo faz
- Corrige as marcações no nível da palavra que o
SpeechTranscribere oSpeechAnalyzerda Apple retornam, sem substituí-los: as mesmas palavras, a mesma superfície de resultado, valores deaudioTimeRangemais justos. - Erro médio de tempo de 124,2 ms para 43,9 ms, com média macro entre os nove idiomas, para que nenhum idioma sozinho carregue o número. Em inglês vai além: de 106,4 ms para 20,2 ms.
- Numa amostra de 500 trechos do LibriSpeech test-clean, 95% das palavras ficam a menos de 50 ms da referência, contra 37% antes. O décimo pior é o que mais melhora: de 230,7 ms para 33,0 ms, cerca de um quadro de vídeo a 30 fps.
- Um fallback estrutural mantém a marcação original da Apple sempre que uma correção seria inválida, atinge a borda da janela de busca ou não tem contexto de streaming.
- Nove idiomas: inglês, espanhol, francês, italiano, português, alemão, japonês, coreano e chinês. Os demais locales passam sem alteração.
- Cerca de 0,7 MB de Core ML compilado em dois estágios, executados na CPU e no Neural Engine; um resultado típico é refinado em poucos milissegundos.
Primeiros passos
Adicione marcações de tempo por palavra ao seu app iOS or macOS em poucas linhas de código. Docs do Align.
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")
import Align
let refiner = try await SpeechTimestampRefiner(locale: locale)
try await analyzer.start(inputSequence: inputs.recordingAudio(for: refiner))
for try await result in transcriber.results.refiningTimestamps(with: refiner) {
result.words // [WordTiming]: text, start, end, refined
}
Add Align from Desert Ant Labs to this Swift project (iOS, macOS). What it does: marcações de tempo por palavra no dispositivo para qualquer transcrição. SDK: Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0") // target dependency .product(name: "Align", package: "desert-ant-core") Reference: - Model page: https://desertant.com/models/align/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Especificações
- Acurácia
- 20,2 ms de erro médio no LibriSpeech test-clean contra os 106,4 ms da Apple, e 43,9 ms nos nove idiomas contra os 124,2 ms da Apple
- Tamanho no dispositivo
- Cerca de 0,7 MB de Core ML compilado (dois estágios de 0,3 MB, mais o banco de filtros e o calibrador)
- Idiomas
- Inglês, espanhol, francês, italiano, português, alemão, japonês, coreano, chinês
- Modelo
- Cascata de dois estágios, do amplo ao fino, sobre um espectrograma log-mel, com 121 mil parâmetros por estágio e um calibrador de árvores com gradient boosting
- Plataformas
- iOS 26, macOS 26, tvOS 26, visionOS 26 (Core ML), onde o SpeechAnalyzer vive
O Align corrige os tempos de um transcritor; ele não transcreve, e o SDK Swift precisa do SpeechAnalyzer da Apple, ou seja, iOS 26, macOS 26, tvOS 26 ou visionOS 26. O Align não promete melhorar todas as palavras.
O mecanismo de segurança que mantém o tempo original detecta correções que parecem arriscadas, não todas as erradas. Números falados são o caso mais fraco: numa amostra pequena, o refinamento afastou os limites dos dígitos da referência em vez de os deixar como estavam.
FAQ
O que é o Align?
Marcações de tempo por palavra no dispositivo, para qualquer transcritor. Corte, legende e destaque com cinco vezes mais precisão, a partir de 0,7 MB.
O Align roda no dispositivo?
Sim. O Align roda no dispositivo, sem chamada a servidor, então os dados ficam com o usuário.
Quais plataformas o Align suporta?
O Align é distribuído como um SDK nativo no dispositivo para Swift.
Quanto custa o Align?
Cada modelo é gratuito para até 100 mil dispositivos ativos mensais por SDK. Inferência ilimitada por usuário. Fale conosco para licenças personalizadas.
Qual a precisão e a velocidade do Align?
Os tempos por palavra da Apple no LibriSpeech test-clean erram em média 106,4 ms; o Align reduz isso para 20,2 ms, e 95% das palavras ficam a menos de 50 ms, a partir de um modelo de 0,7 MB.