Align.
Marcações de tempo por palavra no dispositivo, para qualquer transcritor. Corte, legende e destaque na palavra, com metade do erro, de um modelo de 0,7 MB.
Marcações de tempo precisas por palavra para qualquer transcrição.
A Apple diz que «world» vai de 2,61 a 3,04 segundos. O Align diz de 2,57 a 2,98. Corte ali e o corte fica limpo, a legenda acende na palavra, e o destaque começa onde o orador começou.
Você mantém o transcritor da Apple. O Align lê o mesmo áudio que o SpeechAnalyzer já recebe e devolve as mesmas palavras com tempos de início e fim mais justos, em poucos milissegundos, a partir de um download de 0,7 MB. Em áudio limpo, isso reduz o erro médio da Apple de 113 ms para 45 ms.
Uma palavra que o Align não consegue melhorar mantém a marcação da Apple, então uma correção só pode ajudar ou deixar a palavra como está. Nove línguas, e um locale fora deles passa com as marcações da Apple intactas.
Metade do erro de marcação.
As marcações de palavra da Apple erram 113 ms em média; o Align reduz isso para 45 ms, e três de cada quatro palavras caem a até 50 ms, a partir de um modelo de 0,7 MB.
Distância absoluta média até a fronteira de palavra de referência, 223 gravações limpas e 210 ruidosas reservadas, em nove línguas
| Condição | Apple bruto | Align | Até 50 ms |
|---|---|---|---|
| Clean | 113,5 ms | 44,9 ms | 75,1% |
| Noisy | 124,4 ms | 50,1 ms | 69,4% |
Avaliado no runtime Swift distribuído e nos modelos Core ML incluídos. As referências são estimativas de alinhamento forçado por máquina do Qwen3-ForcedAligner, não anotações humanas, então os números mostram uma redução grande e consistente do erro de marcação da Apple, e não um referência exato por amostra.
Legendas palavra a palavra que acompanham
Acenda cada palavra conforme ela é dita num ecrã de legendas, num ecrã de letras em estilo karaokê ou num app de aprendizagem de línguas, a partir da transcrição da Apple. As marcações caem na palavra, em vez de a um décimo de segundo dela.
Corte um clipe numa palavra
Recorte uma gravação até uma citação num editor de podcast ou um app de vídeo e faça o corte começar onde a palavra começa. Sem um fotograma da palavra anterior, sem uma consoante cortada e sem ajuste manual na linha do tempo.
Destaque a palavra falada numa transcrição
Role uma transcrição em sincronia com a reprodução num gravador de reuniões ou um app de aulas, com o destaque a avançar na palavra em vez de se adiantar ao áudio.
Busca que cai no momento exato
Salte para o segundo em que uma palavra foi dita num acervo de gravações, no dispositivo. As marcações são precisas o bastante para o cursor de reprodução começar na palavra, e não no meio da anterior.
Inspiração
Ideias para construir com o Align. Copie um prompt para o seu agente de código e comece.
Highlight each word as it's spoken, timed to the audio.
Run Apple's SpeechTranscriber with Desert Ant's Align attached as a timestamp refiner, then highlight each word using its refined time range. Align tightens Apple's word timings on-device; iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Tighten a system transcriber's word timings so captions land on the word.
Attach Desert Ant's Align as a refiner to Apple's SpeechAnalyzer / SpeechTranscriber so its word-level timings tighten and captions and cuts land exactly on the word. iOS 26 / macOS 26, on-device. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Build a text-based video editor where selecting words trims the clip.
Transcribe with Apple's SpeechTranscriber and Desert Ant's Align refiner for word-exact timings, then let the user select words to trim the video to that span. Deleting a sentence deletes the footage. iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Add bouncing word-by-word captions to vertical videos.
Add animated word-by-word captions to short vertical videos, timed with Desert Ant's Align attached to Apple's SpeechTranscriber so each word pops exactly when it's said. On-device, iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Make transcript search jump the audio to the exact word.
In an Apple media app, transcribe with SpeechTranscriber and Desert Ant's Align refiner so a search result seeks the audio or video to the precise word, not the sentence. iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
O que o modelo faz
- Corrige as marcações no nível da palavra que o
SpeechTranscribere oSpeechAnalyzerda Apple retornam, sem substituí-los: as mesmas palavras, a mesma superfície de resultado, valores deaudioTimeRangemais justos. - Erro médio de marcação de 113,5 ms para 44,9 ms em áudio limpo e de 124,4 ms para 50,1 ms em áudio ruidoso, uma redução de 60%, medido em 433 gravações reservadas contra referências de alinhamento forçado.
- 75,1% das palavras caem a até 50 ms da referência em áudio limpo, e 69,4% em áudio ruidoso.
- Um fallback estrutural mantém a marcação original da Apple sempre que uma correção seria inválida, atinge o limite da janela de pesquisa ou não tem contexto de streaming.
- Nove línguas: inglês, espanhol, francês, italiano, português, alemão, japonês, coreano e chinês. Os demais locales passam sem alteração.
- Cerca de 0,7 MB de Core ML compilado em dois estágios, executados na CPU e no Neural Engine; um resultado típico é refinado em poucos milissegundos.
Primeiros passos
Adicione marcações de tempo por palavra ao seu app iOS or macOS em poucas linhas de código. Docs do Align.
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")
import Align
let refiner = try await SpeechTimestampRefiner(locale: locale)
try await analyzer.start(inputSequence: inputs.recordingAudio(for: refiner))
for try await result in transcriber.results.refiningTimestamps(with: refiner) {
result.words // [WordTiming]: text, start, end, refined
}
Add Align from Desert Ant Labs to this Swift project (iOS, macOS). What it does: marcações de tempo por palavra no dispositivo para qualquer transcrição. SDK: Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0") // target dependency .product(name: "Align", package: "desert-ant-core") Reference: - Model page: https://desertant.com/models/align/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Especificações
- Exatidão
- 44,9 ms de erro médio em áudio limpo e 50,1 ms em ruidoso, contra 113,5 ms e 124,4 ms da Apple
- Tamanho no dispositivo
- Cerca de 0,7 MB de Core ML compilado (dois estágios de 0,3 MB mais o banco de filtros e o calibrador)
- Línguas
- Inglês, espanhol, francês, italiano, português, alemão, japonês, coreano, chinês
- Modelo
- Cascata de dois estágios, do grosso ao fino, sobre um espectrograma log-mel, cerca de 117 mil parâmetros por estágio, com um calibrador por gradient boosting
- Plataformas
- iOS 26, macOS 26, tvOS 26, visionOS 26 (Core ML), onde o SpeechAnalyzer vive
O Align corrige as marcações da Apple; ele não transcreve, e precisa do SpeechAnalyzer da Apple, o que significa iOS 26, macOS 26, tvOS 26 ou visionOS 26. O Align não pode prometer melhorar cada palavra.
O fallback que mantém a marcação da Apple pega as correções que parecem inseguras, não toda correção errada. Inglês, italiano, japonês e coreano são os mais fracos das nove línguas sob as referências atuais.
FAQ
O que é o Align?
Marcações de tempo por palavra no dispositivo, para qualquer transcritor. Corte, legende e destaque na palavra, com metade do erro, de um modelo de 0,7 MB.
O Align é executado no dispositivo?
Sim. O Align é executado no dispositivo, sem qualquer chamada a servidores, por isso os dados ficam com o utilizador.
Que plataformas suporta o Align?
O Align é distribuído como um SDK nativo no dispositivo para Swift.
Quanto custa o Align?
Cada modelo é gratuito para até 100 mil dispositivos ativos mensais por SDK. Inferência ilimitada por utilizador. Contacte-nos para licenças personalizadas.
Qual é a precisão ou a rapidez do Align?
As marcações de palavra da Apple erram 113 ms em média; o Align reduz isso para 45 ms, e três de cada quatro palavras caem a até 50 ms, a partir de um modelo de 0,7 MB.