Desert Ant Labs

Align

Marcações de tempo por palavraDisponível

Marcações de tempo por palavra no dispositivo, para qualquer transcritor. Corte, legende e destaque com cinco vezes mais precisão, a partir de 0,7 MB.

Marcações de tempo precisas por palavra para qualquer transcrição.

A Apple diz que «world» vai de 2,61 a 3,04 segundos. O Align diz de 2,57 a 2,98. Corte ali e o corte fica limpo, a legenda acende na palavra, e o destaque começa onde o orador começou.

Você mantém o transcritor da Apple. O Align lê o mesmo áudio que o SpeechAnalyzer já recebe e devolve as mesmas palavras com tempos de início e fim mais justos, em poucos milissegundos, a partir de um download de 0,7 MB. Em áudio limpo, isso reduz o erro médio da Apple de 113 ms para 45 ms.

Uma palavra que o Align não consegue melhorar mantém a marcação da Apple, então uma correção só pode ajudar ou deixar a palavra como está. Nove línguas, e um locale fora deles passa com as marcações da Apple intactas.

Cinco vezes mais preciso.

Os tempos por palavra da Apple no LibriSpeech test-clean erram em média 106,4 ms; o Align reduz isso para 20,2 ms, e 95% das palavras ficam a menos de 50 ms, a partir de um modelo de 0,7 MB.

20,2 ms
Erro médio, LibriSpeech test-clean
Apple sem correção: 106,4 ms
5x
Mais preciso
de 106,4 ms para 20,2 ms
45,0 ms
Contra fronteiras corrigidas à mão
WhisperX: 53,5 ms
0,7 MB
No dispositivo
Core ML compilado, dois estágios

Distância absoluta média em relação à fronteira de palavra de referência, numa amostra de 500 excertos de cada split oficial do LibriSpeech, sem qualquer falante partilhado entre treino e avaliação

SplitApple brutoAlignAté 50 ms
test-clean106,4 ms20,2 ms95%
test-other111,6 ms24,8 ms92%

Avaliado com os pesos v1.0.0. As referências são estimativas de alinhamento forçado por máquina, do Qwen3-ForcedAligner combinado com um segundo alinhador, e não anotações humanas: os números mostram uma redução grande e consistente do erro de tempo, não uma verdade absoluta ao nível da amostra. A exceção é a comparação com o WhisperX, medida em 258 fronteiras de palavra corrigidas à mão por uma pessoa sobre a forma de onda.

Casos de uso

Marcações de tempo precisas por palavra para qualquer transcrição.

Legendas palavra a palavra que acompanham

Acenda cada palavra conforme ela é dita num ecrã de legendas, num ecrã de letras em estilo karaokê ou num app de aprendizagem de línguas, a partir da transcrição da Apple. As marcações caem na palavra, em vez de a um décimo de segundo dela.

Corte um clipe numa palavra

Recorte uma gravação até uma citação num editor de podcast ou um app de vídeo e faça o corte começar onde a palavra começa. Sem um fotograma da palavra anterior, sem uma consoante cortada e sem ajuste manual na linha do tempo.

Destaque a palavra falada numa transcrição

Role uma transcrição em sincronia com a reprodução num gravador de reuniões ou um app de aulas, com o destaque a avançar na palavra em vez de se adiantar ao áudio.

Busca que cai no momento exato

Salte para o segundo em que uma palavra foi dita num acervo de gravações, no dispositivo. As marcações são precisas o bastante para o cursor de reprodução começar na palavra, e não no meio da anterior.

Inspiração

Ideias para construir com o Align. Copie um prompt para o seu agente de código e comece.

Align

Highlight each word as it's spoken, timed to the audio.

Align

Tighten a system transcriber's word timings so captions land on the word.

Align

Build a text-based video editor where selecting words trims the clip.

Align

Add bouncing word-by-word captions to vertical videos.

Align

Make transcript search jump the audio to the exact word.

O que o modelo faz

  • Corrige as marcações no nível da palavra que o SpeechTranscriber e o SpeechAnalyzer da Apple retornam, sem substituí-los: as mesmas palavras, a mesma superfície de resultado, valores de audioTimeRange mais justos.
  • Erro médio de tempo de 124,2 ms para 43,9 ms, com média macro entre os nove idiomas, para que nenhum idioma sozinho sustente o número. Em inglês vai mais longe: de 106,4 ms para 20,2 ms.
  • Numa amostra de 500 excertos do LibriSpeech test-clean, 95% das palavras ficam a menos de 50 ms da referência, contra 37% antes. O pior décimo é o que mais melhora: de 230,7 ms para 33,0 ms, cerca de um fotograma de vídeo a 30 fps.
  • Um fallback estrutural mantém a marcação original da Apple sempre que uma correção seria inválida, atinge o limite da janela de pesquisa ou não tem contexto de streaming.
  • Nove línguas: inglês, espanhol, francês, italiano, português, alemão, japonês, coreano e chinês. Os demais locales passam sem alteração.
  • Cerca de 0,7 MB de Core ML compilado em dois estágios, executados na CPU e no Neural Engine; um resultado típico é refinado em poucos milissegundos.

Primeiros passos

Adicione marcações de tempo por palavra ao seu app iOS or macOS em poucas linhas de código. Docs do Align.

iOS, macOS
Instalação
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")
Exemplo - Swift
import Align

let refiner = try await SpeechTimestampRefiner(locale: locale)
try await analyzer.start(inputSequence: inputs.recordingAudio(for: refiner))

for try await result in transcriber.results.refiningTimestamps(with: refiner) {
    result.words   // [WordTiming]: text, start, end, refined
}
Crie com um prompt
Add Align from Desert Ant Labs to this Swift project (iOS, macOS).

What it does: marcações de tempo por palavra no dispositivo para qualquer transcrição.

SDK:

Swift (iOS, macOS)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")

Reference:
- Model page: https://desertant.com/models/align/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
AndroidEm breve
Web, Node.jsEm breve

Especificações

Exatidão
20,2 ms de erro médio no LibriSpeech test-clean contra os 106,4 ms da Apple, e 43,9 ms nos nove idiomas contra os 124,2 ms da Apple
Tamanho no dispositivo
Cerca de 0,7 MB de Core ML compilado (dois estágios de 0,3 MB, mais o banco de filtros e o calibrador)
Línguas
Inglês, espanhol, francês, italiano, português, alemão, japonês, coreano, chinês
Modelo
Cascata de dois estágios, do grosseiro ao fino, sobre um espetrograma log-mel, com 121 mil parâmetros por estágio e um calibrador de árvores com gradient boosting
Plataformas
iOS 26, macOS 26, tvOS 26, visionOS 26 (Core ML), onde o SpeechAnalyzer vive

O Align corrige os tempos de um transcritor; não transcreve, e o SDK Swift precisa do SpeechAnalyzer da Apple, ou seja, iOS 26, macOS 26, tvOS 26 ou visionOS 26. O Align não promete melhorar todas as palavras.

O mecanismo de segurança que mantém o tempo original apanha correções que parecem arriscadas, não todas as erradas. Os números falados são o caso mais fraco: numa amostra pequena, o refinamento afastou as fronteiras dos dígitos da referência em vez de as deixar como estavam.

FAQ

O que é o Align?

Marcações de tempo por palavra no dispositivo, para qualquer transcritor. Corte, legende e destaque com cinco vezes mais precisão, a partir de 0,7 MB.

O Align é executado no dispositivo?

Sim. O Align é executado no dispositivo, sem qualquer chamada a servidores, por isso os dados ficam com o utilizador.

Que plataformas suporta o Align?

O Align é distribuído como um SDK nativo no dispositivo para Swift.

Quanto custa o Align?

Cada modelo é gratuito para até 100 mil dispositivos ativos mensais por SDK. Inferência ilimitada por utilizador. Contacte-nos para licenças personalizadas.

Qual é a precisão ou a rapidez do Align?

Os tempos por palavra da Apple no LibriSpeech test-clean erram em média 106,4 ms; o Align reduz isso para 20,2 ms, e 95% das palavras ficam a menos de 50 ms, a partir de um modelo de 0,7 MB.

Recursos