Desert Ant Labs

Align

Marcações de tempo por palavraDisponível

Marcações de tempo por palavra no dispositivo, para qualquer transcritor. Corte, legende e destaque com cinco vezes mais precisão, a partir de 0,7 MB.

Marcações de tempo precisas por palavra para qualquer transcrição.

A Apple diz que “world” vai de 2,61 a 3,04 segundos. O Align diz de 2,57 a 2,98. Corte ali e o corte fica limpo, a legenda acende na palavra, e o destaque começa onde o locutor começou.

Você mantém o transcritor da Apple. O Align lê o mesmo áudio que o SpeechAnalyzer já recebe e devolve as mesmas palavras com tempos de início e fim mais justos, em poucos milissegundos, a partir de um download de 0,7 MB. Em áudio limpo, isso reduz o erro médio da Apple de 113 ms para 45 ms.

Uma palavra que o Align não consegue melhorar mantém a marcação da Apple, então uma correção só pode ajudar ou deixar a palavra como está. Nove idiomas, e um locale fora deles passa com as marcações da Apple intactas.

Cinco vezes mais preciso.

Os tempos por palavra da Apple no LibriSpeech test-clean erram em média 106,4 ms; o Align reduz isso para 20,2 ms, e 95% das palavras ficam a menos de 50 ms, a partir de um modelo de 0,7 MB.

20,2 ms
Erro médio, LibriSpeech test-clean
Apple sem correção: 106,4 ms
5x
Mais preciso
de 106,4 ms para 20,2 ms
45,0 ms
Contra limites corrigidos à mão
WhisperX: 53,5 ms
0,7 MB
No dispositivo
Core ML compilado, dois estágios

Distância absoluta média em relação ao limite de palavra de referência, numa amostra de 500 trechos de cada split oficial do LibriSpeech, sem nenhum falante partilhado entre treino e avaliação

SplitApple brutoAlignAté 50 ms
test-clean106,4 ms20,2 ms95%
test-other111,6 ms24,8 ms92%

Avaliado com os pesos v1.0.0. As referências são estimativas de alinhamento forçado por máquina, do Qwen3-ForcedAligner combinado com um segundo alinhador, e não anotações humanas: os números mostram uma redução grande e consistente do erro de tempo, não uma verdade absoluta ao nível da amostra. A exceção é a comparação com o WhisperX, medida em 258 limites de palavra corrigidos à mão por uma pessoa sobre a forma de onda.

Casos de uso

Marcações de tempo precisas por palavra para qualquer transcrição.

Legendas palavra a palavra que acompanham

Acenda cada palavra conforme ela é dita em uma tela de legendas, uma tela de letras em estilo karaokê ou um app de aprendizado de idiomas, a partir da transcrição da Apple. As marcações caem na palavra, em vez de a um décimo de segundo dela.

Corte um clipe em uma palavra

Recorte uma gravação até uma citação em um editor de podcast ou um app de vídeo e faça o corte começar onde a palavra começa. Sem um quadro da palavra anterior, sem uma consoante cortada e sem ajuste manual na linha do tempo.

Destaque a palavra falada em uma transcrição

Role uma transcrição em sincronia com a reprodução em um gravador de reuniões ou um app de aulas, com o destaque avançando na palavra em vez de se adiantar ao áudio.

Busca que cai no momento exato

Pule para o segundo em que uma palavra foi dita em um acervo de gravações, no dispositivo. As marcações são precisas o bastante para o cursor de reprodução começar na palavra, e não no meio da anterior.

Inspiração

Ideias para construir com o Align. Copie um prompt para o seu agente de código e comece.

Align

Highlight each word as it's spoken, timed to the audio.

Align

Tighten a system transcriber's word timings so captions land on the word.

Align

Build a text-based video editor where selecting words trims the clip.

Align

Add bouncing word-by-word captions to vertical videos.

Align

Make transcript search jump the audio to the exact word.

O que o modelo faz

  • Corrige as marcações no nível da palavra que o SpeechTranscriber e o SpeechAnalyzer da Apple retornam, sem substituí-los: as mesmas palavras, a mesma superfície de resultado, valores de audioTimeRange mais justos.
  • Erro médio de tempo de 124,2 ms para 43,9 ms, com média macro entre os nove idiomas, para que nenhum idioma sozinho carregue o número. Em inglês vai além: de 106,4 ms para 20,2 ms.
  • Numa amostra de 500 trechos do LibriSpeech test-clean, 95% das palavras ficam a menos de 50 ms da referência, contra 37% antes. O décimo pior é o que mais melhora: de 230,7 ms para 33,0 ms, cerca de um quadro de vídeo a 30 fps.
  • Um fallback estrutural mantém a marcação original da Apple sempre que uma correção seria inválida, atinge a borda da janela de busca ou não tem contexto de streaming.
  • Nove idiomas: inglês, espanhol, francês, italiano, português, alemão, japonês, coreano e chinês. Os demais locales passam sem alteração.
  • Cerca de 0,7 MB de Core ML compilado em dois estágios, executados na CPU e no Neural Engine; um resultado típico é refinado em poucos milissegundos.

Primeiros passos

Adicione marcações de tempo por palavra ao seu app iOS or macOS em poucas linhas de código. Docs do Align.

iOS, macOS
Instalação
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")
Exemplo - Swift
import Align

let refiner = try await SpeechTimestampRefiner(locale: locale)
try await analyzer.start(inputSequence: inputs.recordingAudio(for: refiner))

for try await result in transcriber.results.refiningTimestamps(with: refiner) {
    result.words   // [WordTiming]: text, start, end, refined
}
Crie com um prompt
Add Align from Desert Ant Labs to this Swift project (iOS, macOS).

What it does: marcações de tempo por palavra no dispositivo para qualquer transcrição.

SDK:

Swift (iOS, macOS)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")

Reference:
- Model page: https://desertant.com/models/align/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
AndroidEm breve
Web, Node.jsEm breve

Especificações

Acurácia
20,2 ms de erro médio no LibriSpeech test-clean contra os 106,4 ms da Apple, e 43,9 ms nos nove idiomas contra os 124,2 ms da Apple
Tamanho no dispositivo
Cerca de 0,7 MB de Core ML compilado (dois estágios de 0,3 MB, mais o banco de filtros e o calibrador)
Idiomas
Inglês, espanhol, francês, italiano, português, alemão, japonês, coreano, chinês
Modelo
Cascata de dois estágios, do amplo ao fino, sobre um espectrograma log-mel, com 121 mil parâmetros por estágio e um calibrador de árvores com gradient boosting
Plataformas
iOS 26, macOS 26, tvOS 26, visionOS 26 (Core ML), onde o SpeechAnalyzer vive

O Align corrige os tempos de um transcritor; ele não transcreve, e o SDK Swift precisa do SpeechAnalyzer da Apple, ou seja, iOS 26, macOS 26, tvOS 26 ou visionOS 26. O Align não promete melhorar todas as palavras.

O mecanismo de segurança que mantém o tempo original detecta correções que parecem arriscadas, não todas as erradas. Números falados são o caso mais fraco: numa amostra pequena, o refinamento afastou os limites dos dígitos da referência em vez de os deixar como estavam.

FAQ

O que é o Align?

Marcações de tempo por palavra no dispositivo, para qualquer transcritor. Corte, legende e destaque com cinco vezes mais precisão, a partir de 0,7 MB.

O Align roda no dispositivo?

Sim. O Align roda no dispositivo, sem chamada a servidor, então os dados ficam com o usuário.

Quais plataformas o Align suporta?

O Align é distribuído como um SDK nativo no dispositivo para Swift.

Quanto custa o Align?

Cada modelo é gratuito para até 100 mil dispositivos ativos mensais por SDK. Inferência ilimitada por usuário. Fale conosco para licenças personalizadas.

Qual a precisão e a velocidade do Align?

Os tempos por palavra da Apple no LibriSpeech test-clean erram em média 106,4 ms; o Align reduz isso para 20,2 ms, e 95% das palavras ficam a menos de 50 ms, a partir de um modelo de 0,7 MB.

Recursos