Desert Ant Labs

Align.

Marcações de tempo por palavraDisponível

Marcações de tempo por palavra no dispositivo, para qualquer transcritor. Corte, legende e destaque na palavra, com metade do erro, de um modelo de 0,7 MB.

Marcações de tempo precisas por palavra para qualquer transcrição.

A Apple diz que «world» vai de 2,61 a 3,04 segundos. O Align diz de 2,57 a 2,98. Corte ali e o corte fica limpo, a legenda acende na palavra, e o destaque começa onde o orador começou.

Você mantém o transcritor da Apple. O Align lê o mesmo áudio que o SpeechAnalyzer já recebe e devolve as mesmas palavras com tempos de início e fim mais justos, em poucos milissegundos, a partir de um download de 0,7 MB. Em áudio limpo, isso reduz o erro médio da Apple de 113 ms para 45 ms.

Uma palavra que o Align não consegue melhorar mantém a marcação da Apple, então uma correção só pode ajudar ou deixar a palavra como está. Nove línguas, e um locale fora deles passa com as marcações da Apple intactas.

Metade do erro de marcação.

As marcações de palavra da Apple erram 113 ms em média; o Align reduz isso para 45 ms, e três de cada quatro palavras caem a até 50 ms, a partir de um modelo de 0,7 MB.

45 ms
Erro médio, áudio limpo
Apple bruto: 113,5 ms
60%
Erro removido
áudio limpo e ruidoso igualmente
0,7 MB
No dispositivo
Core ML compilado, dois estágios

Distância absoluta média até a fronteira de palavra de referência, 223 gravações limpas e 210 ruidosas reservadas, em nove línguas

CondiçãoApple brutoAlignAté 50 ms
Clean113,5 ms44,9 ms75,1%
Noisy124,4 ms50,1 ms69,4%

Avaliado no runtime Swift distribuído e nos modelos Core ML incluídos. As referências são estimativas de alinhamento forçado por máquina do Qwen3-ForcedAligner, não anotações humanas, então os números mostram uma redução grande e consistente do erro de marcação da Apple, e não um referência exato por amostra.

Legendas palavra a palavra que acompanham

Acenda cada palavra conforme ela é dita num ecrã de legendas, num ecrã de letras em estilo karaokê ou num app de aprendizagem de línguas, a partir da transcrição da Apple. As marcações caem na palavra, em vez de a um décimo de segundo dela.

Corte um clipe numa palavra

Recorte uma gravação até uma citação num editor de podcast ou um app de vídeo e faça o corte começar onde a palavra começa. Sem um fotograma da palavra anterior, sem uma consoante cortada e sem ajuste manual na linha do tempo.

Destaque a palavra falada numa transcrição

Role uma transcrição em sincronia com a reprodução num gravador de reuniões ou um app de aulas, com o destaque a avançar na palavra em vez de se adiantar ao áudio.

Busca que cai no momento exato

Salte para o segundo em que uma palavra foi dita num acervo de gravações, no dispositivo. As marcações são precisas o bastante para o cursor de reprodução começar na palavra, e não no meio da anterior.

Inspiração

Ideias para construir com o Align. Copie um prompt para o seu agente de código e comece.

Align

Highlight each word as it's spoken, timed to the audio.

Align

Tighten a system transcriber's word timings so captions land on the word.

Align

Build a text-based video editor where selecting words trims the clip.

Align

Add bouncing word-by-word captions to vertical videos.

Align

Make transcript search jump the audio to the exact word.

O que o modelo faz

  • Corrige as marcações no nível da palavra que o SpeechTranscriber e o SpeechAnalyzer da Apple retornam, sem substituí-los: as mesmas palavras, a mesma superfície de resultado, valores de audioTimeRange mais justos.
  • Erro médio de marcação de 113,5 ms para 44,9 ms em áudio limpo e de 124,4 ms para 50,1 ms em áudio ruidoso, uma redução de 60%, medido em 433 gravações reservadas contra referências de alinhamento forçado.
  • 75,1% das palavras caem a até 50 ms da referência em áudio limpo, e 69,4% em áudio ruidoso.
  • Um fallback estrutural mantém a marcação original da Apple sempre que uma correção seria inválida, atinge o limite da janela de pesquisa ou não tem contexto de streaming.
  • Nove línguas: inglês, espanhol, francês, italiano, português, alemão, japonês, coreano e chinês. Os demais locales passam sem alteração.
  • Cerca de 0,7 MB de Core ML compilado em dois estágios, executados na CPU e no Neural Engine; um resultado típico é refinado em poucos milissegundos.

Primeiros passos

Adicione marcações de tempo por palavra ao seu app iOS or macOS em poucas linhas de código. Docs do Align.

iOS, macOS
Instalação
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")
Exemplo - Swift
import Align

let refiner = try await SpeechTimestampRefiner(locale: locale)
try await analyzer.start(inputSequence: inputs.recordingAudio(for: refiner))

for try await result in transcriber.results.refiningTimestamps(with: refiner) {
    result.words   // [WordTiming]: text, start, end, refined
}
Crie com um prompt
Add Align from Desert Ant Labs to this Swift project (iOS, macOS).

What it does: marcações de tempo por palavra no dispositivo para qualquer transcrição.

SDK:

Swift (iOS, macOS)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")

Reference:
- Model page: https://desertant.com/models/align/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
AndroidEm breve
Web, Node.jsEm breve

Especificações

Exatidão
44,9 ms de erro médio em áudio limpo e 50,1 ms em ruidoso, contra 113,5 ms e 124,4 ms da Apple
Tamanho no dispositivo
Cerca de 0,7 MB de Core ML compilado (dois estágios de 0,3 MB mais o banco de filtros e o calibrador)
Línguas
Inglês, espanhol, francês, italiano, português, alemão, japonês, coreano, chinês
Modelo
Cascata de dois estágios, do grosso ao fino, sobre um espectrograma log-mel, cerca de 117 mil parâmetros por estágio, com um calibrador por gradient boosting
Plataformas
iOS 26, macOS 26, tvOS 26, visionOS 26 (Core ML), onde o SpeechAnalyzer vive

O Align corrige as marcações da Apple; ele não transcreve, e precisa do SpeechAnalyzer da Apple, o que significa iOS 26, macOS 26, tvOS 26 ou visionOS 26. O Align não pode prometer melhorar cada palavra.

O fallback que mantém a marcação da Apple pega as correções que parecem inseguras, não toda correção errada. Inglês, italiano, japonês e coreano são os mais fracos das nove línguas sob as referências atuais.

FAQ

O que é o Align?

Marcações de tempo por palavra no dispositivo, para qualquer transcritor. Corte, legende e destaque na palavra, com metade do erro, de um modelo de 0,7 MB.

O Align é executado no dispositivo?

Sim. O Align é executado no dispositivo, sem qualquer chamada a servidores, por isso os dados ficam com o utilizador.

Que plataformas suporta o Align?

O Align é distribuído como um SDK nativo no dispositivo para Swift.

Quanto custa o Align?

Cada modelo é gratuito para até 100 mil dispositivos ativos mensais por SDK. Inferência ilimitada por utilizador. Contacte-nos para licenças personalizadas.

Qual é a precisão ou a rapidez do Align?

As marcações de palavra da Apple erram 113 ms em média; o Align reduz isso para 45 ms, e três de cada quatro palavras caem a até 50 ms, a partir de um modelo de 0,7 MB.

Recursos