Desert Ant Labs

Align

Timestamp per parolaDisponibile

Marcature temporali per parola sul dispositivo, per qualsiasi trascrittore. Taglia, sottotitola ed evidenzia con cinque volte più precisione, da 0,7 MB.

Timestamp per parola precisi per ogni trascrizione.

Apple dice che «world» va da 2,61 a 3,04 secondi. Align dice da 2,57 a 2,98. Taglia lì e il taglio è pulito, il sottotitolo si accende sulla parola, e l'evidenziazione parte da dove è partito chi parla.

Tieni il trascrittore di Apple. Align legge lo stesso audio che SpeechAnalyzer riceve già e restituisce le stesse parole con tempi di inizio e fine più precisi, in pochi millisecondi, da un download di 0,7 MB. Su audio pulito porta l'errore medio di Apple da 113 ms a 45 ms.

Una parola che Align non può migliorare mantiene il tempo di Apple, quindi una correzione può solo aiutare o lasciare la parola com'è. Nove lingue, e una lingua fuori da queste passa con i tempi di Apple intatti.

Cinque volte più preciso.

I tempi per parola di Apple su LibriSpeech test-clean sbagliano in media di 106,4 ms; Align li porta a 20,2 ms, e il 95% delle parole cade entro 50 ms, da un modello di 0,7 MB.

20,2 ms
Errore medio, LibriSpeech test-clean
Apple non corretto: 106,4 ms
5x
Più preciso
da 106,4 ms a 20,2 ms
45,0 ms
Su confini corretti a mano
WhisperX: 53,5 ms
0,7 MB
Sul dispositivo
Core ML compilato, due stadi

Distanza assoluta media dal confine di parola di riferimento, su un campione di 500 clip per ciascuno split ufficiale di LibriSpeech, senza alcun parlante condiviso tra addestramento e valutazione

SplitApple grezzoAlignEntro 50 ms
test-clean106,4 ms20,2 ms95%
test-other111,6 ms24,8 ms92%

Valutato sui pesi v1.0.0. I riferimenti sono stime di allineamento forzato prodotte da Qwen3-ForcedAligner combinato con un secondo allineatore, non annotazioni umane: i numeri mostrano una riduzione ampia e coerente dell'errore di tempo, non una verità esatta a livello di campione. Fa eccezione il confronto con WhisperX, misurato su 258 confini di parola corretti a mano da una persona sulla forma d'onda.

Casi d'uso

Timestamp per parola precisi per ogni trascrizione.

Sottotitoli parola per parola che stanno al passo

Accendi ogni parola nel momento in cui viene detta in una vista di sottotitoli, in una schermata di testi in stile karaoke o in un'app per imparare le lingue, dalla trascrizione di Apple. I tempi cadono sulla parola invece che un decimo di secondo più in là.

Taglia una clip su una parola

Ritaglia una registrazione fino a una citazione in un editor di podcast o in un'app video e fai partire il taglio da dove parte la parola. Nessun fotogramma della parola precedente, nessuna consonante mozzata, e nessuna correzione manuale sulla timeline.

Evidenzia la parola pronunciata in una trascrizione

Scorri una trascrizione al passo con la riproduzione in un registratore di riunioni o in un'app per le lezioni, con l'evidenziazione che si muove sulla parola invece di scappare avanti rispetto all'audio.

Una ricerca che cade sul momento giusto

Salta al secondo esatto in cui una parola è stata detta in un archivio di registrazioni, sul dispositivo. I tempi sono così precisi che la testina parte sulla parola e non a metà di quella precedente.

Ispirazione

Idee da costruire con Align. Copia un prompt nel tuo coding agent e parti.

Align

Highlight each word as it's spoken, timed to the audio.

Align

Tighten a system transcriber's word timings so captions land on the word.

Align

Build a text-based video editor where selecting words trims the clip.

Align

Add bouncing word-by-word captions to vertical videos.

Align

Make transcript search jump the audio to the exact word.

Cosa fa il modello

  • Corregge i tempi a livello di parola che restituiscono SpeechTranscriber e SpeechAnalyzer di Apple, senza sostituirli: stesse parole, stessa superficie di risultato, valori audioTimeRange più precisi.
  • Errore medio da 124,2 ms a 43,9 ms, mediato per macro sulle nove lingue perché nessuna lingua da sola regga il dato. In inglese va oltre: da 106,4 ms a 20,2 ms.
  • Su un campione di 500 clip di LibriSpeech test-clean, il 95% delle parole cade entro 50 ms dal riferimento, contro il 37% precedente. Il decimo peggiore migliora di più: da 230,7 ms a 33,0 ms, circa un fotogramma video a 30 fps.
  • Un fallback strutturale mantiene il timestamp originale di Apple ogni volta che una correzione sarebbe non valida, tocca il bordo della finestra di ricerca o non ha contesto di streaming.
  • Nove lingue: inglese, spagnolo, francese, italiano, portoghese, tedesco, giapponese, coreano e cinese. Le altre lingue passano invariate.
  • Circa 0,7 MB di Core ML compilato in due stadi, eseguiti su CPU e Neural Engine; un risultato tipico viene rifinito in pochi millisecondi.

Per iniziare

Aggiungi timestamp per parola alla tua app iOS or macOS in poche righe di codice. Documentazione di Align.

iOS, macOS
Installazione
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")
Esempio - Swift
import Align

let refiner = try await SpeechTimestampRefiner(locale: locale)
try await analyzer.start(inputSequence: inputs.recordingAudio(for: refiner))

for try await result in transcriber.results.refiningTimestamps(with: refiner) {
    result.words   // [WordTiming]: text, start, end, refined
}
Costruisci con un prompt
Add Align from Desert Ant Labs to this Swift project (iOS, macOS).

What it does: timestamp per parola on-device per qualsiasi trascrizione.

SDK:

Swift (iOS, macOS)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")

Reference:
- Model page: https://desertant.com/models/align/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
AndroidIn arrivo
Web, Node.jsIn arrivo

Specifiche

Accuratezza
20,2 ms di errore medio su LibriSpeech test-clean contro i 106,4 ms di Apple, e 43,9 ms sulle nove lingue contro i 124,2 ms di Apple
Dimensione sul dispositivo
Circa 0,7 MB di Core ML compilato (due stadi da 0,3 MB, più il banco di filtri e il calibratore)
Lingue
Inglese, spagnolo, francese, italiano, portoghese, tedesco, giapponese, coreano, cinese
Modello
Cascata a due stadi, dal grosso al fine, su uno spettrogramma log-mel, con 121 mila parametri per stadio e un calibratore ad alberi con gradient boosting
Piattaforme
iOS 26, macOS 26, tvOS 26, visionOS 26 (Core ML), dove vive SpeechAnalyzer

Align corregge i tempi di un trascrittore; non trascrive, e l'SDK Swift richiede SpeechAnalyzer di Apple, quindi iOS 26, macOS 26, tvOS 26 o visionOS 26. Align non promette di migliorare ogni parola.

Il ripiego che mantiene il tempo originale intercetta le correzioni che sembrano rischiose, non tutte quelle sbagliate. I numeri pronunciati sono il caso più debole: su un campione ridotto la rifinitura ha allontanato i confini delle cifre dal riferimento invece di lasciarli com'erano.

FAQ

Cos'è Align?

Marcature temporali per parola sul dispositivo, per qualsiasi trascrittore. Taglia, sottotitola ed evidenzia con cinque volte più precisione, da 0,7 MB.

Align funziona sul dispositivo?

Sì. Align funziona sul dispositivo, senza chiamate a un server, quindi i dati restano con l'utente.

Quali piattaforme supporta Align?

Align è distribuito come SDK nativo on-device per Swift.

Quanto costa Align?

Ogni modello è gratuito fino a 100k dispositivi attivi mensili per SDK. Inferenza illimitata per utente. Contattaci per licenze personalizzate.

Quanto è preciso o veloce Align?

I tempi per parola di Apple su LibriSpeech test-clean sbagliano in media di 106,4 ms; Align li porta a 20,2 ms, e il 95% delle parole cade entro 50 ms, da un modello di 0,7 MB.

Risorse