Align
Marcature temporali per parola sul dispositivo, per qualsiasi trascrittore. Taglia, sottotitola ed evidenzia con cinque volte più precisione, da 0,7 MB.

Timestamp per parola precisi per ogni trascrizione.
Apple dice che «world» va da 2,61 a 3,04 secondi. Align dice da 2,57 a 2,98. Taglia lì e il taglio è pulito, il sottotitolo si accende sulla parola, e l'evidenziazione parte da dove è partito chi parla.
Tieni il trascrittore di Apple. Align legge lo stesso audio che SpeechAnalyzer riceve già e restituisce le stesse parole con tempi di inizio e fine più precisi, in pochi millisecondi, da un download di 0,7 MB. Su audio pulito porta l'errore medio di Apple da 113 ms a 45 ms.
Una parola che Align non può migliorare mantiene il tempo di Apple, quindi una correzione può solo aiutare o lasciare la parola com'è. Nove lingue, e una lingua fuori da queste passa con i tempi di Apple intatti.
Cinque volte più preciso.
I tempi per parola di Apple su LibriSpeech test-clean sbagliano in media di 106,4 ms; Align li porta a 20,2 ms, e il 95% delle parole cade entro 50 ms, da un modello di 0,7 MB.
Distanza assoluta media dal confine di parola di riferimento, su un campione di 500 clip per ciascuno split ufficiale di LibriSpeech, senza alcun parlante condiviso tra addestramento e valutazione
| Split | Apple grezzo | Align | Entro 50 ms |
|---|---|---|---|
| test-clean | 106,4 ms | 20,2 ms | 95% |
| test-other | 111,6 ms | 24,8 ms | 92% |
Valutato sui pesi v1.0.0. I riferimenti sono stime di allineamento forzato prodotte da Qwen3-ForcedAligner combinato con un secondo allineatore, non annotazioni umane: i numeri mostrano una riduzione ampia e coerente dell'errore di tempo, non una verità esatta a livello di campione. Fa eccezione il confronto con WhisperX, misurato su 258 confini di parola corretti a mano da una persona sulla forma d'onda.
Casi d'uso
Timestamp per parola precisi per ogni trascrizione.
Sottotitoli parola per parola che stanno al passo
Accendi ogni parola nel momento in cui viene detta in una vista di sottotitoli, in una schermata di testi in stile karaoke o in un'app per imparare le lingue, dalla trascrizione di Apple. I tempi cadono sulla parola invece che un decimo di secondo più in là.
Taglia una clip su una parola
Ritaglia una registrazione fino a una citazione in un editor di podcast o in un'app video e fai partire il taglio da dove parte la parola. Nessun fotogramma della parola precedente, nessuna consonante mozzata, e nessuna correzione manuale sulla timeline.
Evidenzia la parola pronunciata in una trascrizione
Scorri una trascrizione al passo con la riproduzione in un registratore di riunioni o in un'app per le lezioni, con l'evidenziazione che si muove sulla parola invece di scappare avanti rispetto all'audio.
Una ricerca che cade sul momento giusto
Salta al secondo esatto in cui una parola è stata detta in un archivio di registrazioni, sul dispositivo. I tempi sono così precisi che la testina parte sulla parola e non a metà di quella precedente.
Ispirazione
Idee da costruire con Align. Copia un prompt nel tuo coding agent e parti.
Highlight each word as it's spoken, timed to the audio.
Run Apple's SpeechTranscriber with Desert Ant's Align attached as a timestamp refiner, then highlight each word using its refined time range. Align tightens Apple's word timings on-device; iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Tighten a system transcriber's word timings so captions land on the word.
Attach Desert Ant's Align as a refiner to Apple's SpeechAnalyzer / SpeechTranscriber so its word-level timings tighten and captions and cuts land exactly on the word. iOS 26 / macOS 26, on-device. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Build a text-based video editor where selecting words trims the clip.
Transcribe with Apple's SpeechTranscriber and Desert Ant's Align refiner for word-exact timings, then let the user select words to trim the video to that span. Deleting a sentence deletes the footage. iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Add bouncing word-by-word captions to vertical videos.
Add animated word-by-word captions to short vertical videos, timed with Desert Ant's Align attached to Apple's SpeechTranscriber so each word pops exactly when it's said. On-device, iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Make transcript search jump the audio to the exact word.
In an Apple media app, transcribe with SpeechTranscriber and Desert Ant's Align refiner so a search result seeks the audio or video to the precise word, not the sentence. iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Cosa fa il modello
- Corregge i tempi a livello di parola che restituiscono
SpeechTranscribereSpeechAnalyzerdi Apple, senza sostituirli: stesse parole, stessa superficie di risultato, valoriaudioTimeRangepiù precisi. - Errore medio da 124,2 ms a 43,9 ms, mediato per macro sulle nove lingue perché nessuna lingua da sola regga il dato. In inglese va oltre: da 106,4 ms a 20,2 ms.
- Su un campione di 500 clip di LibriSpeech test-clean, il 95% delle parole cade entro 50 ms dal riferimento, contro il 37% precedente. Il decimo peggiore migliora di più: da 230,7 ms a 33,0 ms, circa un fotogramma video a 30 fps.
- Un fallback strutturale mantiene il timestamp originale di Apple ogni volta che una correzione sarebbe non valida, tocca il bordo della finestra di ricerca o non ha contesto di streaming.
- Nove lingue: inglese, spagnolo, francese, italiano, portoghese, tedesco, giapponese, coreano e cinese. Le altre lingue passano invariate.
- Circa 0,7 MB di Core ML compilato in due stadi, eseguiti su CPU e Neural Engine; un risultato tipico viene rifinito in pochi millisecondi.
Per iniziare
Aggiungi timestamp per parola alla tua app iOS or macOS in poche righe di codice. Documentazione di Align.
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")
import Align
let refiner = try await SpeechTimestampRefiner(locale: locale)
try await analyzer.start(inputSequence: inputs.recordingAudio(for: refiner))
for try await result in transcriber.results.refiningTimestamps(with: refiner) {
result.words // [WordTiming]: text, start, end, refined
}
Add Align from Desert Ant Labs to this Swift project (iOS, macOS). What it does: timestamp per parola on-device per qualsiasi trascrizione. SDK: Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0") // target dependency .product(name: "Align", package: "desert-ant-core") Reference: - Model page: https://desertant.com/models/align/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Specifiche
- Accuratezza
- 20,2 ms di errore medio su LibriSpeech test-clean contro i 106,4 ms di Apple, e 43,9 ms sulle nove lingue contro i 124,2 ms di Apple
- Dimensione sul dispositivo
- Circa 0,7 MB di Core ML compilato (due stadi da 0,3 MB, più il banco di filtri e il calibratore)
- Lingue
- Inglese, spagnolo, francese, italiano, portoghese, tedesco, giapponese, coreano, cinese
- Modello
- Cascata a due stadi, dal grosso al fine, su uno spettrogramma log-mel, con 121 mila parametri per stadio e un calibratore ad alberi con gradient boosting
- Piattaforme
- iOS 26, macOS 26, tvOS 26, visionOS 26 (Core ML), dove vive SpeechAnalyzer
Align corregge i tempi di un trascrittore; non trascrive, e l'SDK Swift richiede SpeechAnalyzer di Apple, quindi iOS 26, macOS 26, tvOS 26 o visionOS 26. Align non promette di migliorare ogni parola.
Il ripiego che mantiene il tempo originale intercetta le correzioni che sembrano rischiose, non tutte quelle sbagliate. I numeri pronunciati sono il caso più debole: su un campione ridotto la rifinitura ha allontanato i confini delle cifre dal riferimento invece di lasciarli com'erano.
FAQ
Cos'è Align?
Marcature temporali per parola sul dispositivo, per qualsiasi trascrittore. Taglia, sottotitola ed evidenzia con cinque volte più precisione, da 0,7 MB.
Align funziona sul dispositivo?
Sì. Align funziona sul dispositivo, senza chiamate a un server, quindi i dati restano con l'utente.
Quali piattaforme supporta Align?
Align è distribuito come SDK nativo on-device per Swift.
Quanto costa Align?
Ogni modello è gratuito fino a 100k dispositivi attivi mensili per SDK. Inferenza illimitata per utente. Contattaci per licenze personalizzate.
Quanto è preciso o veloce Align?
I tempi per parola di Apple su LibriSpeech test-clean sbagliano in media di 106,4 ms; Align li porta a 20,2 ms, e il 95% delle parole cade entro 50 ms, da un modello di 0,7 MB.