Align.
Timestamp per parola on-device, per qualsiasi trascrittore. Taglia, sottotitola ed evidenzia sulla parola, con metà dell'errore, da un modello di 0,7 MB.
Timestamp per parola precisi per ogni trascrizione.
Apple dice che «world» va da 2,61 a 3,04 secondi. Align dice da 2,57 a 2,98. Taglia lì e il taglio è pulito, il sottotitolo si accende sulla parola, e l'evidenziazione parte da dove è partito chi parla.
Tieni il trascrittore di Apple. Align legge lo stesso audio che SpeechAnalyzer riceve già e restituisce le stesse parole con tempi di inizio e fine più precisi, in pochi millisecondi, da un download di 0,7 MB. Su audio pulito porta l'errore medio di Apple da 113 ms a 45 ms.
Una parola che Align non può migliorare mantiene il tempo di Apple, quindi una correzione può solo aiutare o lasciare la parola com'è. Nove lingue, e una lingua fuori da queste passa con i tempi di Apple intatti.
Metà dell'errore sui tempi.
I tempi delle parole di Apple sbagliano in media di 113 ms; Align li porta a 45 ms, e tre parole su quattro cadono entro 50 ms, da un modello da 0,7 MB.
Distanza media assoluta dal confine di parola di riferimento, 223 registrazioni pulite e 210 rumorose tenute da parte, in nove lingue
| Condizione | Apple grezzo | Align | Entro 50 ms |
|---|---|---|---|
| Clean | 113,5 ms | 44,9 ms | 75,1% |
| Noisy | 124,4 ms | 50,1 ms | 69,4% |
Valutato sul runtime Swift distribuito e sui modelli Core ML inclusi. I riferimenti sono stime di allineamento forzato automatico da Qwen3-ForcedAligner, non annotazioni umane, quindi i valori mostrano una riduzione ampia e costante dell'errore sui tempi di Apple più che un dato di riferimento accurato al campione.
Sottotitoli parola per parola che stanno al passo
Accendi ogni parola nel momento in cui viene detta in una vista di sottotitoli, in una schermata di testi in stile karaoke o in un'app per imparare le lingue, dalla trascrizione di Apple. I tempi cadono sulla parola invece che un decimo di secondo più in là.
Taglia una clip su una parola
Ritaglia una registrazione fino a una citazione in un editor di podcast o in un'app video e fai partire il taglio da dove parte la parola. Nessun fotogramma della parola precedente, nessuna consonante mozzata, e nessuna correzione manuale sulla timeline.
Evidenzia la parola pronunciata in una trascrizione
Scorri una trascrizione al passo con la riproduzione in un registratore di riunioni o in un'app per le lezioni, con l'evidenziazione che si muove sulla parola invece di scappare avanti rispetto all'audio.
Una ricerca che cade sul momento giusto
Salta al secondo esatto in cui una parola è stata detta in un archivio di registrazioni, sul dispositivo. I tempi sono così precisi che la testina parte sulla parola e non a metà di quella precedente.
Ispirazione
Idee da costruire con Align. Copia un prompt nel tuo coding agent e parti.
Highlight each word as it's spoken, timed to the audio.
Run Apple's SpeechTranscriber with Desert Ant's Align attached as a timestamp refiner, then highlight each word using its refined time range. Align tightens Apple's word timings on-device; iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Tighten a system transcriber's word timings so captions land on the word.
Attach Desert Ant's Align as a refiner to Apple's SpeechAnalyzer / SpeechTranscriber so its word-level timings tighten and captions and cuts land exactly on the word. iOS 26 / macOS 26, on-device. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Build a text-based video editor where selecting words trims the clip.
Transcribe with Apple's SpeechTranscriber and Desert Ant's Align refiner for word-exact timings, then let the user select words to trim the video to that span. Deleting a sentence deletes the footage. iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Add bouncing word-by-word captions to vertical videos.
Add animated word-by-word captions to short vertical videos, timed with Desert Ant's Align attached to Apple's SpeechTranscriber so each word pops exactly when it's said. On-device, iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Make transcript search jump the audio to the exact word.
In an Apple media app, transcribe with SpeechTranscriber and Desert Ant's Align refiner so a search result seeks the audio or video to the precise word, not the sentence. iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Cosa fa il modello
- Corregge i tempi a livello di parola che restituiscono
SpeechTranscribereSpeechAnalyzerdi Apple, senza sostituirli: stesse parole, stessa superficie di risultato, valoriaudioTimeRangepiù precisi. - Errore medio dei tempi da 113,5 ms a 44,9 ms su audio pulito e da 124,4 ms a 50,1 ms su audio rumoroso, una riduzione del 60%, misurato su 433 registrazioni tenute da parte rispetto a riferimenti di allineamento forzato.
- Il 75,1% delle parole cade entro 50 ms dal riferimento su audio pulito, il 69,4% su audio rumoroso.
- Un fallback strutturale mantiene il timestamp originale di Apple ogni volta che una correzione sarebbe non valida, tocca il bordo della finestra di ricerca o non ha contesto di streaming.
- Nove lingue: inglese, spagnolo, francese, italiano, portoghese, tedesco, giapponese, coreano e cinese. Le altre lingue passano invariate.
- Circa 0,7 MB di Core ML compilato in due stadi, eseguiti su CPU e Neural Engine; un risultato tipico è affinato in pochi millisecondi.
Per iniziare
Aggiungi timestamp per parola alla tua app iOS or macOS in poche righe di codice. Documentazione di Align.
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")
import Align
let refiner = try await SpeechTimestampRefiner(locale: locale)
try await analyzer.start(inputSequence: inputs.recordingAudio(for: refiner))
for try await result in transcriber.results.refiningTimestamps(with: refiner) {
result.words // [WordTiming]: text, start, end, refined
}
Add Align from Desert Ant Labs to this Swift project (iOS, macOS). What it does: timestamp per parola on-device per qualsiasi trascrizione. SDK: Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0") // target dependency .product(name: "Align", package: "desert-ant-core") Reference: - Model page: https://desertant.com/models/align/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Specifiche
- Accuratezza
- Errore medio di 44,9 ms su audio pulito, 50,1 ms su rumoroso, contro i 113,5 ms e 124,4 ms di Apple
- Dimensione sul dispositivo
- Circa 0,7 MB di Core ML compilato (due stadi da 0,3 MB più il banco di filtri e il calibratore)
- Lingue
- Inglese, spagnolo, francese, italiano, portoghese, tedesco, giapponese, coreano, cinese
- Modello
- Cascata a due stadi dal grossolano al fine su uno spettrogramma log-mel, circa 117k parametri per stadio, con un calibratore a gradient boosting
- Piattaforme
- iOS 26, macOS 26, tvOS 26, visionOS 26 (Core ML), dove vive SpeechAnalyzer
Align corregge i tempi di Apple; non trascrive, e ha bisogno di SpeechAnalyzer di Apple, cioè iOS 26, macOS 26, tvOS 26 o visionOS 26. Align non può promettere di migliorare ogni parola.
Il fallback che mantiene il tempo di Apple intercetta le correzioni che sembrano rischiose, non ogni correzione sbagliata. Inglese, italiano, giapponese e coreano sono le più deboli delle nove lingue con i riferimenti attuali.
FAQ
Cos'è Align?
Timestamp per parola on-device, per qualsiasi trascrittore. Taglia, sottotitola ed evidenzia sulla parola, con metà dell'errore, da un modello di 0,7 MB.
Align funziona sul dispositivo?
Sì. Align funziona sul dispositivo, senza chiamate a un server, quindi i dati restano con l'utente.
Quali piattaforme supporta Align?
Align è distribuito come SDK nativo on-device per Swift.
Quanto costa Align?
Ogni modello è gratuito fino a 100k dispositivi attivi mensili per SDK. Inferenza illimitata per utente. Contattaci per licenze personalizzate.
Quanto è preciso o veloce Align?
I tempi delle parole di Apple sbagliano in media di 113 ms; Align li porta a 45 ms, e tre parole su quattro cadono entro 50 ms, da un modello da 0,7 MB.