Align
Woordtijdstempels op het apparaat, voor elke transcriptie. Knip, ondertitel en markeer op het woord, vijf keer nauwkeuriger, vanaf 0,7 MB.

Precieze woordtijdstempels voor elk transcript.
Apple zegt dat “world” loopt van 2,61 tot 3,04 seconden. Align zegt 2,57 tot 2,98. Knip daar en de knip is schoon, de ondertitel licht op bij het woord, en de markering begint waar de spreker begon.
Je houdt de transcriber van Apple. Align leest dezelfde audio die SpeechAnalyzer al krijgt en geeft dezelfde woorden terug met strakkere begin- en eindtijden, in een paar milliseconden, uit een download van 0,7 MB. Op schone audio brengt dat de gemiddelde afwijking van Apple van 113 ms naar 45 ms.
Een woord dat Align niet kan verbeteren, houdt de timing van Apple, dus een correctie kan alleen helpen of het woord met rust laten. Negen talen, en een taal daarbuiten gaat er ongewijzigd doorheen, met de timings van Apple onaangeroerd.
Vijf keer nauwkeuriger.
Apple's woordtijden op LibriSpeech test-clean zitten er gemiddeld 106,4 ms naast; Align brengt dat naar 20,2 ms, en 95% van de woorden valt binnen 50 ms, uit een model van 0,7 MB.
Gemiddelde absolute afstand tot de referentiewoordgrens, in een steekproef van 500 clips uit elke officiële LibriSpeech-split, zonder gedeelde sprekers tussen training en evaluatie
| Split | Apple ruw | Align | Binnen 50 ms |
|---|---|---|---|
| test-clean | 106,4ms | 20,2ms | 95% |
| test-other | 111,6ms | 24,8ms | 92% |
Geëvalueerd op de v1.0.0-gewichten. De referenties zijn machinale forced-alignment-schattingen van Qwen3-ForcedAligner gecombineerd met een tweede aligner, geen menselijke annotaties: de cijfers tonen een grote en consistente verlaging van de tijdfout, geen exacte waarheid op steekproefniveau. De uitzondering is de vergelijking met WhisperX, gemeten op 258 woordgrenzen die een mens met de hand op de golfvorm heeft gecorrigeerd.
Toepassingen
Precieze woordtijdstempels voor elk transcript.
Ondertitels woord voor woord die bijblijven
Laat elk woord oplichten terwijl het wordt gezegd in een ondertitelweergave, een karaoke-achtig songtekstscherm of een taalleer-app, vanuit het transcript van Apple. De timings landen op het woord in plaats van een tiende seconde ernaast.
Een clip op een woord knippen
Trim een opname tot een citaat in een podcast-editor of een video-app en laat de knip beginnen waar het woord begint. Geen frame van het vorige woord, geen afgekapte medeklinker, en geen handmatig duwtje op de tijdlijn.
Het gesproken woord in een transcript markeren
Scroll een transcript in de pas met het afspelen in een vergaderrecorder of een college-app, waarbij de markering met het woord meebeweegt in plaats van vooruit te lopen op de audio.
Zoeken dat op het moment landt
Spring naar de seconde waarop een woord werd gezegd in een archief van opnames, op het apparaat. De timings zijn strak genoeg dat de afspeelkop op het woord begint en niet midden in het vorige.
Inspiratie
Ideeën om te bouwen met Align. Kopieer een prompt naar je coding-agent en ga.
Highlight each word as it's spoken, timed to the audio.
Run Apple's SpeechTranscriber with Desert Ant's Align attached as a timestamp refiner, then highlight each word using its refined time range. Align tightens Apple's word timings on-device; iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Tighten a system transcriber's word timings so captions land on the word.
Attach Desert Ant's Align as a refiner to Apple's SpeechAnalyzer / SpeechTranscriber so its word-level timings tighten and captions and cuts land exactly on the word. iOS 26 / macOS 26, on-device. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Build a text-based video editor where selecting words trims the clip.
Transcribe with Apple's SpeechTranscriber and Desert Ant's Align refiner for word-exact timings, then let the user select words to trim the video to that span. Deleting a sentence deletes the footage. iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Add bouncing word-by-word captions to vertical videos.
Add animated word-by-word captions to short vertical videos, timed with Desert Ant's Align attached to Apple's SpeechTranscriber so each word pops exactly when it's said. On-device, iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Make transcript search jump the audio to the exact word.
In an Apple media app, transcribe with SpeechTranscriber and Desert Ant's Align refiner so a search result seeks the audio or video to the precise word, not the sentence. iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Wat het model doet
- Corrigeert de timings op woordniveau die Apple's
SpeechTranscriberenSpeechAnalyzerteruggeven, zonder ze te vervangen: dezelfde woorden, hetzelfde resultaatoppervlak, strakkereaudioTimeRange-waarden. - Gemiddelde tijdfout van 124,2 ms naar 43,9 ms, macro-gemiddeld over alle negen talen zodat geen enkele taal het cijfer alleen draagt. In het Engels gaat het verder: van 106,4 ms naar 20,2 ms.
- In een steekproef van 500 clips uit LibriSpeech test-clean valt 95% van de woorden binnen 50 ms van de referentie, eerder 37%. Het slechtste tiende deel verbetert het meest: van 230,7 ms naar 33,0 ms, ongeveer één videoframe bij 30fps.
- Een structurele fallback behoudt het oorspronkelijke tijdstempel van Apple telkens als een correctie ongeldig zou zijn, de rand van het zoekvenster raakt of streamingcontext mist.
- Negen talen: Engels, Spaans, Frans, Italiaans, Portugees, Duits, Japans, Koreaans en Chinees. Andere talen gaan er ongewijzigd doorheen.
- Ongeveer 0,7 MB gecompileerde Core ML in twee trappen, uitgevoerd op de CPU en de Neural Engine; een typisch resultaat is in enkele milliseconden bijgesteld.
Aan de slag
Voeg woordtijdstempels toe aan je iOS or macOS-app in een paar regels code. Align docs.
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")
import Align
let refiner = try await SpeechTimestampRefiner(locale: locale)
try await analyzer.start(inputSequence: inputs.recordingAudio(for: refiner))
for try await result in transcriber.results.refiningTimestamps(with: refiner) {
result.words // [WordTiming]: text, start, end, refined
}
Add Align from Desert Ant Labs to this Swift project (iOS, macOS). What it does: on-device woordtijdstempels voor elk transcript. SDK: Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0") // target dependency .product(name: "Align", package: "desert-ant-core") Reference: - Model page: https://desertant.com/models/align/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Specs
- Nauwkeurigheid
- 20,2 ms gemiddelde fout op LibriSpeech test-clean tegenover Apple's 106,4 ms, en 43,9 ms over alle negen talen tegenover Apple's 124,2 ms
- Grootte op het apparaat
- Ongeveer 0,7 MB gecompileerde Core ML (twee trappen van 0,3 MB, plus de filterbank en de calibrator)
- Talen
- Engels, Spaans, Frans, Italiaans, Portugees, Duits, Japans, Koreaans, Chinees
- Model
- Cascade in twee trappen, van grof naar fijn, over een log-mel-spectrogram, met 121 duizend parameters per trap en een gradient-boosting-calibrator
- Platforms
- iOS 26, macOS 26, tvOS 26, visionOS 26 (Core ML), waar SpeechAnalyzer leeft
Align corrigeert de tijden van een transcriptie; het transcribeert niet, en de Swift-SDK heeft Apple's SpeechAnalyzer nodig, dus iOS 26, macOS 26, tvOS 26 of visionOS 26. Align belooft niet elk woord te verbeteren.
De terugval die het oorspronkelijke tijdstempel behoudt, vangt correcties af die onveilig lijken, niet alle foute. Uitgesproken getallen zijn het zwakste geval: in een kleine steekproef verschoof de correctie de cijfergrenzen verder van de referentie in plaats van ze te laten staan.
FAQ
Wat is Align?
Woordtijdstempels op het apparaat, voor elke transcriptie. Knip, ondertitel en markeer op het woord, vijf keer nauwkeuriger, vanaf 0,7 MB.
Draait Align op het apparaat?
Ja. Align draait op het apparaat, zonder serveraanroep, dus de data blijft bij de gebruiker.
Welke platforms ondersteunt Align?
Align wordt geleverd als een native on-device SDK voor Swift.
Hoeveel kost Align?
Elk model is gratis voor maximaal 100k maandelijks actieve apparaten per SDK. Onbeperkte inference per gebruiker. Neem contact op voor aangepaste licenties.
Hoe nauwkeurig of snel is Align?
Apple's woordtijden op LibriSpeech test-clean zitten er gemiddeld 106,4 ms naast; Align brengt dat naar 20,2 ms, en 95% van de woorden valt binnen 50 ms, uit een model van 0,7 MB.