Align.
Woordtijdstempels op het apparaat, voor elke transcriber. Knip, ondertitel en markeer op het woord, met de helft van de fout, uit een model van 0,7 MB.
Precieze woordtijdstempels voor elk transcript.
Apple zegt dat “world” loopt van 2,61 tot 3,04 seconden. Align zegt 2,57 tot 2,98. Knip daar en de knip is schoon, de ondertitel licht op bij het woord, en de markering begint waar de spreker begon.
Je houdt de transcriber van Apple. Align leest dezelfde audio die SpeechAnalyzer al krijgt en geeft dezelfde woorden terug met strakkere begin- en eindtijden, in een paar milliseconden, uit een download van 0,7 MB. Op schone audio brengt dat de gemiddelde afwijking van Apple van 113 ms naar 45 ms.
Een woord dat Align niet kan verbeteren, houdt de timing van Apple, dus een correctie kan alleen helpen of het woord met rust laten. Negen talen, en een taal daarbuiten gaat er ongewijzigd doorheen, met de timings van Apple onaangeroerd.
De helft van de timingfout.
De woordtimings van Apple zitten er gemiddeld 113 ms naast; Align brengt dat naar 45 ms, en drie op de vier woorden landen binnen 50 ms, uit een model van 0,7 MB.
Gemiddelde absolute afstand tot de referentie-woordgrens, 223 schone en 210 opnames met ruis, apart gehouden, in negen talen
| Conditie | Apple ruw | Align | Binnen 50 ms |
|---|---|---|---|
| Clean | 113,5ms | 44,9ms | 75,1% |
| Noisy | 124,4ms | 50,1ms | 69,4% |
Geëvalueerd op de uitgeleverde Swift-runtime en de meegeleverde Core ML-modellen. De referenties zijn machinale forced-alignment-schattingen van Qwen3-ForcedAligner, geen menselijke annotaties, dus de cijfers tonen een grote, consistente reductie van de timingfout van Apple in plaats van een op de sample nauwkeurige gouden standaard.
Ondertitels woord voor woord die bijblijven
Laat elk woord oplichten terwijl het wordt gezegd in een ondertitelweergave, een karaoke-achtig songtekstscherm of een taalleer-app, vanuit het transcript van Apple. De timings landen op het woord in plaats van een tiende seconde ernaast.
Een clip op een woord knippen
Trim een opname tot een citaat in een podcast-editor of een video-app en laat de knip beginnen waar het woord begint. Geen frame van het vorige woord, geen afgekapte medeklinker, en geen handmatig duwtje op de tijdlijn.
Het gesproken woord in een transcript markeren
Scroll een transcript in de pas met het afspelen in een vergaderrecorder of een college-app, waarbij de markering met het woord meebeweegt in plaats van vooruit te lopen op de audio.
Zoeken dat op het moment landt
Spring naar de seconde waarop een woord werd gezegd in een archief van opnames, op het apparaat. De timings zijn strak genoeg dat de afspeelkop op het woord begint en niet midden in het vorige.
Inspiratie
Ideeën om te bouwen met Align. Kopieer een prompt naar je coding-agent en ga.
Highlight each word as it's spoken, timed to the audio.
Run Apple's SpeechTranscriber with Desert Ant's Align attached as a timestamp refiner, then highlight each word using its refined time range. Align tightens Apple's word timings on-device; iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Tighten a system transcriber's word timings so captions land on the word.
Attach Desert Ant's Align as a refiner to Apple's SpeechAnalyzer / SpeechTranscriber so its word-level timings tighten and captions and cuts land exactly on the word. iOS 26 / macOS 26, on-device. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Build a text-based video editor where selecting words trims the clip.
Transcribe with Apple's SpeechTranscriber and Desert Ant's Align refiner for word-exact timings, then let the user select words to trim the video to that span. Deleting a sentence deletes the footage. iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Add bouncing word-by-word captions to vertical videos.
Add animated word-by-word captions to short vertical videos, timed with Desert Ant's Align attached to Apple's SpeechTranscriber so each word pops exactly when it's said. On-device, iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Make transcript search jump the audio to the exact word.
In an Apple media app, transcribe with SpeechTranscriber and Desert Ant's Align refiner so a search result seeks the audio or video to the precise word, not the sentence. iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Wat het model doet
- Corrigeert de timings op woordniveau die Apple's
SpeechTranscriberenSpeechAnalyzerteruggeven, zonder ze te vervangen: dezelfde woorden, hetzelfde resultaatoppervlak, strakkereaudioTimeRange-waarden. - Gemiddelde timingfout van 113,5 ms naar 44,9 ms op schone audio en van 124,4 ms naar 50,1 ms op audio met ruis, een reductie van 60%, gemeten op 433 apart gehouden opnames tegen forced-alignment-referenties.
- 75,1% van de woorden landt binnen 50 ms van de referentie op schone audio, 69,4% op audio met ruis.
- Een structurele fallback behoudt het oorspronkelijke tijdstempel van Apple telkens als een correctie ongeldig zou zijn, de rand van het zoekvenster raakt of streamingcontext mist.
- Negen talen: Engels, Spaans, Frans, Italiaans, Portugees, Duits, Japans, Koreaans en Chinees. Andere talen gaan er ongewijzigd doorheen.
- Ongeveer 0,7 MB gecompileerde Core ML in twee fasen, uitgevoerd op de CPU en Neural Engine; een typisch resultaat wordt in een paar milliseconden verfijnd.
Aan de slag
Voeg woordtijdstempels toe aan je iOS or macOS-app in een paar regels code. Align docs.
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")
import Align
let refiner = try await SpeechTimestampRefiner(locale: locale)
try await analyzer.start(inputSequence: inputs.recordingAudio(for: refiner))
for try await result in transcriber.results.refiningTimestamps(with: refiner) {
result.words // [WordTiming]: text, start, end, refined
}
Add Align from Desert Ant Labs to this Swift project (iOS, macOS). What it does: on-device woordtijdstempels voor elk transcript. SDK: Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0") // target dependency .product(name: "Align", package: "desert-ant-core") Reference: - Model page: https://desertant.com/models/align/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Specs
- Nauwkeurigheid
- 44,9 ms gemiddelde fout op schone audio, 50,1 ms op audio met ruis, tegenover 113,5 ms en 124,4 ms van Apple
- Grootte op het apparaat
- Ongeveer 0,7 MB gecompileerde Core ML (twee fasen van 0,3 MB plus de filterbank en calibrator)
- Talen
- Engels, Spaans, Frans, Italiaans, Portugees, Duits, Japans, Koreaans, Chinees
- Model
- Cascade van grof naar fijn in twee fasen over een log-mel-spectrogram, ongeveer 117k parameters per fase, met een gradient-boosted calibrator
- Platforms
- iOS 26, macOS 26, tvOS 26, visionOS 26 (Core ML), waar SpeechAnalyzer leeft
Align corrigeert de timings van Apple; het transcribeert niet, en het heeft Apple's SpeechAnalyzer nodig, wat neerkomt op iOS 26, macOS 26, tvOS 26 of visionOS 26. Align kan niet beloven elk woord te verbeteren.
De fallback die de timing van Apple behoudt, vangt correcties op die onveilig lijken, niet elke foute. Engels, Italiaans, Japans en Koreaans zijn de zwakste van de negen talen onder de huidige referenties.
FAQ
Wat is Align?
Woordtijdstempels op het apparaat, voor elke transcriber. Knip, ondertitel en markeer op het woord, met de helft van de fout, uit een model van 0,7 MB.
Draait Align op het apparaat?
Ja. Align draait op het apparaat, zonder serveraanroep, dus de data blijft bij de gebruiker.
Welke platforms ondersteunt Align?
Align wordt geleverd als een native on-device SDK voor Swift.
Hoeveel kost Align?
Elk model is gratis voor maximaal 100k maandelijks actieve apparaten per SDK. Onbeperkte inference per gebruiker. Neem contact op voor aangepaste licenties.
Hoe nauwkeurig of snel is Align?
De woordtimings van Apple zitten er gemiddeld 113 ms naast; Align brengt dat naar 45 ms, en drie op de vier woorden landen binnen 50 ms, uit een model van 0,7 MB.