Align
Wortgenaue Zeitstempel auf dem Gerät, für jede Transkription. Schneiden, untertiteln und hervorheben auf das Wort genau, fünfmal genauer, ab 0,7 MB.

Genaue Wort-Zeitstempel für jedes Transkript.
Apple sagt, „Welt“ läuft von 2,61 bis 3,04 Sekunden. Align sagt 2,57 bis 2,98. Schneiden Sie dort, und der Schnitt ist sauber, der Untertitel leuchtet auf das Wort genau auf, und die Hervorhebung beginnt dort, wo der Sprecher begann.
Sie behalten Apples Transkribierer. Align liest dasselbe Audio, das SpeechAnalyzer ohnehin bekommt, und gibt dieselben Wörter mit engeren Start- und Endzeiten zurück, in wenigen Millisekunden, aus einem 0,7 MB großen Download. Bei sauberem Audio senkt das Apples durchschnittliche Abweichung von 113 ms auf 45 ms.
Ein Wort, das Align nicht verbessern kann, behält Apples Zeitangabe, sodass eine Korrektur nur helfen oder das Wort in Ruhe lassen kann. Neun Sprachen, und eine Sprache außerhalb davon wird mit Apples Zeitangaben unverändert durchgereicht.
Fünfmal genauer.
Apples wortgenaue Zeiten auf LibriSpeech test-clean liegen im Mittel 106,4 ms daneben; Align bringt das auf 20,2 ms, und 95 % der Wörter liegen innerhalb von 50 ms, aus einem Modell von 0,7 MB.
Mittlerer absoluter Abstand zur Referenz-Wortgrenze, in einer Stichprobe von 500 Clips je offiziellem LibriSpeech-Split, ohne gemeinsame Sprecher zwischen Training und Auswertung
| Split | Apple roh | Align | Innerhalb 50 ms |
|---|---|---|---|
| test-clean | 106,4 ms | 20,2 ms | 95 % |
| test-other | 111,6 ms | 24,8 ms | 92 % |
Ausgewertet auf den v1.0.0-Gewichten. Die Referenzen sind maschinelle Forced-Alignment-Schätzungen aus Qwen3-ForcedAligner, gemittelt mit einem zweiten Aligner, keine menschlichen Annotationen: die Zahlen zeigen eine große und konsistente Verringerung des Zeitfehlers, keine exakte Wahrheit auf Stichprobenebene. Ausnahme ist der Vergleich mit WhisperX, gemessen an 258 Wortgrenzen, die ein Mensch anhand der Wellenform von Hand korrigiert hat.
Anwendungsfälle
Genaue Wort-Zeitstempel für jedes Transkript.
Wort-für-Wort-Untertitel, die mithalten
Lassen Sie jedes Wort aufleuchten, während es gesprochen wird, in einer Untertitelansicht, einem Karaoke-artigen Textbildschirm oder einer Sprachlern-App, aus Apples Transkript. Die Zeiten treffen das Wort, statt eine Zehntelsekunde daneben zu liegen.
Einen Clip auf ein Wort schneiden
Kürzen Sie eine Aufnahme in einem Podcast-Editor oder einer Video-App auf ein Zitat, und lassen Sie den Schnitt dort beginnen, wo das Wort beginnt. Kein Frame des vorigen Wortes, kein abgeschnittener Konsonant und kein manuelles Verschieben auf der Zeitleiste.
Das gesprochene Wort im Transkript hervorheben
Scrollen Sie ein Transkript im Takt der Wiedergabe in einem Meeting-Recorder oder einer Vorlesungs-App, wobei die Hervorhebung auf das Wort genau mitwandert, statt dem Audio vorauszueilen.
Suche, die den Moment trifft
Springen Sie in einem Archiv von Aufnahmen auf die Sekunde, in der ein Wort gesagt wurde, auf dem Gerät. Die Zeiten sind eng genug, dass der Abspielkopf auf dem Wort startet und nicht mitten im vorigen.
Inspiration
Ideen zum Bauen mit Align. Kopieren Sie einen Prompt in Ihren Coding-Agenten und los.
Highlight each word as it's spoken, timed to the audio.
Run Apple's SpeechTranscriber with Desert Ant's Align attached as a timestamp refiner, then highlight each word using its refined time range. Align tightens Apple's word timings on-device; iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Tighten a system transcriber's word timings so captions land on the word.
Attach Desert Ant's Align as a refiner to Apple's SpeechAnalyzer / SpeechTranscriber so its word-level timings tighten and captions and cuts land exactly on the word. iOS 26 / macOS 26, on-device. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Build a text-based video editor where selecting words trims the clip.
Transcribe with Apple's SpeechTranscriber and Desert Ant's Align refiner for word-exact timings, then let the user select words to trim the video to that span. Deleting a sentence deletes the footage. iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Add bouncing word-by-word captions to vertical videos.
Add animated word-by-word captions to short vertical videos, timed with Desert Ant's Align attached to Apple's SpeechTranscriber so each word pops exactly when it's said. On-device, iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Make transcript search jump the audio to the exact word.
In an Apple media app, transcribe with SpeechTranscriber and Desert Ant's Align refiner so a search result seeks the audio or video to the precise word, not the sentence. iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Was das Modell macht
- Korrigiert die Zeitangaben auf Wortebene, die Apples
SpeechTranscriberundSpeechAnalyzerzurückgeben, ohne sie zu ersetzen: dieselben Wörter, dieselbe Ergebnisfläche, engereaudioTimeRange-Werte. - Mittlerer Zeitfehler von 124,2 ms auf 43,9 ms, makro-gemittelt über alle neun Sprachen, damit keine Sprache den Wert allein trägt. Im Englischen geht es weiter: von 106,4 ms auf 20,2 ms.
- In einer Stichprobe von 500 Clips aus LibriSpeech test-clean liegen 95 % der Wörter innerhalb von 50 ms der Referenz, zuvor 37 %. Das schlechteste Zehntel verbessert sich am stärksten: von 230,7 ms auf 33,0 ms, etwa ein Videobild bei 30 fps.
- Ein struktureller Fallback behält Apples ursprünglichen Zeitstempel, wann immer eine Korrektur ungültig wäre, an den Rand des Suchfensters stößt oder keinen Streaming-Kontext hat.
- Neun Sprachen: Englisch, Spanisch, Französisch, Italienisch, Portugiesisch, Deutsch, Japanisch, Koreanisch und Chinesisch. Andere Sprachen werden unverändert durchgereicht.
- Rund 0,7 MB kompiliertes Core ML in zwei Stufen, ausgeführt auf CPU und Neural Engine; ein typisches Ergebnis ist in wenigen Millisekunden korrigiert.
Erste Schritte
Fügen Sie wort-zeitstempel mit wenigen Zeilen Code zu Ihrer iOS or macOS-App hinzu. Align Docs.
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")
import Align
let refiner = try await SpeechTimestampRefiner(locale: locale)
try await analyzer.start(inputSequence: inputs.recordingAudio(for: refiner))
for try await result in transcriber.results.refiningTimestamps(with: refiner) {
result.words // [WordTiming]: text, start, end, refined
}
Add Align from Desert Ant Labs to this Swift project (iOS, macOS). What it does: On-Device-Wort-Zeitstempel für jedes Transkript. SDK: Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0") // target dependency .product(name: "Align", package: "desert-ant-core") Reference: - Model page: https://desertant.com/models/align/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Technische Daten
- Genauigkeit
- 20,2 ms mittlerer Fehler auf LibriSpeech test-clean gegenüber Apples 106,4 ms, und 43,9 ms über alle neun Sprachen gegenüber Apples 124,2 ms
- Größe auf dem Gerät
- Rund 0,7 MB kompiliertes Core ML (zwei Stufen mit je 0,3 MB, dazu Filterbank und Kalibrator)
- Sprachen
- Englisch, Spanisch, Französisch, Italienisch, Portugiesisch, Deutsch, Japanisch, Koreanisch, Chinesisch
- Modell
- Zweistufige Kaskade von grob nach fein über ein Log-Mel-Spektrogramm, 121 Tausend Parameter je Stufe, mit einem Gradient-Boosting-Kalibrator
- Plattformen
- iOS 26, macOS 26, tvOS 26, visionOS 26 (Core ML), auf denen es SpeechAnalyzer gibt
Align korrigiert die Zeiten einer Transkription; es transkribiert nicht, und das Swift-SDK braucht Apples SpeechAnalyzer, also iOS 26, macOS 26, tvOS 26 oder visionOS 26. Align verspricht nicht, jedes Wort zu verbessern.
Der Rückfall, der den ursprünglichen Zeitstempel behält, fängt Korrekturen ab, die unsicher aussehen, nicht jede falsche. Gesprochene Zahlen sind der schwächste Fall: in einer kleinen Stichprobe hat die Korrektur die Ziffergrenzen weiter von der Referenz weggerückt, statt sie zu lassen.
FAQ
Was ist Align?
Wortgenaue Zeitstempel auf dem Gerät, für jede Transkription. Schneiden, untertiteln und hervorheben auf das Wort genau, fünfmal genauer, ab 0,7 MB.
Läuft Align auf dem Gerät?
Ja. Align läuft auf dem Gerät, ohne Serveraufruf, sodass die Daten beim Nutzer bleiben.
Welche Plattformen unterstützt Align?
Align wird als natives On-Device-SDK für Swift ausgeliefert.
Was kostet Align?
Jedes Modell ist kostenlos für bis zu 100k monatlich aktive Geräte pro SDK. Unbegrenzte Inferenz pro Nutzer. Kontaktieren Sie uns für individuelle Lizenzen.
Wie genau oder schnell ist Align?
Apples wortgenaue Zeiten auf LibriSpeech test-clean liegen im Mittel 106,4 ms daneben; Align bringt das auf 20,2 ms, und 95 % der Wörter liegen innerhalb von 50 ms, aus einem Modell von 0,7 MB.