Align.
Wort-Zeitstempel auf dem Gerät, für jeden Transkribierer. Schneiden, untertiteln und hervorheben auf das Wort genau, bei halber Fehlerrate, aus 0,7 MB.
Genaue Wort-Zeitstempel für jedes Transkript.
Apple sagt, „Welt“ läuft von 2,61 bis 3,04 Sekunden. Align sagt 2,57 bis 2,98. Schneiden Sie dort, und der Schnitt ist sauber, der Untertitel leuchtet auf das Wort genau auf, und die Hervorhebung beginnt dort, wo der Sprecher begann.
Sie behalten Apples Transkribierer. Align liest dasselbe Audio, das SpeechAnalyzer ohnehin bekommt, und gibt dieselben Wörter mit engeren Start- und Endzeiten zurück, in wenigen Millisekunden, aus einem 0,7 MB großen Download. Bei sauberem Audio senkt das Apples durchschnittliche Abweichung von 113 ms auf 45 ms.
Ein Wort, das Align nicht verbessern kann, behält Apples Zeitangabe, sodass eine Korrektur nur helfen oder das Wort in Ruhe lassen kann. Neun Sprachen, und eine Sprache außerhalb davon wird mit Apples Zeitangaben unverändert durchgereicht.
Der halbe Zeitfehler.
Apples Wort-Zeiten weichen im Schnitt um 113 ms ab; Align bringt das auf 45 ms, und drei von vier Wörtern liegen innerhalb von 50 ms, aus einem 0,7 MB großen Modell.
Mittlerer absoluter Abstand von der Referenz-Wortgrenze, 223 saubere und 210 verrauschte zurückgehaltene Aufnahmen in neun Sprachen
| Bedingung | Apple roh | Align | Innerhalb 50 ms |
|---|---|---|---|
| Clean | 113,5 ms | 44,9 ms | 75,1 % |
| Noisy | 124,4 ms | 50,1 ms | 69,4 % |
Bewertet auf der ausgelieferten Swift-Laufzeit und den mitgelieferten Core-ML-Modellen. Die Referenzen sind maschinelle Forced-Alignment-Schätzungen von Qwen3-ForcedAligner, keine menschlichen Annotationen, sodass die Werte eine große, konsistente Reduktion von Apples Zeitfehler zeigen und keine samplegenaue Ground Truth.
Wort-für-Wort-Untertitel, die mithalten
Lassen Sie jedes Wort aufleuchten, während es gesprochen wird, in einer Untertitelansicht, einem Karaoke-artigen Textbildschirm oder einer Sprachlern-App, aus Apples Transkript. Die Zeiten treffen das Wort, statt eine Zehntelsekunde daneben zu liegen.
Einen Clip auf ein Wort schneiden
Kürzen Sie eine Aufnahme in einem Podcast-Editor oder einer Video-App auf ein Zitat, und lassen Sie den Schnitt dort beginnen, wo das Wort beginnt. Kein Frame des vorigen Wortes, kein abgeschnittener Konsonant und kein manuelles Verschieben auf der Zeitleiste.
Das gesprochene Wort im Transkript hervorheben
Scrollen Sie ein Transkript im Takt der Wiedergabe in einem Meeting-Recorder oder einer Vorlesungs-App, wobei die Hervorhebung auf das Wort genau mitwandert, statt dem Audio vorauszueilen.
Suche, die den Moment trifft
Springen Sie in einem Archiv von Aufnahmen auf die Sekunde, in der ein Wort gesagt wurde, auf dem Gerät. Die Zeiten sind eng genug, dass der Abspielkopf auf dem Wort startet und nicht mitten im vorigen.
Inspiration
Ideen zum Bauen mit Align. Kopieren Sie einen Prompt in Ihren Coding-Agenten und los.
Highlight each word as it's spoken, timed to the audio.
Run Apple's SpeechTranscriber with Desert Ant's Align attached as a timestamp refiner, then highlight each word using its refined time range. Align tightens Apple's word timings on-device; iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Tighten a system transcriber's word timings so captions land on the word.
Attach Desert Ant's Align as a refiner to Apple's SpeechAnalyzer / SpeechTranscriber so its word-level timings tighten and captions and cuts land exactly on the word. iOS 26 / macOS 26, on-device. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Build a text-based video editor where selecting words trims the clip.
Transcribe with Apple's SpeechTranscriber and Desert Ant's Align refiner for word-exact timings, then let the user select words to trim the video to that span. Deleting a sentence deletes the footage. iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Add bouncing word-by-word captions to vertical videos.
Add animated word-by-word captions to short vertical videos, timed with Desert Ant's Align attached to Apple's SpeechTranscriber so each word pops exactly when it's said. On-device, iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Make transcript search jump the audio to the exact word.
In an Apple media app, transcribe with SpeechTranscriber and Desert Ant's Align refiner so a search result seeks the audio or video to the precise word, not the sentence. iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Was das Modell macht
- Korrigiert die Zeitangaben auf Wortebene, die Apples
SpeechTranscriberundSpeechAnalyzerzurückgeben, ohne sie zu ersetzen: dieselben Wörter, dieselbe Ergebnisfläche, engereaudioTimeRange-Werte. - Mittlerer Zeitfehler von 113,5 ms auf 44,9 ms bei sauberem Audio und von 124,4 ms auf 50,1 ms bei verrauschtem Audio, eine Reduktion um 60 %, gemessen an 433 zurückgehaltenen Aufnahmen gegen Forced-Alignment-Referenzen.
- 75,1 % der Wörter liegen bei sauberem Audio innerhalb von 50 ms der Referenz, 69,4 % bei verrauschtem Audio.
- Ein struktureller Fallback behält Apples ursprünglichen Zeitstempel, wann immer eine Korrektur ungültig wäre, an den Rand des Suchfensters stößt oder keinen Streaming-Kontext hat.
- Neun Sprachen: Englisch, Spanisch, Französisch, Italienisch, Portugiesisch, Deutsch, Japanisch, Koreanisch und Chinesisch. Andere Sprachen werden unverändert durchgereicht.
- Etwa 0,7 MB kompiliertes Core ML in zwei Stufen, ausgeführt auf CPU und Neural Engine; ein typisches Ergebnis wird in wenigen Millisekunden verfeinert.
Erste Schritte
Fügen Sie wort-zeitstempel mit wenigen Zeilen Code zu Ihrer iOS or macOS-App hinzu. Align Docs.
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")
import Align
let refiner = try await SpeechTimestampRefiner(locale: locale)
try await analyzer.start(inputSequence: inputs.recordingAudio(for: refiner))
for try await result in transcriber.results.refiningTimestamps(with: refiner) {
result.words // [WordTiming]: text, start, end, refined
}
Add Align from Desert Ant Labs to this Swift project (iOS, macOS). What it does: On-Device-Wort-Zeitstempel für jedes Transkript. SDK: Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0") // target dependency .product(name: "Align", package: "desert-ant-core") Reference: - Model page: https://desertant.com/models/align/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Technische Daten
- Genauigkeit
- 44,9 ms mittlerer Fehler bei sauberem Audio, 50,1 ms bei verrauschtem, gegenüber Apples 113,5 ms und 124,4 ms
- Größe auf dem Gerät
- Etwa 0,7 MB kompiliertes Core ML (zwei 0,3-MB-Stufen plus Filterbank und Kalibrator)
- Sprachen
- Englisch, Spanisch, Französisch, Italienisch, Portugiesisch, Deutsch, Japanisch, Koreanisch, Chinesisch
- Modell
- Zweistufige Coarse-to-Fine-Kaskade über ein Log-Mel-Spektrogramm, etwa 117k Parameter pro Stufe, mit einem Gradient-Boosted-Kalibrator
- Plattformen
- iOS 26, macOS 26, tvOS 26, visionOS 26 (Core ML), auf denen es SpeechAnalyzer gibt
Align korrigiert Apples Zeitangaben; es transkribiert nicht und braucht Apples SpeechAnalyzer, also iOS 26, macOS 26, tvOS 26 oder visionOS 26. Align kann nicht versprechen, jedes Wort zu verbessern.
Der Fallback, der Apples Zeitangabe behält, fängt Korrekturen ab, die unsicher aussehen, nicht jede falsche. Englisch, Italienisch, Japanisch und Koreanisch sind die schwächsten der neun Sprachen unter den aktuellen Referenzen.
FAQ
Was ist Align?
Wort-Zeitstempel auf dem Gerät, für jeden Transkribierer. Schneiden, untertiteln und hervorheben auf das Wort genau, bei halber Fehlerrate, aus 0,7 MB.
Läuft Align auf dem Gerät?
Ja. Align läuft auf dem Gerät, ohne Serveraufruf, sodass die Daten beim Nutzer bleiben.
Welche Plattformen unterstützt Align?
Align wird als natives On-Device-SDK für Swift ausgeliefert.
Was kostet Align?
Jedes Modell ist kostenlos für bis zu 100k monatlich aktive Geräte pro SDK. Unbegrenzte Inferenz pro Nutzer. Kontaktieren Sie uns für individuelle Lizenzen.
Wie genau oder schnell ist Align?
Apples Wort-Zeiten weichen im Schnitt um 113 ms ab; Align bringt das auf 45 ms, und drei von vier Wörtern liegen innerhalb von 50 ms, aus einem 0,7 MB großen Modell.