Desert Ant Labs

Align

Wort-ZeitstempelVerfügbar

Wortgenaue Zeitstempel auf dem Gerät, für jede Transkription. Schneiden, untertiteln und hervorheben auf das Wort genau, fünfmal genauer, ab 0,7 MB.

Genaue Wort-Zeitstempel für jedes Transkript.

Apple sagt, „Welt“ läuft von 2,61 bis 3,04 Sekunden. Align sagt 2,57 bis 2,98. Schneiden Sie dort, und der Schnitt ist sauber, der Untertitel leuchtet auf das Wort genau auf, und die Hervorhebung beginnt dort, wo der Sprecher begann.

Sie behalten Apples Transkribierer. Align liest dasselbe Audio, das SpeechAnalyzer ohnehin bekommt, und gibt dieselben Wörter mit engeren Start- und Endzeiten zurück, in wenigen Millisekunden, aus einem 0,7 MB großen Download. Bei sauberem Audio senkt das Apples durchschnittliche Abweichung von 113 ms auf 45 ms.

Ein Wort, das Align nicht verbessern kann, behält Apples Zeitangabe, sodass eine Korrektur nur helfen oder das Wort in Ruhe lassen kann. Neun Sprachen, und eine Sprache außerhalb davon wird mit Apples Zeitangaben unverändert durchgereicht.

Fünfmal genauer.

Apples wortgenaue Zeiten auf LibriSpeech test-clean liegen im Mittel 106,4 ms daneben; Align bringt das auf 20,2 ms, und 95 % der Wörter liegen innerhalb von 50 ms, aus einem Modell von 0,7 MB.

20,2 ms
Mittlerer Fehler, LibriSpeech test-clean
Apple unkorrigiert: 106,4 ms
5x
Genauer
von 106,4 ms auf 20,2 ms
45,0 ms
Gegen handkorrigierte Grenzen
WhisperX: 53,5 ms
0,7 MB
Auf dem Gerät
kompiliertes Core ML, zwei Stufen

Mittlerer absoluter Abstand zur Referenz-Wortgrenze, in einer Stichprobe von 500 Clips je offiziellem LibriSpeech-Split, ohne gemeinsame Sprecher zwischen Training und Auswertung

SplitApple rohAlignInnerhalb 50 ms
test-clean106,4 ms20,2 ms95 %
test-other111,6 ms24,8 ms92 %

Ausgewertet auf den v1.0.0-Gewichten. Die Referenzen sind maschinelle Forced-Alignment-Schätzungen aus Qwen3-ForcedAligner, gemittelt mit einem zweiten Aligner, keine menschlichen Annotationen: die Zahlen zeigen eine große und konsistente Verringerung des Zeitfehlers, keine exakte Wahrheit auf Stichprobenebene. Ausnahme ist der Vergleich mit WhisperX, gemessen an 258 Wortgrenzen, die ein Mensch anhand der Wellenform von Hand korrigiert hat.

Anwendungsfälle

Genaue Wort-Zeitstempel für jedes Transkript.

Wort-für-Wort-Untertitel, die mithalten

Lassen Sie jedes Wort aufleuchten, während es gesprochen wird, in einer Untertitelansicht, einem Karaoke-artigen Textbildschirm oder einer Sprachlern-App, aus Apples Transkript. Die Zeiten treffen das Wort, statt eine Zehntelsekunde daneben zu liegen.

Einen Clip auf ein Wort schneiden

Kürzen Sie eine Aufnahme in einem Podcast-Editor oder einer Video-App auf ein Zitat, und lassen Sie den Schnitt dort beginnen, wo das Wort beginnt. Kein Frame des vorigen Wortes, kein abgeschnittener Konsonant und kein manuelles Verschieben auf der Zeitleiste.

Das gesprochene Wort im Transkript hervorheben

Scrollen Sie ein Transkript im Takt der Wiedergabe in einem Meeting-Recorder oder einer Vorlesungs-App, wobei die Hervorhebung auf das Wort genau mitwandert, statt dem Audio vorauszueilen.

Suche, die den Moment trifft

Springen Sie in einem Archiv von Aufnahmen auf die Sekunde, in der ein Wort gesagt wurde, auf dem Gerät. Die Zeiten sind eng genug, dass der Abspielkopf auf dem Wort startet und nicht mitten im vorigen.

Inspiration

Ideen zum Bauen mit Align. Kopieren Sie einen Prompt in Ihren Coding-Agenten und los.

Align

Highlight each word as it's spoken, timed to the audio.

Align

Tighten a system transcriber's word timings so captions land on the word.

Align

Build a text-based video editor where selecting words trims the clip.

Align

Add bouncing word-by-word captions to vertical videos.

Align

Make transcript search jump the audio to the exact word.

Was das Modell macht

  • Korrigiert die Zeitangaben auf Wortebene, die Apples SpeechTranscriber und SpeechAnalyzer zurückgeben, ohne sie zu ersetzen: dieselben Wörter, dieselbe Ergebnisfläche, engere audioTimeRange-Werte.
  • Mittlerer Zeitfehler von 124,2 ms auf 43,9 ms, makro-gemittelt über alle neun Sprachen, damit keine Sprache den Wert allein trägt. Im Englischen geht es weiter: von 106,4 ms auf 20,2 ms.
  • In einer Stichprobe von 500 Clips aus LibriSpeech test-clean liegen 95 % der Wörter innerhalb von 50 ms der Referenz, zuvor 37 %. Das schlechteste Zehntel verbessert sich am stärksten: von 230,7 ms auf 33,0 ms, etwa ein Videobild bei 30 fps.
  • Ein struktureller Fallback behält Apples ursprünglichen Zeitstempel, wann immer eine Korrektur ungültig wäre, an den Rand des Suchfensters stößt oder keinen Streaming-Kontext hat.
  • Neun Sprachen: Englisch, Spanisch, Französisch, Italienisch, Portugiesisch, Deutsch, Japanisch, Koreanisch und Chinesisch. Andere Sprachen werden unverändert durchgereicht.
  • Rund 0,7 MB kompiliertes Core ML in zwei Stufen, ausgeführt auf CPU und Neural Engine; ein typisches Ergebnis ist in wenigen Millisekunden korrigiert.

Erste Schritte

Fügen Sie wort-zeitstempel mit wenigen Zeilen Code zu Ihrer iOS or macOS-App hinzu. Align Docs.

iOS, macOS
Installation
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")
Beispiel - Swift
import Align

let refiner = try await SpeechTimestampRefiner(locale: locale)
try await analyzer.start(inputSequence: inputs.recordingAudio(for: refiner))

for try await result in transcriber.results.refiningTimestamps(with: refiner) {
    result.words   // [WordTiming]: text, start, end, refined
}
Mit einem Prompt bauen
Add Align from Desert Ant Labs to this Swift project (iOS, macOS).

What it does: On-Device-Wort-Zeitstempel für jedes Transkript.

SDK:

Swift (iOS, macOS)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")

Reference:
- Model page: https://desertant.com/models/align/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
AndroidDemnächst
Web, Node.jsDemnächst

Technische Daten

Genauigkeit
20,2 ms mittlerer Fehler auf LibriSpeech test-clean gegenüber Apples 106,4 ms, und 43,9 ms über alle neun Sprachen gegenüber Apples 124,2 ms
Größe auf dem Gerät
Rund 0,7 MB kompiliertes Core ML (zwei Stufen mit je 0,3 MB, dazu Filterbank und Kalibrator)
Sprachen
Englisch, Spanisch, Französisch, Italienisch, Portugiesisch, Deutsch, Japanisch, Koreanisch, Chinesisch
Modell
Zweistufige Kaskade von grob nach fein über ein Log-Mel-Spektrogramm, 121 Tausend Parameter je Stufe, mit einem Gradient-Boosting-Kalibrator
Plattformen
iOS 26, macOS 26, tvOS 26, visionOS 26 (Core ML), auf denen es SpeechAnalyzer gibt

Align korrigiert die Zeiten einer Transkription; es transkribiert nicht, und das Swift-SDK braucht Apples SpeechAnalyzer, also iOS 26, macOS 26, tvOS 26 oder visionOS 26. Align verspricht nicht, jedes Wort zu verbessern.

Der Rückfall, der den ursprünglichen Zeitstempel behält, fängt Korrekturen ab, die unsicher aussehen, nicht jede falsche. Gesprochene Zahlen sind der schwächste Fall: in einer kleinen Stichprobe hat die Korrektur die Ziffergrenzen weiter von der Referenz weggerückt, statt sie zu lassen.

FAQ

Was ist Align?

Wortgenaue Zeitstempel auf dem Gerät, für jede Transkription. Schneiden, untertiteln und hervorheben auf das Wort genau, fünfmal genauer, ab 0,7 MB.

Läuft Align auf dem Gerät?

Ja. Align läuft auf dem Gerät, ohne Serveraufruf, sodass die Daten beim Nutzer bleiben.

Welche Plattformen unterstützt Align?

Align wird als natives On-Device-SDK für Swift ausgeliefert.

Was kostet Align?

Jedes Modell ist kostenlos für bis zu 100k monatlich aktive Geräte pro SDK. Unbegrenzte Inferenz pro Nutzer. Kontaktieren Sie uns für individuelle Lizenzen.

Wie genau oder schnell ist Align?

Apples wortgenaue Zeiten auf LibriSpeech test-clean liegen im Mittel 106,4 ms daneben; Align bringt das auf 20,2 ms, und 95 % der Wörter liegen innerhalb von 50 ms, aus einem Modell von 0,7 MB.

Ressourcen