Desert Ant Labs

Align.

Wort-ZeitstempelVerfügbar

Wort-Zeitstempel auf dem Gerät, für jeden Transkribierer. Schneiden, untertiteln und hervorheben auf das Wort genau, bei halber Fehlerrate, aus 0,7 MB.

Genaue Wort-Zeitstempel für jedes Transkript.

Apple sagt, „Welt“ läuft von 2,61 bis 3,04 Sekunden. Align sagt 2,57 bis 2,98. Schneiden Sie dort, und der Schnitt ist sauber, der Untertitel leuchtet auf das Wort genau auf, und die Hervorhebung beginnt dort, wo der Sprecher begann.

Sie behalten Apples Transkribierer. Align liest dasselbe Audio, das SpeechAnalyzer ohnehin bekommt, und gibt dieselben Wörter mit engeren Start- und Endzeiten zurück, in wenigen Millisekunden, aus einem 0,7 MB großen Download. Bei sauberem Audio senkt das Apples durchschnittliche Abweichung von 113 ms auf 45 ms.

Ein Wort, das Align nicht verbessern kann, behält Apples Zeitangabe, sodass eine Korrektur nur helfen oder das Wort in Ruhe lassen kann. Neun Sprachen, und eine Sprache außerhalb davon wird mit Apples Zeitangaben unverändert durchgereicht.

Der halbe Zeitfehler.

Apples Wort-Zeiten weichen im Schnitt um 113 ms ab; Align bringt das auf 45 ms, und drei von vier Wörtern liegen innerhalb von 50 ms, aus einem 0,7 MB großen Modell.

45 ms
Mittlerer Fehler, sauberes Audio
Apple roh: 113,5 ms
60 %
Fehler entfernt
sauberes und verrauschtes Audio gleichermaßen
0,7 MB
Auf dem Gerät
kompiliertes Core ML, zwei Stufen

Mittlerer absoluter Abstand von der Referenz-Wortgrenze, 223 saubere und 210 verrauschte zurückgehaltene Aufnahmen in neun Sprachen

BedingungApple rohAlignInnerhalb 50 ms
Clean113,5 ms44,9 ms75,1 %
Noisy124,4 ms50,1 ms69,4 %

Bewertet auf der ausgelieferten Swift-Laufzeit und den mitgelieferten Core-ML-Modellen. Die Referenzen sind maschinelle Forced-Alignment-Schätzungen von Qwen3-ForcedAligner, keine menschlichen Annotationen, sodass die Werte eine große, konsistente Reduktion von Apples Zeitfehler zeigen und keine samplegenaue Ground Truth.

Wort-für-Wort-Untertitel, die mithalten

Lassen Sie jedes Wort aufleuchten, während es gesprochen wird, in einer Untertitelansicht, einem Karaoke-artigen Textbildschirm oder einer Sprachlern-App, aus Apples Transkript. Die Zeiten treffen das Wort, statt eine Zehntelsekunde daneben zu liegen.

Einen Clip auf ein Wort schneiden

Kürzen Sie eine Aufnahme in einem Podcast-Editor oder einer Video-App auf ein Zitat, und lassen Sie den Schnitt dort beginnen, wo das Wort beginnt. Kein Frame des vorigen Wortes, kein abgeschnittener Konsonant und kein manuelles Verschieben auf der Zeitleiste.

Das gesprochene Wort im Transkript hervorheben

Scrollen Sie ein Transkript im Takt der Wiedergabe in einem Meeting-Recorder oder einer Vorlesungs-App, wobei die Hervorhebung auf das Wort genau mitwandert, statt dem Audio vorauszueilen.

Suche, die den Moment trifft

Springen Sie in einem Archiv von Aufnahmen auf die Sekunde, in der ein Wort gesagt wurde, auf dem Gerät. Die Zeiten sind eng genug, dass der Abspielkopf auf dem Wort startet und nicht mitten im vorigen.

Inspiration

Ideen zum Bauen mit Align. Kopieren Sie einen Prompt in Ihren Coding-Agenten und los.

Align

Highlight each word as it's spoken, timed to the audio.

Align

Tighten a system transcriber's word timings so captions land on the word.

Align

Build a text-based video editor where selecting words trims the clip.

Align

Add bouncing word-by-word captions to vertical videos.

Align

Make transcript search jump the audio to the exact word.

Was das Modell macht

  • Korrigiert die Zeitangaben auf Wortebene, die Apples SpeechTranscriber und SpeechAnalyzer zurückgeben, ohne sie zu ersetzen: dieselben Wörter, dieselbe Ergebnisfläche, engere audioTimeRange-Werte.
  • Mittlerer Zeitfehler von 113,5 ms auf 44,9 ms bei sauberem Audio und von 124,4 ms auf 50,1 ms bei verrauschtem Audio, eine Reduktion um 60 %, gemessen an 433 zurückgehaltenen Aufnahmen gegen Forced-Alignment-Referenzen.
  • 75,1 % der Wörter liegen bei sauberem Audio innerhalb von 50 ms der Referenz, 69,4 % bei verrauschtem Audio.
  • Ein struktureller Fallback behält Apples ursprünglichen Zeitstempel, wann immer eine Korrektur ungültig wäre, an den Rand des Suchfensters stößt oder keinen Streaming-Kontext hat.
  • Neun Sprachen: Englisch, Spanisch, Französisch, Italienisch, Portugiesisch, Deutsch, Japanisch, Koreanisch und Chinesisch. Andere Sprachen werden unverändert durchgereicht.
  • Etwa 0,7 MB kompiliertes Core ML in zwei Stufen, ausgeführt auf CPU und Neural Engine; ein typisches Ergebnis wird in wenigen Millisekunden verfeinert.

Erste Schritte

Fügen Sie wort-zeitstempel mit wenigen Zeilen Code zu Ihrer iOS or macOS-App hinzu. Align Docs.

iOS, macOS
Installation
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")
Beispiel - Swift
import Align

let refiner = try await SpeechTimestampRefiner(locale: locale)
try await analyzer.start(inputSequence: inputs.recordingAudio(for: refiner))

for try await result in transcriber.results.refiningTimestamps(with: refiner) {
    result.words   // [WordTiming]: text, start, end, refined
}
Mit einem Prompt bauen
Add Align from Desert Ant Labs to this Swift project (iOS, macOS).

What it does: On-Device-Wort-Zeitstempel für jedes Transkript.

SDK:

Swift (iOS, macOS)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")

Reference:
- Model page: https://desertant.com/models/align/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
AndroidDemnächst
Web, Node.jsDemnächst

Technische Daten

Genauigkeit
44,9 ms mittlerer Fehler bei sauberem Audio, 50,1 ms bei verrauschtem, gegenüber Apples 113,5 ms und 124,4 ms
Größe auf dem Gerät
Etwa 0,7 MB kompiliertes Core ML (zwei 0,3-MB-Stufen plus Filterbank und Kalibrator)
Sprachen
Englisch, Spanisch, Französisch, Italienisch, Portugiesisch, Deutsch, Japanisch, Koreanisch, Chinesisch
Modell
Zweistufige Coarse-to-Fine-Kaskade über ein Log-Mel-Spektrogramm, etwa 117k Parameter pro Stufe, mit einem Gradient-Boosted-Kalibrator
Plattformen
iOS 26, macOS 26, tvOS 26, visionOS 26 (Core ML), auf denen es SpeechAnalyzer gibt

Align korrigiert Apples Zeitangaben; es transkribiert nicht und braucht Apples SpeechAnalyzer, also iOS 26, macOS 26, tvOS 26 oder visionOS 26. Align kann nicht versprechen, jedes Wort zu verbessern.

Der Fallback, der Apples Zeitangabe behält, fängt Korrekturen ab, die unsicher aussehen, nicht jede falsche. Englisch, Italienisch, Japanisch und Koreanisch sind die schwächsten der neun Sprachen unter den aktuellen Referenzen.

FAQ

Was ist Align?

Wort-Zeitstempel auf dem Gerät, für jeden Transkribierer. Schneiden, untertiteln und hervorheben auf das Wort genau, bei halber Fehlerrate, aus 0,7 MB.

Läuft Align auf dem Gerät?

Ja. Align läuft auf dem Gerät, ohne Serveraufruf, sodass die Daten beim Nutzer bleiben.

Welche Plattformen unterstützt Align?

Align wird als natives On-Device-SDK für Swift ausgeliefert.

Was kostet Align?

Jedes Modell ist kostenlos für bis zu 100k monatlich aktive Geräte pro SDK. Unbegrenzte Inferenz pro Nutzer. Kontaktieren Sie uns für individuelle Lizenzen.

Wie genau oder schnell ist Align?

Apples Wort-Zeiten weichen im Schnitt um 113 ms ab; Align bringt das auf 45 ms, und drei von vier Wörtern liegen innerhalb von 50 ms, aus einem 0,7 MB großen Modell.

Ressourcen