Desert Ant Labs

Align

WoordtijdstempelsBeschikbaar

Woordtijdstempels op het apparaat, voor elke transcriptie. Knip, ondertitel en markeer op het woord, vijf keer nauwkeuriger, vanaf 0,7 MB.

Precieze woordtijdstempels voor elk transcript.

Apple zegt dat “world” loopt van 2,61 tot 3,04 seconden. Align zegt 2,57 tot 2,98. Knip daar en de knip is schoon, de ondertitel licht op bij het woord, en de markering begint waar de spreker begon.

Je houdt de transcriber van Apple. Align leest dezelfde audio die SpeechAnalyzer al krijgt en geeft dezelfde woorden terug met strakkere begin- en eindtijden, in een paar milliseconden, uit een download van 0,7 MB. Op schone audio brengt dat de gemiddelde afwijking van Apple van 113 ms naar 45 ms.

Een woord dat Align niet kan verbeteren, houdt de timing van Apple, dus een correctie kan alleen helpen of het woord met rust laten. Negen talen, en een taal daarbuiten gaat er ongewijzigd doorheen, met de timings van Apple onaangeroerd.

Vijf keer nauwkeuriger.

Apple's woordtijden op LibriSpeech test-clean zitten er gemiddeld 106,4 ms naast; Align brengt dat naar 20,2 ms, en 95% van de woorden valt binnen 50 ms, uit een model van 0,7 MB.

20,2ms
Gemiddelde fout, LibriSpeech test-clean
Apple ongecorrigeerd: 106,4 ms
5x
Nauwkeuriger
van 106,4 ms naar 20,2 ms
45,0ms
Tegen met de hand gecorrigeerde grenzen
WhisperX: 53,5 ms
0,7MB
Op het apparaat
gecompileerde Core ML, twee trappen

Gemiddelde absolute afstand tot de referentiewoordgrens, in een steekproef van 500 clips uit elke officiële LibriSpeech-split, zonder gedeelde sprekers tussen training en evaluatie

SplitApple ruwAlignBinnen 50 ms
test-clean106,4ms20,2ms95%
test-other111,6ms24,8ms92%

Geëvalueerd op de v1.0.0-gewichten. De referenties zijn machinale forced-alignment-schattingen van Qwen3-ForcedAligner gecombineerd met een tweede aligner, geen menselijke annotaties: de cijfers tonen een grote en consistente verlaging van de tijdfout, geen exacte waarheid op steekproefniveau. De uitzondering is de vergelijking met WhisperX, gemeten op 258 woordgrenzen die een mens met de hand op de golfvorm heeft gecorrigeerd.

Toepassingen

Precieze woordtijdstempels voor elk transcript.

Ondertitels woord voor woord die bijblijven

Laat elk woord oplichten terwijl het wordt gezegd in een ondertitelweergave, een karaoke-achtig songtekstscherm of een taalleer-app, vanuit het transcript van Apple. De timings landen op het woord in plaats van een tiende seconde ernaast.

Een clip op een woord knippen

Trim een opname tot een citaat in een podcast-editor of een video-app en laat de knip beginnen waar het woord begint. Geen frame van het vorige woord, geen afgekapte medeklinker, en geen handmatig duwtje op de tijdlijn.

Het gesproken woord in een transcript markeren

Scroll een transcript in de pas met het afspelen in een vergaderrecorder of een college-app, waarbij de markering met het woord meebeweegt in plaats van vooruit te lopen op de audio.

Zoeken dat op het moment landt

Spring naar de seconde waarop een woord werd gezegd in een archief van opnames, op het apparaat. De timings zijn strak genoeg dat de afspeelkop op het woord begint en niet midden in het vorige.

Inspiratie

Ideeën om te bouwen met Align. Kopieer een prompt naar je coding-agent en ga.

Align

Highlight each word as it's spoken, timed to the audio.

Align

Tighten a system transcriber's word timings so captions land on the word.

Align

Build a text-based video editor where selecting words trims the clip.

Align

Add bouncing word-by-word captions to vertical videos.

Align

Make transcript search jump the audio to the exact word.

Wat het model doet

  • Corrigeert de timings op woordniveau die Apple's SpeechTranscriber en SpeechAnalyzer teruggeven, zonder ze te vervangen: dezelfde woorden, hetzelfde resultaatoppervlak, strakkere audioTimeRange-waarden.
  • Gemiddelde tijdfout van 124,2 ms naar 43,9 ms, macro-gemiddeld over alle negen talen zodat geen enkele taal het cijfer alleen draagt. In het Engels gaat het verder: van 106,4 ms naar 20,2 ms.
  • In een steekproef van 500 clips uit LibriSpeech test-clean valt 95% van de woorden binnen 50 ms van de referentie, eerder 37%. Het slechtste tiende deel verbetert het meest: van 230,7 ms naar 33,0 ms, ongeveer één videoframe bij 30fps.
  • Een structurele fallback behoudt het oorspronkelijke tijdstempel van Apple telkens als een correctie ongeldig zou zijn, de rand van het zoekvenster raakt of streamingcontext mist.
  • Negen talen: Engels, Spaans, Frans, Italiaans, Portugees, Duits, Japans, Koreaans en Chinees. Andere talen gaan er ongewijzigd doorheen.
  • Ongeveer 0,7 MB gecompileerde Core ML in twee trappen, uitgevoerd op de CPU en de Neural Engine; een typisch resultaat is in enkele milliseconden bijgesteld.

Aan de slag

Voeg woordtijdstempels toe aan je iOS or macOS-app in een paar regels code. Align docs.

iOS, macOS
Installeren
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")
Voorbeeld - Swift
import Align

let refiner = try await SpeechTimestampRefiner(locale: locale)
try await analyzer.start(inputSequence: inputs.recordingAudio(for: refiner))

for try await result in transcriber.results.refiningTimestamps(with: refiner) {
    result.words   // [WordTiming]: text, start, end, refined
}
Bouwen met een prompt
Add Align from Desert Ant Labs to this Swift project (iOS, macOS).

What it does: on-device woordtijdstempels voor elk transcript.

SDK:

Swift (iOS, macOS)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")

Reference:
- Model page: https://desertant.com/models/align/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
AndroidBinnenkort
Web, Node.jsBinnenkort

Specs

Nauwkeurigheid
20,2 ms gemiddelde fout op LibriSpeech test-clean tegenover Apple's 106,4 ms, en 43,9 ms over alle negen talen tegenover Apple's 124,2 ms
Grootte op het apparaat
Ongeveer 0,7 MB gecompileerde Core ML (twee trappen van 0,3 MB, plus de filterbank en de calibrator)
Talen
Engels, Spaans, Frans, Italiaans, Portugees, Duits, Japans, Koreaans, Chinees
Model
Cascade in twee trappen, van grof naar fijn, over een log-mel-spectrogram, met 121 duizend parameters per trap en een gradient-boosting-calibrator
Platforms
iOS 26, macOS 26, tvOS 26, visionOS 26 (Core ML), waar SpeechAnalyzer leeft

Align corrigeert de tijden van een transcriptie; het transcribeert niet, en de Swift-SDK heeft Apple's SpeechAnalyzer nodig, dus iOS 26, macOS 26, tvOS 26 of visionOS 26. Align belooft niet elk woord te verbeteren.

De terugval die het oorspronkelijke tijdstempel behoudt, vangt correcties af die onveilig lijken, niet alle foute. Uitgesproken getallen zijn het zwakste geval: in een kleine steekproef verschoof de correctie de cijfergrenzen verder van de referentie in plaats van ze te laten staan.

FAQ

Wat is Align?

Woordtijdstempels op het apparaat, voor elke transcriptie. Knip, ondertitel en markeer op het woord, vijf keer nauwkeuriger, vanaf 0,7 MB.

Draait Align op het apparaat?

Ja. Align draait op het apparaat, zonder serveraanroep, dus de data blijft bij de gebruiker.

Welke platforms ondersteunt Align?

Align wordt geleverd als een native on-device SDK voor Swift.

Hoeveel kost Align?

Elk model is gratis voor maximaal 100k maandelijks actieve apparaten per SDK. Onbeperkte inference per gebruiker. Neem contact op voor aangepaste licenties.

Hoe nauwkeurig of snel is Align?

Apple's woordtijden op LibriSpeech test-clean zitten er gemiddeld 106,4 ms naast; Align brengt dat naar 20,2 ms, en 95% van de woorden valt binnen 50 ms, uit een model van 0,7 MB.

Bronnen