Desert Ant Labs

Align.

WoordtijdstempelsBeschikbaar

Woordtijdstempels op het apparaat, voor elke transcriber. Knip, ondertitel en markeer op het woord, met de helft van de fout, uit een model van 0,7 MB.

Precieze woordtijdstempels voor elk transcript.

Apple zegt dat “world” loopt van 2,61 tot 3,04 seconden. Align zegt 2,57 tot 2,98. Knip daar en de knip is schoon, de ondertitel licht op bij het woord, en de markering begint waar de spreker begon.

Je houdt de transcriber van Apple. Align leest dezelfde audio die SpeechAnalyzer al krijgt en geeft dezelfde woorden terug met strakkere begin- en eindtijden, in een paar milliseconden, uit een download van 0,7 MB. Op schone audio brengt dat de gemiddelde afwijking van Apple van 113 ms naar 45 ms.

Een woord dat Align niet kan verbeteren, houdt de timing van Apple, dus een correctie kan alleen helpen of het woord met rust laten. Negen talen, en een taal daarbuiten gaat er ongewijzigd doorheen, met de timings van Apple onaangeroerd.

De helft van de timingfout.

De woordtimings van Apple zitten er gemiddeld 113 ms naast; Align brengt dat naar 45 ms, en drie op de vier woorden landen binnen 50 ms, uit een model van 0,7 MB.

45ms
Gemiddelde fout, schone audio
Apple ruw: 113,5 ms
60%
Fout weggenomen
schone audio en audio met ruis gelijk
0,7MB
Op het apparaat
gecompileerde Core ML, twee fasen

Gemiddelde absolute afstand tot de referentie-woordgrens, 223 schone en 210 opnames met ruis, apart gehouden, in negen talen

ConditieApple ruwAlignBinnen 50 ms
Clean113,5ms44,9ms75,1%
Noisy124,4ms50,1ms69,4%

Geëvalueerd op de uitgeleverde Swift-runtime en de meegeleverde Core ML-modellen. De referenties zijn machinale forced-alignment-schattingen van Qwen3-ForcedAligner, geen menselijke annotaties, dus de cijfers tonen een grote, consistente reductie van de timingfout van Apple in plaats van een op de sample nauwkeurige gouden standaard.

Ondertitels woord voor woord die bijblijven

Laat elk woord oplichten terwijl het wordt gezegd in een ondertitelweergave, een karaoke-achtig songtekstscherm of een taalleer-app, vanuit het transcript van Apple. De timings landen op het woord in plaats van een tiende seconde ernaast.

Een clip op een woord knippen

Trim een opname tot een citaat in een podcast-editor of een video-app en laat de knip beginnen waar het woord begint. Geen frame van het vorige woord, geen afgekapte medeklinker, en geen handmatig duwtje op de tijdlijn.

Het gesproken woord in een transcript markeren

Scroll een transcript in de pas met het afspelen in een vergaderrecorder of een college-app, waarbij de markering met het woord meebeweegt in plaats van vooruit te lopen op de audio.

Zoeken dat op het moment landt

Spring naar de seconde waarop een woord werd gezegd in een archief van opnames, op het apparaat. De timings zijn strak genoeg dat de afspeelkop op het woord begint en niet midden in het vorige.

Inspiratie

Ideeën om te bouwen met Align. Kopieer een prompt naar je coding-agent en ga.

Align

Highlight each word as it's spoken, timed to the audio.

Align

Tighten a system transcriber's word timings so captions land on the word.

Align

Build a text-based video editor where selecting words trims the clip.

Align

Add bouncing word-by-word captions to vertical videos.

Align

Make transcript search jump the audio to the exact word.

Wat het model doet

  • Corrigeert de timings op woordniveau die Apple's SpeechTranscriber en SpeechAnalyzer teruggeven, zonder ze te vervangen: dezelfde woorden, hetzelfde resultaatoppervlak, strakkere audioTimeRange-waarden.
  • Gemiddelde timingfout van 113,5 ms naar 44,9 ms op schone audio en van 124,4 ms naar 50,1 ms op audio met ruis, een reductie van 60%, gemeten op 433 apart gehouden opnames tegen forced-alignment-referenties.
  • 75,1% van de woorden landt binnen 50 ms van de referentie op schone audio, 69,4% op audio met ruis.
  • Een structurele fallback behoudt het oorspronkelijke tijdstempel van Apple telkens als een correctie ongeldig zou zijn, de rand van het zoekvenster raakt of streamingcontext mist.
  • Negen talen: Engels, Spaans, Frans, Italiaans, Portugees, Duits, Japans, Koreaans en Chinees. Andere talen gaan er ongewijzigd doorheen.
  • Ongeveer 0,7 MB gecompileerde Core ML in twee fasen, uitgevoerd op de CPU en Neural Engine; een typisch resultaat wordt in een paar milliseconden verfijnd.

Aan de slag

Voeg woordtijdstempels toe aan je iOS or macOS-app in een paar regels code. Align docs.

iOS, macOS
Installeren
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")
Voorbeeld - Swift
import Align

let refiner = try await SpeechTimestampRefiner(locale: locale)
try await analyzer.start(inputSequence: inputs.recordingAudio(for: refiner))

for try await result in transcriber.results.refiningTimestamps(with: refiner) {
    result.words   // [WordTiming]: text, start, end, refined
}
Bouwen met een prompt
Add Align from Desert Ant Labs to this Swift project (iOS, macOS).

What it does: on-device woordtijdstempels voor elk transcript.

SDK:

Swift (iOS, macOS)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")

Reference:
- Model page: https://desertant.com/models/align/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
AndroidBinnenkort
Web, Node.jsBinnenkort

Specs

Nauwkeurigheid
44,9 ms gemiddelde fout op schone audio, 50,1 ms op audio met ruis, tegenover 113,5 ms en 124,4 ms van Apple
Grootte op het apparaat
Ongeveer 0,7 MB gecompileerde Core ML (twee fasen van 0,3 MB plus de filterbank en calibrator)
Talen
Engels, Spaans, Frans, Italiaans, Portugees, Duits, Japans, Koreaans, Chinees
Model
Cascade van grof naar fijn in twee fasen over een log-mel-spectrogram, ongeveer 117k parameters per fase, met een gradient-boosted calibrator
Platforms
iOS 26, macOS 26, tvOS 26, visionOS 26 (Core ML), waar SpeechAnalyzer leeft

Align corrigeert de timings van Apple; het transcribeert niet, en het heeft Apple's SpeechAnalyzer nodig, wat neerkomt op iOS 26, macOS 26, tvOS 26 of visionOS 26. Align kan niet beloven elk woord te verbeteren.

De fallback die de timing van Apple behoudt, vangt correcties op die onveilig lijken, niet elke foute. Engels, Italiaans, Japans en Koreaans zijn de zwakste van de negen talen onder de huidige referenties.

FAQ

Wat is Align?

Woordtijdstempels op het apparaat, voor elke transcriber. Knip, ondertitel en markeer op het woord, met de helft van de fout, uit een model van 0,7 MB.

Draait Align op het apparaat?

Ja. Align draait op het apparaat, zonder serveraanroep, dus de data blijft bij de gebruiker.

Welke platforms ondersteunt Align?

Align wordt geleverd als een native on-device SDK voor Swift.

Hoeveel kost Align?

Elk model is gratis voor maximaal 100k maandelijks actieve apparaten per SDK. Onbeperkte inference per gebruiker. Neem contact op voor aangepaste licenties.

Hoe nauwkeurig of snel is Align?

De woordtimings van Apple zitten er gemiddeld 113 ms naast; Align brengt dat naar 45 ms, en drie op de vier woorden landen binnen 50 ms, uit een model van 0,7 MB.

Bronnen