Align.
Ordtidsstämplar på enheten, för vilken transkriberare som helst. Klipp, texta och markera på ordet, med halva felet, från en modell på 0,7 MB.
Exakta ordtidsstämplar för vilket transkript som helst.
Apple säger att ”world” löper från 2,61 till 3,04 sekunder. Align säger 2,57 till 2,98. Klipp där och klippet blir rent, textningen tänds på ordet, och markeringen börjar där talaren gjorde det.
Du behåller Apples transkriberare. Align läser samma ljud som SpeechAnalyzer redan får och returnerar samma ord med tightare start- och sluttider, på några millisekunder, från en nedladdning på 0,7 MB. På rent ljud tar det Apples genomsnittliga miss från 113 ms till 45 ms.
Ett ord Align inte kan förbättra behåller Apples tid, så en korrigering kan bara hjälpa eller lämna ordet i fred. Nio språk, och en lokal utanför dem passerar igenom med Apples tider orörda.
Halva tidsfelet.
Apples ordtider ligger fel med 113 ms i genomsnitt; Align tar ned det till 45 ms, och tre av fyra ord landar inom 50 ms, från en modell på 0,7 MB.
Genomsnittligt absolut avstånd från referensens ordgräns, 223 rena och 210 brusiga avskilda inspelningar över nio språk
| Förhållande | Apple rått | Align | Inom 50 ms |
|---|---|---|---|
| Clean | 113,5ms | 44,9ms | 75,1% |
| Noisy | 124,4ms | 50,1ms | 69,4% |
Utvärderat på den levererade Swift-runtimen och de medföljande Core ML-modellerna. Referenserna är maskinella forced alignment-estimat från Qwen3-ForcedAligner, inte mänskliga annoteringar, så siffrorna visar en stor, konsekvent minskning av Apples tidsfel snarare än ett exakt facit på sampelnivå.
Textning ord för ord som håller takten
Tänd varje ord när det sägs i en textningsvy, en karaokeliknande textskärm eller en språkinlärningsapp, från Apples transkript. Tiderna landar på ordet i stället för en tiondels sekund vid sidan av det.
Klipp ett klipp på ett ord
Trimma en inspelning till ett citat i en poddredigerare eller en videoapp och låt klippet börja där ordet börjar. Ingen bildruta av det föregående ordet, ingen kapad konsonant, och ingen manuell knuff på tidslinjen.
Markera det talade ordet i ett transkript
Rulla ett transkript i takt med uppspelningen i en mötesinspelare eller en föreläsningsapp, med markeringen som flyttas på ordet i stället för att glida före ljudet.
Sökning som landar på ögonblicket
Hoppa till sekunden ett ord sades i ett arkiv av inspelningar, på enheten. Tiderna är tighta nog att uppspelningshuvudet börjar på ordet och inte mitt i det föregående.
Inspiration
Idéer att bygga med Align. Kopiera en prompt till din kodningsagent och kör.
Highlight each word as it's spoken, timed to the audio.
Run Apple's SpeechTranscriber with Desert Ant's Align attached as a timestamp refiner, then highlight each word using its refined time range. Align tightens Apple's word timings on-device; iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Tighten a system transcriber's word timings so captions land on the word.
Attach Desert Ant's Align as a refiner to Apple's SpeechAnalyzer / SpeechTranscriber so its word-level timings tighten and captions and cuts land exactly on the word. iOS 26 / macOS 26, on-device. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Build a text-based video editor where selecting words trims the clip.
Transcribe with Apple's SpeechTranscriber and Desert Ant's Align refiner for word-exact timings, then let the user select words to trim the video to that span. Deleting a sentence deletes the footage. iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Add bouncing word-by-word captions to vertical videos.
Add animated word-by-word captions to short vertical videos, timed with Desert Ant's Align attached to Apple's SpeechTranscriber so each word pops exactly when it's said. On-device, iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Make transcript search jump the audio to the exact word.
In an Apple media app, transcribe with SpeechTranscriber and Desert Ant's Align refiner so a search result seeks the audio or video to the precise word, not the sentence. iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Vad modellen gör
- Korrigerar tiderna på ordnivå som Apples
SpeechTranscriberochSpeechAnalyzerreturnerar, utan att ersätta dem: samma ord, samma resultatyta, tightareaudioTimeRange-värden. - Genomsnittligt tidsfel från 113,5 ms till 44,9 ms på rent ljud och från 124,4 ms till 50,1 ms på brusigt ljud, en minskning med 60%, uppmätt på 433 avskilda inspelningar mot forced alignment-referenser.
- 75,1% av orden landar inom 50 ms från referensen på rent ljud, 69,4% på brusigt ljud.
- En strukturell reserv behåller Apples ursprungliga tidsstämpel närhelst en korrigering skulle vara ogiltig, når sökfönstrets kant eller saknar strömningskontext.
- Nio språk: engelska, spanska, franska, italienska, portugisiska, tyska, japanska, koreanska och kinesiska. Andra lokaler passerar igenom oförändrade.
- Ungefär 0,7 MB kompilerad Core ML i två steg, körd på CPU:n och Neural Engine; ett typiskt resultat förfinas på några millisekunder.
Kom igång
Lägg till ordtidsstämplar i din iOS or macOS-app med några rader kod. Align-dokumentation.
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")
import Align
let refiner = try await SpeechTimestampRefiner(locale: locale)
try await analyzer.start(inputSequence: inputs.recordingAudio(for: refiner))
for try await result in transcriber.results.refiningTimestamps(with: refiner) {
result.words // [WordTiming]: text, start, end, refined
}
Add Align from Desert Ant Labs to this Swift project (iOS, macOS). What it does: Ordtidsstämplar på enheten för vilket transkript som helst. SDK: Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0") // target dependency .product(name: "Align", package: "desert-ant-core") Reference: - Model page: https://desertant.com/models/align/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Specifikationer
- Noggrannhet
- 44,9 ms genomsnittligt fel på rent ljud, 50,1 ms på brusigt, mot Apples 113,5 ms och 124,4 ms
- Storlek på enheten
- Ungefär 0,7 MB kompilerad Core ML (två steg på 0,3 MB plus filterbanken och kalibratorn)
- Språk
- engelska, spanska, franska, italienska, portugisiska, tyska, japanska, koreanska, kinesiska
- Modell
- Tvåstegs grov-till-fin-kaskad över ett log-mel-spektrogram, ungefär 117k parametrar per steg, med en gradient-boostad kalibrator
- Plattformar
- iOS 26, macOS 26, tvOS 26, visionOS 26 (Core ML), där SpeechAnalyzer finns
Align korrigerar Apples tider; den transkriberar inte, och den behöver Apples SpeechAnalyzer, vilket innebär iOS 26, macOS 26, tvOS 26 eller visionOS 26. Align kan inte lova att förbättra varje ord.
Reserven som behåller Apples tid fångar korrigeringar som ser osäkra ut, inte varje felaktig. Engelska, italienska, japanska och koreanska är de svagaste av de nio språken under de nuvarande referenserna.
Vanliga frågor
Vad är Align?
Ordtidsstämplar på enheten, för vilken transkriberare som helst. Klipp, texta och markera på ordet, med halva felet, från en modell på 0,7 MB.
Körs Align lokalt på enheten?
Ja. Align körs på enheten, utan något serveranrop, så att data stannar hos användaren.
Vilka plattformar stöder Align?
Align levereras som en nativ SDK på enheten för Swift.
Vad kostar Align?
Varje modell är gratis upp till 100k månadsaktiva enheter per SDK. Obegränsad inferens per användare. Kontakta oss för anpassade licenser.
Hur träffsäker eller snabb är Align?
Apples ordtider ligger fel med 113 ms i genomsnitt; Align tar ned det till 45 ms, och tre av fyra ord landar inom 50 ms, från en modell på 0,7 MB.