Desert Ant Labs

Align.

OrdtidsstämplarTillgänglig

Ordtidsstämplar på enheten, för vilken transkriberare som helst. Klipp, texta och markera på ordet, med halva felet, från en modell på 0,7 MB.

Exakta ordtidsstämplar för vilket transkript som helst.

Apple säger att ”world” löper från 2,61 till 3,04 sekunder. Align säger 2,57 till 2,98. Klipp där och klippet blir rent, textningen tänds på ordet, och markeringen börjar där talaren gjorde det.

Du behåller Apples transkriberare. Align läser samma ljud som SpeechAnalyzer redan får och returnerar samma ord med tightare start- och sluttider, på några millisekunder, från en nedladdning på 0,7 MB. På rent ljud tar det Apples genomsnittliga miss från 113 ms till 45 ms.

Ett ord Align inte kan förbättra behåller Apples tid, så en korrigering kan bara hjälpa eller lämna ordet i fred. Nio språk, och en lokal utanför dem passerar igenom med Apples tider orörda.

Halva tidsfelet.

Apples ordtider ligger fel med 113 ms i genomsnitt; Align tar ned det till 45 ms, och tre av fyra ord landar inom 50 ms, från en modell på 0,7 MB.

45ms
Genomsnittligt fel, rent ljud
Apple rått: 113,5 ms
60%
Borttaget fel
rent och brusigt ljud lika
0,7MB
På enheten
kompilerad Core ML, två steg

Genomsnittligt absolut avstånd från referensens ordgräns, 223 rena och 210 brusiga avskilda inspelningar över nio språk

FörhållandeApple råttAlignInom 50 ms
Clean113,5ms44,9ms75,1%
Noisy124,4ms50,1ms69,4%

Utvärderat på den levererade Swift-runtimen och de medföljande Core ML-modellerna. Referenserna är maskinella forced alignment-estimat från Qwen3-ForcedAligner, inte mänskliga annoteringar, så siffrorna visar en stor, konsekvent minskning av Apples tidsfel snarare än ett exakt facit på sampelnivå.

Textning ord för ord som håller takten

Tänd varje ord när det sägs i en textningsvy, en karaokeliknande textskärm eller en språkinlärningsapp, från Apples transkript. Tiderna landar på ordet i stället för en tiondels sekund vid sidan av det.

Klipp ett klipp på ett ord

Trimma en inspelning till ett citat i en poddredigerare eller en videoapp och låt klippet börja där ordet börjar. Ingen bildruta av det föregående ordet, ingen kapad konsonant, och ingen manuell knuff på tidslinjen.

Markera det talade ordet i ett transkript

Rulla ett transkript i takt med uppspelningen i en mötesinspelare eller en föreläsningsapp, med markeringen som flyttas på ordet i stället för att glida före ljudet.

Sökning som landar på ögonblicket

Hoppa till sekunden ett ord sades i ett arkiv av inspelningar, på enheten. Tiderna är tighta nog att uppspelningshuvudet börjar på ordet och inte mitt i det föregående.

Inspiration

Idéer att bygga med Align. Kopiera en prompt till din kodningsagent och kör.

Align

Highlight each word as it's spoken, timed to the audio.

Align

Tighten a system transcriber's word timings so captions land on the word.

Align

Build a text-based video editor where selecting words trims the clip.

Align

Add bouncing word-by-word captions to vertical videos.

Align

Make transcript search jump the audio to the exact word.

Vad modellen gör

  • Korrigerar tiderna på ordnivå som Apples SpeechTranscriber och SpeechAnalyzer returnerar, utan att ersätta dem: samma ord, samma resultatyta, tightare audioTimeRange-värden.
  • Genomsnittligt tidsfel från 113,5 ms till 44,9 ms på rent ljud och från 124,4 ms till 50,1 ms på brusigt ljud, en minskning med 60%, uppmätt på 433 avskilda inspelningar mot forced alignment-referenser.
  • 75,1% av orden landar inom 50 ms från referensen på rent ljud, 69,4% på brusigt ljud.
  • En strukturell reserv behåller Apples ursprungliga tidsstämpel närhelst en korrigering skulle vara ogiltig, når sökfönstrets kant eller saknar strömningskontext.
  • Nio språk: engelska, spanska, franska, italienska, portugisiska, tyska, japanska, koreanska och kinesiska. Andra lokaler passerar igenom oförändrade.
  • Ungefär 0,7 MB kompilerad Core ML i två steg, körd på CPU:n och Neural Engine; ett typiskt resultat förfinas på några millisekunder.

Kom igång

Lägg till ordtidsstämplar i din iOS or macOS-app med några rader kod. Align-dokumentation.

iOS, macOS
Installera
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")
Exempel - Swift
import Align

let refiner = try await SpeechTimestampRefiner(locale: locale)
try await analyzer.start(inputSequence: inputs.recordingAudio(for: refiner))

for try await result in transcriber.results.refiningTimestamps(with: refiner) {
    result.words   // [WordTiming]: text, start, end, refined
}
Bygg med en prompt
Add Align from Desert Ant Labs to this Swift project (iOS, macOS).

What it does: Ordtidsstämplar på enheten för vilket transkript som helst.

SDK:

Swift (iOS, macOS)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")

Reference:
- Model page: https://desertant.com/models/align/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
AndroidKommer snart
Web, Node.jsKommer snart

Specifikationer

Noggrannhet
44,9 ms genomsnittligt fel på rent ljud, 50,1 ms på brusigt, mot Apples 113,5 ms och 124,4 ms
Storlek på enheten
Ungefär 0,7 MB kompilerad Core ML (två steg på 0,3 MB plus filterbanken och kalibratorn)
Språk
engelska, spanska, franska, italienska, portugisiska, tyska, japanska, koreanska, kinesiska
Modell
Tvåstegs grov-till-fin-kaskad över ett log-mel-spektrogram, ungefär 117k parametrar per steg, med en gradient-boostad kalibrator
Plattformar
iOS 26, macOS 26, tvOS 26, visionOS 26 (Core ML), där SpeechAnalyzer finns

Align korrigerar Apples tider; den transkriberar inte, och den behöver Apples SpeechAnalyzer, vilket innebär iOS 26, macOS 26, tvOS 26 eller visionOS 26. Align kan inte lova att förbättra varje ord.

Reserven som behåller Apples tid fångar korrigeringar som ser osäkra ut, inte varje felaktig. Engelska, italienska, japanska och koreanska är de svagaste av de nio språken under de nuvarande referenserna.

Vanliga frågor

Vad är Align?

Ordtidsstämplar på enheten, för vilken transkriberare som helst. Klipp, texta och markera på ordet, med halva felet, från en modell på 0,7 MB.

Körs Align lokalt på enheten?

Ja. Align körs på enheten, utan något serveranrop, så att data stannar hos användaren.

Vilka plattformar stöder Align?

Align levereras som en nativ SDK på enheten för Swift.

Vad kostar Align?

Varje modell är gratis upp till 100k månadsaktiva enheter per SDK. Obegränsad inferens per användare. Kontakta oss för anpassade licenser.

Hur träffsäker eller snabb är Align?

Apples ordtider ligger fel med 113 ms i genomsnitt; Align tar ned det till 45 ms, och tre av fyra ord landar inom 50 ms, från en modell på 0,7 MB.

Resurser