Desert Ant Labs

Align

OrdtidsstämplarTillgänglig

Ordtidsstämplar på enheten, för vilken transkribering som helst. Klipp, texta och markera på ordet, fem gånger noggrannare, från 0,7 MB.

Exakta ordtidsstämplar för vilket transkript som helst.

Apple säger att ”world” löper från 2,61 till 3,04 sekunder. Align säger 2,57 till 2,98. Klipp där och klippet blir rent, textningen tänds på ordet, och markeringen börjar där talaren gjorde det.

Du behåller Apples transkriberare. Align läser samma ljud som SpeechAnalyzer redan får och returnerar samma ord med tightare start- och sluttider, på några millisekunder, från en nedladdning på 0,7 MB. På rent ljud tar det Apples genomsnittliga miss från 113 ms till 45 ms.

Ett ord Align inte kan förbättra behåller Apples tid, så en korrigering kan bara hjälpa eller lämna ordet i fred. Nio språk, och en lokal utanför dem passerar igenom med Apples tider orörda.

Fem gånger noggrannare.

Apples ordtider på LibriSpeech test-clean ligger i snitt 106,4 ms fel; Align tar det till 20,2 ms, och 95% av orden hamnar inom 50 ms, från en modell på 0,7 MB.

20,2ms
Genomsnittligt fel, LibriSpeech test-clean
Apple orättat: 106,4 ms
5x
Noggrannare
från 106,4 ms till 20,2 ms
45,0ms
Mot handrättade gränser
WhisperX: 53,5 ms
0,7MB
På enheten
kompilerad Core ML, två steg

Genomsnittligt absolut avstånd till referensens ordgräns, i ett urval på 500 klipp ur varje officiell LibriSpeech-split, utan någon talare gemensam mellan träning och utvärdering

SplitApple råttAlignInom 50 ms
test-clean106,4ms20,2ms95%
test-other111,6ms24,8ms92%

Utvärderat på v1.0.0-vikterna. Referenserna är maskinella forced alignment-skattningar från Qwen3-ForcedAligner kombinerat med en andra aligner, inte mänskliga annoteringar: siffrorna visar en stor och konsekvent minskning av tidsfelet, inte exakt sanning på urvalsnivå. Undantaget är jämförelsen med WhisperX, mätt på 258 ordgränser som en människa rättat för hand mot vågformen.

Användningsfall

Exakta ordtidsstämplar för vilket transkript som helst.

Textning ord för ord som håller takten

Tänd varje ord när det sägs i en textningsvy, en karaokeliknande textskärm eller en språkinlärningsapp, från Apples transkript. Tiderna landar på ordet i stället för en tiondels sekund vid sidan av det.

Klipp ett klipp på ett ord

Trimma en inspelning till ett citat i en poddredigerare eller en videoapp och låt klippet börja där ordet börjar. Ingen bildruta av det föregående ordet, ingen kapad konsonant, och ingen manuell knuff på tidslinjen.

Markera det talade ordet i ett transkript

Rulla ett transkript i takt med uppspelningen i en mötesinspelare eller en föreläsningsapp, med markeringen som flyttas på ordet i stället för att glida före ljudet.

Sökning som landar på ögonblicket

Hoppa till sekunden ett ord sades i ett arkiv av inspelningar, på enheten. Tiderna är tighta nog att uppspelningshuvudet börjar på ordet och inte mitt i det föregående.

Inspiration

Idéer att bygga med Align. Kopiera en prompt till din kodningsagent och kör.

Align

Highlight each word as it's spoken, timed to the audio.

Align

Tighten a system transcriber's word timings so captions land on the word.

Align

Build a text-based video editor where selecting words trims the clip.

Align

Add bouncing word-by-word captions to vertical videos.

Align

Make transcript search jump the audio to the exact word.

Vad modellen gör

  • Korrigerar tiderna på ordnivå som Apples SpeechTranscriber och SpeechAnalyzer returnerar, utan att ersätta dem: samma ord, samma resultatyta, tightare audioTimeRange-värden.
  • Genomsnittligt tidsfel från 124,2 ms till 43,9 ms, makrogenomsnitt över alla nio språk så att inget språk ensamt bär siffran. På engelska går det längre: från 106,4 ms till 20,2 ms.
  • I ett urval på 500 klipp ur LibriSpeech test-clean hamnar 95% av orden inom 50 ms från referensen, mot 37% tidigare. Den sämsta tiondelen förbättras mest: från 230,7 ms till 33,0 ms, ungefär en videobildruta vid 30fps.
  • En strukturell reserv behåller Apples ursprungliga tidsstämpel närhelst en korrigering skulle vara ogiltig, når sökfönstrets kant eller saknar strömningskontext.
  • Nio språk: engelska, spanska, franska, italienska, portugisiska, tyska, japanska, koreanska och kinesiska. Andra lokaler passerar igenom oförändrade.
  • Ungefär 0,7 MB kompilerad Core ML i två steg, som körs på CPU och Neural Engine; ett typiskt resultat finjusteras på några millisekunder.

Kom igång

Lägg till ordtidsstämplar i din iOS or macOS-app med några rader kod. Align-dokumentation.

iOS, macOS
Installera
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")
Exempel - Swift
import Align

let refiner = try await SpeechTimestampRefiner(locale: locale)
try await analyzer.start(inputSequence: inputs.recordingAudio(for: refiner))

for try await result in transcriber.results.refiningTimestamps(with: refiner) {
    result.words   // [WordTiming]: text, start, end, refined
}
Bygg med en prompt
Add Align from Desert Ant Labs to this Swift project (iOS, macOS).

What it does: Ordtidsstämplar på enheten för vilket transkript som helst.

SDK:

Swift (iOS, macOS)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")

Reference:
- Model page: https://desertant.com/models/align/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
AndroidKommer snart
Web, Node.jsKommer snart

Specifikationer

Noggrannhet
20,2 ms genomsnittligt fel på LibriSpeech test-clean mot Apples 106,4 ms, och 43,9 ms över alla nio språk mot Apples 124,2 ms
Storlek på enheten
Ungefär 0,7 MB kompilerad Core ML (två steg på 0,3 MB, plus filterbanken och kalibratorn)
Språk
engelska, spanska, franska, italienska, portugisiska, tyska, japanska, koreanska, kinesiska
Modell
Kaskad i två steg, från grov till fin, över ett log-mel-spektrogram, med 121 tusen parametrar per steg och en kalibrator byggd på gradient boosting
Plattformar
iOS 26, macOS 26, tvOS 26, visionOS 26 (Core ML), där SpeechAnalyzer finns

Align rättar tiderna från en transkribering; den transkriberar inte, och Swift-SDK:t kräver Apples SpeechAnalyzer, alltså iOS 26, macOS 26, tvOS 26 eller visionOS 26. Align lovar inte att förbättra varje ord.

Reservlösningen som behåller den ursprungliga tidsstämpeln fångar korrigeringar som ser osäkra ut, inte alla felaktiga. Uttalade siffror är det svagaste fallet: i ett litet urval flyttade finjusteringen siffergränserna längre från referensen i stället för att låta dem vara.

Vanliga frågor

Vad är Align?

Ordtidsstämplar på enheten, för vilken transkribering som helst. Klipp, texta och markera på ordet, fem gånger noggrannare, från 0,7 MB.

Körs Align lokalt på enheten?

Ja. Align körs på enheten, utan något serveranrop, så att data stannar hos användaren.

Vilka plattformar stöder Align?

Align levereras som en nativ SDK på enheten för Swift.

Vad kostar Align?

Varje modell är gratis upp till 100k månadsaktiva enheter per SDK. Obegränsad inferens per användare. Kontakta oss för anpassade licenser.

Hur träffsäker eller snabb är Align?

Apples ordtider på LibriSpeech test-clean ligger i snitt 106,4 ms fel; Align tar det till 20,2 ms, och 95% av orden hamnar inom 50 ms, från en modell på 0,7 MB.

Resurser