Desert Ant Labs

Align.

Timestamp per parolaDisponibile

Timestamp per parola on-device, per qualsiasi trascrittore. Taglia, sottotitola ed evidenzia sulla parola, con metà dell'errore, da un modello di 0,7 MB.

Timestamp per parola precisi per ogni trascrizione.

Apple dice che «world» va da 2,61 a 3,04 secondi. Align dice da 2,57 a 2,98. Taglia lì e il taglio è pulito, il sottotitolo si accende sulla parola, e l'evidenziazione parte da dove è partito chi parla.

Tieni il trascrittore di Apple. Align legge lo stesso audio che SpeechAnalyzer riceve già e restituisce le stesse parole con tempi di inizio e fine più precisi, in pochi millisecondi, da un download di 0,7 MB. Su audio pulito porta l'errore medio di Apple da 113 ms a 45 ms.

Una parola che Align non può migliorare mantiene il tempo di Apple, quindi una correzione può solo aiutare o lasciare la parola com'è. Nove lingue, e una lingua fuori da queste passa con i tempi di Apple intatti.

Metà dell'errore sui tempi.

I tempi delle parole di Apple sbagliano in media di 113 ms; Align li porta a 45 ms, e tre parole su quattro cadono entro 50 ms, da un modello da 0,7 MB.

45 ms
Errore medio, audio pulito
Apple grezzo: 113,5 ms
60%
Errore eliminato
audio pulito e rumoroso allo stesso modo
0,7 MB
Sul dispositivo
Core ML compilato, due stadi

Distanza media assoluta dal confine di parola di riferimento, 223 registrazioni pulite e 210 rumorose tenute da parte, in nove lingue

CondizioneApple grezzoAlignEntro 50 ms
Clean113,5 ms44,9 ms75,1%
Noisy124,4 ms50,1 ms69,4%

Valutato sul runtime Swift distribuito e sui modelli Core ML inclusi. I riferimenti sono stime di allineamento forzato automatico da Qwen3-ForcedAligner, non annotazioni umane, quindi i valori mostrano una riduzione ampia e costante dell'errore sui tempi di Apple più che un dato di riferimento accurato al campione.

Sottotitoli parola per parola che stanno al passo

Accendi ogni parola nel momento in cui viene detta in una vista di sottotitoli, in una schermata di testi in stile karaoke o in un'app per imparare le lingue, dalla trascrizione di Apple. I tempi cadono sulla parola invece che un decimo di secondo più in là.

Taglia una clip su una parola

Ritaglia una registrazione fino a una citazione in un editor di podcast o in un'app video e fai partire il taglio da dove parte la parola. Nessun fotogramma della parola precedente, nessuna consonante mozzata, e nessuna correzione manuale sulla timeline.

Evidenzia la parola pronunciata in una trascrizione

Scorri una trascrizione al passo con la riproduzione in un registratore di riunioni o in un'app per le lezioni, con l'evidenziazione che si muove sulla parola invece di scappare avanti rispetto all'audio.

Una ricerca che cade sul momento giusto

Salta al secondo esatto in cui una parola è stata detta in un archivio di registrazioni, sul dispositivo. I tempi sono così precisi che la testina parte sulla parola e non a metà di quella precedente.

Ispirazione

Idee da costruire con Align. Copia un prompt nel tuo coding agent e parti.

Align

Highlight each word as it's spoken, timed to the audio.

Align

Tighten a system transcriber's word timings so captions land on the word.

Align

Build a text-based video editor where selecting words trims the clip.

Align

Add bouncing word-by-word captions to vertical videos.

Align

Make transcript search jump the audio to the exact word.

Cosa fa il modello

  • Corregge i tempi a livello di parola che restituiscono SpeechTranscriber e SpeechAnalyzer di Apple, senza sostituirli: stesse parole, stessa superficie di risultato, valori audioTimeRange più precisi.
  • Errore medio dei tempi da 113,5 ms a 44,9 ms su audio pulito e da 124,4 ms a 50,1 ms su audio rumoroso, una riduzione del 60%, misurato su 433 registrazioni tenute da parte rispetto a riferimenti di allineamento forzato.
  • Il 75,1% delle parole cade entro 50 ms dal riferimento su audio pulito, il 69,4% su audio rumoroso.
  • Un fallback strutturale mantiene il timestamp originale di Apple ogni volta che una correzione sarebbe non valida, tocca il bordo della finestra di ricerca o non ha contesto di streaming.
  • Nove lingue: inglese, spagnolo, francese, italiano, portoghese, tedesco, giapponese, coreano e cinese. Le altre lingue passano invariate.
  • Circa 0,7 MB di Core ML compilato in due stadi, eseguiti su CPU e Neural Engine; un risultato tipico è affinato in pochi millisecondi.

Per iniziare

Aggiungi timestamp per parola alla tua app iOS or macOS in poche righe di codice. Documentazione di Align.

iOS, macOS
Installazione
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")
Esempio - Swift
import Align

let refiner = try await SpeechTimestampRefiner(locale: locale)
try await analyzer.start(inputSequence: inputs.recordingAudio(for: refiner))

for try await result in transcriber.results.refiningTimestamps(with: refiner) {
    result.words   // [WordTiming]: text, start, end, refined
}
Costruisci con un prompt
Add Align from Desert Ant Labs to this Swift project (iOS, macOS).

What it does: timestamp per parola on-device per qualsiasi trascrizione.

SDK:

Swift (iOS, macOS)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")

Reference:
- Model page: https://desertant.com/models/align/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
AndroidIn arrivo
Web, Node.jsIn arrivo

Specifiche

Accuratezza
Errore medio di 44,9 ms su audio pulito, 50,1 ms su rumoroso, contro i 113,5 ms e 124,4 ms di Apple
Dimensione sul dispositivo
Circa 0,7 MB di Core ML compilato (due stadi da 0,3 MB più il banco di filtri e il calibratore)
Lingue
Inglese, spagnolo, francese, italiano, portoghese, tedesco, giapponese, coreano, cinese
Modello
Cascata a due stadi dal grossolano al fine su uno spettrogramma log-mel, circa 117k parametri per stadio, con un calibratore a gradient boosting
Piattaforme
iOS 26, macOS 26, tvOS 26, visionOS 26 (Core ML), dove vive SpeechAnalyzer

Align corregge i tempi di Apple; non trascrive, e ha bisogno di SpeechAnalyzer di Apple, cioè iOS 26, macOS 26, tvOS 26 o visionOS 26. Align non può promettere di migliorare ogni parola.

Il fallback che mantiene il tempo di Apple intercetta le correzioni che sembrano rischiose, non ogni correzione sbagliata. Inglese, italiano, giapponese e coreano sono le più deboli delle nove lingue con i riferimenti attuali.

FAQ

Cos'è Align?

Timestamp per parola on-device, per qualsiasi trascrittore. Taglia, sottotitola ed evidenzia sulla parola, con metà dell'errore, da un modello di 0,7 MB.

Align funziona sul dispositivo?

Sì. Align funziona sul dispositivo, senza chiamate a un server, quindi i dati restano con l'utente.

Quali piattaforme supporta Align?

Align è distribuito come SDK nativo on-device per Swift.

Quanto costa Align?

Ogni modello è gratuito fino a 100k dispositivi attivi mensili per SDK. Inferenza illimitata per utente. Contattaci per licenze personalizzate.

Quanto è preciso o veloce Align?

I tempi delle parole di Apple sbagliano in media di 113 ms; Align li porta a 45 ms, e tre parole su quattro cadono entro 50 ms, da un modello da 0,7 MB.

Risorse