Align.
Horodatage des mots sur l'appareil, pour tout transcripteur : coupez, sous-titrez et surlignez au mot près, deux fois plus précis, depuis un modèle de 0,7 MB.
Des horodatages de mots précis pour toute transcription.
Apple situe « world » de 2,61 à 3,04 secondes. Align dit 2,57 à 2,98. Coupez là et la coupe est nette, le sous-titre s'allume sur le mot, et le surlignage commence là où le locuteur a commencé.
Vous gardez le transcripteur d'Apple. Align lit le même audio que SpeechAnalyzer reçoit déjà et renvoie les mêmes mots avec des temps de début et de fin plus serrés, en quelques millisecondes, depuis un téléchargement de 0,7 MB. Sur un audio propre, l'écart moyen d'Apple passe de 113 ms à 45 ms.
Un mot qu'Align ne peut pas améliorer garde l'horodatage d'Apple : une correction ne peut donc qu'aider ou laisser le mot tel quel. Neuf langues, et une langue hors de cette liste passe avec les horodatages d'Apple intacts.
Deux fois moins d'erreur d'horodatage.
Les horodatages de mots d'Apple sont décalés de 113 ms en moyenne ; Align ramène cela à 45 ms, et trois mots sur quatre tombent à 50 ms près, depuis un modèle de 0,7 MB.
Distance absolue moyenne à la frontière de mot de référence, 223 enregistrements de test propres et 210 bruités dans neuf langues
| Condition | Apple brut | Align | À 50 ms près |
|---|---|---|---|
| Clean | 113,5 ms | 44,9 ms | 75,1 % |
| Noisy | 124,4 ms | 50,1 ms | 69,4 % |
Évalué sur le runtime Swift livré et les modèles Core ML fournis. Les références sont des estimations d'alignement forcé automatique issues de Qwen3-ForcedAligner, pas des annotations humaines : les chiffres montrent donc une réduction importante et constante de l'erreur d'horodatage d'Apple plutôt qu'une vérité terrain à l'échantillon près.
Des sous-titres mot à mot qui suivent
Allumez chaque mot au moment où il est dit dans une vue de sous-titres, un écran de paroles karaoké ou une app d'apprentissage des langues, à partir de la transcription d'Apple. Les horodatages tombent sur le mot, et non un dixième de seconde à côté.
Couper un clip sur un mot
Rognez un enregistrement jusqu'à une citation dans un éditeur de podcast ou une app vidéo, et faites commencer la coupe là où le mot commence. Aucune image du mot précédent, aucune consonne tronquée, aucun ajustement manuel sur la timeline.
Surligner le mot prononcé dans une transcription
Faites défiler une transcription au rythme de la lecture dans un enregistreur de réunions ou une app de cours, le surlignage se déplaçant sur le mot au lieu de devancer l'audio.
Une recherche qui tombe au bon moment
Sautez à la seconde où un mot a été dit dans une archive d'enregistrements, sur l'appareil. Les horodatages sont assez serrés pour que la tête de lecture démarre sur le mot et non au milieu du précédent.
Inspiration
Des idées à construire avec Align. Copiez un prompt dans votre agent de code et lancez-vous.
Highlight each word as it's spoken, timed to the audio.
Run Apple's SpeechTranscriber with Desert Ant's Align attached as a timestamp refiner, then highlight each word using its refined time range. Align tightens Apple's word timings on-device; iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Tighten a system transcriber's word timings so captions land on the word.
Attach Desert Ant's Align as a refiner to Apple's SpeechAnalyzer / SpeechTranscriber so its word-level timings tighten and captions and cuts land exactly on the word. iOS 26 / macOS 26, on-device. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Build a text-based video editor where selecting words trims the clip.
Transcribe with Apple's SpeechTranscriber and Desert Ant's Align refiner for word-exact timings, then let the user select words to trim the video to that span. Deleting a sentence deletes the footage. iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Add bouncing word-by-word captions to vertical videos.
Add animated word-by-word captions to short vertical videos, timed with Desert Ant's Align attached to Apple's SpeechTranscriber so each word pops exactly when it's said. On-device, iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Make transcript search jump the audio to the exact word.
In an Apple media app, transcribe with SpeechTranscriber and Desert Ant's Align refiner so a search result seeks the audio or video to the precise word, not the sentence. iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Ce que fait le modèle
- Corrige les horodatages au niveau du mot que renvoient
SpeechTranscriberetSpeechAnalyzerd'Apple, sans les remplacer : mêmes mots, même surface de résultat, valeursaudioTimeRangeplus serrées. - Erreur moyenne d'horodatage de 113,5 ms à 44,9 ms sur l'audio propre et de 124,4 ms à 50,1 ms sur l'audio bruité, une réduction de 60 %, mesurée sur 433 enregistrements de test contre des références d'alignement forcé.
- 75,1 % des mots tombent à 50 ms près de la référence sur l'audio propre, 69,4 % sur l'audio bruité.
- Un repli structurel garde l'horodatage original d'Apple chaque fois qu'une correction serait invalide, atteint le bord de la fenêtre de recherche, ou manque de contexte de streaming.
- Neuf langues : anglais, espagnol, français, italien, portugais, allemand, japonais, coréen et chinois. Les autres langues passent sans changement.
- Environ 0,7 MB de Core ML compilé en deux étages, exécutés sur le CPU et le Neural Engine ; un résultat typique est affiné en quelques millisecondes.
Prise en main
Ajoutez horodatage des mots à votre application iOS or macOS en quelques lignes de code. Docs Align.
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")
import Align
let refiner = try await SpeechTimestampRefiner(locale: locale)
try await analyzer.start(inputSequence: inputs.recordingAudio(for: refiner))
for try await result in transcriber.results.refiningTimestamps(with: refiner) {
result.words // [WordTiming]: text, start, end, refined
}
Add Align from Desert Ant Labs to this Swift project (iOS, macOS). What it does: Align : horodatages de mots sur l'appareil pour toute transcription. SDK: Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0") // target dependency .product(name: "Align", package: "desert-ant-core") Reference: - Model page: https://desertant.com/models/align/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Spécifications
- Exactitude
- 44,9 ms d'erreur moyenne sur l'audio propre, 50,1 ms sur le bruité, contre 113,5 ms et 124,4 ms pour Apple
- Taille sur l'appareil
- Environ 0,7 MB de Core ML compilé (deux étages de 0,3 MB plus le banc de filtres et le calibrateur)
- Langues
- Anglais, espagnol, français, italien, portugais, allemand, japonais, coréen, chinois
- Modèle
- Cascade en deux étages, du grossier au fin, sur un spectrogramme log-mel, environ 117k paramètres par étage, avec un calibrateur à gradient boosté
- Plateformes
- iOS 26, macOS 26, tvOS 26, visionOS 26 (Core ML), où vit SpeechAnalyzer
Align corrige les horodatages d'Apple ; il ne transcrit pas, et il a besoin de SpeechAnalyzer d'Apple, ce qui implique iOS 26, macOS 26, tvOS 26 ou visionOS 26. Align ne peut pas promettre d'améliorer chaque mot.
Le repli qui garde l'horodatage d'Apple rattrape les corrections qui semblent risquées, pas tous les mots erronés. L'anglais, l'italien, le japonais et le coréen sont les plus faibles des neuf langues sous les références actuelles.
FAQ
Qu'est-ce que Align ?
Horodatage des mots sur l'appareil, pour tout transcripteur : coupez, sous-titrez et surlignez au mot près, deux fois plus précis, depuis un modèle de 0,7 MB.
Align fonctionne-t-il sur l'appareil ?
Oui. Align s'exécute sur l'appareil, sans appel serveur : les données restent chez l'utilisateur.
Quelles plateformes Align prend-il en charge ?
Align est livré sous forme de SDK natif sur l'appareil pour Swift.
Combien coûte Align ?
Chaque modèle est gratuit jusqu'à 100k appareils actifs mensuels par SDK. Inférence illimitée par utilisateur. Contactez-nous pour des licences sur mesure.
Quelle est la précision ou la vitesse de Align ?
Les horodatages de mots d'Apple sont décalés de 113 ms en moyenne ; Align ramène cela à 45 ms, et trois mots sur quatre tombent à 50 ms près, depuis un modèle de 0,7 MB.