Desert Ant Labs

Align

Horodatage des motsDisponible

Horodatage par mot sur l'appareil, pour n'importe quelle transcription. Coupez, sous-titrez et surlignez, cinq fois plus précisément, à partir de 0,7 Mo.

Des horodatages de mots précis pour toute transcription.

Apple situe « world » de 2,61 à 3,04 secondes. Align dit 2,57 à 2,98. Coupez là et la coupe est nette, le sous-titre s'allume sur le mot, et le surlignage commence là où le locuteur a commencé.

Vous gardez le transcripteur d'Apple. Align lit le même audio que SpeechAnalyzer reçoit déjà et renvoie les mêmes mots avec des temps de début et de fin plus serrés, en quelques millisecondes, depuis un téléchargement de 0,7 MB. Sur un audio propre, l'écart moyen d'Apple passe de 113 ms à 45 ms.

Un mot qu'Align ne peut pas améliorer garde l'horodatage d'Apple : une correction ne peut donc qu'aider ou laisser le mot tel quel. Neuf langues, et une langue hors de cette liste passe avec les horodatages d'Apple intacts.

Cinq fois plus précis.

Les temps par mot d'Apple sur LibriSpeech test-clean s'écartent de 106,4 ms en moyenne ; Align les ramène à 20,2 ms, et 95 % des mots tombent à moins de 50 ms, depuis un modèle de 0,7 Mo.

20,2 ms
Erreur moyenne, LibriSpeech test-clean
Apple sans correction : 106,4 ms
5x
Plus précis
de 106,4 ms à 20,2 ms
45,0 ms
Face aux frontières corrigées à la main
WhisperX : 53,5 ms
0,7 MB
Sur l'appareil
Core ML compilé, deux étages

Distance absolue moyenne à la frontière de mot de référence, sur un échantillon de 500 extraits de chaque split officiel de LibriSpeech, sans aucun locuteur partagé entre entraînement et évaluation

SplitApple brutAlignÀ 50 ms près
test-clean106,4 ms20,2 ms95 %
test-other111,6 ms24,8 ms92 %

Évalué sur les poids v1.0.0. Les références sont des estimations d'alignement forcé produites par Qwen3-ForcedAligner combiné à un second aligneur, et non des annotations humaines : les chiffres montrent une réduction large et constante de l'erreur de calage, pas une vérité exacte au niveau de l'échantillon. L'exception est la comparaison avec WhisperX, mesurée sur 258 frontières de mot corrigées à la main par une personne sur la forme d'onde.

Cas d'usage

Des horodatages de mots précis pour toute transcription.

Des sous-titres mot à mot qui suivent

Allumez chaque mot au moment où il est dit dans une vue de sous-titres, un écran de paroles karaoké ou une app d'apprentissage des langues, à partir de la transcription d'Apple. Les horodatages tombent sur le mot, et non un dixième de seconde à côté.

Couper un clip sur un mot

Rognez un enregistrement jusqu'à une citation dans un éditeur de podcast ou une app vidéo, et faites commencer la coupe là où le mot commence. Aucune image du mot précédent, aucune consonne tronquée, aucun ajustement manuel sur la timeline.

Surligner le mot prononcé dans une transcription

Faites défiler une transcription au rythme de la lecture dans un enregistreur de réunions ou une app de cours, le surlignage se déplaçant sur le mot au lieu de devancer l'audio.

Une recherche qui tombe au bon moment

Sautez à la seconde où un mot a été dit dans une archive d'enregistrements, sur l'appareil. Les horodatages sont assez serrés pour que la tête de lecture démarre sur le mot et non au milieu du précédent.

Inspiration

Des idées à construire avec Align. Copiez un prompt dans votre agent de code et lancez-vous.

Align

Highlight each word as it's spoken, timed to the audio.

Align

Tighten a system transcriber's word timings so captions land on the word.

Align

Build a text-based video editor where selecting words trims the clip.

Align

Add bouncing word-by-word captions to vertical videos.

Align

Make transcript search jump the audio to the exact word.

Ce que fait le modèle

  • Corrige les horodatages au niveau du mot que renvoient SpeechTranscriber et SpeechAnalyzer d'Apple, sans les remplacer : mêmes mots, même surface de résultat, valeurs audioTimeRange plus serrées.
  • Erreur moyenne de 124,2 ms à 43,9 ms, moyennée par macro sur les neuf langues pour qu'aucune ne porte le chiffre à elle seule. En anglais, elle va plus loin : de 106,4 ms à 20,2 ms.
  • Sur un échantillon de 500 extraits de LibriSpeech test-clean, 95 % des mots tombent à moins de 50 ms de la référence, contre 37 % auparavant. Le pire dixième progresse le plus : de 230,7 ms à 33,0 ms, environ une image vidéo à 30 fps.
  • Un repli structurel garde l'horodatage original d'Apple chaque fois qu'une correction serait invalide, atteint le bord de la fenêtre de recherche, ou manque de contexte de streaming.
  • Neuf langues : anglais, espagnol, français, italien, portugais, allemand, japonais, coréen et chinois. Les autres langues passent sans changement.
  • Environ 0,7 Mo de Core ML compilé en deux étages, exécutés sur le CPU et le Neural Engine ; un résultat courant est affiné en quelques millisecondes.

Prise en main

Ajoutez horodatage des mots à votre application iOS or macOS en quelques lignes de code. Docs Align.

iOS, macOS
Installation
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")
Exemple - Swift
import Align

let refiner = try await SpeechTimestampRefiner(locale: locale)
try await analyzer.start(inputSequence: inputs.recordingAudio(for: refiner))

for try await result in transcriber.results.refiningTimestamps(with: refiner) {
    result.words   // [WordTiming]: text, start, end, refined
}
Construire avec un prompt
Add Align from Desert Ant Labs to this Swift project (iOS, macOS).

What it does: Align : horodatages de mots sur l'appareil pour toute transcription.

SDK:

Swift (iOS, macOS)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")

Reference:
- Model page: https://desertant.com/models/align/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
AndroidBientôt disponible
Web, Node.jsBientôt disponible

Spécifications

Exactitude
20,2 ms d'erreur moyenne sur LibriSpeech test-clean face aux 106,4 ms d'Apple, et 43,9 ms sur les neuf langues face aux 124,2 ms d'Apple
Taille sur l'appareil
Environ 0,7 Mo de Core ML compilé (deux étages de 0,3 Mo, plus le banc de filtres et le calibrateur)
Langues
Anglais, espagnol, français, italien, portugais, allemand, japonais, coréen, chinois
Modèle
Cascade à deux étages, du grossier au fin, sur un spectrogramme log-mel, avec 121 mille paramètres par étage et un calibrateur à arbres avec gradient boosting
Plateformes
iOS 26, macOS 26, tvOS 26, visionOS 26 (Core ML), où vit SpeechAnalyzer

Align corrige les temps d'un système de transcription ; il ne transcrit pas, et le SDK Swift a besoin de SpeechAnalyzer d'Apple, donc d'iOS 26, macOS 26, tvOS 26 ou visionOS 26. Align ne promet pas d'améliorer chaque mot.

Le repli qui conserve l'horodatage d'origine attrape les corrections qui semblent risquées, pas toutes celles qui sont fausses. Les nombres prononcés restent le point faible : sur un petit échantillon, l'affinage a éloigné les frontières des chiffres de la référence au lieu de les laisser telles quelles.

FAQ

Qu'est-ce que Align ?

Horodatage par mot sur l'appareil, pour n'importe quelle transcription. Coupez, sous-titrez et surlignez, cinq fois plus précisément, à partir de 0,7 Mo.

Align fonctionne-t-il sur l'appareil ?

Oui. Align s'exécute sur l'appareil, sans appel serveur : les données restent chez l'utilisateur.

Quelles plateformes Align prend-il en charge ?

Align est livré sous forme de SDK natif sur l'appareil pour Swift.

Combien coûte Align ?

Chaque modèle est gratuit jusqu'à 100k appareils actifs mensuels par SDK. Inférence illimitée par utilisateur. Contactez-nous pour des licences sur mesure.

Quelle est la précision ou la vitesse de Align ?

Les temps par mot d'Apple sur LibriSpeech test-clean s'écartent de 106,4 ms en moyenne ; Align les ramène à 20,2 ms, et 95 % des mots tombent à moins de 50 ms, depuis un modèle de 0,7 Mo.

Ressources