Desert Ant Labs

Align.

Horodatage des motsDisponible

Horodatage des mots sur l'appareil, pour tout transcripteur : coupez, sous-titrez et surlignez au mot près, deux fois plus précis, depuis un modèle de 0,7 MB.

Des horodatages de mots précis pour toute transcription.

Apple situe « world » de 2,61 à 3,04 secondes. Align dit 2,57 à 2,98. Coupez là et la coupe est nette, le sous-titre s'allume sur le mot, et le surlignage commence là où le locuteur a commencé.

Vous gardez le transcripteur d'Apple. Align lit le même audio que SpeechAnalyzer reçoit déjà et renvoie les mêmes mots avec des temps de début et de fin plus serrés, en quelques millisecondes, depuis un téléchargement de 0,7 MB. Sur un audio propre, l'écart moyen d'Apple passe de 113 ms à 45 ms.

Un mot qu'Align ne peut pas améliorer garde l'horodatage d'Apple : une correction ne peut donc qu'aider ou laisser le mot tel quel. Neuf langues, et une langue hors de cette liste passe avec les horodatages d'Apple intacts.

Deux fois moins d'erreur d'horodatage.

Les horodatages de mots d'Apple sont décalés de 113 ms en moyenne ; Align ramène cela à 45 ms, et trois mots sur quatre tombent à 50 ms près, depuis un modèle de 0,7 MB.

45 ms
Erreur moyenne, audio propre
Apple brut : 113,5 ms
60 %
Erreur supprimée
audio propre comme bruité
0,7 MB
Sur l'appareil
Core ML compilé, deux étages

Distance absolue moyenne à la frontière de mot de référence, 223 enregistrements de test propres et 210 bruités dans neuf langues

ConditionApple brutAlignÀ 50 ms près
Clean113,5 ms44,9 ms75,1 %
Noisy124,4 ms50,1 ms69,4 %

Évalué sur le runtime Swift livré et les modèles Core ML fournis. Les références sont des estimations d'alignement forcé automatique issues de Qwen3-ForcedAligner, pas des annotations humaines : les chiffres montrent donc une réduction importante et constante de l'erreur d'horodatage d'Apple plutôt qu'une vérité terrain à l'échantillon près.

Des sous-titres mot à mot qui suivent

Allumez chaque mot au moment où il est dit dans une vue de sous-titres, un écran de paroles karaoké ou une app d'apprentissage des langues, à partir de la transcription d'Apple. Les horodatages tombent sur le mot, et non un dixième de seconde à côté.

Couper un clip sur un mot

Rognez un enregistrement jusqu'à une citation dans un éditeur de podcast ou une app vidéo, et faites commencer la coupe là où le mot commence. Aucune image du mot précédent, aucune consonne tronquée, aucun ajustement manuel sur la timeline.

Surligner le mot prononcé dans une transcription

Faites défiler une transcription au rythme de la lecture dans un enregistreur de réunions ou une app de cours, le surlignage se déplaçant sur le mot au lieu de devancer l'audio.

Une recherche qui tombe au bon moment

Sautez à la seconde où un mot a été dit dans une archive d'enregistrements, sur l'appareil. Les horodatages sont assez serrés pour que la tête de lecture démarre sur le mot et non au milieu du précédent.

Inspiration

Des idées à construire avec Align. Copiez un prompt dans votre agent de code et lancez-vous.

Align

Highlight each word as it's spoken, timed to the audio.

Align

Tighten a system transcriber's word timings so captions land on the word.

Align

Build a text-based video editor where selecting words trims the clip.

Align

Add bouncing word-by-word captions to vertical videos.

Align

Make transcript search jump the audio to the exact word.

Ce que fait le modèle

  • Corrige les horodatages au niveau du mot que renvoient SpeechTranscriber et SpeechAnalyzer d'Apple, sans les remplacer : mêmes mots, même surface de résultat, valeurs audioTimeRange plus serrées.
  • Erreur moyenne d'horodatage de 113,5 ms à 44,9 ms sur l'audio propre et de 124,4 ms à 50,1 ms sur l'audio bruité, une réduction de 60 %, mesurée sur 433 enregistrements de test contre des références d'alignement forcé.
  • 75,1 % des mots tombent à 50 ms près de la référence sur l'audio propre, 69,4 % sur l'audio bruité.
  • Un repli structurel garde l'horodatage original d'Apple chaque fois qu'une correction serait invalide, atteint le bord de la fenêtre de recherche, ou manque de contexte de streaming.
  • Neuf langues : anglais, espagnol, français, italien, portugais, allemand, japonais, coréen et chinois. Les autres langues passent sans changement.
  • Environ 0,7 MB de Core ML compilé en deux étages, exécutés sur le CPU et le Neural Engine ; un résultat typique est affiné en quelques millisecondes.

Prise en main

Ajoutez horodatage des mots à votre application iOS or macOS en quelques lignes de code. Docs Align.

iOS, macOS
Installation
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")
Exemple - Swift
import Align

let refiner = try await SpeechTimestampRefiner(locale: locale)
try await analyzer.start(inputSequence: inputs.recordingAudio(for: refiner))

for try await result in transcriber.results.refiningTimestamps(with: refiner) {
    result.words   // [WordTiming]: text, start, end, refined
}
Construire avec un prompt
Add Align from Desert Ant Labs to this Swift project (iOS, macOS).

What it does: Align : horodatages de mots sur l'appareil pour toute transcription.

SDK:

Swift (iOS, macOS)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")

Reference:
- Model page: https://desertant.com/models/align/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
AndroidBientôt disponible
Web, Node.jsBientôt disponible

Spécifications

Exactitude
44,9 ms d'erreur moyenne sur l'audio propre, 50,1 ms sur le bruité, contre 113,5 ms et 124,4 ms pour Apple
Taille sur l'appareil
Environ 0,7 MB de Core ML compilé (deux étages de 0,3 MB plus le banc de filtres et le calibrateur)
Langues
Anglais, espagnol, français, italien, portugais, allemand, japonais, coréen, chinois
Modèle
Cascade en deux étages, du grossier au fin, sur un spectrogramme log-mel, environ 117k paramètres par étage, avec un calibrateur à gradient boosté
Plateformes
iOS 26, macOS 26, tvOS 26, visionOS 26 (Core ML), où vit SpeechAnalyzer

Align corrige les horodatages d'Apple ; il ne transcrit pas, et il a besoin de SpeechAnalyzer d'Apple, ce qui implique iOS 26, macOS 26, tvOS 26 ou visionOS 26. Align ne peut pas promettre d'améliorer chaque mot.

Le repli qui garde l'horodatage d'Apple rattrape les corrections qui semblent risquées, pas tous les mots erronés. L'anglais, l'italien, le japonais et le coréen sont les plus faibles des neuf langues sous les références actuelles.

FAQ

Qu'est-ce que Align ?

Horodatage des mots sur l'appareil, pour tout transcripteur : coupez, sous-titrez et surlignez au mot près, deux fois plus précis, depuis un modèle de 0,7 MB.

Align fonctionne-t-il sur l'appareil ?

Oui. Align s'exécute sur l'appareil, sans appel serveur : les données restent chez l'utilisateur.

Quelles plateformes Align prend-il en charge ?

Align est livré sous forme de SDK natif sur l'appareil pour Swift.

Combien coûte Align ?

Chaque modèle est gratuit jusqu'à 100k appareils actifs mensuels par SDK. Inférence illimitée par utilisateur. Contactez-nous pour des licences sur mesure.

Quelle est la précision ou la vitesse de Align ?

Les horodatages de mots d'Apple sont décalés de 113 ms en moyenne ; Align ramène cela à 45 ms, et trois mots sur quatre tombent à 50 ms près, depuis un modèle de 0,7 MB.

Ressources