Align
Marcas de tiempo por palabra en el dispositivo, para cualquier transcriptor. Corta, subtitula y resalta con cinco veces más precisión, desde 0,7 MB.

Marcas de tiempo por palabra precisas para cualquier transcripción.
Apple dice que «world» va de 2,61 a 3,04 segundos. Align dice de 2,57 a 2,98. Corta ahí y el corte queda limpio, el subtítulo se enciende sobre la palabra y el resaltado empieza donde empezó quien habla.
Conservas el transcriptor de Apple. Align lee el mismo audio que ya recibe SpeechAnalyzer y devuelve las mismas palabras con tiempos de inicio y fin más ajustados, en unos milisegundos, desde una descarga de 0,7 MB. Con audio limpio, el error medio de Apple pasa de 113 ms a 45 ms.
Una palabra que Align no puede mejorar conserva la marca de Apple, así que una corrección solo puede ayudar o dejar la palabra igual. Nueve idiomas, y un idioma fuera de ellos pasa con las marcas de Apple intactas.
Cinco veces más preciso.
Los tiempos por palabra de Apple en LibriSpeech test-clean se desvían 106,4 ms de media; Align los deja en 20,2 ms, y el 95% de las palabras queda a menos de 50 ms, desde un modelo de 0,7 MB.
Distancia absoluta media respecto al límite de palabra de referencia, en una muestra de 500 clips de cada split oficial de LibriSpeech, sin ningún hablante compartido entre entrenamiento y evaluación
| Split | Apple en bruto | Align | A menos de 50 ms |
|---|---|---|---|
| test-clean | 106,4 ms | 20,2 ms | 95% |
| test-other | 111,6 ms | 24,8 ms | 92% |
Evaluado con los pesos v1.0.0. Las referencias son estimaciones de alineamiento forzado por máquina, de Qwen3-ForcedAligner combinado con un segundo alineador, no anotaciones humanas: las cifras muestran una reducción amplia y consistente del error de tiempo, no una verdad exacta a nivel de muestra. La excepción es la comparación con WhisperX, medida sobre 258 límites de palabra corregidos a mano por una persona sobre la forma de onda.
Casos de uso
Marcas de tiempo por palabra precisas para cualquier transcripción.
Subtítulos palabra por palabra que no se retrasan
Enciende cada palabra a medida que se dice en una vista de subtítulos, una pantalla de letras estilo karaoke o una app para aprender idiomas, a partir de la transcripción de Apple. Los tiempos caen sobre la palabra en lugar de una décima de segundo antes o después.
Corta un clip en una palabra
Recorta una grabación hasta una cita en un editor de podcast o una app de vídeo y haz que el corte empiece donde empieza la palabra. Sin un fotograma de la palabra anterior, sin una consonante cortada y sin ajustes manuales en la línea de tiempo.
Resalta la palabra hablada en una transcripción
Desplaza una transcripción al ritmo de la reproducción en un grabador de reuniones o una app de clases, con el resaltado moviéndose sobre la palabra en lugar de adelantarse al audio.
Una búsqueda que cae en el momento justo
Salta al segundo en que se dijo una palabra dentro de una biblioteca de grabaciones, en el dispositivo. Los tiempos son lo bastante ajustados como para que el cabezal de reproducción empiece en la palabra y no en mitad de la anterior.
Inspiración
Ideas para crear con Align. Copia un prompt en tu agente de código y adelante.
Highlight each word as it's spoken, timed to the audio.
Run Apple's SpeechTranscriber with Desert Ant's Align attached as a timestamp refiner, then highlight each word using its refined time range. Align tightens Apple's word timings on-device; iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Tighten a system transcriber's word timings so captions land on the word.
Attach Desert Ant's Align as a refiner to Apple's SpeechAnalyzer / SpeechTranscriber so its word-level timings tighten and captions and cuts land exactly on the word. iOS 26 / macOS 26, on-device. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Build a text-based video editor where selecting words trims the clip.
Transcribe with Apple's SpeechTranscriber and Desert Ant's Align refiner for word-exact timings, then let the user select words to trim the video to that span. Deleting a sentence deletes the footage. iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Add bouncing word-by-word captions to vertical videos.
Add animated word-by-word captions to short vertical videos, timed with Desert Ant's Align attached to Apple's SpeechTranscriber so each word pops exactly when it's said. On-device, iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Make transcript search jump the audio to the exact word.
In an Apple media app, transcribe with SpeechTranscriber and Desert Ant's Align refiner so a search result seeks the audio or video to the precise word, not the sentence. iOS 26 / macOS 26. Build it with the Desert Ant SDK. Align (Swift). Install and API: https://desertant.com/docs/align/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Qué hace el modelo
- Corrige las marcas de tiempo por palabra que devuelven
SpeechTranscriberySpeechAnalyzerde Apple, sin sustituirlas: las mismas palabras, la misma superficie de resultados, valores deaudioTimeRangemás ajustados. - Error medio de tiempo de 124,2 ms a 43,9 ms, promediado por macro entre los nueve idiomas para que ninguno cargue solo con la cifra. En inglés llega más lejos: de 106,4 ms a 20,2 ms.
- En una muestra de 500 clips de LibriSpeech test-clean, el 95% de las palabras queda a menos de 50 ms de la referencia, frente al 37% anterior. El décimo peor es el que más mejora: de 230,7 ms a 33,0 ms, cerca de un fotograma de vídeo a 30 fps.
- Un mecanismo de reserva estructural conserva la marca de tiempo original de Apple siempre que una corrección no sea válida, alcance el borde de la ventana de búsqueda o carezca de contexto de streaming.
- Nueve idiomas: inglés, español, francés, italiano, portugués, alemán, japonés, coreano y chino. El resto de idiomas pasan sin cambios.
- Unos 0,7 MB de Core ML compilado en dos etapas, ejecutadas en la CPU y el Neural Engine; un resultado típico se refina en unos pocos milisegundos.
Primeros pasos
Añade marcas de tiempo por palabra a tu app de iOS or macOS con unas pocas líneas de código. Docs de Align.
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")
import Align
let refiner = try await SpeechTimestampRefiner(locale: locale)
try await analyzer.start(inputSequence: inputs.recordingAudio(for: refiner))
for try await result in transcriber.results.refiningTimestamps(with: refiner) {
result.words // [WordTiming]: text, start, end, refined
}
Add Align from Desert Ant Labs to this Swift project (iOS, macOS). What it does: marcas de tiempo por palabra en el dispositivo para cualquier transcripción. SDK: Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0") // target dependency .product(name: "Align", package: "desert-ant-core") Reference: - Model page: https://desertant.com/models/align/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Especificaciones
- Exactitud
- 20,2 ms de error medio en LibriSpeech test-clean frente a los 106,4 ms de Apple, y 43,9 ms en los nueve idiomas frente a los 124,2 ms de Apple
- Tamaño en el dispositivo
- Unos 0,7 MB de Core ML compilado (dos etapas de 0,3 MB, más el banco de filtros y el calibrador)
- Idiomas
- Inglés, español, francés, italiano, portugués, alemán, japonés, coreano y chino
- Modelo
- Cascada de dos etapas, de gruesa a fina, sobre un espectrograma log-mel, con 121 mil parámetros por etapa y un calibrador de árboles con gradient boosting
- Plataformas
- iOS 26, macOS 26, tvOS 26, visionOS 26 (Core ML), donde vive SpeechAnalyzer
Align corrige los tiempos de un transcriptor; no transcribe, y el SDK de Swift necesita SpeechAnalyzer de Apple, es decir iOS 26, macOS 26, tvOS 26 o visionOS 26. Align no promete mejorar todas las palabras.
El resguardo que conserva el tiempo original detecta las correcciones que parecen arriesgadas, no todas las equivocadas. Los números hablados son el caso más flojo: en una muestra pequeña, el refinamiento alejó los límites de los dígitos de la referencia en lugar de dejarlos como estaban.
Preguntas frecuentes
¿Qué es Align?
Marcas de tiempo por palabra en el dispositivo, para cualquier transcriptor. Corta, subtitula y resalta con cinco veces más precisión, desde 0,7 MB.
¿Align se ejecuta en el dispositivo?
Sí. Align se ejecuta en el dispositivo, sin llamadas a servidor, así que los datos se quedan con el usuario.
¿Qué plataformas admite Align?
Align se distribuye como un SDK nativo en el dispositivo para Swift.
¿Cuánto cuesta Align?
Todos los modelos son gratis hasta 100 000 dispositivos activos mensuales por SDK. Inferencia ilimitada por usuario. Contáctanos para licencias personalizadas.
¿Qué precisión o velocidad tiene Align?
Los tiempos por palabra de Apple en LibriSpeech test-clean se desvían 106,4 ms de media; Align los deja en 20,2 ms, y el 95% de las palabras queda a menos de 50 ms, desde un modelo de 0,7 MB.