Desert Ant Labs

Align

Marcas de tiempo por palabraDisponible

Marcas de tiempo por palabra en el dispositivo, para cualquier transcriptor. Corta, subtitula y resalta con cinco veces más precisión, desde 0,7 MB.

Marcas de tiempo por palabra precisas para cualquier transcripción.

Apple dice que «world» va de 2,61 a 3,04 segundos. Align dice de 2,57 a 2,98. Corta ahí y el corte queda limpio, el subtítulo se enciende sobre la palabra y el resaltado empieza donde empezó quien habla.

Conservas el transcriptor de Apple. Align lee el mismo audio que ya recibe SpeechAnalyzer y devuelve las mismas palabras con tiempos de inicio y fin más ajustados, en unos milisegundos, desde una descarga de 0,7 MB. Con audio limpio, el error medio de Apple pasa de 113 ms a 45 ms.

Una palabra que Align no puede mejorar conserva la marca de Apple, así que una corrección solo puede ayudar o dejar la palabra igual. Nueve idiomas, y un idioma fuera de ellos pasa con las marcas de Apple intactas.

Cinco veces más preciso.

Los tiempos por palabra de Apple en LibriSpeech test-clean se desvían 106,4 ms de media; Align los deja en 20,2 ms, y el 95% de las palabras queda a menos de 50 ms, desde un modelo de 0,7 MB.

20,2 ms
Error medio, LibriSpeech test-clean
Apple sin corregir: 106,4 ms
5x
Más preciso
de 106,4 ms a 20,2 ms
45,0 ms
Frente a límites corregidos a mano
WhisperX: 53,5 ms
0,7 MB
En el dispositivo
Core ML compilado, dos etapas

Distancia absoluta media respecto al límite de palabra de referencia, en una muestra de 500 clips de cada split oficial de LibriSpeech, sin ningún hablante compartido entre entrenamiento y evaluación

SplitApple en brutoAlignA menos de 50 ms
test-clean106,4 ms20,2 ms95%
test-other111,6 ms24,8 ms92%

Evaluado con los pesos v1.0.0. Las referencias son estimaciones de alineamiento forzado por máquina, de Qwen3-ForcedAligner combinado con un segundo alineador, no anotaciones humanas: las cifras muestran una reducción amplia y consistente del error de tiempo, no una verdad exacta a nivel de muestra. La excepción es la comparación con WhisperX, medida sobre 258 límites de palabra corregidos a mano por una persona sobre la forma de onda.

Casos de uso

Marcas de tiempo por palabra precisas para cualquier transcripción.

Subtítulos palabra por palabra que no se retrasan

Enciende cada palabra a medida que se dice en una vista de subtítulos, una pantalla de letras estilo karaoke o una app para aprender idiomas, a partir de la transcripción de Apple. Los tiempos caen sobre la palabra en lugar de una décima de segundo antes o después.

Corta un clip en una palabra

Recorta una grabación hasta una cita en un editor de podcast o una app de vídeo y haz que el corte empiece donde empieza la palabra. Sin un fotograma de la palabra anterior, sin una consonante cortada y sin ajustes manuales en la línea de tiempo.

Resalta la palabra hablada en una transcripción

Desplaza una transcripción al ritmo de la reproducción en un grabador de reuniones o una app de clases, con el resaltado moviéndose sobre la palabra en lugar de adelantarse al audio.

Una búsqueda que cae en el momento justo

Salta al segundo en que se dijo una palabra dentro de una biblioteca de grabaciones, en el dispositivo. Los tiempos son lo bastante ajustados como para que el cabezal de reproducción empiece en la palabra y no en mitad de la anterior.

Inspiración

Ideas para crear con Align. Copia un prompt en tu agente de código y adelante.

Align

Highlight each word as it's spoken, timed to the audio.

Align

Tighten a system transcriber's word timings so captions land on the word.

Align

Build a text-based video editor where selecting words trims the clip.

Align

Add bouncing word-by-word captions to vertical videos.

Align

Make transcript search jump the audio to the exact word.

Qué hace el modelo

  • Corrige las marcas de tiempo por palabra que devuelven SpeechTranscriber y SpeechAnalyzer de Apple, sin sustituirlas: las mismas palabras, la misma superficie de resultados, valores de audioTimeRange más ajustados.
  • Error medio de tiempo de 124,2 ms a 43,9 ms, promediado por macro entre los nueve idiomas para que ninguno cargue solo con la cifra. En inglés llega más lejos: de 106,4 ms a 20,2 ms.
  • En una muestra de 500 clips de LibriSpeech test-clean, el 95% de las palabras queda a menos de 50 ms de la referencia, frente al 37% anterior. El décimo peor es el que más mejora: de 230,7 ms a 33,0 ms, cerca de un fotograma de vídeo a 30 fps.
  • Un mecanismo de reserva estructural conserva la marca de tiempo original de Apple siempre que una corrección no sea válida, alcance el borde de la ventana de búsqueda o carezca de contexto de streaming.
  • Nueve idiomas: inglés, español, francés, italiano, portugués, alemán, japonés, coreano y chino. El resto de idiomas pasan sin cambios.
  • Unos 0,7 MB de Core ML compilado en dos etapas, ejecutadas en la CPU y el Neural Engine; un resultado típico se refina en unos pocos milisegundos.

Primeros pasos

Añade marcas de tiempo por palabra a tu app de iOS or macOS con unas pocas líneas de código. Docs de Align.

iOS, macOS
Instalación
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")
Ejemplo - Swift
import Align

let refiner = try await SpeechTimestampRefiner(locale: locale)
try await analyzer.start(inputSequence: inputs.recordingAudio(for: refiner))

for try await result in transcriber.results.refiningTimestamps(with: refiner) {
    result.words   // [WordTiming]: text, start, end, refined
}
Crea con un prompt
Add Align from Desert Ant Labs to this Swift project (iOS, macOS).

What it does: marcas de tiempo por palabra en el dispositivo para cualquier transcripción.

SDK:

Swift (iOS, macOS)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")

Reference:
- Model page: https://desertant.com/models/align/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
AndroidPróximamente
Web, Node.jsPróximamente

Especificaciones

Exactitud
20,2 ms de error medio en LibriSpeech test-clean frente a los 106,4 ms de Apple, y 43,9 ms en los nueve idiomas frente a los 124,2 ms de Apple
Tamaño en el dispositivo
Unos 0,7 MB de Core ML compilado (dos etapas de 0,3 MB, más el banco de filtros y el calibrador)
Idiomas
Inglés, español, francés, italiano, portugués, alemán, japonés, coreano y chino
Modelo
Cascada de dos etapas, de gruesa a fina, sobre un espectrograma log-mel, con 121 mil parámetros por etapa y un calibrador de árboles con gradient boosting
Plataformas
iOS 26, macOS 26, tvOS 26, visionOS 26 (Core ML), donde vive SpeechAnalyzer

Align corrige los tiempos de un transcriptor; no transcribe, y el SDK de Swift necesita SpeechAnalyzer de Apple, es decir iOS 26, macOS 26, tvOS 26 o visionOS 26. Align no promete mejorar todas las palabras.

El resguardo que conserva el tiempo original detecta las correcciones que parecen arriesgadas, no todas las equivocadas. Los números hablados son el caso más flojo: en una muestra pequeña, el refinamiento alejó los límites de los dígitos de la referencia en lugar de dejarlos como estaban.

Preguntas frecuentes

¿Qué es Align?

Marcas de tiempo por palabra en el dispositivo, para cualquier transcriptor. Corta, subtitula y resalta con cinco veces más precisión, desde 0,7 MB.

¿Align se ejecuta en el dispositivo?

Sí. Align se ejecuta en el dispositivo, sin llamadas a servidor, así que los datos se quedan con el usuario.

¿Qué plataformas admite Align?

Align se distribuye como un SDK nativo en el dispositivo para Swift.

¿Cuánto cuesta Align?

Todos los modelos son gratis hasta 100 000 dispositivos activos mensuales por SDK. Inferencia ilimitada por usuario. Contáctanos para licencias personalizadas.

¿Qué precisión o velocidad tiene Align?

Los tiempos por palabra de Apple en LibriSpeech test-clean se desvían 106,4 ms de media; Align los deja en 20,2 ms, y el 95% de las palabras queda a menos de 50 ms, desde un modelo de 0,7 MB.

Recursos