Desert Ant Labs

Align.

Marcas de tiempo por palabraDisponible

Marcas de tiempo por palabra en el dispositivo, para cualquier transcriptor. Corta, subtitula y resalta sobre la palabra, con la mitad de error, desde 0,7 MB.

Marcas de tiempo por palabra precisas para cualquier transcripción.

Apple dice que «world» va de 2,61 a 3,04 segundos. Align dice de 2,57 a 2,98. Corta ahí y el corte queda limpio, el subtítulo se enciende sobre la palabra y el resaltado empieza donde empezó quien habla.

Conservas el transcriptor de Apple. Align lee el mismo audio que ya recibe SpeechAnalyzer y devuelve las mismas palabras con tiempos de inicio y fin más ajustados, en unos milisegundos, desde una descarga de 0,7 MB. Con audio limpio, el error medio de Apple pasa de 113 ms a 45 ms.

Una palabra que Align no puede mejorar conserva la marca de Apple, así que una corrección solo puede ayudar o dejar la palabra igual. Nueve idiomas, y un idioma fuera de ellos pasa con las marcas de Apple intactas.

La mitad de error de tiempo.

Las marcas de tiempo por palabra de Apple se desvían 113 ms de media; Align las reduce a 45 ms, y tres de cada cuatro palabras caen a menos de 50 ms, desde un modelo de 0,7 MB.

45 ms
Error medio, audio limpio
Apple en bruto: 113,5 ms
60%
Error eliminado
audio limpio y ruidoso por igual
0,7 MB
En el dispositivo
Core ML compilado, dos etapas

Distancia absoluta media respecto al límite de palabra de referencia, 223 grabaciones limpias y 210 ruidosas reservadas en nueve idiomas

CondiciónApple en brutoAlignA menos de 50 ms
Clean113,5 ms44,9 ms75,1%
Noisy124,4 ms50,1 ms69,4%

Evaluado en el runtime de Swift publicado y los modelos Core ML incluidos. Las referencias son estimaciones de alineación forzada por máquina de Qwen3-ForcedAligner, no anotaciones humanas, así que las cifras muestran una reducción amplia y constante del error de tiempo de Apple más que una referencia exacta a nivel de muestra.

Subtítulos palabra por palabra que no se retrasan

Enciende cada palabra a medida que se dice en una vista de subtítulos, una pantalla de letras estilo karaoke o una app para aprender idiomas, a partir de la transcripción de Apple. Los tiempos caen sobre la palabra en lugar de una décima de segundo antes o después.

Corta un clip en una palabra

Recorta una grabación hasta una cita en un editor de podcast o una app de vídeo y haz que el corte empiece donde empieza la palabra. Sin un fotograma de la palabra anterior, sin una consonante cortada y sin ajustes manuales en la línea de tiempo.

Resalta la palabra hablada en una transcripción

Desplaza una transcripción al ritmo de la reproducción en un grabador de reuniones o una app de clases, con el resaltado moviéndose sobre la palabra en lugar de adelantarse al audio.

Una búsqueda que cae en el momento justo

Salta al segundo en que se dijo una palabra dentro de una biblioteca de grabaciones, en el dispositivo. Los tiempos son lo bastante ajustados como para que el cabezal de reproducción empiece en la palabra y no en mitad de la anterior.

Inspiración

Ideas para crear con Align. Copia un prompt en tu agente de código y adelante.

Align

Highlight each word as it's spoken, timed to the audio.

Align

Tighten a system transcriber's word timings so captions land on the word.

Align

Build a text-based video editor where selecting words trims the clip.

Align

Add bouncing word-by-word captions to vertical videos.

Align

Make transcript search jump the audio to the exact word.

Qué hace el modelo

  • Corrige las marcas de tiempo por palabra que devuelven SpeechTranscriber y SpeechAnalyzer de Apple, sin sustituirlas: las mismas palabras, la misma superficie de resultados, valores de audioTimeRange más ajustados.
  • Error medio de tiempo de 113,5 ms a 44,9 ms con audio limpio y de 124,4 ms a 50,1 ms con audio ruidoso, una reducción del 60%, medido en 433 grabaciones reservadas frente a referencias de alineación forzada.
  • El 75,1% de las palabras caen a menos de 50 ms de la referencia con audio limpio, y el 69,4% con audio ruidoso.
  • Un mecanismo de reserva estructural conserva la marca de tiempo original de Apple siempre que una corrección no sea válida, alcance el borde de la ventana de búsqueda o carezca de contexto de streaming.
  • Nueve idiomas: inglés, español, francés, italiano, portugués, alemán, japonés, coreano y chino. El resto de idiomas pasan sin cambios.
  • Unos 0,7 MB de Core ML compilado en dos etapas, que se ejecutan en la CPU y el Neural Engine; un resultado típico se refina en unos milisegundos.

Primeros pasos

Añade marcas de tiempo por palabra a tu app de iOS or macOS con unas pocas líneas de código. Docs de Align.

iOS, macOS
Instalación
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")
Ejemplo - Swift
import Align

let refiner = try await SpeechTimestampRefiner(locale: locale)
try await analyzer.start(inputSequence: inputs.recordingAudio(for: refiner))

for try await result in transcriber.results.refiningTimestamps(with: refiner) {
    result.words   // [WordTiming]: text, start, end, refined
}
Crea con un prompt
Add Align from Desert Ant Labs to this Swift project (iOS, macOS).

What it does: marcas de tiempo por palabra en el dispositivo para cualquier transcripción.

SDK:

Swift (iOS, macOS)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")

Reference:
- Model page: https://desertant.com/models/align/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
AndroidPróximamente
Web, Node.jsPróximamente

Especificaciones

Exactitud
44,9 ms de error medio con audio limpio y 50,1 ms con ruidoso, frente a los 113,5 ms y 124,4 ms de Apple
Tamaño en el dispositivo
Unos 0,7 MB de Core ML compilado (dos etapas de 0,3 MB más el banco de filtros y el calibrador)
Idiomas
Inglés, español, francés, italiano, portugués, alemán, japonés, coreano y chino
Modelo
Cascada de dos etapas de gruesa a fina sobre un espectrograma log-mel, unos 117k parámetros por etapa, con un calibrador con potenciación de gradiente
Plataformas
iOS 26, macOS 26, tvOS 26, visionOS 26 (Core ML), donde vive SpeechAnalyzer

Align corrige las marcas de tiempo de Apple; no transcribe, y necesita SpeechAnalyzer de Apple, es decir iOS 26, macOS 26, tvOS 26 o visionOS 26. Align no puede prometer que mejore todas las palabras.

El mecanismo de reserva que conserva la marca de Apple detecta las correcciones que parecen poco seguras, no todas las erróneas. El inglés, el italiano, el japonés y el coreano son los más flojos de los nueve idiomas con las referencias actuales.

Preguntas frecuentes

¿Qué es Align?

Marcas de tiempo por palabra en el dispositivo, para cualquier transcriptor. Corta, subtitula y resalta sobre la palabra, con la mitad de error, desde 0,7 MB.

¿Align se ejecuta en el dispositivo?

Sí. Align se ejecuta en el dispositivo, sin llamadas a servidor, así que los datos se quedan con el usuario.

¿Qué plataformas admite Align?

Align se distribuye como un SDK nativo en el dispositivo para Swift.

¿Cuánto cuesta Align?

Todos los modelos son gratis hasta 100 000 dispositivos activos mensuales por SDK. Inferencia ilimitada por usuario. Contáctanos para licencias personalizadas.

¿Qué precisión o velocidad tiene Align?

Las marcas de tiempo por palabra de Apple se desvían 113 ms de media; Align las reduce a 45 ms, y tres de cada cuatro palabras caen a menos de 50 ms, desde un modelo de 0,7 MB.

Recursos