Desert Ant Labs

Align

단어 타임스탬프사용 가능

어떤 전사본에도 쓸 수 있는 온디바이스 단어 타임스탬프. 5배 더 정확하게 단어 위에서 자르고, 자막을 넣고, 강조하세요. 0.7 MB부터.

어떤 자막이든 정확한 단어 타임스탬프.

Apple은 “world”가 2.61초에서 3.04초까지라고 말합니다. Align은 2.57초에서 2.98초라고 합니다. 거기서 자르면 컷이 깔끔하고, 자막이 단어에 맞춰 켜지며, 강조가 화자가 말을 시작한 지점에서 시작됩니다.

Apple의 전사기는 그대로 씁니다. Align은 SpeechAnalyzer가 이미 받는 것과 같은 오디오를 읽고, 같은 단어를 더 정밀한 시작·종료 시각과 함께 몇 밀리초 만에 돌려줍니다. 0.7MB 다운로드로요. 깨끗한 오디오에서는 Apple의 평균 오차를 113밀리초에서 45밀리초로 줄입니다.

Align이 개선하지 못하는 단어는 Apple의 타이밍을 그대로 두므로, 보정은 도움이 되거나 그 단어를 건드리지 않을 뿐입니다. 아홉 개 언어를 지원하며, 그 밖의 언어는 Apple의 타이밍을 그대로 둔 채 통과시킵니다.

5배 더 정확합니다.

LibriSpeech test-clean에서 Apple의 단어 시간은 평균 106.4 ms 어긋납니다. Align은 이를 20.2 ms로 줄이고, 단어의 95%가 50 ms 이내에 들어옵니다. 모델은 0.7 MB입니다.

20.2ms
평균 오차, LibriSpeech test-clean
Apple 미보정: 106.4 ms
5x
더 정확
106.4 ms에서 20.2 ms로
45.0ms
손으로 보정한 경계 대비
WhisperX: 53.5 ms
0.7MB
온디바이스
컴파일된 Core ML, 2단 구성

기준 단어 경계로부터의 평균 절대 거리. LibriSpeech 각 공식 스플릿에서 500개 클립을 표본으로 측정했으며, 학습과 평가에 겹치는 화자는 없습니다

스플릿Apple 원본Align50밀리초 이내
test-clean106.4ms20.2ms95%
test-other111.6ms24.8ms92%

v1.0.0 가중치로 평가했습니다. 기준값은 Qwen3-ForcedAligner에 두 번째 정렬기를 결합한 기계적 강제 정렬 추정치이며 사람이 붙인 주석이 아닙니다. 따라서 수치는 표본 단위의 절대적 정답이 아니라 시간 오차의 크고 일관된 감소를 보여줍니다. 예외는 WhisperX와의 비교로, 사람이 파형을 보고 손으로 보정한 258개의 단어 경계에서 측정했습니다.

활용 사례

어떤 자막이든 정확한 단어 타임스탬프.

따라오는 단어별 자막

Apple의 전사를 바탕으로 자막 화면, 노래방식 가사 화면, 언어 학습 앱에서 말이 나오는 순간 각 단어를 밝힙니다. 타이밍이 0.1초 어긋나지 않고 단어 위에 정확히 맞습니다.

단어에 맞춰 클립 자르기

팟캐스트 편집기나 동영상 앱에서 녹음을 인용 구간으로 잘라내되, 컷이 단어가 시작되는 지점에서 시작하게 하세요. 앞 단어의 프레임이 남지 않고, 자음이 잘리지 않으며, 타임라인에서 손으로 밀어 맞출 일도 없습니다.

전사에서 말하는 단어 강조

회의 녹음기나 강의 앱에서 재생에 맞춰 전사를 스크롤하되, 강조가 오디오보다 앞서 나가지 않고 단어에 맞춰 움직이게 하세요.

그 순간에 정확히 닿는 검색

녹음 보관함에서 어떤 단어가 말해진 초를 기기에서 바로 찾아갑니다. 타이밍이 충분히 정밀해서 재생 헤드가 앞 단어 중간이 아니라 그 단어에서 시작합니다.

영감

Align(으)로 만들 아이디어. 프롬프트를 코딩 에이전트에 복사해 시작하세요.

Align

Highlight each word as it's spoken, timed to the audio.

Align

Tighten a system transcriber's word timings so captions land on the word.

Align

Build a text-based video editor where selecting words trims the clip.

Align

Add bouncing word-by-word captions to vertical videos.

Align

Make transcript search jump the audio to the exact word.

모델이 하는 일

  • Apple의 SpeechTranscriberSpeechAnalyzer가 돌려주는 단어 단위 타이밍을 대체하지 않고 바로잡습니다. 같은 단어, 같은 결과 형태, 더 촘촘한 audioTimeRange 값.
  • 평균 시간 오차는 124.2 ms에서 43.9 ms로 줄었습니다. 9개 언어를 매크로 평균해 어느 한 언어가 수치를 좌우하지 않습니다. 영어에서는 더 나아가 106.4 ms에서 20.2 ms입니다.
  • LibriSpeech test-clean에서 500개 클립을 표본으로 하면 단어의 95%가 기준에서 50 ms 이내에 들어옵니다(이전 37%). 가장 많이 좋아지는 것은 하위 10%로, 230.7 ms에서 33.0 ms, 30fps 영상의 약 한 프레임 수준입니다.
  • 구조적 폴백이, 보정이 유효하지 않거나 탐색 구간의 끝에 닿거나 스트리밍 문맥이 없을 때마다 Apple의 원래 타임스탬프를 유지합니다.
  • 아홉 개 언어: 영어, 스페인어, 프랑스어, 이탈리아어, 포르투갈어, 독일어, 일본어, 한국어, 중국어. 그 밖의 로케일은 그대로 통과합니다.
  • 컴파일된 Core ML 기준 약 0.7 MB, 2단 구성으로 CPU와 Neural Engine에서 실행됩니다. 일반적인 결과는 몇 밀리초 만에 보정됩니다.

시작하기

단어 타임스탬프을(를) 몇 줄의 코드로 iOS or macOS 앱에 추가하세요. Align 문서.

iOS, macOS
설치
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")
예제 - Swift
import Align

let refiner = try await SpeechTimestampRefiner(locale: locale)
try await analyzer.start(inputSequence: inputs.recordingAudio(for: refiner))

for try await result in transcriber.results.refiningTimestamps(with: refiner) {
    result.words   // [WordTiming]: text, start, end, refined
}
프롬프트로 만들기
Add Align from Desert Ant Labs to this Swift project (iOS, macOS).

What it does: 어떤 자막이든 온디바이스 단어 타임스탬프.

SDK:

Swift (iOS, macOS)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")

Reference:
- Model page: https://desertant.com/models/align/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Android곧 출시
Web, Node.js곧 출시

사양

정확도
LibriSpeech test-clean에서 평균 오차 20.2 ms(Apple은 106.4 ms), 9개 언어 전체에서 43.9 ms(Apple은 124.2 ms)
온디바이스 크기
컴파일된 Core ML 기준 약 0.7 MB(0.3 MB 두 단계에 필터 뱅크와 캘리브레이터 포함)
언어
영어, 스페인어, 프랑스어, 이탈리아어, 포르투갈어, 독일어, 일본어, 한국어, 중국어
모델
log-mel 스펙트로그램 위의 2단 조밀 캐스케이드. 단계당 12만 1천 파라미터에 그래디언트 부스팅 캘리브레이터
플랫폼
iOS 26, macOS 26, tvOS 26, visionOS 26 (Core ML), SpeechAnalyzer가 있는 곳

Align은 전사본의 시간을 보정합니다. 전사 자체는 하지 않으며, Swift SDK는 Apple의 SpeechAnalyzer가 필요해 iOS 26, macOS 26, tvOS 26 또는 visionOS 26을 전제로 합니다.

모든 단어를 개선한다고 약속하지는 않습니다. 원래 타임스탬프를 유지하는 폴백은 위험해 보이는 보정을 걸러낼 뿐, 잘못된 보정을 전부 잡아내지는 않습니다.

가장 약한 경우는 말로 표현된 숫자로, 작은 표본에서는 보정이 숫자 경계를 기준에서 오히려 멀어지게 했습니다.

자주 묻는 질문

Align은(는) 무엇인가요?

어떤 전사본에도 쓸 수 있는 온디바이스 단어 타임스탬프. 5배 더 정확하게 단어 위에서 자르고, 자막을 넣고, 강조하세요. 0.7 MB부터.

Align은(는) 온디바이스로 실행되나요?

네. Align은(는) 서버 호출 없이 기기에서 실행되므로, 데이터는 사용자의 기기에 그대로 남습니다.

Align은(는) 어떤 플랫폼을 지원하나요?

Align은(는) Swift용 네이티브 온디바이스 SDK로 제공됩니다.

Align의 비용은 얼마인가요?

모든 모델은 SDK당 월간 활성 기기 10만 대까지 무료입니다. 사용자당 추론은 무제한입니다. 맞춤 라이선스는 문의하기 바랍니다.

Align은(는) 얼마나 정확하고 빠른가요?

LibriSpeech test-clean에서 Apple의 단어 시간은 평균 106.4 ms 어긋납니다. Align은 이를 20.2 ms로 줄이고, 단어의 95%가 50 ms 이내에 들어옵니다. 모델은 0.7 MB입니다.

리소스