Desert Ant Labs

Voz.

音声認識提供中

オンデバイスの音声認識。iPhone で 10 分の音声を 2 秒で文字起こし。Whisper の 4.7 倍速く、正確な単語タイムスタンプ付き。

iPhone で、10 分の音声を 2 秒で文字起こし。

Voz で音声や動画のファイルを文字起こしすると、すべての単語について正確な開始・終了時刻が得られます。iPhone では 10 分が 2 秒で、端末上で処理されるので、何もアップロードされず、分単位の課金もありません。

Apple silicon では、モデルは Neural Engine 上で動くので、文字起こしは圧倒的に速く、消費電力も抑えられます。Mac なら、ポッドキャスト、インタビュー、講義の過去のアーカイブを一度で処理でき、何もアップロードされません。

タイムスタンプは、それをもとに編集できるほど正確です。単語の開始は強制アライメントに対し 83 ms 以内、終了は 95 ms 以内に収まり、文字起こしに基づく精密な編集ができます。Voz は NVIDIA の Parakeet TDT 0.6B v3 を Apple Neural Engine 向けに最適化したもので、ほとんどの音声で Whisper large-v3-turbo に匹敵する精度を、わずか 467MB のダウンロードサイズで提供します。

Whisper の 4.7 倍速い。

iPhone 17 Pro で 10 分のナレーションを 2 秒、30 分を 6 秒、iPhone 15 Pro で 7 秒で。Mac では、同じポッドキャスト音声で whisper.cpp の large-v3-turbo より 4.7 倍速く、6 つの公開英語セットでの単語誤り率は 7.40%(Whisper は 7.00%)です。

0.0s
0:00 / 30:00

音声:Ant Ventures、LibriVox の録音、パブリックドメイン。

6s
30 分の音声
iPhone 17 Pro、Neural Engine 上
4.7x
Whisper より速い
whisper.cpp 経由の large-v3-turbo、M3 Ultra
7.40%
単語誤り率
Open ASR Leaderboard の 6 セット。Whisper large-v3-turbo は 7.00%
467MB
ディスク上
Whisper large-v3-turbo:fp16 で 1.6GB

Open ASR Leaderboard のデータセットでの単語誤り率。Voz は独自のテキスト正規化を使用、Whisper の数値はリーダーボードから。

データセットVozWhisper large-v3-turbo
LibriSpeech test-clean2.19%2.13%
LibriSpeech test-other3.86%3.70%
GigaSpeech9.70%8.47%
SPGISpeech3.86%2.79%
Earnings-2212.97%11.07%
AMI11.84%13.87%
Average7.40%7.00%

自分の音声に合う行を見て読んでください。クリーンで近接収音された音声は 2〜4% 前後(LibriSpeech、SPGISpeech)、ポッドキャストや Web 動画は 10% 前後(GigaSpeech)、会議室や電話は 12〜13%(AMI、Earnings-22)で、この最後のところがモデルが Whisper を上回る領域です。それぞれ 10 分の朗読音声での言語別の数値はモデルカードにあり、イタリア語の 3.31% からギリシャ語の 39.46% まで幅があります。iPhone のタイミングと whisper.cpp との比較は当社独自の計測で、まだカードには載っていません。

あらゆる音声・動画ファイルを文字起こし

ポッドキャストや動画を録れば、書き出しが終わる前に完全な文字起こしが用意できます。すべての単語にタイムスタンプが付いた検索可能なテキストが、25 言語のいずれでも、デバイスから出ることなく得られます。

たまった録音を一気に処理する

インタビュー、講義、会議録音のアーカイブが、Mac で一度の処理で検索可能になります。100 時間が 20 分で処理され、何もアップロードされません。

単語の位置で切る

すべての単語が開始と終了を持つので、文字起こし上で選んだ範囲が、そのまま動画エディターのカットになります。ショートには Clips、その名前付けには Title を組み合わせましょう。

インスピレーション

Voz で作るためのアイデア。プロンプトをコーディングエージェントにコピーして始めましょう。

Voz

Build a podcast player that transcribes every episode and makes it searchable, on the device.

Voz

Build a meeting recorder that hands you a timestamped transcript before you leave the room.

Voz

Turn voice memos into searchable, editable text notes, offline.

Voz

Generate SRT subtitles for any video file on the Mac.

Voz

Add captions to a video player that run on the device.

Voz

Build an interview app for journalists where sources never leave the phone.

VozClipsTitle

Build a full podcast studio: transcribe, clip, and title on the device.

ClearVozClips

Record, clean, transcribe, and clip: a whole creator pipeline, offline.

26 件すべてのアイデアを見る

モデルができること

  • 強制アライメントに対し、平均で単語の開始は 83 ms 以内、終了は 95 ms 以内。フレーム分解能は 80 ms。
  • iPhone 17 Pro で 10 分の音声を 2 秒、30 分を 6 秒。M3 Ultra で実時間の 290 倍。短いクリップ単体では 50〜62 倍で、どのクリップも 15 秒ぶんの窓のコストを払うためです。
  • Open ASR Leaderboard の 6 セット平均で単語誤り率 7.40%(Whisper large-v3-turbo は 7.00%)、30 分のナレーションで 2.83%(Whisper は 2.72%)、AMI の会議で 11.84%(Whisper は 13.87%)。
  • グラフ全体が Neural Engine 上で動き、CPU や GPU へのフォールバックはありません。ピークメモリは録音の長さに応じて増えません。
  • 25 言語:ブルガリア語、クロアチア語、チェコ語、デンマーク語、オランダ語、英語、エストニア語、フィンランド語、フランス語、ドイツ語、ギリシャ語、ハンガリー語、イタリア語、ラトビア語、リトアニア語、マルタ語、ポーランド語、ポルトガル語、ルーマニア語、ロシア語、スロバキア語、スロベニア語、スペイン語、スウェーデン語、ウクライナ語。
  • ディスク上で 467MB、必要に応じてダウンロードされキャッシュされます。ダウンロード後の初回読み込みは、Core ML が特殊化する間だけ一度 20 秒かかり、その後は 0.2 秒です。オンボーディング中にダウンロードしてください。
  • サンプルレートを問わないモノラル音声に対応し、SDK がリサンプリングとダウンミックスを行います。長い音声は休止のところで 15 秒の窓に分割され、隣り合う窓が一致した単語でつなぎ合わされます。
  • CC BY 4.0 で公開された NVIDIA の Parakeet TDT 0.6B v3 を基盤にしています。重みは変更しておらず、変換、圧縮、Neural Engine のランタイムが当社によるものです。

サンプルアプリ

Clipper

Voz, Clips, Title で構築

Generate short clips from a video podcast or a long recording, fully on device. A macOS app and a command-line tool over the same core.

Voz transcribes with a time on every word, Clips ranks the best spans, and Title writes a title and description for each.

macOS 26 or later, Apple Silicon

Homebrew でインストール
brew tap desert-ant-labs/tap
brew install --cask clipper

はじめに

音声認識 を、数行のコードで iOS or macOS アプリに追加。 Voz のドキュメント.

iOS, macOS
インストール
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Voz", package: "desert-ant-core")
使用例 - Swift
import Voz

let voz = try await Voz()
let result = try await voz.transcribe(url)
result.text                     // the transcript
result.words.first?.start       // 80ms resolution
result.realtimeFactor           // seconds of audio per second of wall clock
プロンプトで作る
Add Voz from Desert Ant Labs to this Swift project (iOS, macOS).

What it does: Voz:Neural Engine で動くオンデバイスの音声認識.

SDK:

Swift (iOS, macOS)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Voz", package: "desert-ant-core")

Reference:
- Model page: https://desertant.com/models/voz/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Android近日公開
Web, Node.js近日公開

仕様

速度
iPhone 17 Pro で 10 分の音声を 2 秒、30 分を 6 秒(iPhone 15 Pro で 7 秒)。M3 Ultra で 30 分を 5.6 秒、実時間の 319 倍
精度
Open ASR Leaderboard の 6 セットで WER 7.40%、長尺で 2.83%。単語の開始は平均誤差 83 ms、終了は 95 ms
オンデバイスサイズ
コンパイル済み Core ML で 467MB、必要に応じてダウンロード
言語
欧州 25 言語。朗読音声での精度はイタリア語の 3.31% からギリシャ語の 39.46% まで
モデル
NVIDIA Parakeet TDT 0.6B v3(CC BY 4.0)を、Desert Ant Labs が Core ML に変換・圧縮。対数メルのフロントエンド、Conformer エンコーダー、Transducer デコーダーがすべて Neural Engine 上で動作
プラットフォーム
iOS、iPadOS、macOS、tvOS、visionOS(Core ML)。Apple 専用

Voz は Apple 専用です。ランタイムが Core ML を直接駆動してグラフを Neural Engine 上に保つため、Android、Linux、Web 向けのビルドはありません。Voz は、対応する 25 言語のうちどれを聞いているかを判別しないので、対応していない言語ではエラーではなく自信満々のでたらめを返します。そのため Ear と組み合わせてください。精度は言語によって大きく変わり、単語の終わりはタイムスタンプのなかでも難しい方で、467MB はオンボーディング中に取得するには相応の大きさのダウンロードです。

FAQ

Voz とは?

オンデバイスの音声認識。iPhone で 10 分の音声を 2 秒で文字起こし。Whisper の 4.7 倍速く、正確な単語タイムスタンプ付き。

Voz はオンデバイスで動作しますか?

はい。Voz はデバイス上で動作し、サーバーへの通信は発生しません。データはユーザーの手元に残ります。

Voz はどのプラットフォームに対応していますか?

Voz は Swift 向けのネイティブなオンデバイス SDK として提供されます。

Voz の料金はいくらですか?

すべてのモデルは、SDK ごとに月間アクティブデバイス 100k 台まで無料です。各ユーザーがモデルを実行する回数に制限はありません。 カスタムライセンスについては、お問い合わせください

Voz の精度や速度はどれくらいですか?

iPhone 17 Pro で 10 分のナレーションを 2 秒、30 分を 6 秒、iPhone 15 Pro で 7 秒で。Mac では、同じポッドキャスト音声で whisper.cpp の large-v3-turbo より 4.7 倍速く、6 つの公開英語セットでの単語誤り率は 7.40%(Whisper は 7.00%)です。

Voz は Android や Windows で動きますか?

まだです。Voz は現在 Apple silicon で動作し、そこではモデル全体が Neural Engine 上で動きます。今後数か月のうちに Android と Windows を追加する見込みです。何を作っているか教えていただければ、提供開始時にお知らせします。

リソース