Desert Ant Labs

Voz.

TaligenkänningTillgänglig

Transkribera 10 minuter ljud på 2 s på en iPhone, 4,7x snabbare än Whisper, exakta ordtidsstämplar.

Transkribera 10 minuter ljud på 2 s på en iPhone.

Transkribera en ljud- eller videofil med Voz och få exakta start- och sluttider för varje ord. 10 minuter tar 2 s på en iPhone, på enheten, så inget laddas upp och inget faktureras per minut.

På Apple-kisel körs modellen på Neural Engine, så transkriberingen är blixtsnabb och drar mindre ström. På en Mac körs en backkatalog av poddar, intervjuer och föreläsningar igenom i en enda genomgång, och inget laddas upp.

Tidsstämplarna är precisa nog att redigera på. Ordstarter landar inom 83 ms från en forced aligner och ordslut inom 95 ms, för precis transkriptbaserad redigering. Voz är en version av NVIDIA:s Parakeet TDT 0.6B v3 optimerad för Apple Neural Engine, med noggrannhet jämförbar med Whisper large-v3-turbo på de flesta ljud, med en nedladdningsstorlek på bara 467 MB.

4,7x snabbare än Whisper.

10 minuter berättarröst på 2 s och 30 minuter på 6 s på en iPhone 17 Pro, 7 s på en iPhone 15 Pro. På en Mac, 4,7x snabbare än whisper.cpp large-v3-turbo på samma poddljud, med en ordfelfrekvens på 7,40% över sex offentliga engelska uppsättningar där Whisper får 7,00%.

0.0s
0:00 / 30:00

Ljud: Ant Ventures, en LibriVox-inspelning, allmän egendom.

6s
En halvtimme ljud
iPhone 17 Pro, på Neural Engine
4,7x
Snabbare än Whisper
large-v3-turbo via whisper.cpp, M3 Ultra
7,40%
Ordfelfrekvens
sex uppsättningar från Open ASR Leaderboard; Whisper large-v3-turbo 7,00%
467MB
På disk
Whisper large-v3-turbo: 1,6 GB vid fp16

Ordfelfrekvens på datauppsättningarna från Open ASR Leaderboard, Voz med sin egen textnormaliserare, Whispers siffror från topplistan

DatauppsättningVozWhisper large-v3-turbo
LibriSpeech test-clean2,19%2,13%
LibriSpeech test-other3,86%3,70%
GigaSpeech9,70%8,47%
SPGISpeech3,86%2,79%
Earnings-2212,97%11,07%
AMI11,84%13,87%
Average7,40%7,00%

Läs raden som matchar ditt ljud. Rent, tätt inmikat tal hamnar runt 2–4% (LibriSpeech, SPGISpeech), poddar och webbvideo runt 10% (GigaSpeech), och mötesrum och telefonsamtal 12–13% (AMI, Earnings-22), vilket är där modellen slår Whisper. Siffror per språk på 10 minuter uppläst tal vardera finns på modellkortet, från 3,31% för italienska till 39,46% för grekiska. iPhone-tiderna och jämförelsen med whisper.cpp är våra egna körningar och finns inte på kortet ännu.

Transkribera vilken ljud- eller videofil som helst

Spela in en podd eller en video och hela transkriptet är klart innan exporten är färdig. Sökbar text med en tidsstämpel på varje ord, på vilket som helst av 25 språk, utan att lämna enheten.

Mala igenom en eftersläpning

Ett arkiv av intervjuer, föreläsningar eller mötesinspelningar blir sökbart i en enda genomgång på en Mac. Hundra timmar körs igenom på 20 minuter, och inget laddas upp.

Klipp på ett ord

Varje ord bär en start och ett slut, så ett markerat intervall i transkriptet är ett klipp i en videoredigerare. Kombinera den med Clips för shorts och Title för att namnge dem.

Inspiration

Idéer att bygga med Voz. Kopiera en prompt till din kodningsagent och kör.

Voz

Build a podcast player that transcribes every episode and makes it searchable, on the device.

Voz

Build a meeting recorder that hands you a timestamped transcript before you leave the room.

Voz

Turn voice memos into searchable, editable text notes, offline.

Voz

Generate SRT subtitles for any video file on the Mac.

Voz

Add captions to a video player that run on the device.

Voz

Build an interview app for journalists where sources never leave the phone.

VozClipsTitle

Build a full podcast studio: transcribe, clip, and title on the device.

ClearVozClips

Record, clean, transcribe, and clip: a whole creator pipeline, offline.

Se alla 26 idéer

Vad modellen gör

  • Ordstarter inom 83 ms och ordslut inom 95 ms från en forced aligner, i genomsnitt, vid 80 ms ramupplösning.
  • 10 minuter ljud på 2 s och 30 minuter på 6 s på en iPhone 17 Pro; 290x realtid på en M3 Ultra. Enskilda korta klipp körs 50–62x, eftersom varje klipp betalar för ett helt 15 s-fönster.
  • 7,40% ordfelfrekvens i genomsnitt över sex uppsättningar från Open ASR Leaderboard (Whisper large-v3-turbo: 7,00%), 2,83% på en halvtimmes berättarröst (Whisper: 2,72%), 11,84% på AMI-möten (Whisper: 13,87%).
  • Hela grafen körs på Neural Engine utan CPU- eller GPU-reserv; toppminnet växer inte med inspelningens längd.
  • 25 språk: bulgariska, kroatiska, tjeckiska, danska, nederländska, engelska, estniska, finska, franska, tyska, grekiska, ungerska, italienska, lettiska, litauiska, maltesiska, polska, portugisiska, rumänska, ryska, slovakiska, slovenska, spanska, svenska och ukrainska.
  • 467 MB på disk, nedladdad vid behov och cachad; den första laddningen efter en nedladdning tar 20 s en gång medan Core ML specialiserar, sedan 0,2 s. Ladda ned under onboarding.
  • Monoljud i valfri samplingsfrekvens; SDK:n omsamplar och nedmixar. Längre ljud klipps i 15 s-fönster vid pauser och fogas samman på de ord som angränsande fönster är överens om.
  • Byggd på NVIDIA:s Parakeet TDT 0.6B v3, släppt under CC BY 4.0. Vikterna är oförändrade; konverteringen, kompressionen och Neural Engine-runtimen är våra.

Exempelapp

Clipper

Byggd med Voz, Clips, Title

Generate short clips from a video podcast or a long recording, fully on device. A macOS app and a command-line tool over the same core.

Voz transcribes with a time on every word, Clips ranks the best spans, and Title writes a title and description for each.

macOS 26 or later, Apple Silicon

Installera med Homebrew
brew tap desert-ant-labs/tap
brew install --cask clipper

Kom igång

Lägg till taligenkänning i din iOS or macOS-app med några rader kod. Voz-dokumentation.

iOS, macOS
Installera
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Voz", package: "desert-ant-core")
Exempel - Swift
import Voz

let voz = try await Voz()
let result = try await voz.transcribe(url)
result.text                     // the transcript
result.words.first?.start       // 80ms resolution
result.realtimeFactor           // seconds of audio per second of wall clock
Bygg med en prompt
Add Voz from Desert Ant Labs to this Swift project (iOS, macOS).

What it does: Tal till text på enheten på Neural Engine.

SDK:

Swift (iOS, macOS)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Voz", package: "desert-ant-core")

Reference:
- Model page: https://desertant.com/models/voz/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
AndroidKommer snart
Web, Node.jsKommer snart

Specifikationer

Hastighet
10 minuter ljud på 2 s på en iPhone 17 Pro, 30 minuter på 6 s (7 s på en iPhone 15 Pro); 30 minuter på 5,6 s på en M3 Ultra, 319x realtid
Noggrannhet
7,40% WER över sex uppsättningar från Open ASR Leaderboard; 2,83% långform; ordstarter 83 ms, ordslut 95 ms genomsnittligt fel
Storlek på enheten
467 MB kompilerad Core ML, nedladdad vid behov
Språk
25 europeiska språk; noggrannhet från 3,31% (italienska) till 39,46% (grekiska) på uppläst tal
Modell
NVIDIA Parakeet TDT 0.6B v3 (CC BY 4.0), konverterad till Core ML och komprimerad av Desert Ant Labs: log-mel-frontend, conformer-encoder, transducer-decoder, allt på Neural Engine
Plattformar
iOS, iPadOS, macOS, tvOS, visionOS (Core ML); endast Apple

Voz är endast för Apple: runtimen driver Core ML direkt för att hålla grafen på Neural Engine, och det finns inget bygge för Android, Linux eller webben. Voz vet inte vilket av sina 25 språk den hör, och ett språk den inte täcker ger självsäkert nonsens snarare än ett fel, så kombinera den med Ear.

Noggrannheten varierar kraftigt mellan språk, ordslut är den svårare halvan av tidsstämplarna, och 467 MB är en verklig nedladdning att hämta under onboarding.

Vanliga frågor

Vad är Voz?

Transkribera 10 minuter ljud på 2 s på en iPhone, 4,7x snabbare än Whisper, exakta ordtidsstämplar.

Körs Voz lokalt på enheten?

Ja. Voz körs på enheten, utan något serveranrop, så att data stannar hos användaren.

Vilka plattformar stöder Voz?

Voz levereras som en nativ SDK på enheten för Swift.

Vad kostar Voz?

Varje modell är gratis upp till 100k månadsaktiva enheter per SDK. Obegränsad inferens per användare. Kontakta oss för anpassade licenser.

Hur träffsäker eller snabb är Voz?

10 minuter berättarröst på 2 s och 30 minuter på 6 s på en iPhone 17 Pro, 7 s på en iPhone 15 Pro. På en Mac, 4,7x snabbare än whisper.cpp large-v3-turbo på samma poddljud, med en ordfelfrekvens på 7,40% över sex offentliga engelska uppsättningar där Whisper får 7,00%.

Körs Voz på Android eller Windows?

Inte ännu. Voz körs på Apple-kisel i dag, där hela modellen körs på Neural Engine. Vi räknar med att lägga till Android och Windows under de kommande månaderna. Berätta vad du bygger, så hör vi av oss när de kommer.

Resurser