Voz.
Transkribera 10 minuter ljud på 2 s på en iPhone, 4,7x snabbare än Whisper, exakta ordtidsstämplar.
Transkribera 10 minuter ljud på 2 s på en iPhone.
Transkribera en ljud- eller videofil med Voz och få exakta start- och sluttider för varje ord. 10 minuter tar 2 s på en iPhone, på enheten, så inget laddas upp och inget faktureras per minut.
På Apple-kisel körs modellen på Neural Engine, så transkriberingen är blixtsnabb och drar mindre ström. På en Mac körs en backkatalog av poddar, intervjuer och föreläsningar igenom i en enda genomgång, och inget laddas upp.
Tidsstämplarna är precisa nog att redigera på. Ordstarter landar inom 83 ms från en forced aligner och ordslut inom 95 ms, för precis transkriptbaserad redigering. Voz är en version av NVIDIA:s Parakeet TDT 0.6B v3 optimerad för Apple Neural Engine, med noggrannhet jämförbar med Whisper large-v3-turbo på de flesta ljud, med en nedladdningsstorlek på bara 467 MB.
4,7x snabbare än Whisper.
10 minuter berättarröst på 2 s och 30 minuter på 6 s på en iPhone 17 Pro, 7 s på en iPhone 15 Pro. På en Mac, 4,7x snabbare än whisper.cpp large-v3-turbo på samma poddljud, med en ordfelfrekvens på 7,40% över sex offentliga engelska uppsättningar där Whisper får 7,00%.
Ordfelfrekvens på datauppsättningarna från Open ASR Leaderboard, Voz med sin egen textnormaliserare, Whispers siffror från topplistan
| Datauppsättning | Voz | Whisper large-v3-turbo |
|---|---|---|
| LibriSpeech test-clean | 2,19% | 2,13% |
| LibriSpeech test-other | 3,86% | 3,70% |
| GigaSpeech | 9,70% | 8,47% |
| SPGISpeech | 3,86% | 2,79% |
| Earnings-22 | 12,97% | 11,07% |
| AMI | 11,84% | 13,87% |
| Average | 7,40% | 7,00% |
Läs raden som matchar ditt ljud. Rent, tätt inmikat tal hamnar runt 2–4% (LibriSpeech, SPGISpeech), poddar och webbvideo runt 10% (GigaSpeech), och mötesrum och telefonsamtal 12–13% (AMI, Earnings-22), vilket är där modellen slår Whisper. Siffror per språk på 10 minuter uppläst tal vardera finns på modellkortet, från 3,31% för italienska till 39,46% för grekiska. iPhone-tiderna och jämförelsen med whisper.cpp är våra egna körningar och finns inte på kortet ännu.
Transkribera vilken ljud- eller videofil som helst
Spela in en podd eller en video och hela transkriptet är klart innan exporten är färdig. Sökbar text med en tidsstämpel på varje ord, på vilket som helst av 25 språk, utan att lämna enheten.
Mala igenom en eftersläpning
Ett arkiv av intervjuer, föreläsningar eller mötesinspelningar blir sökbart i en enda genomgång på en Mac. Hundra timmar körs igenom på 20 minuter, och inget laddas upp.
Klipp på ett ord
Varje ord bär en start och ett slut, så ett markerat intervall i transkriptet är ett klipp i en videoredigerare. Kombinera den med Clips för shorts och Title för att namnge dem.
Inspiration
Idéer att bygga med Voz. Kopiera en prompt till din kodningsagent och kör.
Build a podcast player that transcribes every episode and makes it searchable, on the device.
Build a podcast player. When an episode downloads, run Desert Ant's Voz on-device to transcribe it with word timestamps, index the text, and let the user search across a whole feed and tap a result to jump to that moment. No cloud transcription, no per-minute bill. Build it with the Desert Ant SDK. Voz (Swift). Install and API: https://desertant.com/docs/voz/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Build a meeting recorder that hands you a timestamped transcript before you leave the room.
Build a meeting recorder. When recording stops, Desert Ant's Voz transcribes the file in seconds on iPhone or Mac, so the timestamped transcript is ready right away and nothing is uploaded. Build it with the Desert Ant SDK. Voz (Swift). Install and API: https://desertant.com/docs/voz/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Turn voice memos into searchable, editable text notes, offline.
Build a voice-notes app where each memo is transcribed on-device with Desert Ant's Voz into editable, searchable text. Works on a plane, and the audio never leaves the phone. Build it with the Desert Ant SDK. Voz (Swift). Install and API: https://desertant.com/docs/voz/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Generate SRT subtitles for any video file on the Mac.
Build a small Mac tool that takes a video file, transcribes the audio with Desert Ant's Voz (Apple silicon), and writes a correctly timed .srt file. No upload, no API key. Build it with the Desert Ant SDK. Voz (Swift). Install and API: https://desertant.com/docs/voz/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Add captions to a video player that run on the device.
Transcribe the video's audio on-device with Desert Ant's Voz (a fast batch pass on iPhone or Mac), then render a synced caption track. Works offline and for private content that can't go to a cloud service. Build it with the Desert Ant SDK. Voz (Swift). Install and API: https://desertant.com/docs/voz/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Build an interview app for journalists where sources never leave the phone.
Build an interview-recording app that transcribes on-device with Desert Ant's Voz, so a source's audio and words stay on the reporter's phone. Add speaker-friendly formatting and export. Build it with the Desert Ant SDK. Voz (Swift). Install and API: https://desertant.com/docs/voz/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Build a full podcast studio: transcribe, clip, and title on the device.
Build a podcast tool that runs Desert Ant's Voz to transcribe an episode, Clips to pick the best moments as shorts, and Title to name and describe each clip, all on-device with no per-minute or per-token bill. Build it with the Desert Ant SDK. Voz (Swift). Install and API: https://desertant.com/docs/voz/. Clips (Swift). Install and API: https://desertant.com/docs/clips/. Title (Swift). Install and API: https://desertant.com/docs/title/. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Record, clean, transcribe, and clip: a whole creator pipeline, offline.
Build a creator pipeline: Desert Ant's Clear cleans the recording, Voz transcribes it, and Clips pulls the shorts, all on the device so a full episode never touches a server. Build it with the Desert Ant SDK. Clear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/clear/. Voz (Swift). Install and API: https://desertant.com/docs/voz/. Clips (Swift). Install and API: https://desertant.com/docs/clips/. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Vad modellen gör
- Ordstarter inom 83 ms och ordslut inom 95 ms från en forced aligner, i genomsnitt, vid 80 ms ramupplösning.
- 10 minuter ljud på 2 s och 30 minuter på 6 s på en iPhone 17 Pro; 290x realtid på en M3 Ultra. Enskilda korta klipp körs 50–62x, eftersom varje klipp betalar för ett helt 15 s-fönster.
- 7,40% ordfelfrekvens i genomsnitt över sex uppsättningar från Open ASR Leaderboard (Whisper large-v3-turbo: 7,00%), 2,83% på en halvtimmes berättarröst (Whisper: 2,72%), 11,84% på AMI-möten (Whisper: 13,87%).
- Hela grafen körs på Neural Engine utan CPU- eller GPU-reserv; toppminnet växer inte med inspelningens längd.
- 25 språk: bulgariska, kroatiska, tjeckiska, danska, nederländska, engelska, estniska, finska, franska, tyska, grekiska, ungerska, italienska, lettiska, litauiska, maltesiska, polska, portugisiska, rumänska, ryska, slovakiska, slovenska, spanska, svenska och ukrainska.
- 467 MB på disk, nedladdad vid behov och cachad; den första laddningen efter en nedladdning tar 20 s en gång medan Core ML specialiserar, sedan 0,2 s. Ladda ned under onboarding.
- Monoljud i valfri samplingsfrekvens; SDK:n omsamplar och nedmixar. Längre ljud klipps i 15 s-fönster vid pauser och fogas samman på de ord som angränsande fönster är överens om.
- Byggd på NVIDIA:s Parakeet TDT 0.6B v3, släppt under CC BY 4.0. Vikterna är oförändrade; konverteringen, kompressionen och Neural Engine-runtimen är våra.
Exempelapp
Clipper
Byggd med Voz, Clips, Title
Generate short clips from a video podcast or a long recording, fully on device. A macOS app and a command-line tool over the same core.
Voz transcribes with a time on every word, Clips ranks the best spans, and Title writes a title and description for each.
macOS 26 or later, Apple Silicon
brew tap desert-ant-labs/tap
brew install --cask clipper
Kom igång
Lägg till taligenkänning i din iOS or macOS-app med några rader kod. Voz-dokumentation.
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Voz", package: "desert-ant-core")
import Voz
let voz = try await Voz()
let result = try await voz.transcribe(url)
result.text // the transcript
result.words.first?.start // 80ms resolution
result.realtimeFactor // seconds of audio per second of wall clock
Add Voz from Desert Ant Labs to this Swift project (iOS, macOS). What it does: Tal till text på enheten på Neural Engine. SDK: Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0") // target dependency .product(name: "Voz", package: "desert-ant-core") Reference: - Model page: https://desertant.com/models/voz/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Specifikationer
- Hastighet
- 10 minuter ljud på 2 s på en iPhone 17 Pro, 30 minuter på 6 s (7 s på en iPhone 15 Pro); 30 minuter på 5,6 s på en M3 Ultra, 319x realtid
- Noggrannhet
- 7,40% WER över sex uppsättningar från Open ASR Leaderboard; 2,83% långform; ordstarter 83 ms, ordslut 95 ms genomsnittligt fel
- Storlek på enheten
- 467 MB kompilerad Core ML, nedladdad vid behov
- Språk
- 25 europeiska språk; noggrannhet från 3,31% (italienska) till 39,46% (grekiska) på uppläst tal
- Modell
- NVIDIA Parakeet TDT 0.6B v3 (CC BY 4.0), konverterad till Core ML och komprimerad av Desert Ant Labs: log-mel-frontend, conformer-encoder, transducer-decoder, allt på Neural Engine
- Plattformar
- iOS, iPadOS, macOS, tvOS, visionOS (Core ML); endast Apple
Voz är endast för Apple: runtimen driver Core ML direkt för att hålla grafen på Neural Engine, och det finns inget bygge för Android, Linux eller webben. Voz vet inte vilket av sina 25 språk den hör, och ett språk den inte täcker ger självsäkert nonsens snarare än ett fel, så kombinera den med Ear.
Noggrannheten varierar kraftigt mellan språk, ordslut är den svårare halvan av tidsstämplarna, och 467 MB är en verklig nedladdning att hämta under onboarding.
Vanliga frågor
Vad är Voz?
Transkribera 10 minuter ljud på 2 s på en iPhone, 4,7x snabbare än Whisper, exakta ordtidsstämplar.
Körs Voz lokalt på enheten?
Ja. Voz körs på enheten, utan något serveranrop, så att data stannar hos användaren.
Vilka plattformar stöder Voz?
Voz levereras som en nativ SDK på enheten för Swift.
Vad kostar Voz?
Varje modell är gratis upp till 100k månadsaktiva enheter per SDK. Obegränsad inferens per användare. Kontakta oss för anpassade licenser.
Hur träffsäker eller snabb är Voz?
10 minuter berättarröst på 2 s och 30 minuter på 6 s på en iPhone 17 Pro, 7 s på en iPhone 15 Pro. På en Mac, 4,7x snabbare än whisper.cpp large-v3-turbo på samma poddljud, med en ordfelfrekvens på 7,40% över sex offentliga engelska uppsättningar där Whisper får 7,00%.
Körs Voz på Android eller Windows?
Inte ännu. Voz körs på Apple-kisel i dag, där hela modellen körs på Neural Engine. Vi räknar med att lägga till Android och Windows under de kommande månaderna. Berätta vad du bygger, så hör vi av oss när de kommer.