Desert Ant Labs

Voz.

Reconnaissance vocaleDisponible

Transcrivez 10 minutes d'audio en 2 s sur un iPhone, 4,7x plus rapide que Whisper, avec des horodatages de mots précis.

Transcrivez 10 minutes d'audio en 2 s sur un iPhone.

Transcrivez un fichier audio ou vidéo avec Voz et obtenez des temps de début et de fin précis pour chaque mot. 10 minutes prennent 2 s sur un iPhone, sur l'appareil, si bien que rien n'est envoyé et rien n'est facturé à la minute.

Sur Apple silicon, le modèle tourne sur le Neural Engine, si bien que la transcription est ultra-rapide et consomme moins d'énergie. Sur un Mac, un catalogue existant de podcasts, d'entretiens et de cours passe en une seule fois, et rien n'est envoyé.

Les horodatages sont assez précis pour monter dessus. Les débuts de mots tombent à 83 ms d'un aligneur forcé et les fins à 95 ms, pour un montage précis fondé sur la transcription. Voz est une version optimisée pour l'Apple Neural Engine du Parakeet TDT 0.6B v3 de NVIDIA, d'une exactitude comparable à Whisper large-v3-turbo sur la plupart des audios, avec une taille de téléchargement de seulement 467 MB.

4,7x plus rapide que Whisper.

10 minutes de narration en 2 s et 30 minutes en 6 s sur un iPhone 17 Pro, 7 s sur un iPhone 15 Pro. Sur un Mac, 4,7x plus rapide que whisper.cpp large-v3-turbo sur le même audio de podcast, avec un taux d'erreur sur les mots de 7,40 % sur six jeux anglais publics où Whisper obtient 7,00 %.

0.0s
0:00 / 30:00

Audio : Ant Ventures, un enregistrement LibriVox, domaine public.

6 s
Une demi-heure d'audio
iPhone 17 Pro, sur le Neural Engine
4,7x
Plus rapide que Whisper
large-v3-turbo via whisper.cpp, M3 Ultra
7,40 %
Taux d'erreur sur les mots
six jeux de l'Open ASR Leaderboard ; Whisper large-v3-turbo 7,00 %
467 MB
Sur le disque
Whisper large-v3-turbo : 1,6 GB en fp16

Taux d'erreur sur les mots sur les jeux de l'Open ASR Leaderboard, Voz avec son propre normaliseur de texte, chiffres de Whisper issus du leaderboard

Jeu de donnéesVozWhisper large-v3-turbo
LibriSpeech test-clean2,19 %2,13 %
LibriSpeech test-other3,86 %3,70 %
GigaSpeech9,70 %8,47 %
SPGISpeech3,86 %2,79 %
Earnings-2212,97 %11,07 %
AMI11,84 %13,87 %
Average7,40 %7,00 %

Lisez la ligne qui correspond à votre audio. Une parole propre, captée au plus près du micro, tombe autour de 2-4 % (LibriSpeech, SPGISpeech), les podcasts et la vidéo web autour de 10 % (GigaSpeech), et les salles de réunion et les appels téléphoniques à 12-13 % (AMI, Earnings-22), là où le modèle bat Whisper. Les chiffres par langue sur 10 minutes de parole lue chacun sont sur la fiche du modèle, de 3,31 % pour l'italien à 39,46 % pour le grec. Les temps sur iPhone et la comparaison whisper.cpp sont nos propres runs et ne sont pas encore sur la fiche.

Transcrire n'importe quel fichier audio ou vidéo

Enregistrez un podcast ou une vidéo et la transcription complète est prête avant la fin de l'export. Un texte cherchable avec un horodatage sur chaque mot, dans l'une des 25 langues, sans quitter l'appareil.

Enchaîner un arriéré

Une archive d'entretiens, de cours ou d'enregistrements de réunions devient cherchable en une seule passe sur un Mac. Cent heures passent en 20 minutes, et rien n'est envoyé.

Couper sur un mot

Chaque mot porte un début et une fin, si bien qu'une plage sélectionnée dans la transcription est une coupe dans un éditeur vidéo. Associez-le à Clips pour les shorts et à Title pour les nommer.

Inspiration

Des idées à construire avec Voz. Copiez un prompt dans votre agent de code et lancez-vous.

Voz

Build a podcast player that transcribes every episode and makes it searchable, on the device.

Voz

Build a meeting recorder that hands you a timestamped transcript before you leave the room.

Voz

Turn voice memos into searchable, editable text notes, offline.

Voz

Generate SRT subtitles for any video file on the Mac.

Voz

Add captions to a video player that run on the device.

Voz

Build an interview app for journalists where sources never leave the phone.

VozClipsTitle

Build a full podcast studio: transcribe, clip, and title on the device.

ClearVozClips

Record, clean, transcribe, and clip: a whole creator pipeline, offline.

Voir les 26 idées

Ce que fait le modèle

  • Débuts de mots à 83 ms et fins de mots à 95 ms d'un aligneur forcé, en moyenne, à une résolution d'image de 80 ms.
  • 10 minutes d'audio en 2 s et 30 minutes en 6 s sur un iPhone 17 Pro ; 290x en temps réel sur un M3 Ultra. Les clips courts isolés tournent à 50-62x, parce que chaque clip paie une fenêtre complète de 15 s.
  • 7,40 % de taux d'erreur sur les mots en moyenne sur six jeux de l'Open ASR Leaderboard (Whisper large-v3-turbo : 7,00 %), 2,83 % sur une demi-heure de narration (Whisper : 2,72 %), 11,84 % sur les réunions AMI (Whisper : 13,87 %).
  • Tout le graphe tourne sur le Neural Engine sans repli CPU ou GPU ; la mémoire de pointe ne croît pas avec la durée de l'enregistrement.
  • 25 langues : bulgare, croate, tchèque, danois, néerlandais, anglais, estonien, finnois, français, allemand, grec, hongrois, italien, letton, lituanien, maltais, polonais, portugais, roumain, russe, slovaque, slovène, espagnol, suédois et ukrainien.
  • 467 MB sur le disque, téléchargé à la demande et mis en cache ; le premier chargement après un téléchargement prend 20 s une fois pendant que Core ML se spécialise, puis 0,2 s. Téléchargez pendant l'onboarding.
  • Audio mono à n'importe quelle fréquence d'échantillonnage ; le SDK rééchantillonne et remixe. L'audio plus long est découpé en fenêtres de 15 s aux pauses et raccordé sur les mots que les fenêtres voisines confirment.
  • Bâti sur le Parakeet TDT 0.6B v3 de NVIDIA, publié sous CC BY 4.0. Les poids sont inchangés ; la conversion, la compression et le runtime Neural Engine sont les nôtres.

Application d’exemple

Clipper

Conçu avec Voz, Clips, Title

Generate short clips from a video podcast or a long recording, fully on device. A macOS app and a command-line tool over the same core.

Voz transcribes with a time on every word, Clips ranks the best spans, and Title writes a title and description for each.

macOS 26 or later, Apple Silicon

Installer avec Homebrew
brew tap desert-ant-labs/tap
brew install --cask clipper

Prise en main

Ajoutez reconnaissance vocale à votre application iOS or macOS en quelques lignes de code. Docs Voz.

iOS, macOS
Installation
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Voz", package: "desert-ant-core")
Exemple - Swift
import Voz

let voz = try await Voz()
let result = try await voz.transcribe(url)
result.text                     // the transcript
result.words.first?.start       // 80ms resolution
result.realtimeFactor           // seconds of audio per second of wall clock
Construire avec un prompt
Add Voz from Desert Ant Labs to this Swift project (iOS, macOS).

What it does: Voz : reconnaissance vocale sur l'appareil, sur le Neural Engine.

SDK:

Swift (iOS, macOS)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Voz", package: "desert-ant-core")

Reference:
- Model page: https://desertant.com/models/voz/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
AndroidBientôt disponible
Web, Node.jsBientôt disponible

Spécifications

Vitesse
10 minutes d'audio en 2 s sur un iPhone 17 Pro, 30 minutes en 6 s (7 s sur un iPhone 15 Pro) ; 30 minutes en 5,6 s sur un M3 Ultra, 319x en temps réel
Exactitude
7,40 % de WER sur six jeux de l'Open ASR Leaderboard ; 2,83 % en forme longue ; débuts de mots à 83 ms, fins à 95 ms d'erreur moyenne
Taille sur l'appareil
467 MB de Core ML compilé, téléchargé à la demande
Langues
25 langues européennes ; exactitude de 3,31 % (italien) à 39,46 % (grec) sur de la parole lue
Modèle
NVIDIA Parakeet TDT 0.6B v3 (CC BY 4.0), converti en Core ML et compressé par Desert Ant Labs : frontend log-mel, encodeur conformer, décodeur transducer, tout sur le Neural Engine
Plateformes
iOS, iPadOS, macOS, tvOS, visionOS (Core ML) ; Apple uniquement

Voz est Apple uniquement : le runtime pilote Core ML directement pour garder le graphe sur le Neural Engine, et il n'y a pas de version Android, Linux ou web. Voz ne sait pas laquelle de ses 25 langues il entend, et une langue qu'il ne couvre pas produit des absurdités confiantes plutôt qu'une erreur : associez-le donc à Ear.

L'exactitude varie fortement selon la langue, les fins de mots sont la moitié la plus difficile des horodatages, et 467 MB est un vrai téléchargement à récupérer pendant l'onboarding.

FAQ

Qu'est-ce que Voz ?

Transcrivez 10 minutes d'audio en 2 s sur un iPhone, 4,7x plus rapide que Whisper, avec des horodatages de mots précis.

Voz fonctionne-t-il sur l'appareil ?

Oui. Voz s'exécute sur l'appareil, sans appel serveur : les données restent chez l'utilisateur.

Quelles plateformes Voz prend-il en charge ?

Voz est livré sous forme de SDK natif sur l'appareil pour Swift.

Combien coûte Voz ?

Chaque modèle est gratuit jusqu'à 100k appareils actifs mensuels par SDK. Inférence illimitée par utilisateur. Contactez-nous pour des licences sur mesure.

Quelle est la précision ou la vitesse de Voz ?

10 minutes de narration en 2 s et 30 minutes en 6 s sur un iPhone 17 Pro, 7 s sur un iPhone 15 Pro. Sur un Mac, 4,7x plus rapide que whisper.cpp large-v3-turbo sur le même audio de podcast, avec un taux d'erreur sur les mots de 7,40 % sur six jeux anglais publics où Whisper obtient 7,00 %.

Voz fonctionne-t-il sur Android ou Windows ?

Pas encore. Voz tourne aujourd'hui sur Apple silicon, où le modèle entier tourne sur le Neural Engine. Nous prévoyons d'ajouter Android et Windows dans les prochains mois. Dites-nous ce que vous construisez et nous vous préviendrons à leur sortie.

Ressources