Voz.
Transcribe 10 minutos de audio en 2 s en un iPhone, 4,7x más rápido que Whisper, con marcas de tiempo por palabra precisas.
Transcribe 10 minutos de audio en 2 s en un iPhone.
Transcribe un archivo de audio o vídeo con Voz y obtén tiempos de inicio y fin precisos para cada palabra. 10 minutos tardan 2 s en un iPhone, en el dispositivo, así que no se sube nada y no se cobra por minuto.
En Apple silicon, el modelo se ejecuta en el Neural Engine, así que transcribir es ultrarrápido y consume menos energía. En un Mac, un catálogo antiguo de podcasts, entrevistas y clases se procesa de una sola pasada, y no se sube nada.
Las marcas de tiempo son lo bastante precisas para editar sobre ellas. Los inicios de palabra caen a menos de 83 ms de un alineador forzado y los finales a menos de 95 ms, para una edición precisa basada en la transcripción. Voz es una versión de Parakeet TDT 0.6B v3 de NVIDIA optimizada para el Apple Neural Engine, con una exactitud comparable a la de Whisper large-v3-turbo en la mayoría del audio, y un tamaño de descarga de solo 467 MB.
4,7x más rápido que Whisper.
10 minutos de narración en 2 s y 30 minutos en 6 s en un iPhone 17 Pro, 7 s en un iPhone 15 Pro. En un Mac, 4,7x más rápido que whisper.cpp large-v3-turbo con el mismo audio de podcast, con una tasa de error de palabra del 7,40% en seis conjuntos públicos en inglés donde Whisper obtiene el 7,00%.
Tasa de error de palabra en los conjuntos del Open ASR Leaderboard, Voz con su propio normalizador de texto, las cifras de Whisper tomadas del leaderboard
| Conjunto de datos | Voz | Whisper large-v3-turbo |
|---|---|---|
| LibriSpeech test-clean | 2,19% | 2,13% |
| LibriSpeech test-other | 3,86% | 3,70% |
| GigaSpeech | 9,70% | 8,47% |
| SPGISpeech | 3,86% | 2,79% |
| Earnings-22 | 12,97% | 11,07% |
| AMI | 11,84% | 13,87% |
| Average | 7,40% | 7,00% |
Lee la fila que coincide con tu audio. El habla limpia y con micrófono cercano ronda el 2-4% (LibriSpeech, SPGISpeech), los podcasts y el vídeo web en torno al 10% (GigaSpeech), y las salas de reuniones y las llamadas telefónicas el 12-13% (AMI, Earnings-22), que es donde el modelo supera a Whisper. Las cifras por idioma sobre 10 minutos de habla leída cada una están en la ficha del modelo, del 3,31% del italiano al 39,46% del griego. Los tiempos en iPhone y la comparación con whisper.cpp son ejecuciones propias y aún no están en la ficha.
Transcribe cualquier archivo de audio o vídeo
Graba un podcast o un vídeo y la transcripción completa está lista antes de que termine la exportación. Texto en el que puedes buscar con una marca de tiempo en cada palabra, en cualquiera de los 25 idiomas, sin salir del dispositivo.
Despacha el trabajo acumulado
Una biblioteca de entrevistas, clases o grabaciones de reuniones se vuelve consultable de una sola pasada en un Mac. Cien horas se procesan en 20 minutos, y no se sube nada.
Corta en una palabra
Cada palabra lleva un inicio y un fin, así que un rango seleccionado en la transcripción es un corte en un editor de vídeo. Combínalo con Clips para los shorts y con Title para nombrarlos.
Inspiración
Ideas para crear con Voz. Copia un prompt en tu agente de código y adelante.
Build a podcast player that transcribes every episode and makes it searchable, on the device.
Build a podcast player. When an episode downloads, run Desert Ant's Voz on-device to transcribe it with word timestamps, index the text, and let the user search across a whole feed and tap a result to jump to that moment. No cloud transcription, no per-minute bill. Build it with the Desert Ant SDK. Voz (Swift). Install and API: https://desertant.com/docs/voz/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Build a meeting recorder that hands you a timestamped transcript before you leave the room.
Build a meeting recorder. When recording stops, Desert Ant's Voz transcribes the file in seconds on iPhone or Mac, so the timestamped transcript is ready right away and nothing is uploaded. Build it with the Desert Ant SDK. Voz (Swift). Install and API: https://desertant.com/docs/voz/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Turn voice memos into searchable, editable text notes, offline.
Build a voice-notes app where each memo is transcribed on-device with Desert Ant's Voz into editable, searchable text. Works on a plane, and the audio never leaves the phone. Build it with the Desert Ant SDK. Voz (Swift). Install and API: https://desertant.com/docs/voz/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Generate SRT subtitles for any video file on the Mac.
Build a small Mac tool that takes a video file, transcribes the audio with Desert Ant's Voz (Apple silicon), and writes a correctly timed .srt file. No upload, no API key. Build it with the Desert Ant SDK. Voz (Swift). Install and API: https://desertant.com/docs/voz/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Add captions to a video player that run on the device.
Transcribe the video's audio on-device with Desert Ant's Voz (a fast batch pass on iPhone or Mac), then render a synced caption track. Works offline and for private content that can't go to a cloud service. Build it with the Desert Ant SDK. Voz (Swift). Install and API: https://desertant.com/docs/voz/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Build an interview app for journalists where sources never leave the phone.
Build an interview-recording app that transcribes on-device with Desert Ant's Voz, so a source's audio and words stay on the reporter's phone. Add speaker-friendly formatting and export. Build it with the Desert Ant SDK. Voz (Swift). Install and API: https://desertant.com/docs/voz/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Build a full podcast studio: transcribe, clip, and title on the device.
Build a podcast tool that runs Desert Ant's Voz to transcribe an episode, Clips to pick the best moments as shorts, and Title to name and describe each clip, all on-device with no per-minute or per-token bill. Build it with the Desert Ant SDK. Voz (Swift). Install and API: https://desertant.com/docs/voz/. Clips (Swift). Install and API: https://desertant.com/docs/clips/. Title (Swift). Install and API: https://desertant.com/docs/title/. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Record, clean, transcribe, and clip: a whole creator pipeline, offline.
Build a creator pipeline: Desert Ant's Clear cleans the recording, Voz transcribes it, and Clips pulls the shorts, all on the device so a full episode never touches a server. Build it with the Desert Ant SDK. Clear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/clear/. Voz (Swift). Install and API: https://desertant.com/docs/voz/. Clips (Swift). Install and API: https://desertant.com/docs/clips/. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Qué hace el modelo
- Los inicios de palabra caen a menos de 83 ms y los finales a menos de 95 ms de un alineador forzado, de media, con una resolución de trama de 80 ms.
- 10 minutos de audio en 2 s y 30 minutos en 6 s en un iPhone 17 Pro; 290x en tiempo real en un M3 Ultra. Los clips cortos sueltos van a 50-62x, porque cada clip paga una ventana completa de 15 s.
- Tasa de error de palabra del 7,40% de media en seis conjuntos del Open ASR Leaderboard (Whisper large-v3-turbo: 7,00%), 2,83% en media hora de narración (Whisper: 2,72%), 11,84% en las reuniones de AMI (Whisper: 13,87%).
- Todo el grafo se ejecuta en el Neural Engine sin recurrir a la CPU ni a la GPU; la memoria máxima no crece con la duración de la grabación.
- 25 idiomas: búlgaro, croata, checo, danés, neerlandés, inglés, estonio, finés, francés, alemán, griego, húngaro, italiano, letón, lituano, maltés, polaco, portugués, rumano, ruso, eslovaco, esloveno, español, sueco y ucraniano.
- 467 MB en disco, descargado bajo demanda y guardado en caché; la primera carga tras la descarga tarda 20 s una vez mientras Core ML se especializa, y luego 0,2 s. Descárgalo durante la incorporación.
- Audio mono a cualquier frecuencia de muestreo; el SDK remuestrea y mezcla a mono. El audio más largo se divide en ventanas de 15 s en las pausas y se une por las palabras en las que coinciden las ventanas contiguas.
- Construido sobre Parakeet TDT 0.6B v3 de NVIDIA, publicado bajo CC BY 4.0. Los pesos no se modifican; la conversión, la compresión y el runtime para el Neural Engine son nuestros.
Aplicación de ejemplo
Clipper
Creado con Voz, Clips, Title
Generate short clips from a video podcast or a long recording, fully on device. A macOS app and a command-line tool over the same core.
Voz transcribes with a time on every word, Clips ranks the best spans, and Title writes a title and description for each.
macOS 26 or later, Apple Silicon
brew tap desert-ant-labs/tap
brew install --cask clipper
Primeros pasos
Añade reconocimiento de voz a tu app de iOS or macOS con unas pocas líneas de código. Docs de Voz.
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Voz", package: "desert-ant-core")
import Voz
let voz = try await Voz()
let result = try await voz.transcribe(url)
result.text // the transcript
result.words.first?.start // 80ms resolution
result.realtimeFactor // seconds of audio per second of wall clock
Add Voz from Desert Ant Labs to this Swift project (iOS, macOS). What it does: voz a texto en el dispositivo en el Neural Engine. SDK: Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0") // target dependency .product(name: "Voz", package: "desert-ant-core") Reference: - Model page: https://desertant.com/models/voz/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Especificaciones
- Velocidad
- 10 minutos de audio en 2 s en un iPhone 17 Pro, 30 minutos en 6 s (7 s en un iPhone 15 Pro); 30 minutos en 5,6 s en un M3 Ultra, 319x en tiempo real
- Exactitud
- 7,40% de WER en seis conjuntos del Open ASR Leaderboard; 2,83% en formato largo; error medio de 83 ms en los inicios de palabra y 95 ms en los finales
- Tamaño en el dispositivo
- 467 MB de Core ML compilado, descargado bajo demanda
- Idiomas
- 25 idiomas europeos; exactitud del 3,31% (italiano) al 39,46% (griego) en habla leída
- Modelo
- NVIDIA Parakeet TDT 0.6B v3 (CC BY 4.0), convertido a Core ML y comprimido por Desert Ant Labs: frontend log-mel, codificador conformer, decodificador transductor, todo en el Neural Engine
- Plataformas
- iOS, iPadOS, macOS, tvOS, visionOS (Core ML); solo Apple
Voz es solo para Apple: el runtime controla Core ML directamente para mantener el grafo en el Neural Engine, y no hay versión para Android, Linux ni web. Voz no sabe cuál de sus 25 idiomas está oyendo, y un idioma que no cubre produce un sinsentido con seguridad en lugar de un error, así que combínalo con Ear.
La exactitud varía mucho según el idioma, los finales de palabra son la mitad más difícil de las marcas de tiempo, y 467 MB son una descarga real que traer durante la incorporación.
Preguntas frecuentes
¿Qué es Voz?
Transcribe 10 minutos de audio en 2 s en un iPhone, 4,7x más rápido que Whisper, con marcas de tiempo por palabra precisas.
¿Voz se ejecuta en el dispositivo?
Sí. Voz se ejecuta en el dispositivo, sin llamadas a servidor, así que los datos se quedan con el usuario.
¿Qué plataformas admite Voz?
Voz se distribuye como un SDK nativo en el dispositivo para Swift.
¿Cuánto cuesta Voz?
Todos los modelos son gratis hasta 100 000 dispositivos activos mensuales por SDK. Inferencia ilimitada por usuario. Contáctanos para licencias personalizadas.
¿Qué precisión o velocidad tiene Voz?
10 minutos de narración en 2 s y 30 minutos en 6 s en un iPhone 17 Pro, 7 s en un iPhone 15 Pro. En un Mac, 4,7x más rápido que whisper.cpp large-v3-turbo con el mismo audio de podcast, con una tasa de error de palabra del 7,40% en seis conjuntos públicos en inglés donde Whisper obtiene el 7,00%.
¿Voz funciona en Android o Windows?
Todavía no. Hoy Voz se ejecuta en Apple silicon, donde todo el modelo corre en el Neural Engine. Esperamos añadir Android y Windows en los próximos meses. Cuéntanos qué estás creando y te avisaremos cuando salgan.