Desert Ant Labs

Voz.

Reconocimiento de vozDisponible

Transcribe 10 minutos de audio en 2 s en un iPhone, 4,7x más rápido que Whisper, con marcas de tiempo por palabra precisas.

Transcribe 10 minutos de audio en 2 s en un iPhone.

Transcribe un archivo de audio o vídeo con Voz y obtén tiempos de inicio y fin precisos para cada palabra. 10 minutos tardan 2 s en un iPhone, en el dispositivo, así que no se sube nada y no se cobra por minuto.

En Apple silicon, el modelo se ejecuta en el Neural Engine, así que transcribir es ultrarrápido y consume menos energía. En un Mac, un catálogo antiguo de podcasts, entrevistas y clases se procesa de una sola pasada, y no se sube nada.

Las marcas de tiempo son lo bastante precisas para editar sobre ellas. Los inicios de palabra caen a menos de 83 ms de un alineador forzado y los finales a menos de 95 ms, para una edición precisa basada en la transcripción. Voz es una versión de Parakeet TDT 0.6B v3 de NVIDIA optimizada para el Apple Neural Engine, con una exactitud comparable a la de Whisper large-v3-turbo en la mayoría del audio, y un tamaño de descarga de solo 467 MB.

4,7x más rápido que Whisper.

10 minutos de narración en 2 s y 30 minutos en 6 s en un iPhone 17 Pro, 7 s en un iPhone 15 Pro. En un Mac, 4,7x más rápido que whisper.cpp large-v3-turbo con el mismo audio de podcast, con una tasa de error de palabra del 7,40% en seis conjuntos públicos en inglés donde Whisper obtiene el 7,00%.

0.0s
0:00 / 30:00

Audio: Ant Ventures, una grabación de LibriVox, dominio público.

6 s
Media hora de audio
iPhone 17 Pro, en el Neural Engine
4,7x
Más rápido que Whisper
large-v3-turbo con whisper.cpp, M3 Ultra
7,40%
Tasa de error de palabra
seis conjuntos del Open ASR Leaderboard; Whisper large-v3-turbo 7,00%
467 MB
En disco
Whisper large-v3-turbo: 1,6 GB en fp16

Tasa de error de palabra en los conjuntos del Open ASR Leaderboard, Voz con su propio normalizador de texto, las cifras de Whisper tomadas del leaderboard

Conjunto de datosVozWhisper large-v3-turbo
LibriSpeech test-clean2,19%2,13%
LibriSpeech test-other3,86%3,70%
GigaSpeech9,70%8,47%
SPGISpeech3,86%2,79%
Earnings-2212,97%11,07%
AMI11,84%13,87%
Average7,40%7,00%

Lee la fila que coincide con tu audio. El habla limpia y con micrófono cercano ronda el 2-4% (LibriSpeech, SPGISpeech), los podcasts y el vídeo web en torno al 10% (GigaSpeech), y las salas de reuniones y las llamadas telefónicas el 12-13% (AMI, Earnings-22), que es donde el modelo supera a Whisper. Las cifras por idioma sobre 10 minutos de habla leída cada una están en la ficha del modelo, del 3,31% del italiano al 39,46% del griego. Los tiempos en iPhone y la comparación con whisper.cpp son ejecuciones propias y aún no están en la ficha.

Transcribe cualquier archivo de audio o vídeo

Graba un podcast o un vídeo y la transcripción completa está lista antes de que termine la exportación. Texto en el que puedes buscar con una marca de tiempo en cada palabra, en cualquiera de los 25 idiomas, sin salir del dispositivo.

Despacha el trabajo acumulado

Una biblioteca de entrevistas, clases o grabaciones de reuniones se vuelve consultable de una sola pasada en un Mac. Cien horas se procesan en 20 minutos, y no se sube nada.

Corta en una palabra

Cada palabra lleva un inicio y un fin, así que un rango seleccionado en la transcripción es un corte en un editor de vídeo. Combínalo con Clips para los shorts y con Title para nombrarlos.

Inspiración

Ideas para crear con Voz. Copia un prompt en tu agente de código y adelante.

Voz

Build a podcast player that transcribes every episode and makes it searchable, on the device.

Voz

Build a meeting recorder that hands you a timestamped transcript before you leave the room.

Voz

Turn voice memos into searchable, editable text notes, offline.

Voz

Generate SRT subtitles for any video file on the Mac.

Voz

Add captions to a video player that run on the device.

Voz

Build an interview app for journalists where sources never leave the phone.

VozClipsTitle

Build a full podcast studio: transcribe, clip, and title on the device.

ClearVozClips

Record, clean, transcribe, and clip: a whole creator pipeline, offline.

Ver las 26 ideas

Qué hace el modelo

  • Los inicios de palabra caen a menos de 83 ms y los finales a menos de 95 ms de un alineador forzado, de media, con una resolución de trama de 80 ms.
  • 10 minutos de audio en 2 s y 30 minutos en 6 s en un iPhone 17 Pro; 290x en tiempo real en un M3 Ultra. Los clips cortos sueltos van a 50-62x, porque cada clip paga una ventana completa de 15 s.
  • Tasa de error de palabra del 7,40% de media en seis conjuntos del Open ASR Leaderboard (Whisper large-v3-turbo: 7,00%), 2,83% en media hora de narración (Whisper: 2,72%), 11,84% en las reuniones de AMI (Whisper: 13,87%).
  • Todo el grafo se ejecuta en el Neural Engine sin recurrir a la CPU ni a la GPU; la memoria máxima no crece con la duración de la grabación.
  • 25 idiomas: búlgaro, croata, checo, danés, neerlandés, inglés, estonio, finés, francés, alemán, griego, húngaro, italiano, letón, lituano, maltés, polaco, portugués, rumano, ruso, eslovaco, esloveno, español, sueco y ucraniano.
  • 467 MB en disco, descargado bajo demanda y guardado en caché; la primera carga tras la descarga tarda 20 s una vez mientras Core ML se especializa, y luego 0,2 s. Descárgalo durante la incorporación.
  • Audio mono a cualquier frecuencia de muestreo; el SDK remuestrea y mezcla a mono. El audio más largo se divide en ventanas de 15 s en las pausas y se une por las palabras en las que coinciden las ventanas contiguas.
  • Construido sobre Parakeet TDT 0.6B v3 de NVIDIA, publicado bajo CC BY 4.0. Los pesos no se modifican; la conversión, la compresión y el runtime para el Neural Engine son nuestros.

Aplicación de ejemplo

Clipper

Creado con Voz, Clips, Title

Generate short clips from a video podcast or a long recording, fully on device. A macOS app and a command-line tool over the same core.

Voz transcribes with a time on every word, Clips ranks the best spans, and Title writes a title and description for each.

macOS 26 or later, Apple Silicon

Instalar con Homebrew
brew tap desert-ant-labs/tap
brew install --cask clipper

Primeros pasos

Añade reconocimiento de voz a tu app de iOS or macOS con unas pocas líneas de código. Docs de Voz.

iOS, macOS
Instalación
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Voz", package: "desert-ant-core")
Ejemplo - Swift
import Voz

let voz = try await Voz()
let result = try await voz.transcribe(url)
result.text                     // the transcript
result.words.first?.start       // 80ms resolution
result.realtimeFactor           // seconds of audio per second of wall clock
Crea con un prompt
Add Voz from Desert Ant Labs to this Swift project (iOS, macOS).

What it does: voz a texto en el dispositivo en el Neural Engine.

SDK:

Swift (iOS, macOS)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Voz", package: "desert-ant-core")

Reference:
- Model page: https://desertant.com/models/voz/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
AndroidPróximamente
Web, Node.jsPróximamente

Especificaciones

Velocidad
10 minutos de audio en 2 s en un iPhone 17 Pro, 30 minutos en 6 s (7 s en un iPhone 15 Pro); 30 minutos en 5,6 s en un M3 Ultra, 319x en tiempo real
Exactitud
7,40% de WER en seis conjuntos del Open ASR Leaderboard; 2,83% en formato largo; error medio de 83 ms en los inicios de palabra y 95 ms en los finales
Tamaño en el dispositivo
467 MB de Core ML compilado, descargado bajo demanda
Idiomas
25 idiomas europeos; exactitud del 3,31% (italiano) al 39,46% (griego) en habla leída
Modelo
NVIDIA Parakeet TDT 0.6B v3 (CC BY 4.0), convertido a Core ML y comprimido por Desert Ant Labs: frontend log-mel, codificador conformer, decodificador transductor, todo en el Neural Engine
Plataformas
iOS, iPadOS, macOS, tvOS, visionOS (Core ML); solo Apple

Voz es solo para Apple: el runtime controla Core ML directamente para mantener el grafo en el Neural Engine, y no hay versión para Android, Linux ni web. Voz no sabe cuál de sus 25 idiomas está oyendo, y un idioma que no cubre produce un sinsentido con seguridad en lugar de un error, así que combínalo con Ear.

La exactitud varía mucho según el idioma, los finales de palabra son la mitad más difícil de las marcas de tiempo, y 467 MB son una descarga real que traer durante la incorporación.

Preguntas frecuentes

¿Qué es Voz?

Transcribe 10 minutos de audio en 2 s en un iPhone, 4,7x más rápido que Whisper, con marcas de tiempo por palabra precisas.

¿Voz se ejecuta en el dispositivo?

Sí. Voz se ejecuta en el dispositivo, sin llamadas a servidor, así que los datos se quedan con el usuario.

¿Qué plataformas admite Voz?

Voz se distribuye como un SDK nativo en el dispositivo para Swift.

¿Cuánto cuesta Voz?

Todos los modelos son gratis hasta 100 000 dispositivos activos mensuales por SDK. Inferencia ilimitada por usuario. Contáctanos para licencias personalizadas.

¿Qué precisión o velocidad tiene Voz?

10 minutos de narración en 2 s y 30 minutos en 6 s en un iPhone 17 Pro, 7 s en un iPhone 15 Pro. En un Mac, 4,7x más rápido que whisper.cpp large-v3-turbo con el mismo audio de podcast, con una tasa de error de palabra del 7,40% en seis conjuntos públicos en inglés donde Whisper obtiene el 7,00%.

¿Voz funciona en Android o Windows?

Todavía no. Hoy Voz se ejecuta en Apple silicon, donde todo el modelo corre en el Neural Engine. Esperamos añadir Android y Windows en los próximos meses. Cuéntanos qué estás creando y te avisaremos cuando salgan.

Recursos