Modelos de audio en el dispositivo
Modelos pequeños para la voz, en el dispositivo: sonido de estudio, muletillas eliminadas, el idioma identificado, quién dijo qué. Nada se sube a la nube.
Todos los modelos de audio se ejecutan en el chip que ya lleva el teléfono, así que una grabación de cinco minutos se procesa en segundos y el audio nunca sale del dispositivo. Sin facturación por minuto, sin subidas, sin colas.
Modelos disponibles
Mejora de voz en el dispositivo que da a tu grabación el sonido cálido y de micrófono cercano de un estudio de podcast, procesada 100% en el dispositivo.
Detección de muletillas en el dispositivo que marca cada eh, em y mmm con una precisión de 20 ms, una hora de audio en 12 s.
Marcas de tiempo por palabra en el dispositivo, para cualquier transcriptor. Corta, subtitula y resalta sobre la palabra, con la mitad de error, desde 0,7 MB.
Un modelo rápido de selección de clips que convierte una grabación larga en shorts y destacados ordenados, a partir de una transcripción. En iPhone o Mac.
Identificación del idioma hablado en el dispositivo en 99 idiomas, a partir de un fragmento corto de audio, antes de que empiece la transcripción.
Transcribe 10 minutos de audio en 2 s en un iPhone, 4,7x más rápido que Whisper, con marcas de tiempo por palabra precisas.
Disponibles próximamente
Precios
Todos los modelos son gratis hasta 100 000 dispositivos activos mensuales por SDK. Inferencia ilimitada por usuario.