Desert Ant Labs

Uhm.

Detección de muletillasDisponible

Detección de muletillas en el dispositivo que marca cada eh, em y mmm con una precisión de 20 ms, una hora de audio en 12 s.

Encuentra y elimina todas las muletillas.

Un episodio de una hora se analiza en 12 s en un iPhone 17 Pro. Un catálogo antiguo es un trabajo por lotes que ejecutas en local, no una factura de la nube.

Uhm lo consigue saltándose el paso de la transcripción. La forma habitual de encontrar un «em» es transcribir todo el archivo y buscar en el texto. Una transcripción tampoco ayudaría: modelos como Whisper dejan las muletillas fuera de su salida, así que los «em» nunca aparecen en el texto para encontrarlos.

En su lugar, Uhm lee la forma de onda y marca cada muletilla que oye, así que un editor puede cortarlas o una limpieza con un clic puede ajustar toda la toma. Abre un archivo de audio o vídeo y cada muletilla aparece con su tiempo, así que haces clic en una y saltas justo a ella.

Apple ejecuta la versión Core ML de 45 MB. La demo del navegador y un backend en Python ejecutan el mismo modelo como 51 MB de ONNX, así que un editor web y un trabajo por lotes se comportan igual.

10 minutos de audio en 2 s.

296x en tiempo real en un iPhone 17 Pro, 279x en un iPad Pro M4 y 169x en un iPhone 15 Pro, con una predicción cada 20 ms.

296x
Factor de tiempo real
iPhone 17 Pro
20 ms
Resolución de trama
45 MB
En el dispositivo
Core ML fp16; 51 MB de ONNX para navegador y servidor

Factor de tiempo real (duración del audio dividida entre el tiempo de análisis), Core ML fp16, en caliente (interno)

DispositivoFactor de tiempo real
iPhone 17 Pro296x
iPad Pro (M4)279x
iPhone 15 Pro169x

Benchmarks internos. Entrenado en inglés; la transferencia al español, francés, alemán y neerlandés es acústica y no se ha medido por separado.

Limpia un catálogo antiguo de la noche a la mañana.

Corta todas las muletillas de la línea de tiempo

Marca cada «eh» y cada «em» para que un editor, o una limpieza en un clic, pueda acortar la grabación sin ejecutar antes una pasada de transcripción.

Una línea de tiempo de muletillas en el navegador

En un editor web, cada muletilla de un archivo de audio o vídeo aparece con un tiempo en el que puedes hacer clic para saltar, calculado en el cliente, sin subidas ni una cola de workers por detrás.

Quita los «eh» antes de que lleguen al texto

Marca las disfluencias en el audio y déjalas fuera de las palabras que llegan a tu transcripción, para que el texto final se lea como el hablante quería decir la frase.

Práctica de oratoria y coaching

Mide con qué frecuencia recurre alguien a una muletilla a lo largo de una charla grabada y enséñale el patrón, en una app de práctica que nunca sube su voz.

Inspiración

Ideas para crear con Uhm. Copia un prompt en tu agente de código y adelante.

Uhm

Add a 'remove ums' button to a podcast or video editor.

Uhm

Build a speaking coach that counts and marks your filler words.

Uhm

Show a filler-word timeline for any recording.

ClearVozUhm

A clean, filler-free transcript from a raw, noisy recording.

Uhm

Trim every filler from a talking-head take automatically.

Qué hace el modelo

  • Precisión de trama: exactitud de 20 ms.
  • Detección acústica: funciona directamente sobre la forma de onda, sin necesidad de transcripción.
  • Preajuste Bias: precisión, equilibrado o recall.
  • Entrenado en inglés, se transfiere al español, francés, alemán y neerlandés sin reentrenamiento.

Primeros pasos

Añade detección de muletillas a tu app de iOS or macOS con unas pocas líneas de código. Docs de Uhm.

iOS, macOS
Instalación
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core", from: "3.1.0")
// target dependency
.product(name: "Uhm", package: "desert-ant-core")
Ejemplo - Swift
import Uhm

let result = try await Uhm().analyze(audioURL: url)
for f in result.fillers { print(f.start, f.end, f.type ?? .other) }
Crea con un prompt
Add Uhm from Desert Ant Labs to this Swift project (iOS, macOS).

What it does: detección de muletillas en el dispositivo para audio y vídeo.

SDK:

Swift (iOS, macOS)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core", from: "3.1.0")
// target dependency
.product(name: "Uhm", package: "desert-ant-core")

Reference:
- Model page: https://desertant.com/models/uhm/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
AndroidPróximamente
Web, Node.jsPróximamente

Especificaciones

Resolución
Resolución de 20 ms
Modelo
Acústico, sin transcripción
Tamaño en el dispositivo
45 MB Core ML (Apple); 51 MB ONNX (navegador, servidor)
Idiomas
Inglés; se transfiere al español, francés, alemán y neerlandés
Velocidad
296× tiempo real en un iPhone 17 Pro

Uhm se entrenó con inglés, y los cuatro idiomas a los que transfiere no se han medido con datos de referencia por idioma. Uhm funciona mejor con audio de podcasts, reuniones y bustos parlantes.

La música de fondo intensa, las risas o varias personas hablando a la vez le restan precisión. Fíate más de la respuesta de si hay muletilla o no que de la etiqueta: si una muletilla fue un «eh», un «em» o un «mmm» es la parte menos fiable del resultado.

Preguntas frecuentes

¿Qué es Uhm?

Detección de muletillas en el dispositivo que marca cada eh, em y mmm con una precisión de 20 ms, una hora de audio en 12 s.

¿Uhm se ejecuta en el dispositivo?

Sí. Uhm se ejecuta en el dispositivo, sin llamadas a servidor, así que los datos se quedan con el usuario.

¿Qué plataformas admite Uhm?

Uhm se distribuye como un SDK nativo en el dispositivo para Swift.

¿Cuánto cuesta Uhm?

Todos los modelos son gratis hasta 100 000 dispositivos activos mensuales por SDK. Inferencia ilimitada por usuario. Contáctanos para licencias personalizadas.

¿Qué precisión o velocidad tiene Uhm?

296x en tiempo real en un iPhone 17 Pro, 279x en un iPad Pro M4 y 169x en un iPhone 15 Pro, con una predicción cada 20 ms.

Recursos