Uhm.
Detección de muletillas en el dispositivo que marca cada eh, em y mmm con una precisión de 20 ms, una hora de audio en 12 s.
Encuentra y elimina todas las muletillas.
Un episodio de una hora se analiza en 12 s en un iPhone 17 Pro. Un catálogo antiguo es un trabajo por lotes que ejecutas en local, no una factura de la nube.
Uhm lo consigue saltándose el paso de la transcripción. La forma habitual de encontrar un «em» es transcribir todo el archivo y buscar en el texto. Una transcripción tampoco ayudaría: modelos como Whisper dejan las muletillas fuera de su salida, así que los «em» nunca aparecen en el texto para encontrarlos.
En su lugar, Uhm lee la forma de onda y marca cada muletilla que oye, así que un editor puede cortarlas o una limpieza con un clic puede ajustar toda la toma. Abre un archivo de audio o vídeo y cada muletilla aparece con su tiempo, así que haces clic en una y saltas justo a ella.
Apple ejecuta la versión Core ML de 45 MB. La demo del navegador y un backend en Python ejecutan el mismo modelo como 51 MB de ONNX, así que un editor web y un trabajo por lotes se comportan igual.
10 minutos de audio en 2 s.
296x en tiempo real en un iPhone 17 Pro, 279x en un iPad Pro M4 y 169x en un iPhone 15 Pro, con una predicción cada 20 ms.

Factor de tiempo real (duración del audio dividida entre el tiempo de análisis), Core ML fp16, en caliente (interno)
| Dispositivo | Factor de tiempo real |
|---|---|
| iPhone 17 Pro | 296x |
| iPad Pro (M4) | 279x |
| iPhone 15 Pro | 169x |
Benchmarks internos. Entrenado en inglés; la transferencia al español, francés, alemán y neerlandés es acústica y no se ha medido por separado.
Limpia un catálogo antiguo de la noche a la mañana.
Corta todas las muletillas de la línea de tiempo
Marca cada «eh» y cada «em» para que un editor, o una limpieza en un clic, pueda acortar la grabación sin ejecutar antes una pasada de transcripción.
Una línea de tiempo de muletillas en el navegador
En un editor web, cada muletilla de un archivo de audio o vídeo aparece con un tiempo en el que puedes hacer clic para saltar, calculado en el cliente, sin subidas ni una cola de workers por detrás.
Quita los «eh» antes de que lleguen al texto
Marca las disfluencias en el audio y déjalas fuera de las palabras que llegan a tu transcripción, para que el texto final se lea como el hablante quería decir la frase.
Práctica de oratoria y coaching
Mide con qué frecuencia recurre alguien a una muletilla a lo largo de una charla grabada y enséñale el patrón, en una app de práctica que nunca sube su voz.
Inspiración
Ideas para crear con Uhm. Copia un prompt en tu agente de código y adelante.
Add a 'remove ums' button to a podcast or video editor.
Add a one-tap action that runs Desert Ant's Uhm on-device to find every filler word (um, uh, hmm) to within 20ms and cut them from the timeline, with an undo. Build it with the Desert Ant SDK. Uhm (Swift). Install and API: https://desertant.com/docs/uhm/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Build a speaking coach that counts and marks your filler words.
Build a speaking-practice app that records the user and uses Desert Ant's Uhm to mark and count filler words, showing progress over sessions. Runs on the phone, private. Build it with the Desert Ant SDK. Uhm (Swift). Install and API: https://desertant.com/docs/uhm/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Show a filler-word timeline for any recording.
Add a filler timeline to an audio editor: run Desert Ant's Uhm on-device and mark every um and uh on the waveform so an editor can jump between and trim them. Build it with the Desert Ant SDK. Uhm (Swift). Install and API: https://desertant.com/docs/uhm/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
A clean, filler-free transcript from a raw, noisy recording.
Build a transcript pipeline: Desert Ant's Clear cleans the audio, Voz transcribes it, and Uhm removes the fillers, so a messy recording becomes a clean transcript, on-device. Build it with the Desert Ant SDK. Clear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/clear/. Voz (Swift). Install and API: https://desertant.com/docs/voz/. Uhm (Swift). Install and API: https://desertant.com/docs/uhm/. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Trim every filler from a talking-head take automatically.
Build an auto-trim that runs Desert Ant's Uhm on-device to find and cut fillers from a talking-head video before export. Build it with the Desert Ant SDK. Uhm (Swift). Install and API: https://desertant.com/docs/uhm/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Qué hace el modelo
- Precisión de trama: exactitud de 20 ms.
- Detección acústica: funciona directamente sobre la forma de onda, sin necesidad de transcripción.
- Preajuste
Bias: precisión, equilibrado o recall. - Entrenado en inglés, se transfiere al español, francés, alemán y neerlandés sin reentrenamiento.
Primeros pasos
Añade detección de muletillas a tu app de iOS or macOS con unas pocas líneas de código. Docs de Uhm.
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core", from: "3.1.0")
// target dependency
.product(name: "Uhm", package: "desert-ant-core")
import Uhm
let result = try await Uhm().analyze(audioURL: url)
for f in result.fillers { print(f.start, f.end, f.type ?? .other) }
Add Uhm from Desert Ant Labs to this Swift project (iOS, macOS). What it does: detección de muletillas en el dispositivo para audio y vídeo. SDK: Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core", from: "3.1.0") // target dependency .product(name: "Uhm", package: "desert-ant-core") Reference: - Model page: https://desertant.com/models/uhm/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Especificaciones
- Resolución
- Resolución de 20 ms
- Modelo
- Acústico, sin transcripción
- Tamaño en el dispositivo
- 45 MB Core ML (Apple); 51 MB ONNX (navegador, servidor)
- Idiomas
- Inglés; se transfiere al español, francés, alemán y neerlandés
- Velocidad
- 296× tiempo real en un iPhone 17 Pro
Uhm se entrenó con inglés, y los cuatro idiomas a los que transfiere no se han medido con datos de referencia por idioma. Uhm funciona mejor con audio de podcasts, reuniones y bustos parlantes.
La música de fondo intensa, las risas o varias personas hablando a la vez le restan precisión. Fíate más de la respuesta de si hay muletilla o no que de la etiqueta: si una muletilla fue un «eh», un «em» o un «mmm» es la parte menos fiable del resultado.
Preguntas frecuentes
¿Qué es Uhm?
Detección de muletillas en el dispositivo que marca cada eh, em y mmm con una precisión de 20 ms, una hora de audio en 12 s.
¿Uhm se ejecuta en el dispositivo?
Sí. Uhm se ejecuta en el dispositivo, sin llamadas a servidor, así que los datos se quedan con el usuario.
¿Qué plataformas admite Uhm?
Uhm se distribuye como un SDK nativo en el dispositivo para Swift.
¿Cuánto cuesta Uhm?
Todos los modelos son gratis hasta 100 000 dispositivos activos mensuales por SDK. Inferencia ilimitada por usuario. Contáctanos para licencias personalizadas.
¿Qué precisión o velocidad tiene Uhm?
296x en tiempo real en un iPhone 17 Pro, 279x en un iPad Pro M4 y 169x en un iPhone 15 Pro, con una predicción cada 20 ms.