Uhm.
Deteção de bordões no dispositivo que marca cada «um», «uh» e «hmm» com precisão de 20 ms: uma hora de áudio em 12 s.
Encontre e remova cada bordão.
Um episódio de uma hora é analisado em 12 s num iPhone 17 Pro. Um catálogo antigo é um processamento em lote que corre localmente, não uma fatura de nuvem.
O Uhm chega lá ao saltar a etapa de transcrição. A forma habitual de encontrar um «um» é transcrever o ficheiro inteiro e procurar no texto. E a transcrição nem ajudaria: modelos como o Whisper deixam os bordões de fora da saída, pelo que nunca aparecem no texto para serem encontrados.
Em vez disso, o Uhm lê a forma de onda e marca cada bordão que ouve, para que um editor possa cortá-los ou uma limpeza de um clique enxugue a tomada inteira. Abra um ficheiro de áudio ou vídeo e cada bordão é listado com o seu tempo, pelo que basta clicar num e ir diretamente até ele.
Em dispositivos Apple corre a build Core ML de 45 MB. A demo no navegador e um backend em Python correm o mesmo modelo como 51 MB de ONNX, então um editor web e um processamento em lote comportam-se de forma idêntica.
10 minutos de áudio em 2 s.
296x tempo real num iPhone 17 Pro, 279x num iPad Pro M4 e 169x num iPhone 15 Pro, com previsões a cada 20 ms.

Fator de tempo real (duração do áudio sobre o tempo de análise), Core ML fp16, a quente (interno)
| Dispositivo | Fator de tempo real |
|---|---|
| iPhone 17 Pro | 296x |
| iPad Pro (M4) | 279x |
| iPhone 15 Pro | 169x |
Benchmarks internos. Treinado em inglês; a transferência para espanhol, francês, alemão e neerlandês é acústica e não foi medida em separado.
Limpe o catálogo antigo numa noite.
Corte todos os bordões na linha de tempo
Marque cada ocorrência de «um» e «uh» para que um editor, ou uma limpeza de um clique, aperte a gravação sem correr antes uma passagem de transcrição.
Uma linha de tempo de bordões no navegador
Num editor web, cada bordão de um ficheiro de áudio ou vídeo é listado com um tempo clicável, calculado no cliente, sem carregamento e sem uma fila de workers por trás.
Não deixe os bordões chegarem ao texto
Sinalize as disfluências no áudio e mantenha-as fora das palavras que chegam à sua transcrição, para que o texto final se leia como o orador queria ter dito a frase.
Treino de oratória e coaching
Conte quantas vezes um orador recorre a um bordão ao longo de uma palestra gravada e mostre-lhe o padrão, numa app de treino que nunca envia a voz dele para fora.
Inspiração
Ideias para construir com o Uhm. Copie um prompt para o seu agente de código e comece.
Add a 'remove ums' button to a podcast or video editor.
Add a one-tap action that runs Desert Ant's Uhm on-device to find every filler word (um, uh, hmm) to within 20ms and cut them from the timeline, with an undo. Build it with the Desert Ant SDK. Uhm (Swift). Install and API: https://desertant.com/docs/uhm/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Build a speaking coach that counts and marks your filler words.
Build a speaking-practice app that records the user and uses Desert Ant's Uhm to mark and count filler words, showing progress over sessions. Runs on the phone, private. Build it with the Desert Ant SDK. Uhm (Swift). Install and API: https://desertant.com/docs/uhm/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Show a filler-word timeline for any recording.
Add a filler timeline to an audio editor: run Desert Ant's Uhm on-device and mark every um and uh on the waveform so an editor can jump between and trim them. Build it with the Desert Ant SDK. Uhm (Swift). Install and API: https://desertant.com/docs/uhm/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
A clean, filler-free transcript from a raw, noisy recording.
Build a transcript pipeline: Desert Ant's Clear cleans the audio, Voz transcribes it, and Uhm removes the fillers, so a messy recording becomes a clean transcript, on-device. Build it with the Desert Ant SDK. Clear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/clear/. Voz (Swift). Install and API: https://desertant.com/docs/voz/. Uhm (Swift). Install and API: https://desertant.com/docs/uhm/. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Trim every filler from a talking-head take automatically.
Build an auto-trim that runs Desert Ant's Uhm on-device to find and cut fillers from a talking-head video before export. Build it with the Desert Ant SDK. Uhm (Swift). Install and API: https://desertant.com/docs/uhm/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
O que o modelo faz
- Alta resolução temporal: preciso a 20 ms.
- Deteção acústica: funciona diretamente na forma de onda, sem necessidade de transcrição.
- Predefinição
Bias: precisão, equilibrado ou recall. - Treinado em inglês, transfere-se para espanhol, francês, alemão e neerlandês sem novo treino.
Primeiros passos
Adicione deteção de bordões ao seu app iOS or macOS em poucas linhas de código. Docs do Uhm.
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core", from: "3.1.0")
// target dependency
.product(name: "Uhm", package: "desert-ant-core")
import Uhm
let result = try await Uhm().analyze(audioURL: url)
for f in result.fillers { print(f.start, f.end, f.type ?? .other) }
Add Uhm from Desert Ant Labs to this Swift project (iOS, macOS). What it does: deteção de bordões no dispositivo para áudio e vídeo. SDK: Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core", from: "3.1.0") // target dependency .product(name: "Uhm", package: "desert-ant-core") Reference: - Model page: https://desertant.com/models/uhm/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Especificações
- Resolução
- Resolução de 20 ms
- Modelo
- Acústica, sem transcrição
- Tamanho no dispositivo
- 45 MB Core ML (Apple); 51 MB ONNX (navegador, servidor)
- Línguas
- Inglês; transfere-se para espanhol, francês, alemão e neerlandês
- Velocidade
- 296x tempo real num iPhone 17 Pro
O Uhm foi treinado em inglês, e as quatro línguas para as quais transfere não foram medidas contra uma referência por língua. O Uhm funciona melhor em áudio de podcast, de reunião e de pessoa a falar para a câmara.
Música de fundo alta, risos ou várias pessoas a falar por cima umas das outras reduzem a exatidão. Confie mais na resposta «é bordão ou não» do que no rótulo: se um bordão foi um «uh», um «um» ou um «hmm» é a metade menos fiável do resultado.
FAQ
O que é o Uhm?
Deteção de bordões no dispositivo que marca cada «um», «uh» e «hmm» com precisão de 20 ms: uma hora de áudio em 12 s.
O Uhm é executado no dispositivo?
Sim. O Uhm é executado no dispositivo, sem qualquer chamada a servidores, por isso os dados ficam com o utilizador.
Que plataformas suporta o Uhm?
O Uhm é distribuído como um SDK nativo no dispositivo para Swift.
Quanto custa o Uhm?
Cada modelo é gratuito para até 100 mil dispositivos ativos mensais por SDK. Inferência ilimitada por utilizador. Contacte-nos para licenças personalizadas.
Qual é a precisão ou a rapidez do Uhm?
296x tempo real num iPhone 17 Pro, 279x num iPad Pro M4 e 169x num iPhone 15 Pro, com previsões a cada 20 ms.