Desert Ant Labs

Uhm.

Deteção de bordõesDisponível

Deteção de bordões no dispositivo que marca cada «um», «uh» e «hmm» com precisão de 20 ms: uma hora de áudio em 12 s.

Encontre e remova cada bordão.

Um episódio de uma hora é analisado em 12 s num iPhone 17 Pro. Um catálogo antigo é um processamento em lote que corre localmente, não uma fatura de nuvem.

O Uhm chega lá ao saltar a etapa de transcrição. A forma habitual de encontrar um «um» é transcrever o ficheiro inteiro e procurar no texto. E a transcrição nem ajudaria: modelos como o Whisper deixam os bordões de fora da saída, pelo que nunca aparecem no texto para serem encontrados.

Em vez disso, o Uhm lê a forma de onda e marca cada bordão que ouve, para que um editor possa cortá-los ou uma limpeza de um clique enxugue a tomada inteira. Abra um ficheiro de áudio ou vídeo e cada bordão é listado com o seu tempo, pelo que basta clicar num e ir diretamente até ele.

Em dispositivos Apple corre a build Core ML de 45 MB. A demo no navegador e um backend em Python correm o mesmo modelo como 51 MB de ONNX, então um editor web e um processamento em lote comportam-se de forma idêntica.

10 minutos de áudio em 2 s.

296x tempo real num iPhone 17 Pro, 279x num iPad Pro M4 e 169x num iPhone 15 Pro, com previsões a cada 20 ms.

296x
Fator de tempo real
iPhone 17 Pro
20 ms
Resolução temporal
45 MB
No dispositivo
Core ML fp16; 51 MB em ONNX para navegador e servidor

Fator de tempo real (duração do áudio sobre o tempo de análise), Core ML fp16, a quente (interno)

DispositivoFator de tempo real
iPhone 17 Pro296x
iPad Pro (M4)279x
iPhone 15 Pro169x

Benchmarks internos. Treinado em inglês; a transferência para espanhol, francês, alemão e neerlandês é acústica e não foi medida em separado.

Limpe o catálogo antigo numa noite.

Corte todos os bordões na linha de tempo

Marque cada ocorrência de «um» e «uh» para que um editor, ou uma limpeza de um clique, aperte a gravação sem correr antes uma passagem de transcrição.

Uma linha de tempo de bordões no navegador

Num editor web, cada bordão de um ficheiro de áudio ou vídeo é listado com um tempo clicável, calculado no cliente, sem carregamento e sem uma fila de workers por trás.

Não deixe os bordões chegarem ao texto

Sinalize as disfluências no áudio e mantenha-as fora das palavras que chegam à sua transcrição, para que o texto final se leia como o orador queria ter dito a frase.

Treino de oratória e coaching

Conte quantas vezes um orador recorre a um bordão ao longo de uma palestra gravada e mostre-lhe o padrão, numa app de treino que nunca envia a voz dele para fora.

Inspiração

Ideias para construir com o Uhm. Copie um prompt para o seu agente de código e comece.

Uhm

Add a 'remove ums' button to a podcast or video editor.

Uhm

Build a speaking coach that counts and marks your filler words.

Uhm

Show a filler-word timeline for any recording.

ClearVozUhm

A clean, filler-free transcript from a raw, noisy recording.

Uhm

Trim every filler from a talking-head take automatically.

O que o modelo faz

  • Alta resolução temporal: preciso a 20 ms.
  • Deteção acústica: funciona diretamente na forma de onda, sem necessidade de transcrição.
  • Predefinição Bias: precisão, equilibrado ou recall.
  • Treinado em inglês, transfere-se para espanhol, francês, alemão e neerlandês sem novo treino.

Primeiros passos

Adicione deteção de bordões ao seu app iOS or macOS em poucas linhas de código. Docs do Uhm.

iOS, macOS
Instalação
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core", from: "3.1.0")
// target dependency
.product(name: "Uhm", package: "desert-ant-core")
Exemplo - Swift
import Uhm

let result = try await Uhm().analyze(audioURL: url)
for f in result.fillers { print(f.start, f.end, f.type ?? .other) }
Crie com um prompt
Add Uhm from Desert Ant Labs to this Swift project (iOS, macOS).

What it does: deteção de bordões no dispositivo para áudio e vídeo.

SDK:

Swift (iOS, macOS)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core", from: "3.1.0")
// target dependency
.product(name: "Uhm", package: "desert-ant-core")

Reference:
- Model page: https://desertant.com/models/uhm/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
AndroidEm breve
Web, Node.jsEm breve

Especificações

Resolução
Resolução de 20 ms
Modelo
Acústica, sem transcrição
Tamanho no dispositivo
45 MB Core ML (Apple); 51 MB ONNX (navegador, servidor)
Línguas
Inglês; transfere-se para espanhol, francês, alemão e neerlandês
Velocidade
296x tempo real num iPhone 17 Pro

O Uhm foi treinado em inglês, e as quatro línguas para as quais transfere não foram medidas contra uma referência por língua. O Uhm funciona melhor em áudio de podcast, de reunião e de pessoa a falar para a câmara.

Música de fundo alta, risos ou várias pessoas a falar por cima umas das outras reduzem a exatidão. Confie mais na resposta «é bordão ou não» do que no rótulo: se um bordão foi um «uh», um «um» ou um «hmm» é a metade menos fiável do resultado.

FAQ

O que é o Uhm?

Deteção de bordões no dispositivo que marca cada «um», «uh» e «hmm» com precisão de 20 ms: uma hora de áudio em 12 s.

O Uhm é executado no dispositivo?

Sim. O Uhm é executado no dispositivo, sem qualquer chamada a servidores, por isso os dados ficam com o utilizador.

Que plataformas suporta o Uhm?

O Uhm é distribuído como um SDK nativo no dispositivo para Swift.

Quanto custa o Uhm?

Cada modelo é gratuito para até 100 mil dispositivos ativos mensais por SDK. Inferência ilimitada por utilizador. Contacte-nos para licenças personalizadas.

Qual é a precisão ou a rapidez do Uhm?

296x tempo real num iPhone 17 Pro, 279x num iPad Pro M4 e 169x num iPhone 15 Pro, com previsões a cada 20 ms.

Recursos