Desert Ant Labs

Uhm.

Detectie van vulwoordenBeschikbaar

Detectie van vulwoorden op het apparaat die elke eh, uhm en hmm tot op 20 ms markeert: een uur audio in 12s.

Vind en verwijder elk vulwoord.

Een aflevering van een uur wordt in 12s geanalyseerd op een iPhone 17 Pro. Een backcatalogus is een batchklus die je lokaal draait, geen cloudfactuur.

Uhm doet dat door de transcriptiestap over te slaan. De gebruikelijke manier om een “uhm” te vinden is het hele bestand transcriberen en de tekst doorzoeken. Een transcript zou toch niet helpen: modellen als Whisper laten vulwoorden weg uit hun output, dus de uhm's staan nergens in de tekst om te vinden.

Uhm leest in plaats daarvan de golfvorm en markeert elk vulwoord dat het hoort, zodat een editor ze kan wegknippen of een opschoning met één klik de hele take strakker maakt. Open een audio- of videobestand en elk vulwoord staat op een rij met zijn tijd, dus je klikt er een aan en landt erop.

Apple draait de Core ML-build van 45 MB. De browserdemo en een Python-backend draaien hetzelfde model als 51 MB ONNX, zodat een web-editor en een batchklus zich identiek gedragen.

10 minuten audio in 2s.

296x realtime op een iPhone 17 Pro, 279x op een iPad Pro M4 en 169x op een iPhone 15 Pro, met een voorspelling om de 20 ms.

296x
Realtime-factor
iPhone 17 Pro
20ms
Frameresolutie
45MB
On-device
Core ML fp16; 51 MB ONNX voor browser en server

Realtime-factor (audioduur gedeeld door analysetijd), fp16 Core ML, warm (intern)

ApparaatRealtime-factor
iPhone 17 Pro296x
iPad Pro (M4)279x
iPhone 15 Pro169x

Interne benchmarks. Getraind op Engels; de overdracht naar Spaans, Frans, Duits en Nederlands is akoestisch en is niet apart gemeten.

Een backcatalogus in één nacht opschonen.

Alle vulwoorden op de tijdlijn wegknippen

Markeer elke “eh” en “uhm”, zodat een editor, of een opschoning met één klik, een opname strakker maakt zonder eerst een transcriptie te draaien.

Een tijdlijn met vulwoorden in de browser

In een web-editor staat elk vulwoord in een audio- of videobestand op een rij met een klik-naar-tijd, client-side berekend, zonder upload en zonder wachtrij van workers erachter.

De eh's eruit filteren voordat ze de tekst halen

Signaleer haperingen in de audio en laat ze weg uit de woorden die in je transcript belanden, zodat de uiteindelijke tekst leest zoals de spreker het bedoelde.

Spreekoefening en coaching

Tel hoe vaak een spreker in een opgenomen praatje naar een vulwoord grijpt en laat het patroon zien, in een oefenapp die zijn stem nooit uploadt.

Inspiratie

Ideeën om te bouwen met Uhm. Kopieer een prompt naar je coding-agent en ga.

Uhm

Add a 'remove ums' button to a podcast or video editor.

Uhm

Build a speaking coach that counts and marks your filler words.

Uhm

Show a filler-word timeline for any recording.

ClearVozUhm

A clean, filler-free transcript from a raw, noisy recording.

Uhm

Trim every filler from a talking-head take automatically.

Wat het model doet

  • Frame-precies: nauwkeurig tot op 20 ms.
  • Akoestische detectie: werkt rechtstreeks op de golfvorm, geen transcript nodig.
  • Bias-preset: precision, balanced of recall.
  • Getraind op Engels, werkt zonder hertraining ook op Spaans, Frans, Duits en Nederlands.

Aan de slag

Voeg detectie van vulwoorden toe aan je iOS or macOS-app in een paar regels code. Uhm docs.

iOS, macOS
Installeren
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core", from: "3.1.0")
// target dependency
.product(name: "Uhm", package: "desert-ant-core")
Voorbeeld - Swift
import Uhm

let result = try await Uhm().analyze(audioURL: url)
for f in result.fillers { print(f.start, f.end, f.type ?? .other) }
Bouwen met een prompt
Add Uhm from Desert Ant Labs to this Swift project (iOS, macOS).

What it does: on-device detectie van vulwoorden voor audio en video.

SDK:

Swift (iOS, macOS)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core", from: "3.1.0")
// target dependency
.product(name: "Uhm", package: "desert-ant-core")

Reference:
- Model page: https://desertant.com/models/uhm/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
AndroidBinnenkort
Web, Node.jsBinnenkort

Specs

Resolutie
Frameresolutie van 20 ms
Model
Akoestisch, zonder transcript
Grootte op het apparaat
45 MB Core ML (Apple); 51 MB ONNX (browser, server)
Talen
Engels; draagt over naar Spaans, Frans, Duits en Nederlands
Snelheid
296x realtime op een iPhone 17 Pro

Uhm is getraind op Engels, en de vier talen waarnaar het overdraagt zijn niet per taal tegen een gouden standaard gemeten. Uhm werkt het best op podcasts, vergaderingen en talking-head-audio.

Veel achtergrondmuziek, gelach of meerdere mensen die door elkaar praten kosten nauwkeurigheid. Vertrouw meer op het antwoord “vulwoord of niet” dan op het label: of een vulwoord een “eh”, een “uhm” of een “hmm” was, is de minst betrouwbare helft van het resultaat.

FAQ

Wat is Uhm?

Detectie van vulwoorden op het apparaat die elke eh, uhm en hmm tot op 20 ms markeert: een uur audio in 12s.

Draait Uhm op het apparaat?

Ja. Uhm draait op het apparaat, zonder serveraanroep, dus de data blijft bij de gebruiker.

Welke platforms ondersteunt Uhm?

Uhm wordt geleverd als een native on-device SDK voor Swift.

Hoeveel kost Uhm?

Elk model is gratis voor maximaal 100k maandelijks actieve apparaten per SDK. Onbeperkte inference per gebruiker. Neem contact op voor aangepaste licenties.

Hoe nauwkeurig of snel is Uhm?

296x realtime op een iPhone 17 Pro, 279x op een iPad Pro M4 en 169x op een iPhone 15 Pro, met een voorspelling om de 20 ms.

Bronnen