Uhm.
Utfyllnadsdetektering på enheten som märker varje um, uh och hmm på 20 ms när, en timme ljud på 12 s.
Hitta och ta bort varje utfyllnadsord.
Ett timslångt avsnitt analyseras på 12 s på en iPhone 17 Pro. En backkatalog är ett batchjobb du kör lokalt, inte en molnfaktura.
Uhm når dit genom att hoppa över transkriptionssteget. Det vanliga sättet att hitta ett ”um” är att transkribera hela filen och söka i texten. Ett transkript skulle ändå inte hjälpa: modeller som Whisper utelämnar utfyllnadsord ur sin utdata, så de um som ska hittas dyker aldrig upp i texten.
Uhm läser i stället vågformen och markerar varje utfyllnadsord den hör, så att en redigerare kan klippa bort dem eller en enknappsrensning kan strama upp hela tagningen. Öppna en ljud- eller videofil och varje utfyllnadsord listas med sin tid, så att du klickar på ett och hamnar på det.
Apple kör Core ML-bygget på 45 MB. Webbdemon och en Python-backend kör samma modell som 51 MB ONNX, så att en webbredigerare och ett batchjobb beter sig likadant.
10 minuter ljud på 2 s.
296x realtid på en iPhone 17 Pro, 279x på en iPad Pro M4 och 169x på en iPhone 15 Pro, med en prediktion var 20:e ms.

Realtidsfaktor (ljudlängd genom analystid), fp16 Core ML, varm (internt)
| Enhet | Realtidsfaktor |
|---|---|
| iPhone 17 Pro | 296x |
| iPad Pro (M4) | 279x |
| iPhone 15 Pro | 169x |
Interna benchmarks. Tränad på engelska; överföringen till spanska, franska, tyska och nederländska är akustisk och har inte mätts separat.
Rensa en backkatalog över natten.
Klipp bort varje utfyllnadsord på tidslinjen
Markera varje ”um” och ”uh”, så att en redigerare, eller en rensning med ett klick, kan strama åt en inspelning utan att först köra en transkribering.
En tidslinje med utfyllnadsord i webbläsaren
I en webbredigerare listas varje utfyllnadsord i en ljud- eller videofil med en klickbar tidsangivelse, beräknad på klientsidan, utan uppladdning och utan någon jobbkö bakom.
Fånga ”um” och ”uh” innan de hamnar i texten
Flagga disfluenser i ljudet och plocka bort dem ur orden som når din transkription, så att den färdiga texten läses som talaren menade den.
Talträning och coachning
Räkna hur ofta en talare griper efter ett utfyllnadsord genom ett inspelat föredrag och visa mönstret, i en träningsapp som aldrig laddar upp rösten.
Inspiration
Idéer att bygga med Uhm. Kopiera en prompt till din kodningsagent och kör.
Add a 'remove ums' button to a podcast or video editor.
Add a one-tap action that runs Desert Ant's Uhm on-device to find every filler word (um, uh, hmm) to within 20ms and cut them from the timeline, with an undo. Build it with the Desert Ant SDK. Uhm (Swift). Install and API: https://desertant.com/docs/uhm/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Build a speaking coach that counts and marks your filler words.
Build a speaking-practice app that records the user and uses Desert Ant's Uhm to mark and count filler words, showing progress over sessions. Runs on the phone, private. Build it with the Desert Ant SDK. Uhm (Swift). Install and API: https://desertant.com/docs/uhm/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Show a filler-word timeline for any recording.
Add a filler timeline to an audio editor: run Desert Ant's Uhm on-device and mark every um and uh on the waveform so an editor can jump between and trim them. Build it with the Desert Ant SDK. Uhm (Swift). Install and API: https://desertant.com/docs/uhm/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
A clean, filler-free transcript from a raw, noisy recording.
Build a transcript pipeline: Desert Ant's Clear cleans the audio, Voz transcribes it, and Uhm removes the fillers, so a messy recording becomes a clean transcript, on-device. Build it with the Desert Ant SDK. Clear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/clear/. Voz (Swift). Install and API: https://desertant.com/docs/voz/. Uhm (Swift). Install and API: https://desertant.com/docs/uhm/. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Trim every filler from a talking-head take automatically.
Build an auto-trim that runs Desert Ant's Uhm on-device to find and cut fillers from a talking-head video before export. Build it with the Desert Ant SDK. Uhm (Swift). Install and API: https://desertant.com/docs/uhm/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Vad modellen gör
- Rambaserad precision: noggrann till 20 ms.
- Akustisk detektion: fungerar direkt på vågformen, ingen transkription krävs.
- Förinställningen
Bias: precision, balanserad eller recall. - Tränad på engelska, överförs till spanska, franska, tyska och nederländska utan omträning.
Kom igång
Lägg till detektion av utfyllnadsord i din iOS or macOS-app med några rader kod. Uhm-dokumentation.
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core", from: "3.1.0")
// target dependency
.product(name: "Uhm", package: "desert-ant-core")
import Uhm
let result = try await Uhm().analyze(audioURL: url)
for f in result.fillers { print(f.start, f.end, f.type ?? .other) }
Add Uhm from Desert Ant Labs to this Swift project (iOS, macOS). What it does: Detektion av utfyllnadsord på enheten för ljud och video. SDK: Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core", from: "3.1.0") // target dependency .product(name: "Uhm", package: "desert-ant-core") Reference: - Model page: https://desertant.com/models/uhm/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Specifikationer
- Upplösning
- 20 ms ramupplösning
- Modell
- Akustisk, utan transkription
- Storlek på enheten
- 45 MB Core ML (Apple) och 51 MB ONNX (webbläsare, server)
- Språk
- Engelska; överförs till spanska, franska, tyska och nederländska
- Hastighet
- 296x realtid på en iPhone 17 Pro
Uhm tränades på engelska, och de fyra språk den överför till har inte mätts mot facit per språk. Uhm fungerar bäst på podd-, mötes- och talking-head-ljud.
Kraftig bakgrundsmusik, skratt eller flera personer som pratar i mun på varandra kostar noggrannhet. Lita mer på svaret om det är ett utfyllnadsord eller inte än på etiketten: om ett utfyllnadsord var ett ”uh”, ett ”um” eller ett ”hmm” är den mindre tillförlitliga halvan av resultatet.
Vanliga frågor
Vad är Uhm?
Utfyllnadsdetektering på enheten som märker varje um, uh och hmm på 20 ms när, en timme ljud på 12 s.
Körs Uhm lokalt på enheten?
Ja. Uhm körs på enheten, utan något serveranrop, så att data stannar hos användaren.
Vilka plattformar stöder Uhm?
Uhm levereras som en nativ SDK på enheten för Swift.
Vad kostar Uhm?
Varje modell är gratis upp till 100k månadsaktiva enheter per SDK. Obegränsad inferens per användare. Kontakta oss för anpassade licenser.
Hur träffsäker eller snabb är Uhm?
296x realtid på en iPhone 17 Pro, 279x på en iPad Pro M4 och 169x på en iPhone 15 Pro, med en prediktion var 20:e ms.