Uhm.
On-Device-Füllworterkennung, die jedes äh, ähm und hmm auf 20 ms genau markiert, eine Stunde Audio in 12 s.
Jedes Füllwort finden und entfernen.
Eine einstündige Episode wird in 12 s auf einem iPhone 17 Pro analysiert. Ein Archiv ist ein Batch-Job, den Sie lokal ausführen, keine Cloud-Rechnung.
Uhm schafft das, indem es den Transkript-Schritt überspringt. Der übliche Weg, ein „ähm“ zu finden, ist, die ganze Datei zu transkribieren und den Text zu durchsuchen. Ein Transkript würde ohnehin nicht helfen: Modelle wie Whisper lassen Füllwörter in ihrer Ausgabe weg, sodass die ähms nie im Text auftauchen, den man durchsucht.
Uhm liest stattdessen die Wellenform und markiert jedes gehörte Füllwort, sodass ein Cutter sie herausschneiden oder eine Ein-Klick-Aufbereitung die ganze Aufnahme straffen kann. Öffnen Sie eine Audio- oder Videodatei, und jedes Füllwort wird mit seiner Zeit aufgelistet, sodass Sie eines anklicken und dort landen.
Apple führt den 45 MB großen Core-ML-Build aus. Die Browser-Demo und ein Python-Backend führen dasselbe Modell als 51 MB ONNX aus, sodass sich ein Web-Editor und ein Batch-Job identisch verhalten.
10 Minuten Audio in 2 s.
296-fache Echtzeit auf einem iPhone 17 Pro, 279-fache auf einem iPad Pro M4 und 169-fache auf einem iPhone 15 Pro, mit einer Vorhersage alle 20 ms.

Echtzeitfaktor (Audiodauer geteilt durch Analysezeit), fp16 Core ML, warm (intern)
| Gerät | Echtzeitfaktor |
|---|---|
| iPhone 17 Pro | 296x |
| iPad Pro (M4) | 279x |
| iPhone 15 Pro | 169x |
Interne Benchmarks. Auf Englisch trainiert; die Übertragung auf Spanisch, Französisch, Deutsch und Niederländisch ist akustisch und wurde nicht separat gemessen.
Ein Archiv über Nacht säubern.
Alle Füllwörter auf der Timeline wegschneiden
Markieren Sie jedes „äh“ und „ähm“, sodass ein Cutter oder eine Ein-Klick-Bereinigung eine Aufnahme straffen kann, ohne vorher einen Transkriptionsdurchlauf zu starten.
Eine Füllwort-Timeline im Browser
In einem Web-Editor wird jedes Füllwort in einer Audio- oder Videodatei mit einer anklickbaren Sprungzeit aufgelistet, clientseitig berechnet, ohne Upload und ohne Worker-Queue dahinter.
Jedes Äh abfangen, bevor es im Text landet
Kennzeichnen Sie Disfluenzen im Audio und halten Sie sie aus den Wörtern heraus, die in Ihr Transkript gelangen, damit sich der fertige Text so liest, wie der Sprecher es sagen wollte.
Sprechtraining und Coaching
Zählen Sie, wie oft ein Sprecher in einem aufgezeichneten Vortrag zu einem Füllwort greift, und zeigen Sie ihm das Muster, in einer Übungs-App, die seine Stimme nie hochlädt.
Inspiration
Ideen zum Bauen mit Uhm. Kopieren Sie einen Prompt in Ihren Coding-Agenten und los.
Add a 'remove ums' button to a podcast or video editor.
Add a one-tap action that runs Desert Ant's Uhm on-device to find every filler word (um, uh, hmm) to within 20ms and cut them from the timeline, with an undo. Build it with the Desert Ant SDK. Uhm (Swift). Install and API: https://desertant.com/docs/uhm/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Build a speaking coach that counts and marks your filler words.
Build a speaking-practice app that records the user and uses Desert Ant's Uhm to mark and count filler words, showing progress over sessions. Runs on the phone, private. Build it with the Desert Ant SDK. Uhm (Swift). Install and API: https://desertant.com/docs/uhm/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Show a filler-word timeline for any recording.
Add a filler timeline to an audio editor: run Desert Ant's Uhm on-device and mark every um and uh on the waveform so an editor can jump between and trim them. Build it with the Desert Ant SDK. Uhm (Swift). Install and API: https://desertant.com/docs/uhm/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
A clean, filler-free transcript from a raw, noisy recording.
Build a transcript pipeline: Desert Ant's Clear cleans the audio, Voz transcribes it, and Uhm removes the fillers, so a messy recording becomes a clean transcript, on-device. Build it with the Desert Ant SDK. Clear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/clear/. Voz (Swift). Install and API: https://desertant.com/docs/voz/. Uhm (Swift). Install and API: https://desertant.com/docs/uhm/. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Trim every filler from a talking-head take automatically.
Build an auto-trim that runs Desert Ant's Uhm on-device to find and cut fillers from a talking-head video before export. Build it with the Desert Ant SDK. Uhm (Swift). Install and API: https://desertant.com/docs/uhm/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Was das Modell macht
- Frame-genau: präzise auf 20 ms.
- Akustische Erkennung: arbeitet direkt auf der Wellenform, kein Transkript nötig.
Bias-Voreinstellung: Precision, Balanced oder Recall.- Auf Englisch trainiert, überträgt sich auf Spanisch, Französisch, Deutsch und Niederländisch ohne erneutes Training.
Erste Schritte
Fügen Sie füllwort-erkennung mit wenigen Zeilen Code zu Ihrer iOS or macOS-App hinzu. Uhm Docs.
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core", from: "3.1.0")
// target dependency
.product(name: "Uhm", package: "desert-ant-core")
import Uhm
let result = try await Uhm().analyze(audioURL: url)
for f in result.fillers { print(f.start, f.end, f.type ?? .other) }
Add Uhm from Desert Ant Labs to this Swift project (iOS, macOS). What it does: Erkennung von Füllwörtern auf dem Gerät für Audio und Video. SDK: Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core", from: "3.1.0") // target dependency .product(name: "Uhm", package: "desert-ant-core") Reference: - Model page: https://desertant.com/models/uhm/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Technische Daten
- Auflösung
- Frame-Auflösung von 20 ms
- Modell
- Akustisch, ohne Transkript
- Größe auf dem Gerät
- 45 MB Core ML (Apple); 51 MB ONNX (Browser, Server)
- Sprachen
- Englisch; überträgt sich auf Spanisch, Französisch, Deutsch und Niederländisch
- Geschwindigkeit
- 296-fache Echtzeit auf einem iPhone 17 Pro
Uhm wurde auf Englisch trainiert, und die vier Sprachen, auf die es überträgt, wurden nicht gegen sprachspezifische Ground Truth gemessen. Uhm funktioniert am besten bei Podcast-, Meeting- und Talking-Head-Audio.
Viel Hintergrundmusik, Lachen oder mehrere Personen, die durcheinanderreden, kosten Genauigkeit. Vertrauen Sie der Ja-oder-nein-Antwort zum Füllwort mehr als dem Label: ob ein Füllwort ein „äh“, ein „ähm“ oder ein „hmm“ war, ist die weniger verlässliche Hälfte des Ergebnisses.
FAQ
Was ist Uhm?
On-Device-Füllworterkennung, die jedes äh, ähm und hmm auf 20 ms genau markiert, eine Stunde Audio in 12 s.
Läuft Uhm auf dem Gerät?
Ja. Uhm läuft auf dem Gerät, ohne Serveraufruf, sodass die Daten beim Nutzer bleiben.
Welche Plattformen unterstützt Uhm?
Uhm wird als natives On-Device-SDK für Swift ausgeliefert.
Was kostet Uhm?
Jedes Modell ist kostenlos für bis zu 100k monatlich aktive Geräte pro SDK. Unbegrenzte Inferenz pro Nutzer. Kontaktieren Sie uns für individuelle Lizenzen.
Wie genau oder schnell ist Uhm?
296-fache Echtzeit auf einem iPhone 17 Pro, 279-fache auf einem iPad Pro M4 und 169-fache auf einem iPhone 15 Pro, mit einer Vorhersage alle 20 ms.