Desert Ant Labs

Uhm.

Füllwort-ErkennungVerfügbar

On-Device-Füllworterkennung, die jedes äh, ähm und hmm auf 20 ms genau markiert, eine Stunde Audio in 12 s.

Jedes Füllwort finden und entfernen.

Eine einstündige Episode wird in 12 s auf einem iPhone 17 Pro analysiert. Ein Archiv ist ein Batch-Job, den Sie lokal ausführen, keine Cloud-Rechnung.

Uhm schafft das, indem es den Transkript-Schritt überspringt. Der übliche Weg, ein „ähm“ zu finden, ist, die ganze Datei zu transkribieren und den Text zu durchsuchen. Ein Transkript würde ohnehin nicht helfen: Modelle wie Whisper lassen Füllwörter in ihrer Ausgabe weg, sodass die ähms nie im Text auftauchen, den man durchsucht.

Uhm liest stattdessen die Wellenform und markiert jedes gehörte Füllwort, sodass ein Cutter sie herausschneiden oder eine Ein-Klick-Aufbereitung die ganze Aufnahme straffen kann. Öffnen Sie eine Audio- oder Videodatei, und jedes Füllwort wird mit seiner Zeit aufgelistet, sodass Sie eines anklicken und dort landen.

Apple führt den 45 MB großen Core-ML-Build aus. Die Browser-Demo und ein Python-Backend führen dasselbe Modell als 51 MB ONNX aus, sodass sich ein Web-Editor und ein Batch-Job identisch verhalten.

10 Minuten Audio in 2 s.

296-fache Echtzeit auf einem iPhone 17 Pro, 279-fache auf einem iPad Pro M4 und 169-fache auf einem iPhone 15 Pro, mit einer Vorhersage alle 20 ms.

296x
Echtzeitfaktor
iPhone 17 Pro
20 ms
Frame-Auflösung
45 MB
Auf dem Gerät
Core ML fp16; 51 MB ONNX für Browser und Server

Echtzeitfaktor (Audiodauer geteilt durch Analysezeit), fp16 Core ML, warm (intern)

GerätEchtzeitfaktor
iPhone 17 Pro296x
iPad Pro (M4)279x
iPhone 15 Pro169x

Interne Benchmarks. Auf Englisch trainiert; die Übertragung auf Spanisch, Französisch, Deutsch und Niederländisch ist akustisch und wurde nicht separat gemessen.

Ein Archiv über Nacht säubern.

Alle Füllwörter auf der Timeline wegschneiden

Markieren Sie jedes „äh“ und „ähm“, sodass ein Cutter oder eine Ein-Klick-Bereinigung eine Aufnahme straffen kann, ohne vorher einen Transkriptionsdurchlauf zu starten.

Eine Füllwort-Timeline im Browser

In einem Web-Editor wird jedes Füllwort in einer Audio- oder Videodatei mit einer anklickbaren Sprungzeit aufgelistet, clientseitig berechnet, ohne Upload und ohne Worker-Queue dahinter.

Jedes Äh abfangen, bevor es im Text landet

Kennzeichnen Sie Disfluenzen im Audio und halten Sie sie aus den Wörtern heraus, die in Ihr Transkript gelangen, damit sich der fertige Text so liest, wie der Sprecher es sagen wollte.

Sprechtraining und Coaching

Zählen Sie, wie oft ein Sprecher in einem aufgezeichneten Vortrag zu einem Füllwort greift, und zeigen Sie ihm das Muster, in einer Übungs-App, die seine Stimme nie hochlädt.

Inspiration

Ideen zum Bauen mit Uhm. Kopieren Sie einen Prompt in Ihren Coding-Agenten und los.

Uhm

Add a 'remove ums' button to a podcast or video editor.

Uhm

Build a speaking coach that counts and marks your filler words.

Uhm

Show a filler-word timeline for any recording.

ClearVozUhm

A clean, filler-free transcript from a raw, noisy recording.

Uhm

Trim every filler from a talking-head take automatically.

Was das Modell macht

  • Frame-genau: präzise auf 20 ms.
  • Akustische Erkennung: arbeitet direkt auf der Wellenform, kein Transkript nötig.
  • Bias-Voreinstellung: Precision, Balanced oder Recall.
  • Auf Englisch trainiert, überträgt sich auf Spanisch, Französisch, Deutsch und Niederländisch ohne erneutes Training.

Erste Schritte

Fügen Sie füllwort-erkennung mit wenigen Zeilen Code zu Ihrer iOS or macOS-App hinzu. Uhm Docs.

iOS, macOS
Installation
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core", from: "3.1.0")
// target dependency
.product(name: "Uhm", package: "desert-ant-core")
Beispiel - Swift
import Uhm

let result = try await Uhm().analyze(audioURL: url)
for f in result.fillers { print(f.start, f.end, f.type ?? .other) }
Mit einem Prompt bauen
Add Uhm from Desert Ant Labs to this Swift project (iOS, macOS).

What it does: Erkennung von Füllwörtern auf dem Gerät für Audio und Video.

SDK:

Swift (iOS, macOS)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core", from: "3.1.0")
// target dependency
.product(name: "Uhm", package: "desert-ant-core")

Reference:
- Model page: https://desertant.com/models/uhm/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
AndroidDemnächst
Web, Node.jsDemnächst

Technische Daten

Auflösung
Frame-Auflösung von 20 ms
Modell
Akustisch, ohne Transkript
Größe auf dem Gerät
45 MB Core ML (Apple); 51 MB ONNX (Browser, Server)
Sprachen
Englisch; überträgt sich auf Spanisch, Französisch, Deutsch und Niederländisch
Geschwindigkeit
296-fache Echtzeit auf einem iPhone 17 Pro

Uhm wurde auf Englisch trainiert, und die vier Sprachen, auf die es überträgt, wurden nicht gegen sprachspezifische Ground Truth gemessen. Uhm funktioniert am besten bei Podcast-, Meeting- und Talking-Head-Audio.

Viel Hintergrundmusik, Lachen oder mehrere Personen, die durcheinanderreden, kosten Genauigkeit. Vertrauen Sie der Ja-oder-nein-Antwort zum Füllwort mehr als dem Label: ob ein Füllwort ein „äh“, ein „ähm“ oder ein „hmm“ war, ist die weniger verlässliche Hälfte des Ergebnisses.

FAQ

Was ist Uhm?

On-Device-Füllworterkennung, die jedes äh, ähm und hmm auf 20 ms genau markiert, eine Stunde Audio in 12 s.

Läuft Uhm auf dem Gerät?

Ja. Uhm läuft auf dem Gerät, ohne Serveraufruf, sodass die Daten beim Nutzer bleiben.

Welche Plattformen unterstützt Uhm?

Uhm wird als natives On-Device-SDK für Swift ausgeliefert.

Was kostet Uhm?

Jedes Modell ist kostenlos für bis zu 100k monatlich aktive Geräte pro SDK. Unbegrenzte Inferenz pro Nutzer. Kontaktieren Sie uns für individuelle Lizenzen.

Wie genau oder schnell ist Uhm?

296-fache Echtzeit auf einem iPhone 17 Pro, 279-fache auf einem iPad Pro M4 und 169-fache auf einem iPhone 15 Pro, mit einer Vorhersage alle 20 ms.

Ressourcen