Uhm.
Détection des mots de remplissage sur l'appareil qui marque chaque euh, hum et hmm à 20 ms près, une heure d'audio en 12 s.
Trouvez et retirez chaque mot de remplissage.
Un épisode d'une heure est analysé en 12 s sur un iPhone 17 Pro. Un catalogue existant devient une tâche par lots que vous exécutez en local, pas une facture cloud.
Uhm y parvient en sautant l'étape de transcription. La façon habituelle de trouver un « euh » est de transcrire tout le fichier et de chercher dans le texte. Une transcription n'aiderait de toute façon pas : des modèles comme Whisper laissent les mots de remplissage hors de leur sortie, si bien que les « euh » n'apparaissent jamais dans le texte à chercher.
Uhm lit plutôt la forme d'onde et marque chaque mot de remplissage qu'il entend, pour qu'un monteur puisse les couper ou qu'un nettoyage en un clic resserre toute la prise. Ouvrez un fichier audio ou vidéo et chaque mot de remplissage est listé avec son temps : cliquez sur l'un et vous y êtes.
Apple exécute la version Core ML de 45 MB. La démo dans le navigateur et un backend Python exécutent le même modèle sous forme de 51 MB d'ONNX, si bien qu'un éditeur web et une tâche par lots se comportent à l'identique.
10 minutes d'audio en 2 s.
296x le temps réel sur un iPhone 17 Pro, 279x sur un iPad Pro M4 et 169x sur un iPhone 15 Pro, avec une prédiction toutes les 20 ms.

Facteur temps réel (durée audio sur temps d'analyse), Core ML fp16, à chaud (interne)
| Appareil | Facteur temps réel |
|---|---|
| iPhone 17 Pro | 296x |
| iPad Pro (M4) | 279x |
| iPhone 15 Pro | 169x |
Benchmarks internes. Entraîné sur l'anglais ; le transfert à l'espagnol, au français, à l'allemand et au néerlandais est acoustique et n'a pas été mesuré séparément.
Nettoyer un catalogue existant pendant la nuit.
Couper chaque hésitation sur la timeline
Marquez chaque « euh » et chaque « hum » pour qu'un monteur, ou un nettoyage en un clic, resserre un enregistrement sans lancer d'abord une passe de transcription.
Une timeline des hésitations dans le navigateur
Dans un éditeur web, chaque mot de remplissage d'un fichier audio ou vidéo est listé avec un temps cliquable pour s'y rendre, calculé côté client, sans envoi et sans file de workers derrière.
Écarter les euh avant qu'ils n'atteignent le texte
Signalez les hésitations dans l'audio et retirez-les des mots qui arrivent dans votre transcription : le texte final se lit comme l'orateur voulait le dire.
Entraînement à la prise de parole et coaching
Comptez combien de fois un orateur recourt à une hésitation au fil d'une intervention enregistrée et montrez-lui la tendance, dans une application d'entraînement qui n'envoie jamais sa voix ailleurs.
Inspiration
Des idées à construire avec Uhm. Copiez un prompt dans votre agent de code et lancez-vous.
Add a 'remove ums' button to a podcast or video editor.
Add a one-tap action that runs Desert Ant's Uhm on-device to find every filler word (um, uh, hmm) to within 20ms and cut them from the timeline, with an undo. Build it with the Desert Ant SDK. Uhm (Swift). Install and API: https://desertant.com/docs/uhm/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Build a speaking coach that counts and marks your filler words.
Build a speaking-practice app that records the user and uses Desert Ant's Uhm to mark and count filler words, showing progress over sessions. Runs on the phone, private. Build it with the Desert Ant SDK. Uhm (Swift). Install and API: https://desertant.com/docs/uhm/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Show a filler-word timeline for any recording.
Add a filler timeline to an audio editor: run Desert Ant's Uhm on-device and mark every um and uh on the waveform so an editor can jump between and trim them. Build it with the Desert Ant SDK. Uhm (Swift). Install and API: https://desertant.com/docs/uhm/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
A clean, filler-free transcript from a raw, noisy recording.
Build a transcript pipeline: Desert Ant's Clear cleans the audio, Voz transcribes it, and Uhm removes the fillers, so a messy recording becomes a clean transcript, on-device. Build it with the Desert Ant SDK. Clear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/clear/. Voz (Swift). Install and API: https://desertant.com/docs/voz/. Uhm (Swift). Install and API: https://desertant.com/docs/uhm/. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Trim every filler from a talking-head take automatically.
Build an auto-trim that runs Desert Ant's Uhm on-device to find and cut fillers from a talking-head video before export. Build it with the Desert Ant SDK. Uhm (Swift). Install and API: https://desertant.com/docs/uhm/. Install: SwiftPM desert-ant-core. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Ce que fait le modèle
- Précis à la trame : à 20 ms près.
- Détection acoustique : fonctionne directement sur la forme d'onde, sans transcription requise.
- Préréglage
Bias: précision, équilibré ou rappel. - Entraîné sur l'anglais, se transfère à l'espagnol, au français, à l'allemand et au néerlandais sans réentraînement.
Prise en main
Ajoutez détection des mots de remplissage à votre application iOS or macOS en quelques lignes de code. Docs Uhm.
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core", from: "3.1.0")
// target dependency
.product(name: "Uhm", package: "desert-ant-core")
import Uhm
let result = try await Uhm().analyze(audioURL: url)
for f in result.fillers { print(f.start, f.end, f.type ?? .other) }
Add Uhm from Desert Ant Labs to this Swift project (iOS, macOS). What it does: Uhm : détection des mots de remplissage sur l'appareil pour l'audio et la vidéo. SDK: Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core", from: "3.1.0") // target dependency .product(name: "Uhm", package: "desert-ant-core") Reference: - Model page: https://desertant.com/models/uhm/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Spécifications
- Résolution
- Résolution de 20 ms
- Modèle
- Acoustique, sans transcription
- Taille sur l'appareil
- 45 MB Core ML (Apple) ; 51 MB ONNX (navigateur, serveur)
- Langues
- Anglais ; se transfère à l'espagnol, au français, à l'allemand et au néerlandais
- Vitesse
- 296x le temps réel sur un iPhone 17 Pro
Uhm a été entraîné sur l'anglais, et les quatre langues vers lesquelles il transfère n'ont pas été mesurées contre une vérité terrain par langue. Uhm fonctionne au mieux sur l'audio de podcast, de réunion et de vidéo face caméra.
Une forte musique de fond, des rires ou plusieurs personnes qui se coupent la parole font baisser la précision. Fiez-vous à la réponse remplissage-ou-non plus qu'au label : savoir si un mot était un « euh », un « hum » ou un « hmm » est la moitié la moins fiable du résultat.
FAQ
Qu'est-ce que Uhm ?
Détection des mots de remplissage sur l'appareil qui marque chaque euh, hum et hmm à 20 ms près, une heure d'audio en 12 s.
Uhm fonctionne-t-il sur l'appareil ?
Oui. Uhm s'exécute sur l'appareil, sans appel serveur : les données restent chez l'utilisateur.
Quelles plateformes Uhm prend-il en charge ?
Uhm est livré sous forme de SDK natif sur l'appareil pour Swift.
Combien coûte Uhm ?
Chaque modèle est gratuit jusqu'à 100k appareils actifs mensuels par SDK. Inférence illimitée par utilisateur. Contactez-nous pour des licences sur mesure.
Quelle est la précision ou la vitesse de Uhm ?
296x le temps réel sur un iPhone 17 Pro, 279x sur un iPad Pro M4 et 169x sur un iPhone 15 Pro, avec une prédiction toutes les 20 ms.