Ear.
Identification de la langue parlée sur l'appareil, parmi 99 langues, à partir de quelques secondes d'audio, avant que la transcription ne commence.
Identifiez la langue à partir de 30 secondes d'audio.
Une note vocale arrive et le transcripteur est réglé sur l'anglais. Au bout de 30 secondes, Ear dit portugais, et le transcripteur qui s'exécute ensuite est le portugais, au lieu d'un transcripteur anglais qui renverrait des absurdités avec assurance.
Ear n'écoute pas tout le fichier. Ear trouve les trois passages de trente secondes qui ressemblent le plus à de la parole, saute le jingle et le silence, et nomme la langue en 250 ms. La réponse arrive avec un indice de confiance et un indicateur qui dit s'il faut s'y fier.
Quand les deux premiers candidats sont trop proches pour être séparés, Ear le dit. Vous demandez à l'utilisateur ou vous repliez sur un modèle général au lieu de transcrire dans la mauvaise langue. Un seul SDK, toutes les plateformes : Swift sur Apple, Kotlin sur Android, JavaScript dans le navigateur et Node. Rien n'est envoyé.
Le bon transcripteur, 98,5 % du temps.
Sur 162 enregistrements, 98,5 % des réponses qu'Ear a marquées fiables ont été routées vers le bon transcripteur ; sur 12 envois ordinaires et 10 reconstruits en podcasts, aucune réponse confiante n'était fausse.
Mesuré de bout en bout à travers le SDK et publié sur la fiche du modèle. La parole mêlée à une musique plus forte est lue correctement environ 60 % du temps.
Choisir le bon transcripteur d'abord
Un transcripteur pointé sur la mauvaise langue renvoie des absurdités avec assurance. Dans un enregistreur de réunions ou une app de notes vocales, exécutez Ear sur les 30 premières secondes et démarrez le transcripteur, les sous-titres et la traduction dans la langue réellement parlée.
Trier une archive d'enregistrements
Passez une bibliothèque de notes vocales, d'appels ou d'épisodes par Ear dans un script Node ou une app Mac pendant la nuit, et chaque fichier a sa langue au matin. Rien n'est envoyé et rien n'est facturé par fichier.
Router un appel ou un message vocal
Dans une app de support ou un produit de messagerie, nommez la langue d'un appel entrant ou d'un message vocal avant qu'il n'atteigne une personne. L'appel arrive chez quelqu'un qui la parle, ou chez le bon modèle de parole.
Sous-titrer dans le navigateur
Un outil vidéo web identifie la langue parlée côté client, avec le même SDK dans le navigateur et dans Node, et choisit la langue des sous-titres pour que la personne qui envoie n'ait jamais à le faire.
Inspiration
Des idées à construire avec Ear. Copiez un prompt dans votre agent de code et lancez-vous.
Detect a caller's language and route the voicemail.
In a voicemail or call app, run Desert Ant's Ear on the first ~30 seconds of audio to identify the spoken language on-device, then route the message. For a very short voicemail, accumulate audio first, and treat a low-reliability answer as unknown and ask. Build it with the Desert Ant SDK. Ear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/ear/. Install: SwiftPM desert-ant-core; Maven ai.desertant:ear:3.1.0; npm i @desert-ant-labs/ear @litertjs/core # browser. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Sort an archive of recordings by spoken language.
Build a batch tool that runs Desert Ant's Ear over a folder of recordings to tag each by spoken language, so a mixed archive sorts itself. On-device. Build it with the Desert Ant SDK. Ear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/ear/. Install: SwiftPM desert-ant-core; Maven ai.desertant:ear:3.1.0; npm i @desert-ant-labs/ear @litertjs/core # browser. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Detect the language of a voice note, then transcribe with the right model.
Before transcribing, run Desert Ant's Ear on the first ~30 seconds to identify the spoken language on-device, then run Voz. Handle low confidence by asking the user instead of guessing. Build it with the Desert Ant SDK. Ear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/ear/. Voz (Swift). Install and API: https://desertant.com/docs/voz/. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Pick the dominant language of a recording to route it.
Use Desert Ant's Ear on-device to identify the dominant spoken language of a recording (from its most speech-like 30-second windows) and route it to the right transcriber or team. Build it with the Desert Ant SDK. Ear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/ear/. Install: SwiftPM desert-ant-core; Maven ai.desertant:ear:3.1.0; npm i @desert-ant-labs/ear @litertjs/core # browser. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Detect the language of a voicemail or dictation before transcribing.
Run Desert Ant's Ear on the first ~30 seconds of a voicemail or dictation on-device to identify the language, then pick the right transcriber. Ear needs about 30 seconds, so accumulate audio before deciding on very short clips. Build it with the Desert Ant SDK. Ear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/ear/. Install: SwiftPM desert-ant-core; Maven ai.desertant:ear:3.1.0; npm i @desert-ant-labs/ear @litertjs/core # browser. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Gate transcription so it only runs on languages you support.
Use Desert Ant's Ear to detect the spoken language on-device and skip or reroute recordings in languages your transcriber does not support. Build it with the Desert Ant SDK. Ear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/ear/. Install: SwiftPM desert-ant-core; Maven ai.desertant:ear:3.1.0; npm i @desert-ant-labs/ear @litertjs/core # browser. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Ce que fait le modèle
- 99 langues, de l'afrikaans au yoruba, dont les grandes langues européennes, asiatiques et africaines.
- Choisit les trois fenêtres de trente secondes qui ressemblent le plus à de la parole plutôt que de lire par position, si bien qu'une intro musicale ou un passage silencieux ne le trompe pas. Choisir par position trouve la langue 4 % du temps sur un enregistrement de cinq minutes dont un dixième est de la parole.
- Renvoie la langue, un indice de confiance, les candidats classés et un indicateur
isReliable. L'indicateur est faux quand les deux premiers sont trop proches pour trancher, et faux pour le norvégien, le suédois et le danois, que le modèle confond entre eux. - Un audio déjà décodé fonctionne à n'importe quelle fréquence d'échantillonnage ; une URL de fichier fonctionne sur Apple.
- Les poids se téléchargent à la première utilisation et sont mis en cache ; la construction ne fait aucun travail et ne lance aucun téléchargement.
Prise en main
Ajoutez détection de langue parlée à votre application iOS or macOS, Android or web en quelques lignes de code. Docs Ear.
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Ear", package: "desert-ant-core")
import Ear
let ear = Ear() // downloads on first use
let detection = try await ear.identify(contentsOf: url)
detection.language // "pt"
detection.isReliable // true
Add Ear from Desert Ant Labs to this Swift project (iOS, macOS). What it does: Ear : identification de la langue parlée sur l'appareil. SDK: Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0") // target dependency .product(name: "Ear", package: "desert-ant-core") Reference: - Model page: https://desertant.com/models/ear/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
// build.gradle.kts (Maven Central)
implementation("ai.desertant:ear:3.1.0")
import ai.desertant.ear.Ear
val ear = Ear(context) // downloads on first use
val detection = ear.identify(samples, 16_000.0)
detection.language // "pt"
detection.isReliable // true
ear.close()
Add Ear from Desert Ant Labs to this Kotlin project (Android).
What it does: Ear : identification de la langue parlée sur l'appareil.
SDK:
Kotlin (Android)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// build.gradle.kts (Maven Central)
implementation("ai.desertant:ear:3.1.0")
Reference:
- Model page: https://desertant.com/models/ear/
- Full catalog and other models: https://desertant.com/llms.txt
Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
npm i @desert-ant-labs/ear @litertjs/core # browser
npm i @desert-ant-labs/ear # Node
import { Ear } from "@desert-ant-labs/ear";
const ear = await Ear.load();
const detection = await ear.identify(samples, 16000);
detection.language // "pt"
detection.isReliable // true
Add Ear from Desert Ant Labs to this JavaScript / TypeScript project (Web, Node.js). What it does: Ear : identification de la langue parlée sur l'appareil. SDK: JavaScript / TypeScript (Web, Node.js) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme npm i @desert-ant-labs/ear @litertjs/core # browser npm i @desert-ant-labs/ear # Node Reference: - Model page: https://desertant.com/models/ear/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Spécifications
- Langues
- 99
- Entrée
- Trois fenêtres de trente secondes de l'enregistrement ; n'importe quelle fréquence d'échantillonnage
- Vitesse
- Environ 250 ms par identification, trois fenêtres
- Plateformes
- iOS, macOS, tvOS, visionOS (Core ML) ; Android, Linux, Windows (LiteRT) ; navigateur (WebAssembly et LiteRT.js) ; Node
Ear nomme la langue ; il ne transcrit pas. La parole sous une musique plus forte est bien lue environ six fois sur dix, et le norvégien, le suédois et le danois sont confondus entre eux : Ear marque donc ces réponses comme non fiables, par conception.
Les enregistrements de moins de 30 secondes n'obtiennent qu'une fenêtre et une réponse moins certaine. Traitez une réponse non fiable comme une question à poser à l'utilisateur, pas comme un réglage de transcripteur.
FAQ
Qu'est-ce que Ear ?
Identification de la langue parlée sur l'appareil, parmi 99 langues, à partir de quelques secondes d'audio, avant que la transcription ne commence.
Ear fonctionne-t-il sur l'appareil ?
Oui. Ear s'exécute sur l'appareil, sans appel serveur : les données restent chez l'utilisateur.
Quelles plateformes Ear prend-il en charge ?
Ear est livré sous forme de SDK natif sur l'appareil pour Swift, Kotlin, JavaScript / TypeScript.
Combien coûte Ear ?
Chaque modèle est gratuit jusqu'à 100k appareils actifs mensuels par SDK. Inférence illimitée par utilisateur. Contactez-nous pour des licences sur mesure.
Quelle est la précision ou la vitesse de Ear ?
Sur 162 enregistrements, 98,5 % des réponses qu'Ear a marquées fiables ont été routées vers le bon transcripteur ; sur 12 envois ordinaires et 10 reconstruits en podcasts, aucune réponse confiante n'était fausse.