Desert Ant Labs

Ear.

Détection de langue parléeDisponible

Identification de la langue parlée sur l'appareil, parmi 99 langues, à partir de quelques secondes d'audio, avant que la transcription ne commence.

Identifiez la langue à partir de 30 secondes d'audio.

Une note vocale arrive et le transcripteur est réglé sur l'anglais. Au bout de 30 secondes, Ear dit portugais, et le transcripteur qui s'exécute ensuite est le portugais, au lieu d'un transcripteur anglais qui renverrait des absurdités avec assurance.

Ear n'écoute pas tout le fichier. Ear trouve les trois passages de trente secondes qui ressemblent le plus à de la parole, saute le jingle et le silence, et nomme la langue en 250 ms. La réponse arrive avec un indice de confiance et un indicateur qui dit s'il faut s'y fier.

Quand les deux premiers candidats sont trop proches pour être séparés, Ear le dit. Vous demandez à l'utilisateur ou vous repliez sur un modèle général au lieu de transcrire dans la mauvaise langue. Un seul SDK, toutes les plateformes : Swift sur Apple, Kotlin sur Android, JavaScript dans le navigateur et Node. Rien n'est envoyé.

Le bon transcripteur, 98,5 % du temps.

Sur 162 enregistrements, 98,5 % des réponses qu'Ear a marquées fiables ont été routées vers le bon transcripteur ; sur 12 envois ordinaires et 10 reconstruits en podcasts, aucune réponse confiante n'était fausse.

98,5 %
Routées correctement
réponses au-dessus du seuil de fiabilité, 162 enregistrements
99
Langues
250 ms
Par identification
trois fenêtres de trente secondes

Mesuré de bout en bout à travers le SDK et publié sur la fiche du modèle. La parole mêlée à une musique plus forte est lue correctement environ 60 % du temps.

Choisir le bon transcripteur d'abord

Un transcripteur pointé sur la mauvaise langue renvoie des absurdités avec assurance. Dans un enregistreur de réunions ou une app de notes vocales, exécutez Ear sur les 30 premières secondes et démarrez le transcripteur, les sous-titres et la traduction dans la langue réellement parlée.

Trier une archive d'enregistrements

Passez une bibliothèque de notes vocales, d'appels ou d'épisodes par Ear dans un script Node ou une app Mac pendant la nuit, et chaque fichier a sa langue au matin. Rien n'est envoyé et rien n'est facturé par fichier.

Router un appel ou un message vocal

Dans une app de support ou un produit de messagerie, nommez la langue d'un appel entrant ou d'un message vocal avant qu'il n'atteigne une personne. L'appel arrive chez quelqu'un qui la parle, ou chez le bon modèle de parole.

Sous-titrer dans le navigateur

Un outil vidéo web identifie la langue parlée côté client, avec le même SDK dans le navigateur et dans Node, et choisit la langue des sous-titres pour que la personne qui envoie n'ait jamais à le faire.

Inspiration

Des idées à construire avec Ear. Copiez un prompt dans votre agent de code et lancez-vous.

Ear

Detect a caller's language and route the voicemail.

Ear

Sort an archive of recordings by spoken language.

EarVoz

Detect the language of a voice note, then transcribe with the right model.

Ear

Pick the dominant language of a recording to route it.

Ear

Detect the language of a voicemail or dictation before transcribing.

Ear

Gate transcription so it only runs on languages you support.

Ce que fait le modèle

  • 99 langues, de l'afrikaans au yoruba, dont les grandes langues européennes, asiatiques et africaines.
  • Choisit les trois fenêtres de trente secondes qui ressemblent le plus à de la parole plutôt que de lire par position, si bien qu'une intro musicale ou un passage silencieux ne le trompe pas. Choisir par position trouve la langue 4 % du temps sur un enregistrement de cinq minutes dont un dixième est de la parole.
  • Renvoie la langue, un indice de confiance, les candidats classés et un indicateur isReliable. L'indicateur est faux quand les deux premiers sont trop proches pour trancher, et faux pour le norvégien, le suédois et le danois, que le modèle confond entre eux.
  • Un audio déjà décodé fonctionne à n'importe quelle fréquence d'échantillonnage ; une URL de fichier fonctionne sur Apple.
  • Les poids se téléchargent à la première utilisation et sont mis en cache ; la construction ne fait aucun travail et ne lance aucun téléchargement.

Prise en main

Ajoutez détection de langue parlée à votre application iOS or macOS, Android or web en quelques lignes de code. Docs Ear.

iOS, macOS
Installation
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Ear", package: "desert-ant-core")
Exemple - Swift
import Ear

let ear = Ear()   // downloads on first use
let detection = try await ear.identify(contentsOf: url)
detection.language      // "pt"
detection.isReliable    // true
Construire avec un prompt
Add Ear from Desert Ant Labs to this Swift project (iOS, macOS).

What it does: Ear : identification de la langue parlée sur l'appareil.

SDK:

Swift (iOS, macOS)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Ear", package: "desert-ant-core")

Reference:
- Model page: https://desertant.com/models/ear/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Android
Installation
// build.gradle.kts (Maven Central)
implementation("ai.desertant:ear:3.1.0")
Exemple - Kotlin
import ai.desertant.ear.Ear

val ear = Ear(context)   // downloads on first use
val detection = ear.identify(samples, 16_000.0)
detection.language      // "pt"
detection.isReliable    // true
ear.close()
Construire avec un prompt
Add Ear from Desert Ant Labs to this Kotlin project (Android).

What it does: Ear : identification de la langue parlée sur l'appareil.

SDK:

Kotlin (Android)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// build.gradle.kts (Maven Central)
implementation("ai.desertant:ear:3.1.0")

Reference:
- Model page: https://desertant.com/models/ear/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Web, Node.js
Installation
npm i @desert-ant-labs/ear @litertjs/core   # browser
npm i @desert-ant-labs/ear                  # Node
Exemple - TypeScript
import { Ear } from "@desert-ant-labs/ear";

const ear = await Ear.load();
const detection = await ear.identify(samples, 16000);
detection.language      // "pt"
detection.isReliable    // true
Construire avec un prompt
Add Ear from Desert Ant Labs to this JavaScript / TypeScript project (Web, Node.js).

What it does: Ear : identification de la langue parlée sur l'appareil.

SDK:

JavaScript / TypeScript (Web, Node.js)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
npm i @desert-ant-labs/ear @litertjs/core   # browser
npm i @desert-ant-labs/ear                  # Node

Reference:
- Model page: https://desertant.com/models/ear/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.

Spécifications

Langues
99
Entrée
Trois fenêtres de trente secondes de l'enregistrement ; n'importe quelle fréquence d'échantillonnage
Vitesse
Environ 250 ms par identification, trois fenêtres
Plateformes
iOS, macOS, tvOS, visionOS (Core ML) ; Android, Linux, Windows (LiteRT) ; navigateur (WebAssembly et LiteRT.js) ; Node

Ear nomme la langue ; il ne transcrit pas. La parole sous une musique plus forte est bien lue environ six fois sur dix, et le norvégien, le suédois et le danois sont confondus entre eux : Ear marque donc ces réponses comme non fiables, par conception.

Les enregistrements de moins de 30 secondes n'obtiennent qu'une fenêtre et une réponse moins certaine. Traitez une réponse non fiable comme une question à poser à l'utilisateur, pas comme un réglage de transcripteur.

FAQ

Qu'est-ce que Ear ?

Identification de la langue parlée sur l'appareil, parmi 99 langues, à partir de quelques secondes d'audio, avant que la transcription ne commence.

Ear fonctionne-t-il sur l'appareil ?

Oui. Ear s'exécute sur l'appareil, sans appel serveur : les données restent chez l'utilisateur.

Quelles plateformes Ear prend-il en charge ?

Ear est livré sous forme de SDK natif sur l'appareil pour Swift, Kotlin, JavaScript / TypeScript.

Combien coûte Ear ?

Chaque modèle est gratuit jusqu'à 100k appareils actifs mensuels par SDK. Inférence illimitée par utilisateur. Contactez-nous pour des licences sur mesure.

Quelle est la précision ou la vitesse de Ear ?

Sur 162 enregistrements, 98,5 % des réponses qu'Ear a marquées fiables ont été routées vers le bon transcripteur ; sur 12 envois ordinaires et 10 reconstruits en podcasts, aucune réponse confiante n'était fausse.

Ressources