Ear.
Identificación del idioma hablado en el dispositivo en 99 idiomas, a partir de un fragmento corto de audio, antes de que empiece la transcripción.
Detecta el idioma con 30 segundos de audio.
Llega una nota de voz y el transcriptor está configurado en inglés. A los 30 segundos, Ear dice portugués, y el transcriptor que se ejecuta a continuación es el de portugués en lugar de uno en inglés que devolvería un sinsentido con seguridad.
Ear no escucha todo el archivo. Ear encuentra los tres tramos de treinta segundos que más suenan a habla, se salta la sintonía y el silencio, y nombra el idioma en 250 ms. La respuesta llega con una confianza y una marca que indica si fiarse de ella.
Cuando los dos candidatos principales están demasiado cerca para separarlos, Ear lo indica. Preguntas al usuario o recurres a un modelo general en lugar de transcribir en el idioma equivocado. Un solo SDK, todas las plataformas: Swift en Apple, Kotlin en Android, JavaScript en el navegador y Node. No se sube nada.
El transcriptor correcto el 98,5% de las veces.
En 162 grabaciones, el 98,5% de las respuestas que Ear marcó como fiables encaminaron al transcriptor correcto; en 12 subidas corrientes y 10 rehechas como podcasts, ninguna respuesta segura fue errónea.
Medido de extremo a extremo a través del SDK y publicado en la ficha del modelo. El habla mezclada por debajo de una música más alta se lee correctamente en torno al 60% de las veces.
Elige primero el transcriptor correcto
Un transcriptor apuntado al idioma equivocado devuelve un sinsentido con seguridad. En un grabador de reuniones o una app de notas de voz, ejecuta Ear en los primeros 30 segundos e inicia el transcriptor, los subtítulos y la traducción en el idioma que realmente se habla.
Ordena una biblioteca de grabaciones
Pasa Ear por una biblioteca de notas de voz, llamadas o episodios en un script de Node o una app de Mac de la noche a la mañana, y por la mañana cada archivo tiene su idioma. No se sube nada y no se cobra por archivo.
Encamina una llamada o un buzón de voz
En una app de soporte o un producto de mensajería, identifica el idioma de una llamada entrante o un mensaje de voz antes de que llegue a una persona. La llamada acaba con alguien que lo habla, o con el modelo de voz adecuado.
Subtitula en el navegador
Una herramienta de vídeo web identifica el idioma hablado en el cliente, con el mismo SDK en el navegador y en Node, y elige el idioma de los subtítulos para que quien sube el vídeo no tenga que hacerlo nunca.
Inspiración
Ideas para crear con Ear. Copia un prompt en tu agente de código y adelante.
Detect a caller's language and route the voicemail.
In a voicemail or call app, run Desert Ant's Ear on the first ~30 seconds of audio to identify the spoken language on-device, then route the message. For a very short voicemail, accumulate audio first, and treat a low-reliability answer as unknown and ask. Build it with the Desert Ant SDK. Ear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/ear/. Install: SwiftPM desert-ant-core; Maven ai.desertant:ear:3.1.0; npm i @desert-ant-labs/ear @litertjs/core # browser. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Sort an archive of recordings by spoken language.
Build a batch tool that runs Desert Ant's Ear over a folder of recordings to tag each by spoken language, so a mixed archive sorts itself. On-device. Build it with the Desert Ant SDK. Ear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/ear/. Install: SwiftPM desert-ant-core; Maven ai.desertant:ear:3.1.0; npm i @desert-ant-labs/ear @litertjs/core # browser. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Detect the language of a voice note, then transcribe with the right model.
Before transcribing, run Desert Ant's Ear on the first ~30 seconds to identify the spoken language on-device, then run Voz. Handle low confidence by asking the user instead of guessing. Build it with the Desert Ant SDK. Ear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/ear/. Voz (Swift). Install and API: https://desertant.com/docs/voz/. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Pick the dominant language of a recording to route it.
Use Desert Ant's Ear on-device to identify the dominant spoken language of a recording (from its most speech-like 30-second windows) and route it to the right transcriber or team. Build it with the Desert Ant SDK. Ear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/ear/. Install: SwiftPM desert-ant-core; Maven ai.desertant:ear:3.1.0; npm i @desert-ant-labs/ear @litertjs/core # browser. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Detect the language of a voicemail or dictation before transcribing.
Run Desert Ant's Ear on the first ~30 seconds of a voicemail or dictation on-device to identify the language, then pick the right transcriber. Ear needs about 30 seconds, so accumulate audio before deciding on very short clips. Build it with the Desert Ant SDK. Ear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/ear/. Install: SwiftPM desert-ant-core; Maven ai.desertant:ear:3.1.0; npm i @desert-ant-labs/ear @litertjs/core # browser. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Gate transcription so it only runs on languages you support.
Use Desert Ant's Ear to detect the spoken language on-device and skip or reroute recordings in languages your transcriber does not support. Build it with the Desert Ant SDK. Ear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/ear/. Install: SwiftPM desert-ant-core; Maven ai.desertant:ear:3.1.0; npm i @desert-ant-labs/ear @litertjs/core # browser. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Qué hace el modelo
- 99 idiomas, del afrikáans al yoruba, incluidos los principales idiomas europeos, asiáticos y africanos.
- Elige las tres ventanas de treinta segundos que más suenan a habla en lugar de leer por posición, así que una intro musical o un tramo en silencio no lo engañan. Elegir por posición acierta el idioma el 4% de las veces en una grabación de cinco minutos con habla en una décima parte de ella.
- Devuelve el idioma, una confianza, los candidatos ordenados y una marca
isReliable. La marca es falsa cuando los dos principales están demasiado cerca para decidir, y falsa para el noruego, el sueco y el danés, que el modelo confunde entre sí. - Funciona con audio ya decodificado a cualquier frecuencia de muestreo; una URL de archivo funciona en Apple.
- Los pesos se descargan en el primer uso y se guardan en caché; la construcción no hace ningún trabajo ni inicia ninguna descarga.
Primeros pasos
Añade detección del idioma hablado a tu app de iOS or macOS, Android or web con unas pocas líneas de código. Docs de Ear.
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Ear", package: "desert-ant-core")
import Ear
let ear = Ear() // downloads on first use
let detection = try await ear.identify(contentsOf: url)
detection.language // "pt"
detection.isReliable // true
Add Ear from Desert Ant Labs to this Swift project (iOS, macOS). What it does: identificación del idioma hablado en el dispositivo. SDK: Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0") // target dependency .product(name: "Ear", package: "desert-ant-core") Reference: - Model page: https://desertant.com/models/ear/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
// build.gradle.kts (Maven Central)
implementation("ai.desertant:ear:3.1.0")
import ai.desertant.ear.Ear
val ear = Ear(context) // downloads on first use
val detection = ear.identify(samples, 16_000.0)
detection.language // "pt"
detection.isReliable // true
ear.close()
Add Ear from Desert Ant Labs to this Kotlin project (Android).
What it does: identificación del idioma hablado en el dispositivo.
SDK:
Kotlin (Android)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// build.gradle.kts (Maven Central)
implementation("ai.desertant:ear:3.1.0")
Reference:
- Model page: https://desertant.com/models/ear/
- Full catalog and other models: https://desertant.com/llms.txt
Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
npm i @desert-ant-labs/ear @litertjs/core # browser
npm i @desert-ant-labs/ear # Node
import { Ear } from "@desert-ant-labs/ear";
const ear = await Ear.load();
const detection = await ear.identify(samples, 16000);
detection.language // "pt"
detection.isReliable // true
Add Ear from Desert Ant Labs to this JavaScript / TypeScript project (Web, Node.js). What it does: identificación del idioma hablado en el dispositivo. SDK: JavaScript / TypeScript (Web, Node.js) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme npm i @desert-ant-labs/ear @litertjs/core # browser npm i @desert-ant-labs/ear # Node Reference: - Model page: https://desertant.com/models/ear/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Especificaciones
- Idiomas
- 99
- Entrada
- Tres ventanas de treinta segundos de la grabación; cualquier frecuencia de muestreo
- Velocidad
- Unos 250 ms por identificación, tres ventanas
- Plataformas
- iOS, macOS, tvOS, visionOS (Core ML); Android, Linux, Windows (LiteRT); navegador (WebAssembly y LiteRT.js); Node
Ear nombra el idioma; no transcribe. El habla por debajo de una música más alta se acierta unas seis de cada diez veces, y el noruego, el sueco y el danés se confunden entre sí, así que Ear los marca como poco fiables a propósito.
Las grabaciones de menos de 30 segundos reciben una sola ventana y una respuesta menos segura. Trata una respuesta poco fiable como una pregunta para el usuario, no como un ajuste del transcriptor.
Preguntas frecuentes
¿Qué es Ear?
Identificación del idioma hablado en el dispositivo en 99 idiomas, a partir de un fragmento corto de audio, antes de que empiece la transcripción.
¿Ear se ejecuta en el dispositivo?
Sí. Ear se ejecuta en el dispositivo, sin llamadas a servidor, así que los datos se quedan con el usuario.
¿Qué plataformas admite Ear?
Ear se distribuye como un SDK nativo en el dispositivo para Swift, Kotlin, JavaScript / TypeScript.
¿Cuánto cuesta Ear?
Todos los modelos son gratis hasta 100 000 dispositivos activos mensuales por SDK. Inferencia ilimitada por usuario. Contáctanos para licencias personalizadas.
¿Qué precisión o velocidad tiene Ear?
En 162 grabaciones, el 98,5% de las respuestas que Ear marcó como fiables encaminaron al transcriptor correcto; en 12 subidas corrientes y 10 rehechas como podcasts, ninguna respuesta segura fue errónea.