Desert Ant Labs

Ear.

Detección del idioma habladoDisponible

Identificación del idioma hablado en el dispositivo en 99 idiomas, a partir de un fragmento corto de audio, antes de que empiece la transcripción.

Detecta el idioma con 30 segundos de audio.

Llega una nota de voz y el transcriptor está configurado en inglés. A los 30 segundos, Ear dice portugués, y el transcriptor que se ejecuta a continuación es el de portugués en lugar de uno en inglés que devolvería un sinsentido con seguridad.

Ear no escucha todo el archivo. Ear encuentra los tres tramos de treinta segundos que más suenan a habla, se salta la sintonía y el silencio, y nombra el idioma en 250 ms. La respuesta llega con una confianza y una marca que indica si fiarse de ella.

Cuando los dos candidatos principales están demasiado cerca para separarlos, Ear lo indica. Preguntas al usuario o recurres a un modelo general en lugar de transcribir en el idioma equivocado. Un solo SDK, todas las plataformas: Swift en Apple, Kotlin en Android, JavaScript en el navegador y Node. No se sube nada.

El transcriptor correcto el 98,5% de las veces.

En 162 grabaciones, el 98,5% de las respuestas que Ear marcó como fiables encaminaron al transcriptor correcto; en 12 subidas corrientes y 10 rehechas como podcasts, ninguna respuesta segura fue errónea.

98,5%
Encaminado correctamente
respuestas por encima del umbral de fiabilidad, 162 grabaciones
99
Idiomas
250 ms
Por identificación
tres ventanas de treinta segundos

Medido de extremo a extremo a través del SDK y publicado en la ficha del modelo. El habla mezclada por debajo de una música más alta se lee correctamente en torno al 60% de las veces.

Elige primero el transcriptor correcto

Un transcriptor apuntado al idioma equivocado devuelve un sinsentido con seguridad. En un grabador de reuniones o una app de notas de voz, ejecuta Ear en los primeros 30 segundos e inicia el transcriptor, los subtítulos y la traducción en el idioma que realmente se habla.

Ordena una biblioteca de grabaciones

Pasa Ear por una biblioteca de notas de voz, llamadas o episodios en un script de Node o una app de Mac de la noche a la mañana, y por la mañana cada archivo tiene su idioma. No se sube nada y no se cobra por archivo.

Encamina una llamada o un buzón de voz

En una app de soporte o un producto de mensajería, identifica el idioma de una llamada entrante o un mensaje de voz antes de que llegue a una persona. La llamada acaba con alguien que lo habla, o con el modelo de voz adecuado.

Subtitula en el navegador

Una herramienta de vídeo web identifica el idioma hablado en el cliente, con el mismo SDK en el navegador y en Node, y elige el idioma de los subtítulos para que quien sube el vídeo no tenga que hacerlo nunca.

Inspiración

Ideas para crear con Ear. Copia un prompt en tu agente de código y adelante.

Ear

Detect a caller's language and route the voicemail.

Ear

Sort an archive of recordings by spoken language.

EarVoz

Detect the language of a voice note, then transcribe with the right model.

Ear

Pick the dominant language of a recording to route it.

Ear

Detect the language of a voicemail or dictation before transcribing.

Ear

Gate transcription so it only runs on languages you support.

Qué hace el modelo

  • 99 idiomas, del afrikáans al yoruba, incluidos los principales idiomas europeos, asiáticos y africanos.
  • Elige las tres ventanas de treinta segundos que más suenan a habla en lugar de leer por posición, así que una intro musical o un tramo en silencio no lo engañan. Elegir por posición acierta el idioma el 4% de las veces en una grabación de cinco minutos con habla en una décima parte de ella.
  • Devuelve el idioma, una confianza, los candidatos ordenados y una marca isReliable. La marca es falsa cuando los dos principales están demasiado cerca para decidir, y falsa para el noruego, el sueco y el danés, que el modelo confunde entre sí.
  • Funciona con audio ya decodificado a cualquier frecuencia de muestreo; una URL de archivo funciona en Apple.
  • Los pesos se descargan en el primer uso y se guardan en caché; la construcción no hace ningún trabajo ni inicia ninguna descarga.

Primeros pasos

Añade detección del idioma hablado a tu app de iOS or macOS, Android or web con unas pocas líneas de código. Docs de Ear.

iOS, macOS
Instalación
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Ear", package: "desert-ant-core")
Ejemplo - Swift
import Ear

let ear = Ear()   // downloads on first use
let detection = try await ear.identify(contentsOf: url)
detection.language      // "pt"
detection.isReliable    // true
Crea con un prompt
Add Ear from Desert Ant Labs to this Swift project (iOS, macOS).

What it does: identificación del idioma hablado en el dispositivo.

SDK:

Swift (iOS, macOS)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Ear", package: "desert-ant-core")

Reference:
- Model page: https://desertant.com/models/ear/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Android
Instalación
// build.gradle.kts (Maven Central)
implementation("ai.desertant:ear:3.1.0")
Ejemplo - Kotlin
import ai.desertant.ear.Ear

val ear = Ear(context)   // downloads on first use
val detection = ear.identify(samples, 16_000.0)
detection.language      // "pt"
detection.isReliable    // true
ear.close()
Crea con un prompt
Add Ear from Desert Ant Labs to this Kotlin project (Android).

What it does: identificación del idioma hablado en el dispositivo.

SDK:

Kotlin (Android)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// build.gradle.kts (Maven Central)
implementation("ai.desertant:ear:3.1.0")

Reference:
- Model page: https://desertant.com/models/ear/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Web, Node.js
Instalación
npm i @desert-ant-labs/ear @litertjs/core   # browser
npm i @desert-ant-labs/ear                  # Node
Ejemplo - TypeScript
import { Ear } from "@desert-ant-labs/ear";

const ear = await Ear.load();
const detection = await ear.identify(samples, 16000);
detection.language      // "pt"
detection.isReliable    // true
Crea con un prompt
Add Ear from Desert Ant Labs to this JavaScript / TypeScript project (Web, Node.js).

What it does: identificación del idioma hablado en el dispositivo.

SDK:

JavaScript / TypeScript (Web, Node.js)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
npm i @desert-ant-labs/ear @litertjs/core   # browser
npm i @desert-ant-labs/ear                  # Node

Reference:
- Model page: https://desertant.com/models/ear/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.

Especificaciones

Idiomas
99
Entrada
Tres ventanas de treinta segundos de la grabación; cualquier frecuencia de muestreo
Velocidad
Unos 250 ms por identificación, tres ventanas
Plataformas
iOS, macOS, tvOS, visionOS (Core ML); Android, Linux, Windows (LiteRT); navegador (WebAssembly y LiteRT.js); Node

Ear nombra el idioma; no transcribe. El habla por debajo de una música más alta se acierta unas seis de cada diez veces, y el noruego, el sueco y el danés se confunden entre sí, así que Ear los marca como poco fiables a propósito.

Las grabaciones de menos de 30 segundos reciben una sola ventana y una respuesta menos segura. Trata una respuesta poco fiable como una pregunta para el usuario, no como un ajuste del transcriptor.

Preguntas frecuentes

¿Qué es Ear?

Identificación del idioma hablado en el dispositivo en 99 idiomas, a partir de un fragmento corto de audio, antes de que empiece la transcripción.

¿Ear se ejecuta en el dispositivo?

Sí. Ear se ejecuta en el dispositivo, sin llamadas a servidor, así que los datos se quedan con el usuario.

¿Qué plataformas admite Ear?

Ear se distribuye como un SDK nativo en el dispositivo para Swift, Kotlin, JavaScript / TypeScript.

¿Cuánto cuesta Ear?

Todos los modelos son gratis hasta 100 000 dispositivos activos mensuales por SDK. Inferencia ilimitada por usuario. Contáctanos para licencias personalizadas.

¿Qué precisión o velocidad tiene Ear?

En 162 grabaciones, el 98,5% de las respuestas que Ear marcó como fiables encaminaron al transcriptor correcto; en 12 subidas corrientes y 10 rehechas como podcasts, ninguna respuesta segura fue errónea.

Recursos