Ear.
Identificação de idioma falado no dispositivo em 99 idiomas, a partir de um curto trecho de áudio, antes de a transcrição começar.
Detecte o idioma a partir de 30 segundos de áudio.
Chega uma nota de voz e o transcritor está configurado para inglês. Aos 30 segundos, o Ear diz português, e o transcritor que roda em seguida é o de português, em vez de um de inglês devolvendo bobagem com confiança.
O Ear não ouve o arquivo inteiro. O Ear encontra os três trechos de trinta segundos que mais soam como fala, pula a vinheta e o silêncio, e nomeia o idioma em 250 ms. A resposta vem com uma confiança e um sinalizador que diz se dá para confiar nela.
Quando os dois principais candidatos estão próximos demais para separar, o Ear avisa. Você pergunta ao usuário ou recorre a um modelo geral, em vez de transcrever no idioma errado. Um SDK, todas as plataformas: Swift em dispositivos Apple, Kotlin no Android, JavaScript no navegador e no Node. Nada é enviado.
O transcritor certo em 98,5% das vezes.
Em 162 gravações, 98,5% das respostas que o Ear marcou como confiáveis encaminharam ao transcritor certo; em 12 uploads comuns e 10 refeitos como podcasts, nenhuma resposta confiante estava errada.
Medido de ponta a ponta pelo SDK e publicado no cartão do modelo. Fala misturada sob música mais alta é lida corretamente cerca de 60% das vezes.
Escolha o transcritor certo primeiro
Um transcritor apontado para o idioma errado devolve bobagem com confiança. Em um gravador de reuniões ou um app de notas de voz, rode o Ear nos primeiros 30 segundos e comece o transcritor, as legendas e a tradução no idioma realmente falado.
Organize um acervo de gravações
Passe o Ear por uma biblioteca de notas de voz, chamadas ou episódios em um script Node ou um app de Mac durante a noite, e pela manhã cada arquivo terá o seu idioma. Nada é enviado e nada é cobrado por arquivo.
Encaminhe uma chamada ou um recado de voz
Em um app de suporte ou um produto de mensagens, nomeie o idioma de uma chamada recebida ou de um recado de voz antes de ele chegar a uma pessoa. A chamada cai com alguém que fala aquele idioma, ou com o modelo de fala certo.
Legende no navegador
Uma ferramenta de vídeo web identifica o idioma falado no cliente, com o mesmo SDK no navegador e no Node, e escolhe o idioma da legenda para que quem envia nunca precise fazê-lo.
Inspiração
Ideias para construir com o Ear. Copie um prompt para o seu agente de código e comece.
Detect a caller's language and route the voicemail.
In a voicemail or call app, run Desert Ant's Ear on the first ~30 seconds of audio to identify the spoken language on-device, then route the message. For a very short voicemail, accumulate audio first, and treat a low-reliability answer as unknown and ask. Build it with the Desert Ant SDK. Ear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/ear/. Install: SwiftPM desert-ant-core; Maven ai.desertant:ear:3.1.0; npm i @desert-ant-labs/ear @litertjs/core # browser. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Sort an archive of recordings by spoken language.
Build a batch tool that runs Desert Ant's Ear over a folder of recordings to tag each by spoken language, so a mixed archive sorts itself. On-device. Build it with the Desert Ant SDK. Ear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/ear/. Install: SwiftPM desert-ant-core; Maven ai.desertant:ear:3.1.0; npm i @desert-ant-labs/ear @litertjs/core # browser. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Detect the language of a voice note, then transcribe with the right model.
Before transcribing, run Desert Ant's Ear on the first ~30 seconds to identify the spoken language on-device, then run Voz. Handle low confidence by asking the user instead of guessing. Build it with the Desert Ant SDK. Ear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/ear/. Voz (Swift). Install and API: https://desertant.com/docs/voz/. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Pick the dominant language of a recording to route it.
Use Desert Ant's Ear on-device to identify the dominant spoken language of a recording (from its most speech-like 30-second windows) and route it to the right transcriber or team. Build it with the Desert Ant SDK. Ear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/ear/. Install: SwiftPM desert-ant-core; Maven ai.desertant:ear:3.1.0; npm i @desert-ant-labs/ear @litertjs/core # browser. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Detect the language of a voicemail or dictation before transcribing.
Run Desert Ant's Ear on the first ~30 seconds of a voicemail or dictation on-device to identify the language, then pick the right transcriber. Ear needs about 30 seconds, so accumulate audio before deciding on very short clips. Build it with the Desert Ant SDK. Ear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/ear/. Install: SwiftPM desert-ant-core; Maven ai.desertant:ear:3.1.0; npm i @desert-ant-labs/ear @litertjs/core # browser. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Gate transcription so it only runs on languages you support.
Use Desert Ant's Ear to detect the spoken language on-device and skip or reroute recordings in languages your transcriber does not support. Build it with the Desert Ant SDK. Ear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/ear/. Install: SwiftPM desert-ant-core; Maven ai.desertant:ear:3.1.0; npm i @desert-ant-labs/ear @litertjs/core # browser. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
O que o modelo faz
- 99 idiomas, do africâner ao iorubá, incluindo os principais idiomas europeus, asiáticos e africanos.
- Escolhe as três janelas de trinta segundos que mais soam como fala, em vez de ler por posição, então uma introdução musical ou um trecho de silêncio não o engana. Escolher por posição acerta o idioma em 4% das vezes em uma gravação de cinco minutos com fala em um décimo dela.
- Devolve o idioma, uma confiança, os candidatos ranqueados e um sinalizador
isReliable. O sinalizador é falso quando os dois principais estão próximos demais para decidir, e falso para norueguês, sueco e dinamarquês, que o modelo confunde entre si. - Áudio já decodificado em qualquer taxa de amostragem funciona; uma URL de arquivo funciona em dispositivos Apple.
- Os pesos são baixados no primeiro uso e guardados em cache; a construção não faz trabalho nenhum e não inicia download.
Primeiros passos
Adicione detecção de idioma falado ao seu app iOS or macOS, Android or web em poucas linhas de código. Docs do Ear.
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Ear", package: "desert-ant-core")
import Ear
let ear = Ear() // downloads on first use
let detection = try await ear.identify(contentsOf: url)
detection.language // "pt"
detection.isReliable // true
Add Ear from Desert Ant Labs to this Swift project (iOS, macOS). What it does: identificação de idioma falado no dispositivo. SDK: Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0") // target dependency .product(name: "Ear", package: "desert-ant-core") Reference: - Model page: https://desertant.com/models/ear/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
// build.gradle.kts (Maven Central)
implementation("ai.desertant:ear:3.1.0")
import ai.desertant.ear.Ear
val ear = Ear(context) // downloads on first use
val detection = ear.identify(samples, 16_000.0)
detection.language // "pt"
detection.isReliable // true
ear.close()
Add Ear from Desert Ant Labs to this Kotlin project (Android).
What it does: identificação de idioma falado no dispositivo.
SDK:
Kotlin (Android)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// build.gradle.kts (Maven Central)
implementation("ai.desertant:ear:3.1.0")
Reference:
- Model page: https://desertant.com/models/ear/
- Full catalog and other models: https://desertant.com/llms.txt
Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
npm i @desert-ant-labs/ear @litertjs/core # browser
npm i @desert-ant-labs/ear # Node
import { Ear } from "@desert-ant-labs/ear";
const ear = await Ear.load();
const detection = await ear.identify(samples, 16000);
detection.language // "pt"
detection.isReliable // true
Add Ear from Desert Ant Labs to this JavaScript / TypeScript project (Web, Node.js). What it does: identificação de idioma falado no dispositivo. SDK: JavaScript / TypeScript (Web, Node.js) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme npm i @desert-ant-labs/ear @litertjs/core # browser npm i @desert-ant-labs/ear # Node Reference: - Model page: https://desertant.com/models/ear/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Especificações
- Idiomas
- 99
- Entrada
- Três janelas de trinta segundos da gravação; qualquer taxa de amostragem
- Velocidade
- Cerca de 250 ms por identificação, três janelas
- Plataformas
- iOS, macOS, tvOS, visionOS (Core ML); Android, Linux, Windows (LiteRT); navegador (WebAssembly e LiteRT.js); Node
O Ear nomeia o idioma; ele não transcreve. Fala sob música mais alta é lida corretamente cerca de seis vezes em dez, e norueguês, sueco e dinamarquês são confundidos entre si, então o Ear marca esses casos como não confiáveis por design.
Gravações com menos de 30 segundos recebem uma única janela e uma resposta menos certa. Trate uma resposta não confiável como uma pergunta para o usuário, não como um ajuste de transcritor.
FAQ
O que é o Ear?
Identificação de idioma falado no dispositivo em 99 idiomas, a partir de um curto trecho de áudio, antes de a transcrição começar.
O Ear roda no dispositivo?
Sim. O Ear roda no dispositivo, sem chamada a servidor, então os dados ficam com o usuário.
Quais plataformas o Ear suporta?
O Ear é distribuído como um SDK nativo no dispositivo para Swift, Kotlin, JavaScript / TypeScript.
Quanto custa o Ear?
Cada modelo é gratuito para até 100 mil dispositivos ativos mensais por SDK. Inferência ilimitada por usuário. Fale conosco para licenças personalizadas.
Qual a precisão e a velocidade do Ear?
Em 162 gravações, 98,5% das respostas que o Ear marcou como confiáveis encaminharam ao transcritor certo; em 12 uploads comuns e 10 refeitos como podcasts, nenhuma resposta confiante estava errada.