Desert Ant Labs

Ear.

Detecção de idioma faladoDisponível

Identificação de idioma falado no dispositivo em 99 idiomas, a partir de um curto trecho de áudio, antes de a transcrição começar.

Detecte o idioma a partir de 30 segundos de áudio.

Chega uma nota de voz e o transcritor está configurado para inglês. Aos 30 segundos, o Ear diz português, e o transcritor que roda em seguida é o de português, em vez de um de inglês devolvendo bobagem com confiança.

O Ear não ouve o arquivo inteiro. O Ear encontra os três trechos de trinta segundos que mais soam como fala, pula a vinheta e o silêncio, e nomeia o idioma em 250 ms. A resposta vem com uma confiança e um sinalizador que diz se dá para confiar nela.

Quando os dois principais candidatos estão próximos demais para separar, o Ear avisa. Você pergunta ao usuário ou recorre a um modelo geral, em vez de transcrever no idioma errado. Um SDK, todas as plataformas: Swift em dispositivos Apple, Kotlin no Android, JavaScript no navegador e no Node. Nada é enviado.

O transcritor certo em 98,5% das vezes.

Em 162 gravações, 98,5% das respostas que o Ear marcou como confiáveis encaminharam ao transcritor certo; em 12 uploads comuns e 10 refeitos como podcasts, nenhuma resposta confiante estava errada.

98,5%
Encaminhado corretamente
respostas acima do limiar de confiabilidade, 162 gravações
99
Idiomas
250 ms
Por identificação
três janelas de trinta segundos

Medido de ponta a ponta pelo SDK e publicado no cartão do modelo. Fala misturada sob música mais alta é lida corretamente cerca de 60% das vezes.

Escolha o transcritor certo primeiro

Um transcritor apontado para o idioma errado devolve bobagem com confiança. Em um gravador de reuniões ou um app de notas de voz, rode o Ear nos primeiros 30 segundos e comece o transcritor, as legendas e a tradução no idioma realmente falado.

Organize um acervo de gravações

Passe o Ear por uma biblioteca de notas de voz, chamadas ou episódios em um script Node ou um app de Mac durante a noite, e pela manhã cada arquivo terá o seu idioma. Nada é enviado e nada é cobrado por arquivo.

Encaminhe uma chamada ou um recado de voz

Em um app de suporte ou um produto de mensagens, nomeie o idioma de uma chamada recebida ou de um recado de voz antes de ele chegar a uma pessoa. A chamada cai com alguém que fala aquele idioma, ou com o modelo de fala certo.

Legende no navegador

Uma ferramenta de vídeo web identifica o idioma falado no cliente, com o mesmo SDK no navegador e no Node, e escolhe o idioma da legenda para que quem envia nunca precise fazê-lo.

Inspiração

Ideias para construir com o Ear. Copie um prompt para o seu agente de código e comece.

Ear

Detect a caller's language and route the voicemail.

Ear

Sort an archive of recordings by spoken language.

EarVoz

Detect the language of a voice note, then transcribe with the right model.

Ear

Pick the dominant language of a recording to route it.

Ear

Detect the language of a voicemail or dictation before transcribing.

Ear

Gate transcription so it only runs on languages you support.

O que o modelo faz

  • 99 idiomas, do africâner ao iorubá, incluindo os principais idiomas europeus, asiáticos e africanos.
  • Escolhe as três janelas de trinta segundos que mais soam como fala, em vez de ler por posição, então uma introdução musical ou um trecho de silêncio não o engana. Escolher por posição acerta o idioma em 4% das vezes em uma gravação de cinco minutos com fala em um décimo dela.
  • Devolve o idioma, uma confiança, os candidatos ranqueados e um sinalizador isReliable. O sinalizador é falso quando os dois principais estão próximos demais para decidir, e falso para norueguês, sueco e dinamarquês, que o modelo confunde entre si.
  • Áudio já decodificado em qualquer taxa de amostragem funciona; uma URL de arquivo funciona em dispositivos Apple.
  • Os pesos são baixados no primeiro uso e guardados em cache; a construção não faz trabalho nenhum e não inicia download.

Primeiros passos

Adicione detecção de idioma falado ao seu app iOS or macOS, Android or web em poucas linhas de código. Docs do Ear.

iOS, macOS
Instalação
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Ear", package: "desert-ant-core")
Exemplo - Swift
import Ear

let ear = Ear()   // downloads on first use
let detection = try await ear.identify(contentsOf: url)
detection.language      // "pt"
detection.isReliable    // true
Crie com um prompt
Add Ear from Desert Ant Labs to this Swift project (iOS, macOS).

What it does: identificação de idioma falado no dispositivo.

SDK:

Swift (iOS, macOS)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Ear", package: "desert-ant-core")

Reference:
- Model page: https://desertant.com/models/ear/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Android
Instalação
// build.gradle.kts (Maven Central)
implementation("ai.desertant:ear:3.1.0")
Exemplo - Kotlin
import ai.desertant.ear.Ear

val ear = Ear(context)   // downloads on first use
val detection = ear.identify(samples, 16_000.0)
detection.language      // "pt"
detection.isReliable    // true
ear.close()
Crie com um prompt
Add Ear from Desert Ant Labs to this Kotlin project (Android).

What it does: identificação de idioma falado no dispositivo.

SDK:

Kotlin (Android)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// build.gradle.kts (Maven Central)
implementation("ai.desertant:ear:3.1.0")

Reference:
- Model page: https://desertant.com/models/ear/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Web, Node.js
Instalação
npm i @desert-ant-labs/ear @litertjs/core   # browser
npm i @desert-ant-labs/ear                  # Node
Exemplo - TypeScript
import { Ear } from "@desert-ant-labs/ear";

const ear = await Ear.load();
const detection = await ear.identify(samples, 16000);
detection.language      // "pt"
detection.isReliable    // true
Crie com um prompt
Add Ear from Desert Ant Labs to this JavaScript / TypeScript project (Web, Node.js).

What it does: identificação de idioma falado no dispositivo.

SDK:

JavaScript / TypeScript (Web, Node.js)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
npm i @desert-ant-labs/ear @litertjs/core   # browser
npm i @desert-ant-labs/ear                  # Node

Reference:
- Model page: https://desertant.com/models/ear/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.

Especificações

Idiomas
99
Entrada
Três janelas de trinta segundos da gravação; qualquer taxa de amostragem
Velocidade
Cerca de 250 ms por identificação, três janelas
Plataformas
iOS, macOS, tvOS, visionOS (Core ML); Android, Linux, Windows (LiteRT); navegador (WebAssembly e LiteRT.js); Node

O Ear nomeia o idioma; ele não transcreve. Fala sob música mais alta é lida corretamente cerca de seis vezes em dez, e norueguês, sueco e dinamarquês são confundidos entre si, então o Ear marca esses casos como não confiáveis por design.

Gravações com menos de 30 segundos recebem uma única janela e uma resposta menos certa. Trate uma resposta não confiável como uma pergunta para o usuário, não como um ajuste de transcritor.

FAQ

O que é o Ear?

Identificação de idioma falado no dispositivo em 99 idiomas, a partir de um curto trecho de áudio, antes de a transcrição começar.

O Ear roda no dispositivo?

Sim. O Ear roda no dispositivo, sem chamada a servidor, então os dados ficam com o usuário.

Quais plataformas o Ear suporta?

O Ear é distribuído como um SDK nativo no dispositivo para Swift, Kotlin, JavaScript / TypeScript.

Quanto custa o Ear?

Cada modelo é gratuito para até 100 mil dispositivos ativos mensais por SDK. Inferência ilimitada por usuário. Fale conosco para licenças personalizadas.

Qual a precisão e a velocidade do Ear?

Em 162 gravações, 98,5% das respostas que o Ear marcou como confiáveis encaminharam ao transcritor certo; em 12 uploads comuns e 10 refeitos como podcasts, nenhuma resposta confiante estava errada.

Recursos