Ear.
Identifiering av talat språk på enheten över 99 språk, från en kort stund ljud, innan transkriptionen börjar.
Känn igen språket utifrån 30 sekunder ljud.
En röstanteckning kommer in och transkriberaren är inställd på engelska. 30 sekunder in säger Ear portugisiska, och transkriberaren som körs härnäst är den portugisiska i stället för en engelsk som självsäkert returnerar nonsens.
Ear lyssnar inte på hela filen. Ear hittar de tre trettiosekundersstundarna som låter mest som tal, hoppar över jingeln och tystnaden, och namnger språket på 250 ms. Svaret kommer med en tillförlitlighet och en flagga som säger om det går att lita på.
När de två främsta kandidaterna ligger för nära för att skiljas åt säger Ear det. Du frågar användaren eller faller tillbaka på en generell modell i stället för att transkribera på fel språk. En SDK, varje plattform: Swift på Apple, Kotlin på Android, JavaScript i webbläsaren och Node. Inget laddas upp.
Rätt transkriberare, 98,5% av gångerna.
På 162 inspelningar dirigerade 98,5% av de svar Ear markerade som tillförlitliga till rätt transkriberare; på 12 vanliga uppladdningar och 10 ombyggda till poddar var inget självsäkert svar fel.
Uppmätt från början till slut genom SDK:n och publicerat på modellkortet. Tal blandat under starkare musik läses rätt ungefär 60% av gångerna.
Välj rätt transkriberare först
En transkriberare inställd på fel språk returnerar självsäkert nonsens. I en mötesinspelare eller en röstanteckningsapp, kör Ear på de första 30 sekunderna och starta transkriberaren, textningen och översättningen på det språk som faktiskt talas.
Sortera ett arkiv av inspelningar
Kör Ear över ett bibliotek av röstanteckningar, samtal eller avsnitt i ett Node-skript eller en Mac-app över natten, och varje fil har sitt språk till morgonen. Inget laddas upp och inget faktureras per fil.
Dirigera ett samtal eller ett röstmeddelande
I en supportapp eller en meddelandeprodukt, namnge språket för ett inkommande samtal eller ett röstmeddelande innan det når en person. Samtalet hamnar hos någon som talar det, eller hos rätt talmodell.
Texta i webbläsaren
Ett webbvideoverktyg identifierar det talade språket på klientsidan, med samma SDK i webbläsaren och i Node, och väljer textningsspråket så att den som laddar upp aldrig behöver göra det.
Inspiration
Idéer att bygga med Ear. Kopiera en prompt till din kodningsagent och kör.
Detect a caller's language and route the voicemail.
In a voicemail or call app, run Desert Ant's Ear on the first ~30 seconds of audio to identify the spoken language on-device, then route the message. For a very short voicemail, accumulate audio first, and treat a low-reliability answer as unknown and ask. Build it with the Desert Ant SDK. Ear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/ear/. Install: SwiftPM desert-ant-core; Maven ai.desertant:ear:3.1.0; npm i @desert-ant-labs/ear @litertjs/core # browser. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Sort an archive of recordings by spoken language.
Build a batch tool that runs Desert Ant's Ear over a folder of recordings to tag each by spoken language, so a mixed archive sorts itself. On-device. Build it with the Desert Ant SDK. Ear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/ear/. Install: SwiftPM desert-ant-core; Maven ai.desertant:ear:3.1.0; npm i @desert-ant-labs/ear @litertjs/core # browser. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Detect the language of a voice note, then transcribe with the right model.
Before transcribing, run Desert Ant's Ear on the first ~30 seconds to identify the spoken language on-device, then run Voz. Handle low confidence by asking the user instead of guessing. Build it with the Desert Ant SDK. Ear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/ear/. Voz (Swift). Install and API: https://desertant.com/docs/voz/. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Pick the dominant language of a recording to route it.
Use Desert Ant's Ear on-device to identify the dominant spoken language of a recording (from its most speech-like 30-second windows) and route it to the right transcriber or team. Build it with the Desert Ant SDK. Ear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/ear/. Install: SwiftPM desert-ant-core; Maven ai.desertant:ear:3.1.0; npm i @desert-ant-labs/ear @litertjs/core # browser. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Detect the language of a voicemail or dictation before transcribing.
Run Desert Ant's Ear on the first ~30 seconds of a voicemail or dictation on-device to identify the language, then pick the right transcriber. Ear needs about 30 seconds, so accumulate audio before deciding on very short clips. Build it with the Desert Ant SDK. Ear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/ear/. Install: SwiftPM desert-ant-core; Maven ai.desertant:ear:3.1.0; npm i @desert-ant-labs/ear @litertjs/core # browser. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Gate transcription so it only runs on languages you support.
Use Desert Ant's Ear to detect the spoken language on-device and skip or reroute recordings in languages your transcriber does not support. Build it with the Desert Ant SDK. Ear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/ear/. Install: SwiftPM desert-ant-core; Maven ai.desertant:ear:3.1.0; npm i @desert-ant-labs/ear @litertjs/core # browser. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Vad modellen gör
- 99 språk, från afrikaans till yoruba, inklusive de stora europeiska, asiatiska och afrikanska språken.
- Väljer de tre trettiosekundersfönstren som låter mest som tal i stället för att läsa efter position, så att en musikintro eller en tyst stund inte lurar den. Att välja efter position hittar språket 4% av gångerna på en fem minuter lång inspelning med tal i en tiondel av den.
- Returnerar språket, en tillförlitlighet, de rangordnade kandidaterna och en
isReliable-flagga. Flaggan är false när de två främsta ligger för nära för att avgöra, och false för norska, svenska och danska, som modellen förväxlar med varandra. - Redan avkodat ljud i valfri samplingsfrekvens fungerar; en fil-URL fungerar på Apple.
- Vikterna laddas ned vid första användning och cachas; konstruktionen gör inget arbete och startar ingen nedladdning.
Kom igång
Lägg till detektering av talat språk i din iOS or macOS, Android or web-app med några rader kod. Ear-dokumentation.
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Ear", package: "desert-ant-core")
import Ear
let ear = Ear() // downloads on first use
let detection = try await ear.identify(contentsOf: url)
detection.language // "pt"
detection.isReliable // true
Add Ear from Desert Ant Labs to this Swift project (iOS, macOS). What it does: Identifiering av talat språk på enheten. SDK: Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0") // target dependency .product(name: "Ear", package: "desert-ant-core") Reference: - Model page: https://desertant.com/models/ear/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
// build.gradle.kts (Maven Central)
implementation("ai.desertant:ear:3.1.0")
import ai.desertant.ear.Ear
val ear = Ear(context) // downloads on first use
val detection = ear.identify(samples, 16_000.0)
detection.language // "pt"
detection.isReliable // true
ear.close()
Add Ear from Desert Ant Labs to this Kotlin project (Android).
What it does: Identifiering av talat språk på enheten.
SDK:
Kotlin (Android)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// build.gradle.kts (Maven Central)
implementation("ai.desertant:ear:3.1.0")
Reference:
- Model page: https://desertant.com/models/ear/
- Full catalog and other models: https://desertant.com/llms.txt
Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
npm i @desert-ant-labs/ear @litertjs/core # browser
npm i @desert-ant-labs/ear # Node
import { Ear } from "@desert-ant-labs/ear";
const ear = await Ear.load();
const detection = await ear.identify(samples, 16000);
detection.language // "pt"
detection.isReliable // true
Add Ear from Desert Ant Labs to this JavaScript / TypeScript project (Web, Node.js). What it does: Identifiering av talat språk på enheten. SDK: JavaScript / TypeScript (Web, Node.js) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme npm i @desert-ant-labs/ear @litertjs/core # browser npm i @desert-ant-labs/ear # Node Reference: - Model page: https://desertant.com/models/ear/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Specifikationer
- Språk
- 99
- Indata
- Tre trettiosekundersfönster av inspelningen; valfri samplingsfrekvens
- Hastighet
- Ungefär 250 ms per identifiering, tre fönster
- Plattformar
- iOS, macOS, tvOS, visionOS (Core ML); Android, Linux, Windows (LiteRT); webbläsare (WebAssembly och LiteRT.js); Node
Ear namnger språket; den transkriberar inte. Tal under starkare musik läses rätt ungefär sex gånger av tio, och norska, svenska och danska förväxlas med varandra, så Ear markerar dem som otillförlitliga med avsikt.
Inspelningar kortare än 30 sekunder får ett fönster och ett mindre säkert svar. Behandla ett otillförlitligt svar som en fråga till användaren, inte som en inställning för transkriberaren.
Vanliga frågor
Vad är Ear?
Identifiering av talat språk på enheten över 99 språk, från en kort stund ljud, innan transkriptionen börjar.
Körs Ear lokalt på enheten?
Ja. Ear körs på enheten, utan något serveranrop, så att data stannar hos användaren.
Vilka plattformar stöder Ear?
Ear levereras som en nativ SDK på enheten för Swift, Kotlin, JavaScript / TypeScript.
Vad kostar Ear?
Varje modell är gratis upp till 100k månadsaktiva enheter per SDK. Obegränsad inferens per användare. Kontakta oss för anpassade licenser.
Hur träffsäker eller snabb är Ear?
På 162 inspelningar dirigerade 98,5% av de svar Ear markerade som tillförlitliga till rätt transkriberare; på 12 vanliga uppladdningar och 10 ombyggda till poddar var inget självsäkert svar fel.