Desert Ant Labs

Ear.

Detektering av talat språkTillgänglig

Identifiering av talat språk på enheten över 99 språk, från en kort stund ljud, innan transkriptionen börjar.

Känn igen språket utifrån 30 sekunder ljud.

En röstanteckning kommer in och transkriberaren är inställd på engelska. 30 sekunder in säger Ear portugisiska, och transkriberaren som körs härnäst är den portugisiska i stället för en engelsk som självsäkert returnerar nonsens.

Ear lyssnar inte på hela filen. Ear hittar de tre trettiosekundersstundarna som låter mest som tal, hoppar över jingeln och tystnaden, och namnger språket på 250 ms. Svaret kommer med en tillförlitlighet och en flagga som säger om det går att lita på.

När de två främsta kandidaterna ligger för nära för att skiljas åt säger Ear det. Du frågar användaren eller faller tillbaka på en generell modell i stället för att transkribera på fel språk. En SDK, varje plattform: Swift på Apple, Kotlin på Android, JavaScript i webbläsaren och Node. Inget laddas upp.

Rätt transkriberare, 98,5% av gångerna.

På 162 inspelningar dirigerade 98,5% av de svar Ear markerade som tillförlitliga till rätt transkriberare; på 12 vanliga uppladdningar och 10 ombyggda till poddar var inget självsäkert svar fel.

98,5%
Dirigerat rätt
svar över tillförlitlighetströskeln, 162 inspelningar
99
Språk
250ms
Per identifiering
tre trettiosekundersfönster

Uppmätt från början till slut genom SDK:n och publicerat på modellkortet. Tal blandat under starkare musik läses rätt ungefär 60% av gångerna.

Välj rätt transkriberare först

En transkriberare inställd på fel språk returnerar självsäkert nonsens. I en mötesinspelare eller en röstanteckningsapp, kör Ear på de första 30 sekunderna och starta transkriberaren, textningen och översättningen på det språk som faktiskt talas.

Sortera ett arkiv av inspelningar

Kör Ear över ett bibliotek av röstanteckningar, samtal eller avsnitt i ett Node-skript eller en Mac-app över natten, och varje fil har sitt språk till morgonen. Inget laddas upp och inget faktureras per fil.

Dirigera ett samtal eller ett röstmeddelande

I en supportapp eller en meddelandeprodukt, namnge språket för ett inkommande samtal eller ett röstmeddelande innan det når en person. Samtalet hamnar hos någon som talar det, eller hos rätt talmodell.

Texta i webbläsaren

Ett webbvideoverktyg identifierar det talade språket på klientsidan, med samma SDK i webbläsaren och i Node, och väljer textningsspråket så att den som laddar upp aldrig behöver göra det.

Inspiration

Idéer att bygga med Ear. Kopiera en prompt till din kodningsagent och kör.

Ear

Detect a caller's language and route the voicemail.

Ear

Sort an archive of recordings by spoken language.

EarVoz

Detect the language of a voice note, then transcribe with the right model.

Ear

Pick the dominant language of a recording to route it.

Ear

Detect the language of a voicemail or dictation before transcribing.

Ear

Gate transcription so it only runs on languages you support.

Vad modellen gör

  • 99 språk, från afrikaans till yoruba, inklusive de stora europeiska, asiatiska och afrikanska språken.
  • Väljer de tre trettiosekundersfönstren som låter mest som tal i stället för att läsa efter position, så att en musikintro eller en tyst stund inte lurar den. Att välja efter position hittar språket 4% av gångerna på en fem minuter lång inspelning med tal i en tiondel av den.
  • Returnerar språket, en tillförlitlighet, de rangordnade kandidaterna och en isReliable-flagga. Flaggan är false när de två främsta ligger för nära för att avgöra, och false för norska, svenska och danska, som modellen förväxlar med varandra.
  • Redan avkodat ljud i valfri samplingsfrekvens fungerar; en fil-URL fungerar på Apple.
  • Vikterna laddas ned vid första användning och cachas; konstruktionen gör inget arbete och startar ingen nedladdning.

Kom igång

Lägg till detektering av talat språk i din iOS or macOS, Android or web-app med några rader kod. Ear-dokumentation.

iOS, macOS
Installera
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Ear", package: "desert-ant-core")
Exempel - Swift
import Ear

let ear = Ear()   // downloads on first use
let detection = try await ear.identify(contentsOf: url)
detection.language      // "pt"
detection.isReliable    // true
Bygg med en prompt
Add Ear from Desert Ant Labs to this Swift project (iOS, macOS).

What it does: Identifiering av talat språk på enheten.

SDK:

Swift (iOS, macOS)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Ear", package: "desert-ant-core")

Reference:
- Model page: https://desertant.com/models/ear/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Android
Installera
// build.gradle.kts (Maven Central)
implementation("ai.desertant:ear:3.1.0")
Exempel - Kotlin
import ai.desertant.ear.Ear

val ear = Ear(context)   // downloads on first use
val detection = ear.identify(samples, 16_000.0)
detection.language      // "pt"
detection.isReliable    // true
ear.close()
Bygg med en prompt
Add Ear from Desert Ant Labs to this Kotlin project (Android).

What it does: Identifiering av talat språk på enheten.

SDK:

Kotlin (Android)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// build.gradle.kts (Maven Central)
implementation("ai.desertant:ear:3.1.0")

Reference:
- Model page: https://desertant.com/models/ear/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Web, Node.js
Installera
npm i @desert-ant-labs/ear @litertjs/core   # browser
npm i @desert-ant-labs/ear                  # Node
Exempel - TypeScript
import { Ear } from "@desert-ant-labs/ear";

const ear = await Ear.load();
const detection = await ear.identify(samples, 16000);
detection.language      // "pt"
detection.isReliable    // true
Bygg med en prompt
Add Ear from Desert Ant Labs to this JavaScript / TypeScript project (Web, Node.js).

What it does: Identifiering av talat språk på enheten.

SDK:

JavaScript / TypeScript (Web, Node.js)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
npm i @desert-ant-labs/ear @litertjs/core   # browser
npm i @desert-ant-labs/ear                  # Node

Reference:
- Model page: https://desertant.com/models/ear/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.

Specifikationer

Språk
99
Indata
Tre trettiosekundersfönster av inspelningen; valfri samplingsfrekvens
Hastighet
Ungefär 250 ms per identifiering, tre fönster
Plattformar
iOS, macOS, tvOS, visionOS (Core ML); Android, Linux, Windows (LiteRT); webbläsare (WebAssembly och LiteRT.js); Node

Ear namnger språket; den transkriberar inte. Tal under starkare musik läses rätt ungefär sex gånger av tio, och norska, svenska och danska förväxlas med varandra, så Ear markerar dem som otillförlitliga med avsikt.

Inspelningar kortare än 30 sekunder får ett fönster och ett mindre säkert svar. Behandla ett otillförlitligt svar som en fråga till användaren, inte som en inställning för transkriberaren.

Vanliga frågor

Vad är Ear?

Identifiering av talat språk på enheten över 99 språk, från en kort stund ljud, innan transkriptionen börjar.

Körs Ear lokalt på enheten?

Ja. Ear körs på enheten, utan något serveranrop, så att data stannar hos användaren.

Vilka plattformar stöder Ear?

Ear levereras som en nativ SDK på enheten för Swift, Kotlin, JavaScript / TypeScript.

Vad kostar Ear?

Varje modell är gratis upp till 100k månadsaktiva enheter per SDK. Obegränsad inferens per användare. Kontakta oss för anpassade licenser.

Hur träffsäker eller snabb är Ear?

På 162 inspelningar dirigerade 98,5% av de svar Ear markerade som tillförlitliga till rätt transkriberare; på 12 vanliga uppladdningar och 10 ombyggda till poddar var inget självsäkert svar fel.

Resurser