Desert Ant Labs

Ear.

Gesproken taalherkenningBeschikbaar

Herkenning van gesproken taal op het apparaat, in 99 talen, uit een korte flard audio, voordat de transcriptie begint.

Herken de taal op basis van 30 seconden audio.

Er komt een spraaknotitie binnen en de transcriber staat op Engels. Na 30 seconden zegt Ear Portugees, en de transcriber die daarna draait is de Portugese in plaats van een Engelse die met stelligheid onzin teruggeeft.

Ear luistert niet naar het hele bestand. Ear vindt de drie stukken van dertig seconden die het meest op spraak lijken, slaat de jingle en de stilte over, en benoemt de taal in 250 ms. Het antwoord komt met een betrouwbaarheid en een vlag die zegt of je het kunt vertrouwen.

Als de bovenste twee kandidaten te dicht bij elkaar liggen om te scheiden, zegt Ear dat. Je vraagt het aan de gebruiker of valt terug op een algemeen model in plaats van in de verkeerde taal te transcriberen. Eén SDK, elk platform: Swift op Apple, Kotlin op Android, JavaScript in de browser en Node. Er wordt niets geüpload.

De juiste transcriber, in 98,5% van de gevallen.

Op 162 opnames routeerde 98,5% van de antwoorden die Ear als betrouwbaar markeerde naar de juiste transcriber; bij 12 gewone uploads en 10 als podcast opnieuw opgebouwde opnames was geen enkel zeker antwoord fout.

98,5%
Correct gerouteerd
antwoorden boven de betrouwbaarheidsdrempel, 162 opnames
99
Talen
250ms
Per identificatie
drie vensters van dertig seconden

End-to-end gemeten via de SDK en gepubliceerd op de model card. Spraak die onder luidere muziek is gemengd, wordt ongeveer 60% van de tijd goed gelezen.

Kies eerst de juiste transcriber

Een transcriber die op de verkeerde taal staat, geeft met stelligheid onzin terug. Draai Ear in een vergaderrecorder of een spraaknotitie-app op de eerste 30 seconden en start de transcriber, de ondertitels en de vertaling in de taal die daadwerkelijk wordt gesproken.

Een archief met opnames sorteren

Draai Ear 's nachts over een bibliotheek met spraaknotities, gesprekken of afleveringen in een Node-script of een Mac-app, en elk bestand heeft 's ochtends zijn taal. Er wordt niets geüpload en niets per bestand afgerekend.

Een gesprek of voicemail routeren

Benoem in een support-app of een berichtenproduct de taal van een binnenkomend gesprek of een voicemail voordat het een persoon bereikt. Het gesprek komt terecht bij iemand die de taal spreekt, of bij het juiste spraakmodel.

Ondertitelen in de browser

Een webvideotool herkent de gesproken taal client-side, met dezelfde SDK in de browser en in Node, en kiest de ondertiteltaal, zodat de uploader dat nooit hoeft.

Inspiratie

Ideeën om te bouwen met Ear. Kopieer een prompt naar je coding-agent en ga.

Ear

Detect a caller's language and route the voicemail.

Ear

Sort an archive of recordings by spoken language.

EarVoz

Detect the language of a voice note, then transcribe with the right model.

Ear

Pick the dominant language of a recording to route it.

Ear

Detect the language of a voicemail or dictation before transcribing.

Ear

Gate transcription so it only runs on languages you support.

Wat het model doet

  • 99 talen, van Afrikaans tot Yoruba, waaronder de grote Europese, Aziatische en Afrikaanse talen.
  • Kiest de drie vensters van dertig seconden die het meest op spraak lijken in plaats van te lezen op positie, zodat een muziekintro of een stille passage het niet voor de gek houdt. Kiezen op positie vindt de taal in 4% van de gevallen bij een opname van vijf minuten met spraak in een tiende ervan.
  • Geeft de taal terug, een betrouwbaarheid, de gerangschikte kandidaten en een isReliable-vlag. De vlag is false als de bovenste twee te dicht bij elkaar liggen, en false voor Noors, Zweeds en Deens, die het model met elkaar verwart.
  • Al gedecodeerde audio met elke samplerate werkt; een bestands-URL werkt op Apple.
  • De gewichten worden bij het eerste gebruik gedownload en gecachet; het aanmaken doet geen werk en start geen download.

Aan de slag

Voeg gesproken taalherkenning toe aan je iOS or macOS, Android or web-app in een paar regels code. Ear docs.

iOS, macOS
Installeren
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Ear", package: "desert-ant-core")
Voorbeeld - Swift
import Ear

let ear = Ear()   // downloads on first use
let detection = try await ear.identify(contentsOf: url)
detection.language      // "pt"
detection.isReliable    // true
Bouwen met een prompt
Add Ear from Desert Ant Labs to this Swift project (iOS, macOS).

What it does: on-device herkenning van gesproken taal.

SDK:

Swift (iOS, macOS)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Ear", package: "desert-ant-core")

Reference:
- Model page: https://desertant.com/models/ear/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Android
Installeren
// build.gradle.kts (Maven Central)
implementation("ai.desertant:ear:3.1.0")
Voorbeeld - Kotlin
import ai.desertant.ear.Ear

val ear = Ear(context)   // downloads on first use
val detection = ear.identify(samples, 16_000.0)
detection.language      // "pt"
detection.isReliable    // true
ear.close()
Bouwen met een prompt
Add Ear from Desert Ant Labs to this Kotlin project (Android).

What it does: on-device herkenning van gesproken taal.

SDK:

Kotlin (Android)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// build.gradle.kts (Maven Central)
implementation("ai.desertant:ear:3.1.0")

Reference:
- Model page: https://desertant.com/models/ear/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Web, Node.js
Installeren
npm i @desert-ant-labs/ear @litertjs/core   # browser
npm i @desert-ant-labs/ear                  # Node
Voorbeeld - TypeScript
import { Ear } from "@desert-ant-labs/ear";

const ear = await Ear.load();
const detection = await ear.identify(samples, 16000);
detection.language      // "pt"
detection.isReliable    // true
Bouwen met een prompt
Add Ear from Desert Ant Labs to this JavaScript / TypeScript project (Web, Node.js).

What it does: on-device herkenning van gesproken taal.

SDK:

JavaScript / TypeScript (Web, Node.js)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
npm i @desert-ant-labs/ear @litertjs/core   # browser
npm i @desert-ant-labs/ear                  # Node

Reference:
- Model page: https://desertant.com/models/ear/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.

Specs

Talen
99
Invoer
Drie vensters van dertig seconden uit de opname; elke samplerate
Snelheid
Ongeveer 250 ms per identificatie, drie vensters
Platforms
iOS, macOS, tvOS, visionOS (Core ML); Android, Linux, Windows (LiteRT); browser (WebAssembly en LiteRT.js); Node

Ear benoemt de taal; het transcribeert niet. Spraak onder luidere muziek wordt ongeveer zes van de tien keer goed gelezen, en Noors, Zweeds en Deens worden met elkaar verward, dus Ear markeert die bewust als onbetrouwbaar.

Opnames korter dan 30 seconden krijgen één venster en een minder zeker antwoord. Behandel een onbetrouwbaar antwoord als een vraag aan de gebruiker, niet als een instelling voor de transcriber.

FAQ

Wat is Ear?

Herkenning van gesproken taal op het apparaat, in 99 talen, uit een korte flard audio, voordat de transcriptie begint.

Draait Ear op het apparaat?

Ja. Ear draait op het apparaat, zonder serveraanroep, dus de data blijft bij de gebruiker.

Welke platforms ondersteunt Ear?

Ear wordt geleverd als een native on-device SDK voor Swift, Kotlin, JavaScript / TypeScript.

Hoeveel kost Ear?

Elk model is gratis voor maximaal 100k maandelijks actieve apparaten per SDK. Onbeperkte inference per gebruiker. Neem contact op voor aangepaste licenties.

Hoe nauwkeurig of snel is Ear?

Op 162 opnames routeerde 98,5% van de antwoorden die Ear als betrouwbaar markeerde naar de juiste transcriber; bij 12 gewone uploads en 10 als podcast opnieuw opgebouwde opnames was geen enkel zeker antwoord fout.

Bronnen