Ear.
Herkenning van gesproken taal op het apparaat, in 99 talen, uit een korte flard audio, voordat de transcriptie begint.
Herken de taal op basis van 30 seconden audio.
Er komt een spraaknotitie binnen en de transcriber staat op Engels. Na 30 seconden zegt Ear Portugees, en de transcriber die daarna draait is de Portugese in plaats van een Engelse die met stelligheid onzin teruggeeft.
Ear luistert niet naar het hele bestand. Ear vindt de drie stukken van dertig seconden die het meest op spraak lijken, slaat de jingle en de stilte over, en benoemt de taal in 250 ms. Het antwoord komt met een betrouwbaarheid en een vlag die zegt of je het kunt vertrouwen.
Als de bovenste twee kandidaten te dicht bij elkaar liggen om te scheiden, zegt Ear dat. Je vraagt het aan de gebruiker of valt terug op een algemeen model in plaats van in de verkeerde taal te transcriberen. Eén SDK, elk platform: Swift op Apple, Kotlin op Android, JavaScript in de browser en Node. Er wordt niets geüpload.
De juiste transcriber, in 98,5% van de gevallen.
Op 162 opnames routeerde 98,5% van de antwoorden die Ear als betrouwbaar markeerde naar de juiste transcriber; bij 12 gewone uploads en 10 als podcast opnieuw opgebouwde opnames was geen enkel zeker antwoord fout.
End-to-end gemeten via de SDK en gepubliceerd op de model card. Spraak die onder luidere muziek is gemengd, wordt ongeveer 60% van de tijd goed gelezen.
Kies eerst de juiste transcriber
Een transcriber die op de verkeerde taal staat, geeft met stelligheid onzin terug. Draai Ear in een vergaderrecorder of een spraaknotitie-app op de eerste 30 seconden en start de transcriber, de ondertitels en de vertaling in de taal die daadwerkelijk wordt gesproken.
Een archief met opnames sorteren
Draai Ear 's nachts over een bibliotheek met spraaknotities, gesprekken of afleveringen in een Node-script of een Mac-app, en elk bestand heeft 's ochtends zijn taal. Er wordt niets geüpload en niets per bestand afgerekend.
Een gesprek of voicemail routeren
Benoem in een support-app of een berichtenproduct de taal van een binnenkomend gesprek of een voicemail voordat het een persoon bereikt. Het gesprek komt terecht bij iemand die de taal spreekt, of bij het juiste spraakmodel.
Ondertitelen in de browser
Een webvideotool herkent de gesproken taal client-side, met dezelfde SDK in de browser en in Node, en kiest de ondertiteltaal, zodat de uploader dat nooit hoeft.
Inspiratie
Ideeën om te bouwen met Ear. Kopieer een prompt naar je coding-agent en ga.
Detect a caller's language and route the voicemail.
In a voicemail or call app, run Desert Ant's Ear on the first ~30 seconds of audio to identify the spoken language on-device, then route the message. For a very short voicemail, accumulate audio first, and treat a low-reliability answer as unknown and ask. Build it with the Desert Ant SDK. Ear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/ear/. Install: SwiftPM desert-ant-core; Maven ai.desertant:ear:3.1.0; npm i @desert-ant-labs/ear @litertjs/core # browser. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Sort an archive of recordings by spoken language.
Build a batch tool that runs Desert Ant's Ear over a folder of recordings to tag each by spoken language, so a mixed archive sorts itself. On-device. Build it with the Desert Ant SDK. Ear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/ear/. Install: SwiftPM desert-ant-core; Maven ai.desertant:ear:3.1.0; npm i @desert-ant-labs/ear @litertjs/core # browser. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Detect the language of a voice note, then transcribe with the right model.
Before transcribing, run Desert Ant's Ear on the first ~30 seconds to identify the spoken language on-device, then run Voz. Handle low confidence by asking the user instead of guessing. Build it with the Desert Ant SDK. Ear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/ear/. Voz (Swift). Install and API: https://desertant.com/docs/voz/. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Pick the dominant language of a recording to route it.
Use Desert Ant's Ear on-device to identify the dominant spoken language of a recording (from its most speech-like 30-second windows) and route it to the right transcriber or team. Build it with the Desert Ant SDK. Ear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/ear/. Install: SwiftPM desert-ant-core; Maven ai.desertant:ear:3.1.0; npm i @desert-ant-labs/ear @litertjs/core # browser. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Detect the language of a voicemail or dictation before transcribing.
Run Desert Ant's Ear on the first ~30 seconds of a voicemail or dictation on-device to identify the language, then pick the right transcriber. Ear needs about 30 seconds, so accumulate audio before deciding on very short clips. Build it with the Desert Ant SDK. Ear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/ear/. Install: SwiftPM desert-ant-core; Maven ai.desertant:ear:3.1.0; npm i @desert-ant-labs/ear @litertjs/core # browser. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Gate transcription so it only runs on languages you support.
Use Desert Ant's Ear to detect the spoken language on-device and skip or reroute recordings in languages your transcriber does not support. Build it with the Desert Ant SDK. Ear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/ear/. Install: SwiftPM desert-ant-core; Maven ai.desertant:ear:3.1.0; npm i @desert-ant-labs/ear @litertjs/core # browser. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Wat het model doet
- 99 talen, van Afrikaans tot Yoruba, waaronder de grote Europese, Aziatische en Afrikaanse talen.
- Kiest de drie vensters van dertig seconden die het meest op spraak lijken in plaats van te lezen op positie, zodat een muziekintro of een stille passage het niet voor de gek houdt. Kiezen op positie vindt de taal in 4% van de gevallen bij een opname van vijf minuten met spraak in een tiende ervan.
- Geeft de taal terug, een betrouwbaarheid, de gerangschikte kandidaten en een
isReliable-vlag. De vlag is false als de bovenste twee te dicht bij elkaar liggen, en false voor Noors, Zweeds en Deens, die het model met elkaar verwart. - Al gedecodeerde audio met elke samplerate werkt; een bestands-URL werkt op Apple.
- De gewichten worden bij het eerste gebruik gedownload en gecachet; het aanmaken doet geen werk en start geen download.
Aan de slag
Voeg gesproken taalherkenning toe aan je iOS or macOS, Android or web-app in een paar regels code. Ear docs.
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Ear", package: "desert-ant-core")
import Ear
let ear = Ear() // downloads on first use
let detection = try await ear.identify(contentsOf: url)
detection.language // "pt"
detection.isReliable // true
Add Ear from Desert Ant Labs to this Swift project (iOS, macOS). What it does: on-device herkenning van gesproken taal. SDK: Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0") // target dependency .product(name: "Ear", package: "desert-ant-core") Reference: - Model page: https://desertant.com/models/ear/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
// build.gradle.kts (Maven Central)
implementation("ai.desertant:ear:3.1.0")
import ai.desertant.ear.Ear
val ear = Ear(context) // downloads on first use
val detection = ear.identify(samples, 16_000.0)
detection.language // "pt"
detection.isReliable // true
ear.close()
Add Ear from Desert Ant Labs to this Kotlin project (Android).
What it does: on-device herkenning van gesproken taal.
SDK:
Kotlin (Android)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// build.gradle.kts (Maven Central)
implementation("ai.desertant:ear:3.1.0")
Reference:
- Model page: https://desertant.com/models/ear/
- Full catalog and other models: https://desertant.com/llms.txt
Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
npm i @desert-ant-labs/ear @litertjs/core # browser
npm i @desert-ant-labs/ear # Node
import { Ear } from "@desert-ant-labs/ear";
const ear = await Ear.load();
const detection = await ear.identify(samples, 16000);
detection.language // "pt"
detection.isReliable // true
Add Ear from Desert Ant Labs to this JavaScript / TypeScript project (Web, Node.js). What it does: on-device herkenning van gesproken taal. SDK: JavaScript / TypeScript (Web, Node.js) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme npm i @desert-ant-labs/ear @litertjs/core # browser npm i @desert-ant-labs/ear # Node Reference: - Model page: https://desertant.com/models/ear/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Specs
- Talen
- 99
- Invoer
- Drie vensters van dertig seconden uit de opname; elke samplerate
- Snelheid
- Ongeveer 250 ms per identificatie, drie vensters
- Platforms
- iOS, macOS, tvOS, visionOS (Core ML); Android, Linux, Windows (LiteRT); browser (WebAssembly en LiteRT.js); Node
Ear benoemt de taal; het transcribeert niet. Spraak onder luidere muziek wordt ongeveer zes van de tien keer goed gelezen, en Noors, Zweeds en Deens worden met elkaar verward, dus Ear markeert die bewust als onbetrouwbaar.
Opnames korter dan 30 seconden krijgen één venster en een minder zeker antwoord. Behandel een onbetrouwbaar antwoord als een vraag aan de gebruiker, niet als een instelling voor de transcriber.
FAQ
Wat is Ear?
Herkenning van gesproken taal op het apparaat, in 99 talen, uit een korte flard audio, voordat de transcriptie begint.
Draait Ear op het apparaat?
Ja. Ear draait op het apparaat, zonder serveraanroep, dus de data blijft bij de gebruiker.
Welke platforms ondersteunt Ear?
Ear wordt geleverd als een native on-device SDK voor Swift, Kotlin, JavaScript / TypeScript.
Hoeveel kost Ear?
Elk model is gratis voor maximaal 100k maandelijks actieve apparaten per SDK. Onbeperkte inference per gebruiker. Neem contact op voor aangepaste licenties.
Hoe nauwkeurig of snel is Ear?
Op 162 opnames routeerde 98,5% van de antwoorden die Ear als betrouwbaar markeerde naar de juiste transcriber; bij 12 gewone uploads en 10 als podcast opnieuw opgebouwde opnames was geen enkel zeker antwoord fout.