Ear.
On-Device-Erkennung der gesprochenen Sprache in 99 Sprachen, aus einem kurzen Audioausschnitt, noch bevor die Transkription startet.
Sprache anhand von 30 Sekunden Audio bestimmen.
Eine Sprachnotiz kommt herein, und der Transkribierer ist auf Englisch eingestellt. Nach 30 Sekunden sagt Ear Portugiesisch, und als Nächstes läuft der portugiesische Transkribierer statt eines englischen, der selbstbewusst Unsinn zurückgibt.
Ear hört nicht die ganze Datei ab. Ear findet die drei dreißigsekündigen Abschnitte, die am meisten nach Sprache klingen, überspringt den Jingle und die Stille und benennt die Sprache in 250 ms. Die Antwort kommt mit einer Konfidenz und einem Flag, das sagt, ob man ihr trauen kann.
Wenn die beiden besten Kandidaten zu dicht beieinanderliegen, um sie zu trennen, sagt Ear das. Sie fragen den Nutzer oder greifen auf ein allgemeines Modell zurück, statt in der falschen Sprache zu transkribieren. Ein SDK, jede Plattform: Swift auf Apple, Kotlin auf Android, JavaScript im Browser und Node. Es wird nichts hochgeladen.
Der richtige Transkribierer, in 98,5 % der Fälle.
Bei 162 Aufnahmen leiteten 98,5 % der von Ear als zuverlässig markierten Antworten zum richtigen Transkribierer; bei 12 gewöhnlichen Uploads und 10 als Podcasts nachgebauten war keine sichere Antwort falsch.
End-to-End durch das SDK gemessen und auf der Modellkarte veröffentlicht. Sprache, die unter lautere Musik gemischt ist, wird etwa in 60 % der Fälle richtig gelesen.
Zuerst den richtigen Transkribierer wählen
Ein Transkribierer, der auf die falsche Sprache eingestellt ist, gibt selbstbewusst Unsinn zurück. Lassen Sie in einem Meeting-Recorder oder einer Sprachnotiz-App Ear auf den ersten 30 Sekunden laufen und starten Sie Transkribierer, Untertitel und Übersetzung in der tatsächlich gesprochenen Sprache.
Ein Archiv von Aufnahmen sortieren
Lassen Sie Ear über Nacht in einem Node-Skript oder einer Mac-App über eine Bibliothek aus Sprachnotizen, Anrufen oder Episoden laufen, und bis zum Morgen hat jede Datei ihre Sprache. Es wird nichts hochgeladen und nichts pro Datei abgerechnet.
Einen Anruf oder eine Voicemail weiterleiten
Benennen Sie in einer Support-App oder einem Messaging-Produkt die Sprache eines eingehenden Anrufs oder einer Voicemail, bevor sie eine Person erreicht. Der Anruf landet bei jemandem, der sie spricht, oder beim richtigen Sprachmodell.
Untertiteln im Browser
Ein Web-Videotool erkennt die gesprochene Sprache clientseitig, mit demselben SDK im Browser und in Node, und wählt die Untertitelsprache, damit der Uploader es nie tun muss.
Inspiration
Ideen zum Bauen mit Ear. Kopieren Sie einen Prompt in Ihren Coding-Agenten und los.
Detect a caller's language and route the voicemail.
In a voicemail or call app, run Desert Ant's Ear on the first ~30 seconds of audio to identify the spoken language on-device, then route the message. For a very short voicemail, accumulate audio first, and treat a low-reliability answer as unknown and ask. Build it with the Desert Ant SDK. Ear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/ear/. Install: SwiftPM desert-ant-core; Maven ai.desertant:ear:3.1.0; npm i @desert-ant-labs/ear @litertjs/core # browser. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Sort an archive of recordings by spoken language.
Build a batch tool that runs Desert Ant's Ear over a folder of recordings to tag each by spoken language, so a mixed archive sorts itself. On-device. Build it with the Desert Ant SDK. Ear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/ear/. Install: SwiftPM desert-ant-core; Maven ai.desertant:ear:3.1.0; npm i @desert-ant-labs/ear @litertjs/core # browser. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Detect the language of a voice note, then transcribe with the right model.
Before transcribing, run Desert Ant's Ear on the first ~30 seconds to identify the spoken language on-device, then run Voz. Handle low confidence by asking the user instead of guessing. Build it with the Desert Ant SDK. Ear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/ear/. Voz (Swift). Install and API: https://desertant.com/docs/voz/. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Pick the dominant language of a recording to route it.
Use Desert Ant's Ear on-device to identify the dominant spoken language of a recording (from its most speech-like 30-second windows) and route it to the right transcriber or team. Build it with the Desert Ant SDK. Ear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/ear/. Install: SwiftPM desert-ant-core; Maven ai.desertant:ear:3.1.0; npm i @desert-ant-labs/ear @litertjs/core # browser. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Detect the language of a voicemail or dictation before transcribing.
Run Desert Ant's Ear on the first ~30 seconds of a voicemail or dictation on-device to identify the language, then pick the right transcriber. Ear needs about 30 seconds, so accumulate audio before deciding on very short clips. Build it with the Desert Ant SDK. Ear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/ear/. Install: SwiftPM desert-ant-core; Maven ai.desertant:ear:3.1.0; npm i @desert-ant-labs/ear @litertjs/core # browser. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Gate transcription so it only runs on languages you support.
Use Desert Ant's Ear to detect the spoken language on-device and skip or reroute recordings in languages your transcriber does not support. Build it with the Desert Ant SDK. Ear (Swift, Kotlin, JavaScript / TypeScript). Install and API: https://desertant.com/docs/ear/. Install: SwiftPM desert-ant-core; Maven ai.desertant:ear:3.1.0; npm i @desert-ant-labs/ear @litertjs/core # browser. SDK source: https://github.com/Desert-Ant-Labs/desert-ant-core. Machine-readable catalog of every model and SDK: https://desertant.com/llms.txt.
Was das Modell macht
- 99 Sprachen, von Afrikaans bis Yoruba, darunter die wichtigsten europäischen, asiatischen und afrikanischen Sprachen.
- Wählt die drei dreißigsekündigen Fenster, die am meisten nach Sprache klingen, statt nach Position zu lesen, sodass ein Musik-Intro oder ein stiller Abschnitt es nicht täuscht. Die Wahl nach Position findet die Sprache in 4 % der Fälle bei einer fünfminütigen Aufnahme, in der nur ein Zehntel Sprache ist.
- Gibt die Sprache, eine Konfidenz, die gerankten Kandidaten und ein
isReliable-Flag zurück. Das Flag ist false, wenn die beiden besten zu dicht beieinanderliegen, und false für Norwegisch, Schwedisch und Dänisch, die das Modell miteinander verwechselt. - Bereits dekodiertes Audio in beliebiger Abtastrate funktioniert; eine Datei-URL funktioniert auf Apple.
- Die Gewichte werden bei der ersten Nutzung geladen und im Cache gehalten; die Konstruktion tut nichts und startet keinen Download.
Erste Schritte
Fügen Sie erkennung der gesprochenen sprache mit wenigen Zeilen Code zu Ihrer iOS or macOS, Android or web-App hinzu. Ear Docs.
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Ear", package: "desert-ant-core")
import Ear
let ear = Ear() // downloads on first use
let detection = try await ear.identify(contentsOf: url)
detection.language // "pt"
detection.isReliable // true
Add Ear from Desert Ant Labs to this Swift project (iOS, macOS). What it does: On-Device-Erkennung der gesprochenen Sprache. SDK: Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0") // target dependency .product(name: "Ear", package: "desert-ant-core") Reference: - Model page: https://desertant.com/models/ear/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
// build.gradle.kts (Maven Central)
implementation("ai.desertant:ear:3.1.0")
import ai.desertant.ear.Ear
val ear = Ear(context) // downloads on first use
val detection = ear.identify(samples, 16_000.0)
detection.language // "pt"
detection.isReliable // true
ear.close()
Add Ear from Desert Ant Labs to this Kotlin project (Android).
What it does: On-Device-Erkennung der gesprochenen Sprache.
SDK:
Kotlin (Android)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// build.gradle.kts (Maven Central)
implementation("ai.desertant:ear:3.1.0")
Reference:
- Model page: https://desertant.com/models/ear/
- Full catalog and other models: https://desertant.com/llms.txt
Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
npm i @desert-ant-labs/ear @litertjs/core # browser
npm i @desert-ant-labs/ear # Node
import { Ear } from "@desert-ant-labs/ear";
const ear = await Ear.load();
const detection = await ear.identify(samples, 16000);
detection.language // "pt"
detection.isReliable // true
Add Ear from Desert Ant Labs to this JavaScript / TypeScript project (Web, Node.js). What it does: On-Device-Erkennung der gesprochenen Sprache. SDK: JavaScript / TypeScript (Web, Node.js) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme npm i @desert-ant-labs/ear @litertjs/core # browser npm i @desert-ant-labs/ear # Node Reference: - Model page: https://desertant.com/models/ear/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Technische Daten
- Sprachen
- 99
- Eingabe
- Drei dreißigsekündige Fenster der Aufnahme; beliebige Abtastrate
- Geschwindigkeit
- Etwa 250 ms pro Erkennung, drei Fenster
- Plattformen
- iOS, macOS, tvOS, visionOS (Core ML); Android, Linux, Windows (LiteRT); Browser (WebAssembly und LiteRT.js); Node
Ear benennt die Sprache; es transkribiert nicht. Sprache unter lauterer Musik wird etwa sechs von zehn Mal richtig gelesen, und Norwegisch, Schwedisch und Dänisch werden miteinander verwechselt, deshalb markiert Ear diese von vornherein als unzuverlässig.
Aufnahmen unter 30 Sekunden bekommen ein Fenster und eine weniger sichere Antwort. Behandeln Sie eine unzuverlässige Antwort als Frage an den Nutzer, nicht als Einstellung des Transkribierers.
FAQ
Was ist Ear?
On-Device-Erkennung der gesprochenen Sprache in 99 Sprachen, aus einem kurzen Audioausschnitt, noch bevor die Transkription startet.
Läuft Ear auf dem Gerät?
Ja. Ear läuft auf dem Gerät, ohne Serveraufruf, sodass die Daten beim Nutzer bleiben.
Welche Plattformen unterstützt Ear?
Ear wird als natives On-Device-SDK für Swift, Kotlin, JavaScript / TypeScript ausgeliefert.
Was kostet Ear?
Jedes Modell ist kostenlos für bis zu 100k monatlich aktive Geräte pro SDK. Unbegrenzte Inferenz pro Nutzer. Kontaktieren Sie uns für individuelle Lizenzen.
Wie genau oder schnell ist Ear?
Bei 162 Aufnahmen leiteten 98,5 % der von Ear als zuverlässig markierten Antworten zum richtigen Transkribierer; bei 12 gewöhnlichen Uploads und 10 als Podcasts nachgebauten war keine sichere Antwort falsch.