Desert Ant Labs

Ear.

Erkennung der gesprochenen SpracheVerfügbar

On-Device-Erkennung der gesprochenen Sprache in 99 Sprachen, aus einem kurzen Audioausschnitt, noch bevor die Transkription startet.

Sprache anhand von 30 Sekunden Audio bestimmen.

Eine Sprachnotiz kommt herein, und der Transkribierer ist auf Englisch eingestellt. Nach 30 Sekunden sagt Ear Portugiesisch, und als Nächstes läuft der portugiesische Transkribierer statt eines englischen, der selbstbewusst Unsinn zurückgibt.

Ear hört nicht die ganze Datei ab. Ear findet die drei dreißigsekündigen Abschnitte, die am meisten nach Sprache klingen, überspringt den Jingle und die Stille und benennt die Sprache in 250 ms. Die Antwort kommt mit einer Konfidenz und einem Flag, das sagt, ob man ihr trauen kann.

Wenn die beiden besten Kandidaten zu dicht beieinanderliegen, um sie zu trennen, sagt Ear das. Sie fragen den Nutzer oder greifen auf ein allgemeines Modell zurück, statt in der falschen Sprache zu transkribieren. Ein SDK, jede Plattform: Swift auf Apple, Kotlin auf Android, JavaScript im Browser und Node. Es wird nichts hochgeladen.

Der richtige Transkribierer, in 98,5 % der Fälle.

Bei 162 Aufnahmen leiteten 98,5 % der von Ear als zuverlässig markierten Antworten zum richtigen Transkribierer; bei 12 gewöhnlichen Uploads und 10 als Podcasts nachgebauten war keine sichere Antwort falsch.

98,5 %
Richtig weitergeleitet
Antworten über dem Zuverlässigkeits-Schwellenwert, 162 Aufnahmen
99
Sprachen
250 ms
Pro Erkennung
drei dreißigsekündige Fenster

End-to-End durch das SDK gemessen und auf der Modellkarte veröffentlicht. Sprache, die unter lautere Musik gemischt ist, wird etwa in 60 % der Fälle richtig gelesen.

Zuerst den richtigen Transkribierer wählen

Ein Transkribierer, der auf die falsche Sprache eingestellt ist, gibt selbstbewusst Unsinn zurück. Lassen Sie in einem Meeting-Recorder oder einer Sprachnotiz-App Ear auf den ersten 30 Sekunden laufen und starten Sie Transkribierer, Untertitel und Übersetzung in der tatsächlich gesprochenen Sprache.

Ein Archiv von Aufnahmen sortieren

Lassen Sie Ear über Nacht in einem Node-Skript oder einer Mac-App über eine Bibliothek aus Sprachnotizen, Anrufen oder Episoden laufen, und bis zum Morgen hat jede Datei ihre Sprache. Es wird nichts hochgeladen und nichts pro Datei abgerechnet.

Einen Anruf oder eine Voicemail weiterleiten

Benennen Sie in einer Support-App oder einem Messaging-Produkt die Sprache eines eingehenden Anrufs oder einer Voicemail, bevor sie eine Person erreicht. Der Anruf landet bei jemandem, der sie spricht, oder beim richtigen Sprachmodell.

Untertiteln im Browser

Ein Web-Videotool erkennt die gesprochene Sprache clientseitig, mit demselben SDK im Browser und in Node, und wählt die Untertitelsprache, damit der Uploader es nie tun muss.

Inspiration

Ideen zum Bauen mit Ear. Kopieren Sie einen Prompt in Ihren Coding-Agenten und los.

Ear

Detect a caller's language and route the voicemail.

Ear

Sort an archive of recordings by spoken language.

EarVoz

Detect the language of a voice note, then transcribe with the right model.

Ear

Pick the dominant language of a recording to route it.

Ear

Detect the language of a voicemail or dictation before transcribing.

Ear

Gate transcription so it only runs on languages you support.

Was das Modell macht

  • 99 Sprachen, von Afrikaans bis Yoruba, darunter die wichtigsten europäischen, asiatischen und afrikanischen Sprachen.
  • Wählt die drei dreißigsekündigen Fenster, die am meisten nach Sprache klingen, statt nach Position zu lesen, sodass ein Musik-Intro oder ein stiller Abschnitt es nicht täuscht. Die Wahl nach Position findet die Sprache in 4 % der Fälle bei einer fünfminütigen Aufnahme, in der nur ein Zehntel Sprache ist.
  • Gibt die Sprache, eine Konfidenz, die gerankten Kandidaten und ein isReliable-Flag zurück. Das Flag ist false, wenn die beiden besten zu dicht beieinanderliegen, und false für Norwegisch, Schwedisch und Dänisch, die das Modell miteinander verwechselt.
  • Bereits dekodiertes Audio in beliebiger Abtastrate funktioniert; eine Datei-URL funktioniert auf Apple.
  • Die Gewichte werden bei der ersten Nutzung geladen und im Cache gehalten; die Konstruktion tut nichts und startet keinen Download.

Erste Schritte

Fügen Sie erkennung der gesprochenen sprache mit wenigen Zeilen Code zu Ihrer iOS or macOS, Android or web-App hinzu. Ear Docs.

iOS, macOS
Installation
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Ear", package: "desert-ant-core")
Beispiel - Swift
import Ear

let ear = Ear()   // downloads on first use
let detection = try await ear.identify(contentsOf: url)
detection.language      // "pt"
detection.isReliable    // true
Mit einem Prompt bauen
Add Ear from Desert Ant Labs to this Swift project (iOS, macOS).

What it does: On-Device-Erkennung der gesprochenen Sprache.

SDK:

Swift (iOS, macOS)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.1.0")
// target dependency
.product(name: "Ear", package: "desert-ant-core")

Reference:
- Model page: https://desertant.com/models/ear/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Android
Installation
// build.gradle.kts (Maven Central)
implementation("ai.desertant:ear:3.1.0")
Beispiel - Kotlin
import ai.desertant.ear.Ear

val ear = Ear(context)   // downloads on first use
val detection = ear.identify(samples, 16_000.0)
detection.language      // "pt"
detection.isReliable    // true
ear.close()
Mit einem Prompt bauen
Add Ear from Desert Ant Labs to this Kotlin project (Android).

What it does: On-Device-Erkennung der gesprochenen Sprache.

SDK:

Kotlin (Android)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// build.gradle.kts (Maven Central)
implementation("ai.desertant:ear:3.1.0")

Reference:
- Model page: https://desertant.com/models/ear/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Web, Node.js
Installation
npm i @desert-ant-labs/ear @litertjs/core   # browser
npm i @desert-ant-labs/ear                  # Node
Beispiel - TypeScript
import { Ear } from "@desert-ant-labs/ear";

const ear = await Ear.load();
const detection = await ear.identify(samples, 16000);
detection.language      // "pt"
detection.isReliable    // true
Mit einem Prompt bauen
Add Ear from Desert Ant Labs to this JavaScript / TypeScript project (Web, Node.js).

What it does: On-Device-Erkennung der gesprochenen Sprache.

SDK:

JavaScript / TypeScript (Web, Node.js)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
npm i @desert-ant-labs/ear @litertjs/core   # browser
npm i @desert-ant-labs/ear                  # Node

Reference:
- Model page: https://desertant.com/models/ear/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.

Technische Daten

Sprachen
99
Eingabe
Drei dreißigsekündige Fenster der Aufnahme; beliebige Abtastrate
Geschwindigkeit
Etwa 250 ms pro Erkennung, drei Fenster
Plattformen
iOS, macOS, tvOS, visionOS (Core ML); Android, Linux, Windows (LiteRT); Browser (WebAssembly und LiteRT.js); Node

Ear benennt die Sprache; es transkribiert nicht. Sprache unter lauterer Musik wird etwa sechs von zehn Mal richtig gelesen, und Norwegisch, Schwedisch und Dänisch werden miteinander verwechselt, deshalb markiert Ear diese von vornherein als unzuverlässig.

Aufnahmen unter 30 Sekunden bekommen ein Fenster und eine weniger sichere Antwort. Behandeln Sie eine unzuverlässige Antwort als Frage an den Nutzer, nicht als Einstellung des Transkribierers.

FAQ

Was ist Ear?

On-Device-Erkennung der gesprochenen Sprache in 99 Sprachen, aus einem kurzen Audioausschnitt, noch bevor die Transkription startet.

Läuft Ear auf dem Gerät?

Ja. Ear läuft auf dem Gerät, ohne Serveraufruf, sodass die Daten beim Nutzer bleiben.

Welche Plattformen unterstützt Ear?

Ear wird als natives On-Device-SDK für Swift, Kotlin, JavaScript / TypeScript ausgeliefert.

Was kostet Ear?

Jedes Modell ist kostenlos für bis zu 100k monatlich aktive Geräte pro SDK. Unbegrenzte Inferenz pro Nutzer. Kontaktieren Sie uns für individuelle Lizenzen.

Wie genau oder schnell ist Ear?

Bei 162 Aufnahmen leiteten 98,5 % der von Ear als zuverlässig markierten Antworten zum richtigen Transkribierer; bei 12 gewöhnlichen Uploads und 10 als Podcasts nachgebauten war keine sichere Antwort falsch.

Ressourcen