On-Device-Audiomodelle
Kleine Modelle für Sprache, auf dem Gerät: Studiosound, herausgeschnittene Füllwörter, die benannte Sprache, wer was gesagt hat. Nichts wird hochgeladen.
Jedes Audiomodell läuft auf dem Chip, der schon im Telefon steckt, sodass eine fünfminütige Aufnahme in Sekunden fertig ist und das Audio das Gerät nie verlässt. Keine Abrechnung pro Minute, kein Upload, keine Warteschlange.
Verfügbare Modelle
On-Device-Sprachaufbereitung, die Ihrer Aufnahme den warmen, nah mikrofonierten Klang eines Podcast-Studios gibt, komplett auf dem Gerät.
On-Device-Füllworterkennung, die jedes äh, ähm und hmm auf 20 ms genau markiert, eine Stunde Audio in 12 s.
Wort-Zeitstempel auf dem Gerät, für jeden Transkribierer. Schneiden, untertiteln und hervorheben auf das Wort genau, bei halber Fehlerrate, aus 0,7 MB.
Ein schnelles Modell zur Clip-Auswahl, das eine lange Aufnahme aus dem Transkript in gerankte Shorts und Highlights verwandelt. Auf dem Gerät, iPhone oder Mac.
On-Device-Erkennung der gesprochenen Sprache in 99 Sprachen, aus einem kurzen Audioausschnitt, noch bevor die Transkription startet.
10 Minuten Audio in 2 s auf einem iPhone transkribieren, 4,7x schneller als Whisper, mit genauen Wort-Zeitstempeln.
Bald verfügbar
Preise
Jedes Modell ist kostenlos für bis zu 100k monatlich aktive Geräte pro SDK. Unbegrenzte Inferenz pro Nutzer.