Who.
Sprecherzuordnung auf dem Gerät, die eine Aufnahme in Sprecherabschnitte mit Gesichtsboxen und Zeitstempeln zerlegt, fertig zum Schneiden oder Untertiteln.
Kennzeichnen, wer was gesagt hat, in Audio und Video.
Nehmen Sie ein zweistündiges Interview mit zwei Kameras auf, und Who teilt es nach Sprecher auf, sodass Sie zu dem springen, was eine Person gesagt hat, oder bei jedem Sprecherwechsel schneiden.
Who hört zu und sieht gleichzeitig auf die Münder, sodass Überlappungen und kurze Zwischenrufe die Zuordnungen nicht durcheinanderbringen. Jeder Redebeitrag trägt eine Sprecher-ID, eine Gesichtsspur-ID, eine normalisierte Gesichts-Bounding-Box und Zeitstempel im Millisekundenbereich, in derselben Form, die ein Whisper-Transkript verwendet.
Schnitt, der dem Sprecher folgt
Schneiden oder wechseln Sie die Kamera bei jedem Sprecherwechsel. Nutzen Sie die Gesichtsbox, um den Bildausschnitt in Talking-Head- und Multicam-Videos zu setzen.
Untertitel mit Namen
Versehen Sie die Redebeiträge in einem Whisper-kompatiblen Transkript mit Sprecherlabels. Ein Zuschauer liest, wer welche Zeile gesagt hat, statt eines anonymen Textblocks.
Finden, was eine Person gesagt hat
Zerlegen Sie eine zweistündige Aufnahme auf dem Gerät in Redebeiträge pro Person. Filtern Sie nach Sprecher und springen Sie direkt zum Beitrag, statt die Timeline abzusuchen.
Was das Modell macht
- Pro Redebeitrag: Sprecher-ID, Gesichtsspur-ID, normalisierte Gesichts-Bounding-Box, Zeitstempel im Millisekundenbereich.
- Whisper-kompatible Redebeiträge für Untertitelungs-Pipelines.
- Nutzt das Bild zusätzlich zum Ton, nicht nur den Ton.
Technische Daten
- Plattformen
- Apple (Swift) zuerst
FAQ
Was ist Who?
Sprecherzuordnung auf dem Gerät, die eine Aufnahme in Sprecherabschnitte mit Gesichtsboxen und Zeitstempeln zerlegt, fertig zum Schneiden oder Untertiteln.
Läuft Who auf dem Gerät?
Ja. Who läuft auf dem Gerät, ohne Serveraufruf, sodass die Daten beim Nutzer bleiben.
Ist Who schon verfügbar?
Who befindet sich in einer geschlossenen Beta. Fordern Sie auf dieser Seite frühen Zugang an.
Was kostet Who?
Jedes Modell ist kostenlos für bis zu 100k monatlich aktive Geräte pro SDK. Unbegrenzte Inferenz pro Nutzer. Kontaktieren Sie uns für individuelle Lizenzen.
Früher Zugang
Sagen Sie uns, was Sie entwickeln, und wir richten Ihnen alles ein.