Who.
谁说了什么封闭测试
设备端说话人标注,把录音切成按人区分的发言段,附人脸框和时间戳,拿来即可剪辑或配字幕。
Who 目前处于封闭测试阶段。 开发中。可申请抢先体验。
一场访谈,拿回来就能剪。
一场两小时、两机位的访谈,回来时已经按说话人分好段。想听某个人说了什么可以直接跳过去,也可以在每次换人时剪一刀。
Who 一边听声音,一边看嘴型,因此人声重叠和短促插话都不会把标注带偏。每一段发言都带有说话人 id、人脸轨迹 id、归一化的人脸边界框和毫秒级时间戳,格式与 Whisper 转写结果一致。
跟随说话人剪辑
每次说话人一换就剪一刀或切一个机位。在出镜人物和多机位视频里,用人脸框决定画面该怎么取景。
带名字的字幕
给与 Whisper 兼容的转写段落附上说话人标签。观众读到的是每句话由谁说出,而不是一整块看不出人的文字。
找出某个人说过的话
在设备上把两小时的录音按人拆成一段段发言。按说话人筛选,直接跳到那一段,不用在时间线上来回拖。
模型能做什么
- 逐段提供:说话人 id、人脸轨迹 id、归一化人脸边界框、毫秒级时间戳。
- 与 Whisper 兼容的对话段,适配字幕流水线。
- 同时用画面和音频,而不是只用音频。
规格
- 平台
- 先支持 Apple(Swift)
常见问题
Who 是什么?
设备端说话人标注,把录音切成按人区分的发言段,附人脸框和时间戳,拿来即可剪辑或配字幕。
Who 在设备上运行吗?
是的。Who 在设备上运行,不调用任何服务器,因此数据始终留在用户手中。
Who 现在可用了吗?
Who 目前处于封闭测试阶段。可在本页申请抢先体验。
Who 的价格是多少?
每个模型的每个 SDK 均可免费支持最多 10 万台月活跃设备。每位用户调用模型的次数不设上限。 如需定制授权,请联系我们。
抢先体验
告诉我们你正在开发什么,我们会帮你把一切准备就绪。