Desert Ant Labs

Who.

谁说了什么封闭测试

设备端说话人标注,把录音切成按人区分的发言段,附人脸框和时间戳,拿来即可剪辑或配字幕。

Who 目前处于封闭测试阶段。 开发中。可申请抢先体验。

一场访谈,拿回来就能剪。

一场两小时、两机位的访谈,回来时已经按说话人分好段。想听某个人说了什么可以直接跳过去,也可以在每次换人时剪一刀。

Who 一边听声音,一边看嘴型,因此人声重叠和短促插话都不会把标注带偏。每一段发言都带有说话人 id、人脸轨迹 id、归一化的人脸边界框和毫秒级时间戳,格式与 Whisper 转写结果一致。

跟随说话人剪辑

每次说话人一换就剪一刀或切一个机位。在出镜人物和多机位视频里,用人脸框决定画面该怎么取景。

带名字的字幕

给与 Whisper 兼容的转写段落附上说话人标签。观众读到的是每句话由谁说出,而不是一整块看不出人的文字。

找出某个人说过的话

在设备上把两小时的录音按人拆成一段段发言。按说话人筛选,直接跳到那一段,不用在时间线上来回拖。

模型能做什么

  • 逐段提供:说话人 id、人脸轨迹 id、归一化人脸边界框、毫秒级时间戳。
  • 与 Whisper 兼容的对话段,适配字幕流水线。
  • 同时用画面和音频,而不是只用音频。

规格

平台
先支持 Apple(Swift)

常见问题

Who 是什么?

设备端说话人标注,把录音切成按人区分的发言段,附人脸框和时间戳,拿来即可剪辑或配字幕。

Who 在设备上运行吗?

是的。Who 在设备上运行,不调用任何服务器,因此数据始终留在用户手中。

Who 现在可用了吗?

Who 目前处于封闭测试阶段。可在本页申请抢先体验。

Who 的价格是多少?

每个模型的每个 SDK 均可免费支持最多 10 万台月活跃设备。每位用户调用模型的次数不设上限。 如需定制授权,请联系我们

抢先体验

告诉我们你正在开发什么,我们会帮你把一切准备就绪。