设备端音频模型
设备端语音小模型:录音棚音质、删除语气词、判定语种、区分说话人。全程不上传。
每个音频模型都运行在手机里已有的芯片上,因此一段五分钟的录音几秒钟就能处理完,音频从不离开设备。没有按分钟的账单,不上传,也不排队。
可用模型
Clear语音增强
设备端语音增强,让你的录音获得播客录音棚那种温暖、近距离拾音的声音,无需上传。
Uhm语气词检测
设备端语气词检测,以 20 毫秒精度标出每一个「嗯」「呃」:一小时音频十二秒处理完。
Align逐词时间戳
设备端逐词时间戳,适配任意转写器,误差减半,可精准剪辑、打轴和逐词高亮,模型仅 0.7 MB。
Clips片段挑选
设备端片段挑选:根据转写文本,把长录音变成按精彩程度排序的短片和高光,运行在 iPhone 或 Mac 上。
Ear口语语种检测
设备端口语语种识别,在转写开始前,凭一小段音频判定所说语言,覆盖 99 种语言。
Voz语音识别
设备端语音转文字:在 iPhone 上 2 秒转写 10 分钟音频,比 Whisper 快 4.7 倍,逐词时间戳精准。
即将上线
价格
每个模型的每个 SDK 均可免费支持最多 10 万台月活跃设备。每位用户调用模型的次数不设上限。