Desert Ant Labs

Toxic

仇恨言论初筛封闭测试

设备端内容审核,在消息发送前标记 23 种欧洲语言中的仇恨、辱骂和威胁文本。

Toxic 目前处于封闭测试阶段。 模型卡与权重已公开。可申请抢先体验。

仇恨言论,发出去之前就拦下。

Toxic 把三样东西分开打分,产品因此可以区别对待。仇恨言论,指公开煽动针对受保护群体的暴力或仇恨。辱骂,指按严重程度分级的侮辱。威胁,指针对个人或群体的暴力。

在公开的人工撰写样例集 Multilingual HateCheck 上,Toxic 在七种欧盟语言上约得 85 分(满分 100)。Mistral 的 Shieldstral 得 79 分,还要一块 16 GB 显存的 GPU;手机体量的安全护栏模型约为 65 分。

在真实仇恨言论上得 0.847,来自 80 MB。

在真正的 Multilingual HateCheck 上,它覆盖的七种欧盟语言宏平均 F1 为 0.847,出自一个 80 MB、跑在设备上的模型。走同一套评测流程,最接近的安全护栏模型是 Mistral 的 Shieldstral-1.0-3B,得 0.786,而它要一块 16 GB 显存的 GPU;手机体量的那些约为 0.65。

0.847
宏平均 F1
7 种欧盟语言,实际发布的权重
0.786
最佳基线
Shieldstral-1.0-3B,同一批样本
80MB
设备端
Core ML;159.6M 参数
26-30%
误标记
干净文本,7 种欧盟语言,默认设置

在实际发布的权重上测得,而不是从训练检查点推算;同一套配方跑三次的平均值是 0.834。仇恨分数的阈值取 0.40,另外两个取 0.50。领域外,换用没有共同来源的语料:textdetox(5 种语言)为 0.724,offenseval2020(3 种语言)为 0.658。七种欧盟语言是在真正的 Multilingual HateCheck 上评测的;另外 15 种是在合成集上评测的,因为 HateCheck 没有为它们提供真实集,这些数字属于开发阶段的估计,而非可直接对比的分数。延迟尚未测量。

应用场景

仇恨言论,发出去之前就拦下。.

在消息发出去之前先提醒

外发消息在送出之前先在设备上打分,仇恨、辱骂或威胁性内容因此可以触发行内警告或复核流程,全程不必经过你的服务器。

无需基础设施的评论分流

在客户端本地用 Toxic 处理每一条收到的评论,只把疑似仇恨言论送进审核队列。其余的根本不需要人工过目,而且没有一条评论会产生云端调用。

审核 23 种欧洲语言

一个模型文件覆盖 23 种语言,从英语、西班牙语、波兰语,到保加利亚语、爱沙尼亚语和爱尔兰语。不用为每种语言单独准备模型,也不用单独做语种检测。

模型能做什么

  • 每段文本给出三个分数:仇恨、辱骂、威胁。
  • 仇恨分数之下的十个目标信号:种族、肤色、宗教、出身、民族或族裔来源、性取向、性别、残障、年龄、其他。
  • 一个模型文件覆盖 23 种语言,模型元数据中附有每种语言的推荐阈值。
  • 完全在设备上运行。没有文本为了打分而离开设备。

规格

语言
23 种,从英语、德语、法语到希腊语、立陶宛语和爱尔兰语
设备端体积
80 MB Core ML(4-bit);91 MB LiteRT(int4);100 MB ONNX(浏览器)
模型
XLM-R-base,12 层,159.6M 参数
准确度
在 Multilingual HateCheck 的 7 种欧盟语言上宏平均 F1 为 0.847,实际发布的权重;支持 23 种语言
平台
iOS 和 macOS(Core ML)、Android(LiteRT)、浏览器(ONNX);权重已在 Hugging Face 发布,尚未进入 SDK

Toxic 是初筛工具,不是最终判定。请把标记结果交给人工复核,或交给本地更重量级的处理层,而不是自动删除。Toxic 对仇恨词语本身就有反应,哪怕说话的人只是在引用或谴责它们,所以反驳仇恨的言论和新闻报道也可能触发标记。在默认设置下,在测量过的七种欧盟语言中,有 26% 到 30% 的非仇恨文本会被标记,英语则是 12%。Toxic 把仇恨言论和普通文本分开做得很好,把仇恨言论和单纯的粗鲁分开就差得多,因此一位怒气冲冲的客户,也可能被判成仇恨言论。

常见问题

Toxic 是什么?

设备端内容审核,在消息发送前标记 23 种欧洲语言中的仇恨、辱骂和威胁文本。

Toxic 在设备上运行吗?

是的。Toxic 在设备上运行,不调用任何服务器,因此数据始终留在用户手中。

Toxic 现在可用了吗?

Toxic 目前处于封闭测试阶段。可在本页申请抢先体验。

Toxic 的价格是多少?

每个模型的每个 SDK 均可免费支持最多 10 万台月活跃设备。每位用户调用模型的次数不设上限。 如需定制授权,请联系我们

Toxic 的准确度和速度如何?

在真正的 Multilingual HateCheck 上,它覆盖的七种欧盟语言宏平均 F1 为 0.847,出自一个 80 MB、跑在设备上的模型。走同一套评测流程,最接近的安全护栏模型是 Mistral 的 Shieldstral-1.0-3B,得 0.786,而它要一块 16 GB 显存的 GPU;手机体量的那些约为 0.65。

抢先体验

告诉我们你正在开发什么,我们会帮你把一切准备就绪。