Desert Ant Labs

Schemer.

结构化抽取封闭测试

设备端信息抽取,直接返回符合你 schema 的对象;原文没写的字段留空。

演示

Schemer 目前处于封闭测试阶段。 模型卡与权重已公开。可申请抢先体验。

带类型的 JSON,不用校验层。

把「下周四一点和 Priya 吃午饭」交给 Schemer,回来的记录里日期已经按设备时钟解析好,时长是数字,标题是字符串。没有解析步骤,没有 schema 校验,也没有重试循环。

也不会凭空编造。Schemer 有 91% 的情况会把缺失的字段留空;用提示词驱动的 LLM 只能做到 18% 到 43%。抽取出的字符串是输入的逐字子串,并带有字符偏移量,因此审核就是一次子串检查。Schemer 直接使用普通的 JSON Schema,也就是 OpenAI 和 Gemini 接受的那种结构,支持 13 种语言中的任意一种。

在从未见过的 schema 上得 0.800。

Schemer 在从未见过的 schema 上取得 0.800,参数量 211M,体积 111 MB。唯一比它得分更高的模型,体积都是它的 40 倍甚至更大。

0.800
准确度
从未见过的 schema,内部评估
0.911
缺失检测
对比 LLM 的 0.18 到 0.43
8.1ms
每次前向
Apple Neural Engine,256-token 形状
111MB
磁盘占用
int4 AWQ;211M 参数

在 9,021 条留出记录上进行的内部评估;对比模型在同一留出集上运行。

自然语言转日历条目

把「下周四一点和 Priya 吃午饭,大约一小时」变成带类型的事件:标题、开始时间、时长和重复规则。可在键盘或笔记应用中运行,设备端且离线。

消息转结构化记录

把聊天消息、电子邮件或扫描的笔记变成 CRM 线索、订单或发票:姓名、电子邮箱、金额和日期,每一项都解码为它真正的类型,缺失的字段返回 null,记录无需任何解析步骤即可保存。

设备端 agent 与表单自动填充

给本地 agent 一份 JSON Schema 和一段自由文本,它拿到的带类型 JSON 就能触发一个操作或预填一个表单。不用云端 LLM,没有按次调用费用。

模型能做什么

  • 直接使用普通的 JSON Schema(OpenAI 和 Gemini 接受的那种),并输出与之匹配的带类型 JSON。
  • 把字符串、数字、布尔值、日期时间、标签和数组解码为它们真实的类型。
  • 显式的缺失检测:把字段报告为缺失,而不是编造一个值。
  • 单一模型覆盖 13 种语言,无需为每种语言单独配置。

规格

模型
211M(剪枝后的 mmBERT-base 编码器)
准确度
0.800(int8),缺失检测 0.911
设备端体积
111 MB(int4 AWQ),218 MB(int8)
格式
Core ML 和 ONNX,跨平台

Schemer 照抄文本已经写明的内容,它不负责写。要一个概括性的标题,或者一个需要世界知识的判断,大得多的模型会胜过它。Schemer 也不是实体抽取器:它只填你声明过的字段,不会把段落里的每个名字都罗列出来。嵌套 schema 由外层封装处理,而不是模型本身,那部分的质量是在内部模板上测的,而不是在现实中杂乱的文字上。

常见问题

Schemer 是什么?

设备端信息抽取,直接返回符合你 schema 的对象;原文没写的字段留空。

Schemer 在设备上运行吗?

是的。Schemer 在设备上运行,不调用任何服务器,因此数据始终留在用户手中。

Schemer 现在可用了吗?

Schemer 目前处于封闭测试阶段。可在本页申请抢先体验。

Schemer 的价格是多少?

每个模型的每个 SDK 均可免费支持最多 10 万台月活跃设备。每位用户调用模型的次数不设上限。 如需定制授权,请联系我们

Schemer 的准确度和速度如何?

Schemer 在从未见过的 schema 上取得 0.800,参数量 211M,体积 111 MB。唯一比它得分更高的模型,体积都是它的 40 倍甚至更大。

抢先体验

告诉我们你正在开发什么,我们会帮你把一切准备就绪。