Schemer.
设备端信息抽取,直接返回符合你 schema 的对象;原文没写的字段留空。
演示
带类型的 JSON,不用校验层。
把「下周四一点和 Priya 吃午饭」交给 Schemer,回来的记录里日期已经按设备时钟解析好,时长是数字,标题是字符串。没有解析步骤,没有 schema 校验,也没有重试循环。
也不会凭空编造。Schemer 有 91% 的情况会把缺失的字段留空;用提示词驱动的 LLM 只能做到 18% 到 43%。抽取出的字符串是输入的逐字子串,并带有字符偏移量,因此审核就是一次子串检查。Schemer 直接使用普通的 JSON Schema,也就是 OpenAI 和 Gemini 接受的那种结构,支持 13 种语言中的任意一种。
在从未见过的 schema 上得 0.800。
Schemer 在从未见过的 schema 上取得 0.800,参数量 211M,体积 111 MB。唯一比它得分更高的模型,体积都是它的 40 倍甚至更大。
在 9,021 条留出记录上进行的内部评估;对比模型在同一留出集上运行。
自然语言转日历条目
把「下周四一点和 Priya 吃午饭,大约一小时」变成带类型的事件:标题、开始时间、时长和重复规则。可在键盘或笔记应用中运行,设备端且离线。
消息转结构化记录
把聊天消息、电子邮件或扫描的笔记变成 CRM 线索、订单或发票:姓名、电子邮箱、金额和日期,每一项都解码为它真正的类型,缺失的字段返回 null,记录无需任何解析步骤即可保存。
设备端 agent 与表单自动填充
给本地 agent 一份 JSON Schema 和一段自由文本,它拿到的带类型 JSON 就能触发一个操作或预填一个表单。不用云端 LLM,没有按次调用费用。
模型能做什么
- 直接使用普通的 JSON Schema(OpenAI 和 Gemini 接受的那种),并输出与之匹配的带类型 JSON。
- 把字符串、数字、布尔值、日期时间、标签和数组解码为它们真实的类型。
- 显式的缺失检测:把字段报告为缺失,而不是编造一个值。
- 单一模型覆盖 13 种语言,无需为每种语言单独配置。
规格
- 模型
- 211M(剪枝后的 mmBERT-base 编码器)
- 准确度
- 0.800(int8),缺失检测 0.911
- 设备端体积
- 111 MB(int4 AWQ),218 MB(int8)
- 格式
- Core ML 和 ONNX,跨平台
Schemer 照抄文本已经写明的内容,它不负责写。要一个概括性的标题,或者一个需要世界知识的判断,大得多的模型会胜过它。Schemer 也不是实体抽取器:它只填你声明过的字段,不会把段落里的每个名字都罗列出来。嵌套 schema 由外层封装处理,而不是模型本身,那部分的质量是在内部模板上测的,而不是在现实中杂乱的文字上。
常见问题
Schemer 是什么?
设备端信息抽取,直接返回符合你 schema 的对象;原文没写的字段留空。
Schemer 在设备上运行吗?
是的。Schemer 在设备上运行,不调用任何服务器,因此数据始终留在用户手中。
Schemer 现在可用了吗?
Schemer 目前处于封闭测试阶段。可在本页申请抢先体验。
Schemer 的价格是多少?
每个模型的每个 SDK 均可免费支持最多 10 万台月活跃设备。每位用户调用模型的次数不设上限。 如需定制授权,请联系我们。
Schemer 的准确度和速度如何?
Schemer 在从未见过的 schema 上取得 0.800,参数量 211M,体积 111 MB。唯一比它得分更高的模型,体积都是它的 40 倍甚至更大。
抢先体验
告诉我们你正在开发什么,我们会帮你把一切准备就绪。