Schemer.
オンデバイスの構造化抽出。自作のスキーマに沿って型付きフィールドを抽出し、記載のない項目は空のまま残します。
デモ
型付き JSON、検証レイヤーは不要。
「来週木曜 1 時から Priya とランチ」と書けば、予定が型付きになります。日付は端末の時計を基準に解決され、所要時間は数値、タイトルは文字列です。パースの工程も、スキーマの検証も、リトライのループもありません。
でっち上げも起きません。Schemer が欠けているフィールドを空のままにする割合は 91%、プロンプトベースの LLM は 18〜43% です。抽出された文字列は入力そのままの部分文字列で、文字位置も付くので、監査は部分文字列の照合で済みます。Schemer は OpenAI や Gemini が受け付けるのと同じ素の JSON Schema から動作し、13 言語のいずれでも機能します。
見たことのないスキーマで 0.800。
Schemer は、見たことのないスキーマで 0.800 を記録します。211M パラメータ、111MB です。これより高いスコアを出すモデルは、いずれもサイズが 40 倍以上あります。
9,021 件のホールドアウトレコードによる社内評価。競合も同じホールドアウトセットで実行しています。
自然言語からカレンダーの予定へ
「来週木曜 1 時から 1 時間ほど Priya とランチ」を、型付きの予定に変換します。タイトル、開始日時、所要時間、繰り返しといった項目です。キーボードやメモアプリの中で、オンデバイス・オフラインで動作します。
メッセージを構造化レコードへ
チャットのメッセージ、メール、スキャンしたメモを、CRM のリード、注文、請求書に変換します。氏名、メールアドレス、金額、日付はそれぞれ本来の型にデコードされて届き、欠けているフィールドは null として届くので、パースの工程なしにレコードをそのまま保存できます。
オンデバイスのエージェントとフォーム入力
ローカルのエージェントに JSON Schema と自由記述のテキストを渡すと、返ってくる型付きの JSON がアクションを起動したり、フォームを事前入力したりします。クラウド LLM も、呼び出しごとの費用も不要です。
モデルができること
- OpenAI や Gemini が受け付けるのと同じ素の JSON Schema から動作し、それに一致する型付き JSON を書き出します。
- 文字列、数値、真偽値、日時、ラベル、配列を本来の型にデコード。
- 明示的な欠損検出:値をでっち上げるのではなく、フィールドを欠損として報告。
- 単一のモデルで 13 言語に対応。言語ごとの設定は不要。
仕様
- モデル
- 211M(プルーニングした mmBERT-base エンコーダー)
- 精度
- 0.800(int8)、欠損検出 0.911
- オンデバイスサイズ
- 111MB(int4 AWQ)、218MB(int8)
- 形式
- Core ML と ONNX、クロスプラットフォーム
Schemer はテキストに書かれていることを写し取るもので、文章を書くものではありません。要約的なタイトルや、世界知識が要る判断を求めれば、はるかに大きなモデルのほうが上です。エンティティ抽出器でもありません。宣言したフィールドを埋めるだけで、段落に出てくる名前をすべて列挙するわけではないからです。入れ子のスキーマはモデルではなく周辺の実装が扱っており、その品質は現実の雑然とした文章ではなく、内部のテンプレートで計測しています。
FAQ
Schemer とは?
オンデバイスの構造化抽出。自作のスキーマに沿って型付きフィールドを抽出し、記載のない項目は空のまま残します。
Schemer はオンデバイスで動作しますか?
はい。Schemer はデバイス上で動作し、サーバーへの通信は発生しません。データはユーザーの手元に残ります。
Schemer はもう利用できますか?
Schemer はクローズドベータです。このページから早期アクセスをリクエストできます。
Schemer の料金はいくらですか?
すべてのモデルは、SDK ごとに月間アクティブデバイス 100k 台まで無料です。各ユーザーがモデルを実行する回数に制限はありません。 カスタムライセンスについては、お問い合わせください。
Schemer の精度や速度はどれくらいですか?
Schemer は、見たことのないスキーマで 0.800 を記録します。211M パラメータ、111MB です。これより高いスコアを出すモデルは、いずれもサイズが 40 倍以上あります。
早期アクセス
開発中のプロダクトについてお聞かせください。セットアップをお手伝いします。