Desert Ant Labs

On-Device-KI-Modelle für iOS und macOS

Sofort einsatzbereite Swift-Pakete, die kleine, spezialisierte Modelle auf dem Gerät ausführen, auf iOS und macOS, mit wenigen Zeilen Code auf Core ML.

Jedes verfügbare Desert-Ant-Labs-Modell wird als Swift-Paket auf Basis von Core ML ausgeliefert, durchgehend mit async/await und einer API, die sich liest wie ein Teil von AVFoundation.

Fügen Sie das Package in Xcode hinzu und rufen Sie das Modell auf. Alles läuft auf dem Gerät, also verlassen Audio, Bilder und Text das Gerät nie.

Verfügbare Modelle

RedactPII-Schwärzung

Umkehrbare PII-Schwärzung in 27 Sprachen, aus einem 12 MB großen Core-ML-Modell, das in der App gebündelt ist.

EmoEmoji-Vorschläge

Emoji-Vorschläge aus Text in unter 2 ms, klein genug, um bei jedem Tastendruck zu laufen.

GistThemen-Tagging von Inhalten

Content-Themen aus beliebigem Text in 101 Sprachen, aus einem 74 MB großen Core-ML-Modell oder einem 15 MB großen reinen Englisch-Build.

ShapesFormerkennung

PencilKit-Einrasten auf Formen in einem Aufruf, aus einem 0,2 MB großen Core-ML-Modell, ohne Download.

ClearSprachverbesserung

DeepFilterNet-3-Sprachaufbereitung auf Core ML: 302x Echtzeit auf einem iPhone 16 Pro, ein 5-minütiger Clip in 1 s.

UhmFüllwort-Erkennung

Frame-genaue Füllwort-Erkennung direkt aus der Wellenform, ohne Transkript.

TongueSprachenerkennung

Sprachenerkennung für kurzen Text in 84 Sprachen, aus einem 2 MB großen Modell, das in der App gebündelt ist.

AlignWort-Zeitstempel

Engere Wort-Zeiten für jedes Transkript, der halbe Fehler, aus einem 0,7 MB großen Core-ML-Modell. Apple Speech zuerst.

ClipsClip-Auswahl

Shorts und Highlights aus einem Transkript, gerankt, ein 25-minütiges Video in 9 s auf Core ML.

EarErkennung der gesprochenen Sprache

Erkennung der gesprochenen Sprache in 99 Sprachen aus 30 Sekunden Audio, auf Core ML.

TitleTitel und Beschreibungen

Ein Titel und eine Beschreibung aus ein oder zwei Sätzen für jede Passage, auf Apple silicon über MLX.

VozSpracherkennung

Sprache zu Text mit Wort-Zeitstempeln, 25 Sprachen, komplett auf der Neural Engine: 10 Minuten Audio in 2 s auf einem iPhone.

Bald verfügbar

Preise

Jedes Modell ist kostenlos für bis zu 100k monatlich aktive Geräte pro SDK. Unbegrenzte Inferenz pro Nutzer.