Toxic
Moderation auf dem Gerät, die hasserfüllte, beleidigende und bedrohliche Texte in 23 EU-Sprachen markiert, vor dem Senden.

Hassrede abfangen, bevor sie gepostet wird.
Toxic bewertet drei Dinge getrennt, sodass ein Produkt sie unterschiedlich behandeln kann. Hassrede meint die öffentliche Aufstachelung zu Gewalt oder Hass gegen eine geschützte Gruppe. Beleidigung meint Beschimpfungen, gestuft nach ihrer Schwere. Eine Drohung meint Gewalt gegen eine Person oder Gruppe.
Auf Multilingual HateCheck, einer öffentlichen Sammlung von Menschen verfasster Beispiele, erreicht Toxic etwa 85 von 100 in den sieben EU-Sprachen. Mistrals Shieldstral erreicht 79 und will eine 16-GB-GPU; die für ein Handy dimensionierten Guard-Modelle erreichen 65.
0,847 bei echter Hassrede, aus 80 MB.
0,847 Macro F1 auf echtem Multilingual HateCheck in den sieben EU-Sprachen, die es abdeckt, aus einem 80 MB großen Modell, das auf dem Gerät läuft. Das nächstliegende Guard-Modell durch denselben Testaufbau ist Mistrals Shieldstral-1.0-3B mit 0,786, und es will eine 16-GB-GPU; die für ein Handy dimensionierten erreichen etwa 0,65.
Gemessen an den Gewichten, die ausgeliefert werden, nicht aus einem Trainings-Checkpoint hochgerechnet; drei Durchläufe desselben Rezepts ergeben im Mittel 0,834. Der Schwellenwert liegt bei 0,40 für den Hass-Wert und 0,50 für die anderen beiden. Außerhalb der Domäne, auf Korpora ohne gemeinsame Abstammung: 0,724 auf textdetox in 5 Sprachen und 0,658 auf offenseval2020 in 3. Die sieben EU-Sprachen werden auf echtem Multilingual HateCheck bewertet; die anderen 15 werden auf synthetischen Sätzen bewertet, weil HateCheck für sie keinen echten Satz hat, und diese Werte sind Entwicklungsschätzungen und keine vergleichbaren Werte. Die Latenz ist noch nicht gemessen.
Anwendungsfälle
Hassrede abfangen, bevor sie gepostet wird.
Warnen, bevor die Nachricht rausgeht
Bewerten Sie ausgehende Nachrichten auf dem Gerät, bevor sie gesendet werden, sodass hasserfüllte, beleidigende oder bedrohliche Inhalte eine Inline-Warnung oder einen Prüfpfad auslösen können, ohne jemals Ihre Server zu erreichen.
Kommentar-Triage ohne Infrastruktur
Lassen Sie jeden eingehenden Kommentar lokal im Client durch Toxic laufen und schicken Sie nur die wahrscheinliche Hassrede in eine Moderator-Warteschlange. Der Rest braucht nie einen Menschen, und kein Kommentar kostet einen Cloud-Aufruf.
In 23 europäischen Sprachen moderieren
Eine Modelldatei deckt 23 Sprachen ab, von Englisch, Spanisch und Polnisch bis Bulgarisch, Estnisch und Irisch. Kein Modell pro Sprache und kein separater Schritt zur Sprachenerkennung.
Was das Modell macht
- Drei Bewertungen pro Text: hasserfüllt, beleidigend, Drohung.
- Zehn Ziel-Signale unter der Hassbewertung: Rasse, Hautfarbe, Religion, Abstammung, nationale oder ethnische Herkunft, sexuelle Orientierung, Geschlecht, Behinderung, Alter, sonstige.
- 23 Sprachen aus einer einzigen Modelldatei, mit einer empfohlenen Einstellung pro Sprache in den Modell-Metadaten.
- Läuft vollständig auf dem Gerät. Kein Text verlässt das Gerät, um bewertet zu werden.
Technische Daten
- Sprachen
- 23, von Englisch, Deutsch und Französisch bis Griechisch, Litauisch und Irisch
- Größe auf dem Gerät
- 80 MB Core ML (4-bit); 91 MB LiteRT (int4); 100 MB ONNX (Browser)
- Modell
- XLM-R-base, 12 Schichten, 159,6M Parameter
- Genauigkeit
- 0,847 Macro F1 in den 7 EU-Sprachen in Multilingual HateCheck, ausgelieferte Gewichte; 23 Sprachen unterstützt
- Plattformen
- iOS und macOS (Core ML), Android (LiteRT), Browser (ONNX); Gewichte auf Hugging Face, noch nicht im SDK
Toxic ist eine Triage-Hilfe, kein Urteil. Leiten Sie Markierungen an eine menschliche Prüfung oder eine schwerere lokale Stufe weiter, statt automatisch zu entfernen.
Toxic reagiert auf hasserfüllte Wörter, selbst wenn jemand sie zitiert oder verurteilt, sodass Gegenrede und Berichterstattung die Markierung auslösen können. In der Standardeinstellung markiert es 26 bis 30 % des nicht hasserfüllten Textes in den sieben EU-Sprachen, an denen es gemessen wurde, und 12 % im Englischen.
Toxic trennt Hassrede gut von gewöhnlichem Text und Hassrede deutlich schlechter von bloßer Unhöflichkeit, sodass ein wütender Kunde als hasserfüllt gelesen werden kann.
FAQ
Was ist Toxic?
Moderation auf dem Gerät, die hasserfüllte, beleidigende und bedrohliche Texte in 23 EU-Sprachen markiert, vor dem Senden.
Läuft Toxic auf dem Gerät?
Ja. Toxic läuft auf dem Gerät, ohne Serveraufruf, sodass die Daten beim Nutzer bleiben.
Ist Toxic schon verfügbar?
Toxic befindet sich in einer geschlossenen Beta. Fordern Sie auf dieser Seite frühen Zugang an.
Was kostet Toxic?
Jedes Modell ist kostenlos für bis zu 100k monatlich aktive Geräte pro SDK. Unbegrenzte Inferenz pro Nutzer. Kontaktieren Sie uns für individuelle Lizenzen.
Wie genau oder schnell ist Toxic?
0,847 Macro F1 auf echtem Multilingual HateCheck in den sieben EU-Sprachen, die es abdeckt, aus einem 80 MB großen Modell, das auf dem Gerät läuft. Das nächstliegende Guard-Modell durch denselben Testaufbau ist Mistrals Shieldstral-1.0-3B mit 0,786, und es will eine 16-GB-GPU; die für ein Handy dimensionierten erreichen etwa 0,65.
Früher Zugang
Sagen Sie uns, was Sie entwickeln, und wir richten Ihnen alles ein.