Desert Ant Labs

Toxic

Triage de discours de haineBêta fermée

Modération sur l'appareil qui signale les textes haineux, injurieux et menaçants en 23 langues européennes, avant l'envoi.

Toxic est en bêta fermée. La fiche du modèle et les poids sont publics. Accès anticipé sur demande.

Interceptez le discours de haine avant publication.

Toxic note trois choses séparément, pour qu'un produit puisse les traiter différemment. Le discours de haine, c'est l'incitation publique à la violence ou à la haine contre un groupe protégé. L'injure, ce sont des insultes classées par gravité. La menace, c'est la violence annoncée contre une personne ou un groupe.

Sur Multilingual HateCheck, une suite publique d'exemples rédigés par des humains, Toxic obtient environ 85 sur 100 pour les sept langues de l'UE. Le Shieldstral de Mistral obtient 79 et réclame un GPU de 16 GB ; les guard models taillés pour un téléphone obtiennent 65.

0,847 sur du vrai discours de haine, depuis 80 MB.

0,847 de macro F1 sur le vrai Multilingual HateCheck pour les sept langues de l'UE qu'il couvre, depuis un modèle de 80 MB qui tourne sur l'appareil. Le guard model le plus proche via le même protocole est Shieldstral-1.0-3B de Mistral à 0,786, et il réclame un GPU de 16 GB ; ceux taillés pour un téléphone plafonnent vers 0,65.

0,847
F1 macro
7 langues de l'UE, poids livrés
0,786
Meilleure référence
Shieldstral-1.0-3B, mêmes exemples
80 MB
Sur l'appareil
Core ML ; 159,6M de paramètres
26-30 %
Faux signalements
texte non toxique, 7 langues de l'UE, réglage par défaut

Mesuré sur les poids livrés, pas extrapolé depuis un checkpoint d'entraînement ; trois exécutions de la même recette donnent 0,834 en moyenne. Le seuil est de 0,40 pour le score de haine et de 0,50 pour les deux autres. Hors domaine, sur des corpus sans lignée commune : 0,724 sur textdetox pour 5 langues et 0,658 sur offenseval2020 pour 3. Les sept langues de l'UE sont évaluées sur le vrai Multilingual HateCheck ; les 15 autres sont évaluées sur des ensembles synthétiques, parce que HateCheck n'a pas d'ensemble réel pour elles, et ces chiffres sont des estimations de développement plutôt que des scores comparables. La latence n'a pas encore été mesurée.

Cas d'usage

Interceptez le discours de haine avant publication.

Avertir avant que le message ne parte

Notez les messages sortants sur l'appareil avant qu'ils ne soient envoyés : un contenu haineux, injurieux ou menaçant peut déclencher un avertissement en ligne ou un parcours de revue sans jamais atteindre vos serveurs.

Triage des commentaires sans infrastructure

Faites passer chaque commentaire entrant par Toxic, localement dans le client, et n'envoyez à une file de modération que les discours de haine probables. Le reste n'a jamais besoin d'un humain, et aucun commentaire ne coûte un appel au cloud.

Modérer dans 23 langues européennes

Un seul fichier de modèle couvre 23 langues, de l'anglais, l'espagnol et le polonais jusqu'au bulgare, l'estonien et l'irlandais. Aucun modèle par langue, et aucune étape séparée de détection de langue.

Ce que fait le modèle

  • Trois scores par texte : haine, injure, menace.
  • Dix signaux de cible sous le score de haine : race, couleur, religion, ascendance, origine nationale ou ethnique, orientation sexuelle, genre, handicap, âge, autre.
  • 23 langues depuis un seul fichier de modèle, avec un réglage recommandé par langue dans les métadonnées du modèle.
  • Tourne entièrement sur l'appareil. Aucun texte ne quitte l'appareil pour être noté.

Spécifications

Langues
23, de l'anglais, l'allemand et le français au grec, au lituanien et à l'irlandais
Taille sur l'appareil
80 MB Core ML (4 bits) ; 91 MB LiteRT (int4) ; 100 MB ONNX (navigateur)
Modèle
XLM-R-base, 12 couches, 159,6M de paramètres
Exactitude
0,847 de macro F1 sur les 7 langues de l'UE de Multilingual HateCheck, poids livrés ; 23 langues prises en charge
Plateformes
iOS et macOS (Core ML), Android (LiteRT), navigateur (ONNX) ; poids sur Hugging Face, pas encore dans le SDK

Toxic est une aide au triage, pas un verdict. Envoyez les signalements à un relecteur humain ou à un palier local plus lourd plutôt que de retirer automatiquement.

Toxic réagit aux mots haineux même quand quelqu'un les cite ou les condamne, si bien qu'un discours de riposte ou un reportage peut déclencher le signalement. Au réglage par défaut, il signale 26 à 30 % du texte non haineux dans les sept langues de l'UE sur lesquelles il a été mesuré, et 12 % en anglais.

Toxic sépare bien le discours de haine du texte ordinaire, et bien moins bien le discours de haine de la simple grossièreté : un client en colère peut donc passer pour haineux.

FAQ

Qu'est-ce que Toxic ?

Modération sur l'appareil qui signale les textes haineux, injurieux et menaçants en 23 langues européennes, avant l'envoi.

Toxic fonctionne-t-il sur l'appareil ?

Oui. Toxic s'exécute sur l'appareil, sans appel serveur : les données restent chez l'utilisateur.

Toxic est-il déjà disponible ?

Toxic est en bêta fermée. Demandez un accès anticipé sur cette page.

Combien coûte Toxic ?

Chaque modèle est gratuit jusqu'à 100k appareils actifs mensuels par SDK. Inférence illimitée par utilisateur. Contactez-nous pour des licences sur mesure.

Quelle est la précision ou la vitesse de Toxic ?

0,847 de macro F1 sur le vrai Multilingual HateCheck pour les sept langues de l'UE qu'il couvre, depuis un modèle de 80 MB qui tourne sur l'appareil. Le guard model le plus proche via le même protocole est Shieldstral-1.0-3B de Mistral à 0,786, et il réclame un GPU de 16 GB ; ceux taillés pour un téléphone plafonnent vers 0,65.

Accès anticipé

Dites-nous ce que vous construisez et nous vous aidons à démarrer.