Desert Ant Labs

Toxic

Sortering av hatpratStängd beta

Moderering på enheten som flaggar hatfull, kränkande och hotfull text på 23 europeiska språk, innan meddelandet skickas.

Toxic är i stängd beta. Modellkortet och vikterna är offentliga. Tidig åtkomst på begäran.

Fånga hatprat innan det publiceras.

Toxic poängsätter tre saker var för sig, så att en produkt kan hantera dem olika. Hatprat betyder offentlig uppmaning till våld eller hat mot en skyddad grupp. Kränkning betyder förolämpningar, rangordnade efter hur grova de är. Ett hot betyder våld mot en person eller en grupp.

På Multilingual HateCheck, en offentlig uppsättning exempel som människor skrivit, får Toxic ungefär 85 av 100 på de sju EU-språken. Mistrals Shieldstral får 79 och vill ha en 16 GB GPU; skyddsmodellerna i telefonstorlek får 65.

0,847 på verkligt hatprat, från 80 MB.

0,847 makro-F1 på verkliga Multilingual HateCheck över de sju EU-språk den täcker, från en modell på 80 MB som körs på enheten. Den närmaste skyddsmodellen genom samma testrigg är Mistrals Shieldstral-1.0-3B på 0,786, och den vill ha en 16 GB GPU; de i telefonstorlek får ungefär 0,65.

0,847
Makro-F1
7 EU-språk, levererade vikter
0,786
Bästa baseline
Shieldstral-1.0-3B, samma rader
80MB
På enheten
Core ML; 159,6M parametrar
26-30%
Falska flaggor
ren text, 7 EU-språk, standardinställning

Uppmätt på de vikter som levereras, inte extrapolerat från en träningscheckpoint; tre körningar av samma recept ger i genomsnitt 0,834. Tröskeln är 0,40 för hatpoängen och 0,50 för de andra två. Utanför domänen, på korpusar utan gemensamt släkte: 0,724 på textdetox över 5 språk och 0,658 på offenseval2020 över 3. De sju EU-språken poängsätts på verkliga Multilingual HateCheck; de övriga 15 poängsätts på syntetiska uppsättningar, eftersom HateCheck saknar en verklig uppsättning för dem, och de siffrorna är utvecklingsestimat snarare än jämförbara resultat. Latensen är inte uppmätt ännu.

Användningsfall

Fånga hatprat innan det publiceras.

Varna innan meddelandet går iväg

Poängsätt utgående meddelanden på enheten innan de skickas, så att hatfullt, kränkande eller hotfullt innehåll kan utlösa en varning direkt i flödet eller en granskningsväg utan att någonsin nå dina servrar.

Kommentarstriage utan infrastruktur

Kör varje inkommande kommentar genom Toxic lokalt i klienten och skicka bara det som troligen är hatprat vidare till en moderatorkö. Resten behöver aldrig en människa, och ingen kommentar kostar ett molnanrop.

Moderera på 23 europeiska språk

En modellfil täcker 23 språk, från engelska, spanska och polska till bulgariska, estniska och iriska. Ingen modell per språk, och inget separat språkdetektionssteg.

Vad modellen gör

  • Tre poäng per text: hatfullt, kränkande, hot.
  • Tio målsignaler under hatpoängen: ras, hudfärg, religion, härkomst, nationellt eller etniskt ursprung, sexuell läggning, kön, funktionsnedsättning, ålder, annat.
  • 23 språk från en enda modellfil, med en rekommenderad inställning per språk i modellens metadata.
  • Körs helt på enheten. Ingen text lämnar enheten för att poängsättas.

Specifikationer

Språk
23, från engelska, tyska och franska till grekiska, litauiska och iriska
Storlek på enheten
80 MB Core ML (4-bitars); 91 MB LiteRT (int4); 100 MB ONNX (webbläsare)
Modell
XLM-R-base, 12 lager, 159,6M parametrar
Träffsäkerhet
0,847 makro-F1 på de 7 EU-språken i Multilingual HateCheck, levererade vikter; 23 språk stöds
Plattformar
iOS och macOS (Core ML), Android (LiteRT), webbläsare (ONNX); vikter på Hugging Face, inte i SDK:n ännu

Toxic är ett sorteringsstöd, inte en dom. Skicka flaggor till en mänsklig granskare eller en tyngre lokal nivå i stället för att ta bort automatiskt.

Toxic reagerar på hatfulla ord även när någon citerar eller fördömer dem, så genmälen mot hat och nyhetsrapportering kan utlösa flaggan. Vid standardinställningen flaggar den 26 till 30% av den icke-hatfulla texten på de sju EU-språk den mätts på, och 12% på engelska.

Toxic skiljer hatprat från vanlig text väl, och hatprat från ren otrevlighet mycket sämre, så en arg kund kan läsas som hatfull.

Vanliga frågor

Vad är Toxic?

Moderering på enheten som flaggar hatfull, kränkande och hotfull text på 23 europeiska språk, innan meddelandet skickas.

Körs Toxic lokalt på enheten?

Ja. Toxic körs på enheten, utan något serveranrop, så att data stannar hos användaren.

Är Toxic tillgänglig än?

Toxic är i stängd beta. Begär tidig åtkomst på den här sidan.

Vad kostar Toxic?

Varje modell är gratis upp till 100k månadsaktiva enheter per SDK. Obegränsad inferens per användare. Kontakta oss för anpassade licenser.

Hur träffsäker eller snabb är Toxic?

0,847 makro-F1 på verkliga Multilingual HateCheck över de sju EU-språk den täcker, från en modell på 80 MB som körs på enheten. Den närmaste skyddsmodellen genom samma testrigg är Mistrals Shieldstral-1.0-3B på 0,786, och den vill ha en 16 GB GPU; de i telefonstorlek får ungefär 0,65.

Tidig åtkomst

Berätta vad du bygger, så hjälper vi dig igång.