Desert Ant Labs

Toxic

Triage van haatzaaienBesloten bèta

Moderatie op het apparaat die haatdragende, beledigende en bedreigende tekst in 23 Europese talen markeert, vóór verzenden.

Toxic is in besloten bèta. De model card en gewichten zijn openbaar. Early access op aanvraag.

Vang haatzaaiende taal af vóór het plaatsen.

Toxic scoort drie dingen apart, zodat een product ze verschillend kan behandelen. Haatzaaien betekent publiek aanzetten tot geweld of haat tegen een beschermde groep. Belediging betekent scheldwoorden, geordend naar hoe zwaar ze zijn. Een bedreiging betekent geweld tegen een persoon of groep.

Op Multilingual HateCheck, een publieke suite van door mensen geschreven voorbeelden, haalt Toxic ongeveer 85 van de 100 over de zeven EU-talen. Shieldstral van Mistral haalt 79 en wil een GPU van 16 GB; de guard-modellen op telefoonformaat halen 65.

0,847 op echte haatzaaiende taal, uit 80 MB.

0,847 macro-F1 op echte Multilingual HateCheck over de zeven EU-talen die het dekt, uit een model van 80 MB dat op het apparaat draait. Het guard-model dat er via dezelfde meetopstelling het dichtst bij komt, is Shieldstral-1.0-3B van Mistral met 0,786, en dat wil een GPU van 16 GB; de modellen op telefoonformaat scoren ongeveer 0,65.

0,847
Macro-F1
7 EU-talen, uitgeleverde gewichten
0,786
Beste baseline
Shieldstral-1.0-3B, dezelfde rijen
80MB
On-device
Core ML; 159,6M params
26-30%
Valse markeringen
schone tekst, 7 EU-talen, standaardinstelling

Gemeten op de gewichten die worden uitgeleverd, niet geëxtrapoleerd uit een trainingscheckpoint; drie runs van hetzelfde recept komen gemiddeld uit op 0,834. De drempel is 0,40 voor de haatscore en 0,50 voor de andere twee. Buiten het domein, op corpora zonder gedeelde herkomst: 0,724 op textdetox in 5 talen en 0,658 op offenseval2020 in 3. De zeven EU-talen worden gescoord op echte Multilingual HateCheck; de andere 15 worden gescoord op synthetische sets, omdat HateCheck daarvoor geen echte set heeft, en die cijfers zijn ontwikkelschattingen in plaats van vergelijkbare scores. De latency is nog niet gemeten.

Toepassingen

Vang haatzaaiende taal af vóór het plaatsen.

Waarschuwen voordat het bericht de deur uit gaat

Beoordeel uitgaande berichten op het apparaat voordat ze worden verstuurd, zodat haatzaaiende, beledigende of bedreigende inhoud een waarschuwing in de app of een beoordelingsroute kan activeren zonder ooit je servers te bereiken.

Reactietriage zonder infrastructuur

Haal elke binnenkomende reactie lokaal in de client door Toxic en stuur alleen de vermoedelijk haatzaaiende berichten naar een moderatiewachtrij. De rest komt nooit bij een mens, en geen enkele reactie kost een cloudaanroep.

Modereer in 23 Europese talen

Eén modelbestand dekt 23 talen, van Engels, Spaans en Pools tot Bulgaars, Ests en Iers. Geen model per taal, en geen aparte stap voor taalherkenning.

Wat het model doet

  • Drie scores per tekst: haatzaaiend, beledigend, bedreigend.
  • Tien doelsignalen onder de haatscore: ras, huidskleur, religie, afstamming, nationale of etnische afkomst, seksuele geaardheid, gender, beperking, leeftijd, overig.
  • 23 talen uit één modelbestand, met een aanbevolen instelling per taal in de model-metadata.
  • Draait volledig op het apparaat. Er verlaat geen tekst het apparaat om gescoord te worden.

Specs

Talen
23, van Engels, Duits en Frans tot Grieks, Litouws en Iers
Grootte op het apparaat
80 MB Core ML (4-bit); 91 MB LiteRT (int4); 100 MB ONNX (browser)
Model
XLM-R-base, 12 lagen, 159,6M params
Nauwkeurigheid
0,847 macro-F1 op de 7 EU-talen in Multilingual HateCheck, uitgeleverde gewichten; 23 talen ondersteund
Platforms
iOS en macOS (Core ML), Android (LiteRT), browser (ONNX); gewichten op Hugging Face, nog niet in de SDK

Toxic is een hulpmiddel voor triage, geen oordeel. Stuur markeringen naar een menselijke beoordelaar of een zwaardere lokale laag in plaats van automatisch te verwijderen.

Toxic reageert op haatdragende woorden, ook als iemand ze citeert of juist veroordeelt, dus tegengeluid en nieuwsberichtgeving kunnen de markering onterecht laten afgaan. Bij de standaardinstelling markeert het 26 tot 30% van de niet-haatzaaiende tekst in de zeven EU-talen waarop het is gemeten, en 12% in het Engels.

Toxic scheidt haatzaaiende taal goed van gewone tekst, en haatzaaiende taal veel minder goed van simpele grofheid, dus een boze klant kan overkomen als haatzaaiend.

FAQ

Wat is Toxic?

Moderatie op het apparaat die haatdragende, beledigende en bedreigende tekst in 23 Europese talen markeert, vóór verzenden.

Draait Toxic op het apparaat?

Ja. Toxic draait op het apparaat, zonder serveraanroep, dus de data blijft bij de gebruiker.

Is Toxic al beschikbaar?

Toxic is in besloten bèta. Vraag op deze pagina early access aan.

Hoeveel kost Toxic?

Elk model is gratis voor maximaal 100k maandelijks actieve apparaten per SDK. Onbeperkte inference per gebruiker. Neem contact op voor aangepaste licenties.

Hoe nauwkeurig of snel is Toxic?

0,847 macro-F1 op echte Multilingual HateCheck over de zeven EU-talen die het dekt, uit een model van 80 MB dat op het apparaat draait. Het guard-model dat er via dezelfde meetopstelling het dichtst bij komt, is Shieldstral-1.0-3B van Mistral met 0,786, en dat wil een GPU van 16 GB; de modellen op telefoonformaat scoren ongeveer 0,65.

Early access

Vertel ons wat je bouwt, dan zetten we je op weg.