Toxic
Moderatie op het apparaat die haatdragende, beledigende en bedreigende tekst in 23 Europese talen markeert, vóór verzenden.

Vang haatzaaiende taal af vóór het plaatsen.
Toxic scoort drie dingen apart, zodat een product ze verschillend kan behandelen. Haatzaaien betekent publiek aanzetten tot geweld of haat tegen een beschermde groep. Belediging betekent scheldwoorden, geordend naar hoe zwaar ze zijn. Een bedreiging betekent geweld tegen een persoon of groep.
Op Multilingual HateCheck, een publieke suite van door mensen geschreven voorbeelden, haalt Toxic ongeveer 85 van de 100 over de zeven EU-talen. Shieldstral van Mistral haalt 79 en wil een GPU van 16 GB; de guard-modellen op telefoonformaat halen 65.
0,847 op echte haatzaaiende taal, uit 80 MB.
0,847 macro-F1 op echte Multilingual HateCheck over de zeven EU-talen die het dekt, uit een model van 80 MB dat op het apparaat draait. Het guard-model dat er via dezelfde meetopstelling het dichtst bij komt, is Shieldstral-1.0-3B van Mistral met 0,786, en dat wil een GPU van 16 GB; de modellen op telefoonformaat scoren ongeveer 0,65.
Gemeten op de gewichten die worden uitgeleverd, niet geëxtrapoleerd uit een trainingscheckpoint; drie runs van hetzelfde recept komen gemiddeld uit op 0,834. De drempel is 0,40 voor de haatscore en 0,50 voor de andere twee. Buiten het domein, op corpora zonder gedeelde herkomst: 0,724 op textdetox in 5 talen en 0,658 op offenseval2020 in 3. De zeven EU-talen worden gescoord op echte Multilingual HateCheck; de andere 15 worden gescoord op synthetische sets, omdat HateCheck daarvoor geen echte set heeft, en die cijfers zijn ontwikkelschattingen in plaats van vergelijkbare scores. De latency is nog niet gemeten.
Toepassingen
Vang haatzaaiende taal af vóór het plaatsen.
Waarschuwen voordat het bericht de deur uit gaat
Beoordeel uitgaande berichten op het apparaat voordat ze worden verstuurd, zodat haatzaaiende, beledigende of bedreigende inhoud een waarschuwing in de app of een beoordelingsroute kan activeren zonder ooit je servers te bereiken.
Reactietriage zonder infrastructuur
Haal elke binnenkomende reactie lokaal in de client door Toxic en stuur alleen de vermoedelijk haatzaaiende berichten naar een moderatiewachtrij. De rest komt nooit bij een mens, en geen enkele reactie kost een cloudaanroep.
Modereer in 23 Europese talen
Eén modelbestand dekt 23 talen, van Engels, Spaans en Pools tot Bulgaars, Ests en Iers. Geen model per taal, en geen aparte stap voor taalherkenning.
Wat het model doet
- Drie scores per tekst: haatzaaiend, beledigend, bedreigend.
- Tien doelsignalen onder de haatscore: ras, huidskleur, religie, afstamming, nationale of etnische afkomst, seksuele geaardheid, gender, beperking, leeftijd, overig.
- 23 talen uit één modelbestand, met een aanbevolen instelling per taal in de model-metadata.
- Draait volledig op het apparaat. Er verlaat geen tekst het apparaat om gescoord te worden.
Specs
- Talen
- 23, van Engels, Duits en Frans tot Grieks, Litouws en Iers
- Grootte op het apparaat
- 80 MB Core ML (4-bit); 91 MB LiteRT (int4); 100 MB ONNX (browser)
- Model
- XLM-R-base, 12 lagen, 159,6M params
- Nauwkeurigheid
- 0,847 macro-F1 op de 7 EU-talen in Multilingual HateCheck, uitgeleverde gewichten; 23 talen ondersteund
- Platforms
- iOS en macOS (Core ML), Android (LiteRT), browser (ONNX); gewichten op Hugging Face, nog niet in de SDK
Toxic is een hulpmiddel voor triage, geen oordeel. Stuur markeringen naar een menselijke beoordelaar of een zwaardere lokale laag in plaats van automatisch te verwijderen.
Toxic reageert op haatdragende woorden, ook als iemand ze citeert of juist veroordeelt, dus tegengeluid en nieuwsberichtgeving kunnen de markering onterecht laten afgaan. Bij de standaardinstelling markeert het 26 tot 30% van de niet-haatzaaiende tekst in de zeven EU-talen waarop het is gemeten, en 12% in het Engels.
Toxic scheidt haatzaaiende taal goed van gewone tekst, en haatzaaiende taal veel minder goed van simpele grofheid, dus een boze klant kan overkomen als haatzaaiend.
FAQ
Wat is Toxic?
Moderatie op het apparaat die haatdragende, beledigende en bedreigende tekst in 23 Europese talen markeert, vóór verzenden.
Draait Toxic op het apparaat?
Ja. Toxic draait op het apparaat, zonder serveraanroep, dus de data blijft bij de gebruiker.
Is Toxic al beschikbaar?
Toxic is in besloten bèta. Vraag op deze pagina early access aan.
Hoeveel kost Toxic?
Elk model is gratis voor maximaal 100k maandelijks actieve apparaten per SDK. Onbeperkte inference per gebruiker. Neem contact op voor aangepaste licenties.
Hoe nauwkeurig of snel is Toxic?
0,847 macro-F1 op echte Multilingual HateCheck over de zeven EU-talen die het dekt, uit een model van 80 MB dat op het apparaat draait. Het guard-model dat er via dezelfde meetopstelling het dichtst bij komt, is Shieldstral-1.0-3B van Mistral met 0,786, en dat wil een GPU van 16 GB; de modellen op telefoonformaat scoren ongeveer 0,65.
Early access
Vertel ons wat je bouwt, dan zetten we je op weg.