Desert Ant Labs

Toxic

Triage dell'hate speechBeta chiusa

Moderazione sul dispositivo che segnala testi d'odio, offensivi e minacciosi in 23 lingue europee, prima dell'invio.

Toxic è in beta chiusa. La model card e i pesi sono pubblici. Accesso anticipato su richiesta.

Intercetta l'hate speech prima della pubblicazione.

Toxic assegna tre punteggi separati, così un prodotto può trattarli in modo diverso. L'hate speech è istigazione pubblica alla violenza o all'odio verso un gruppo protetto. Le offese sono insulti, ordinati per gravità. Una minaccia è violenza contro una persona o un gruppo.

Su Multilingual HateCheck, una raccolta pubblica di esempi scritti da persone, Toxic ottiene circa 85 su 100 nelle sette lingue dell'UE. Lo Shieldstral di Mistral ottiene 79 e vuole una GPU da 16 GB; i guard model delle dimensioni di un telefono si fermano a 65.

0,847 su hate speech reale, da 80 MB.

0,847 macro F1 sul Multilingual HateCheck reale nelle sette lingue dell'UE che copre, da un modello da 80 MB che gira sul dispositivo. Il guard model più vicino con lo stesso harness è lo Shieldstral-1.0-3B di Mistral, a 0,786, e vuole una GPU da 16 GB; quelli delle dimensioni di un telefono ottengono circa 0,65.

0,847
Macro F1
7 lingue dell'UE, pesi rilasciati
0,786
Miglior baseline
Shieldstral-1.0-3B, stesse frasi
80 MB
On-device
Core ML; 159,6M di parametri
26-30%
Falsi allarmi
testo pulito, 7 lingue dell'UE, impostazione predefinita

Misurato sui pesi rilasciati, non estrapolato da un checkpoint di addestramento; tre addestramenti con la stessa ricetta danno in media 0,834. La soglia è 0,40 per il punteggio sull'odio e 0,50 per gli altri due. Fuori dominio, su corpora senza parentela: 0,724 su textdetox in 5 lingue e 0,658 su offenseval2020 in 3. Le sette lingue dell'UE sono valutate sul Multilingual HateCheck reale; le altre 15 sono valutate su set sintetici, perché HateCheck non ne ha uno reale per loro, e quei valori sono stime di sviluppo più che punteggi comparabili. La latenza non è ancora stata misurata.

Casi d'uso

Intercetta l'hate speech prima della pubblicazione.

Avvisa prima che il messaggio parta

Valuta i messaggi in uscita sul dispositivo prima che vengano inviati, così contenuti d'odio, offensivi o minacciosi possono attivare un avviso in linea o un percorso di revisione senza mai arrivare ai tuoi server.

Triage dei commenti senza infrastruttura

Fai passare ogni commento in arrivo per Toxic in locale nel client e manda in coda di moderazione solo il probabile hate speech. Il resto non ha mai bisogno di una persona, e nessun commento costa una chiamata in cloud.

Modera in 23 lingue europee

Un solo file di modello copre 23 lingue, dall'inglese, lo spagnolo e il polacco fino al bulgaro, l'estone e l'irlandese. Nessun modello per lingua, e nessun passaggio separato di riconoscimento della lingua.

Cosa fa il modello

  • Tre punteggi per testo: hateful, abusive, threat.
  • Dieci segnali di target sotto il punteggio sull'odio: razza, colore, religione, discendenza, origine nazionale o etnica, orientamento sessuale, genere, disabilità, età, altro.
  • 23 lingue da un unico file di modello, con un'impostazione consigliata per lingua nei metadati del modello.
  • Gira interamente sul dispositivo. Nessun testo lascia il dispositivo per essere valutato.

Specifiche

Lingue
23, dall'inglese, dal tedesco e dal francese fino al greco, al lituano e all'irlandese
Dimensione sul dispositivo
80 MB Core ML (4 bit); 91 MB LiteRT (int4); 100 MB ONNX (browser)
Modello
XLM-R-base, 12 livelli, 159,6M di parametri
Accuratezza
0,847 macro F1 sulle 7 lingue dell'UE in Multilingual HateCheck, pesi rilasciati; 23 lingue supportate
Piattaforme
iOS e macOS (Core ML), Android (LiteRT), browser (ONNX); pesi su Hugging Face, non ancora nell'SDK

Toxic è un ausilio al triage, non un verdetto. Manda le segnalazioni a un revisore umano o a un livello locale più pesante invece di rimuovere in automatico.

Toxic reagisce alle parole d'odio anche quando qualcuno le sta citando o condannando, quindi il controdiscorso e la cronaca possono far scattare la segnalazione. Con l'impostazione predefinita segnala dal 26 al 30% dei testi non d'odio nelle sette lingue dell'UE su cui è stato misurato, e il 12% in inglese.

Toxic distingue bene l'hate speech dal testo ordinario, e molto meno bene l'hate speech dalla semplice maleducazione, quindi un cliente arrabbiato può risultare pieno d'odio.

FAQ

Cos'è Toxic?

Moderazione sul dispositivo che segnala testi d'odio, offensivi e minacciosi in 23 lingue europee, prima dell'invio.

Toxic funziona sul dispositivo?

Sì. Toxic funziona sul dispositivo, senza chiamate a un server, quindi i dati restano con l'utente.

Toxic è già disponibile?

Toxic è in beta chiusa. Richiedi l'accesso anticipato in questa pagina.

Quanto costa Toxic?

Ogni modello è gratuito fino a 100k dispositivi attivi mensili per SDK. Inferenza illimitata per utente. Contattaci per licenze personalizzate.

Quanto è preciso o veloce Toxic?

0,847 macro F1 sul Multilingual HateCheck reale nelle sette lingue dell'UE che copre, da un modello da 80 MB che gira sul dispositivo. Il guard model più vicino con lo stesso harness è lo Shieldstral-1.0-3B di Mistral, a 0,786, e vuole una GPU da 16 GB; quelli delle dimensioni di un telefono ottengono circa 0,65.

Accesso anticipato

Raccontaci cosa stai costruendo e ti aiutiamo a iniziare.