Toxic
Moderazione sul dispositivo che segnala testi d'odio, offensivi e minacciosi in 23 lingue europee, prima dell'invio.

Intercetta l'hate speech prima della pubblicazione.
Toxic assegna tre punteggi separati, così un prodotto può trattarli in modo diverso. L'hate speech è istigazione pubblica alla violenza o all'odio verso un gruppo protetto. Le offese sono insulti, ordinati per gravità. Una minaccia è violenza contro una persona o un gruppo.
Su Multilingual HateCheck, una raccolta pubblica di esempi scritti da persone, Toxic ottiene circa 85 su 100 nelle sette lingue dell'UE. Lo Shieldstral di Mistral ottiene 79 e vuole una GPU da 16 GB; i guard model delle dimensioni di un telefono si fermano a 65.
0,847 su hate speech reale, da 80 MB.
0,847 macro F1 sul Multilingual HateCheck reale nelle sette lingue dell'UE che copre, da un modello da 80 MB che gira sul dispositivo. Il guard model più vicino con lo stesso harness è lo Shieldstral-1.0-3B di Mistral, a 0,786, e vuole una GPU da 16 GB; quelli delle dimensioni di un telefono ottengono circa 0,65.
Misurato sui pesi rilasciati, non estrapolato da un checkpoint di addestramento; tre addestramenti con la stessa ricetta danno in media 0,834. La soglia è 0,40 per il punteggio sull'odio e 0,50 per gli altri due. Fuori dominio, su corpora senza parentela: 0,724 su textdetox in 5 lingue e 0,658 su offenseval2020 in 3. Le sette lingue dell'UE sono valutate sul Multilingual HateCheck reale; le altre 15 sono valutate su set sintetici, perché HateCheck non ne ha uno reale per loro, e quei valori sono stime di sviluppo più che punteggi comparabili. La latenza non è ancora stata misurata.
Casi d'uso
Intercetta l'hate speech prima della pubblicazione.
Avvisa prima che il messaggio parta
Valuta i messaggi in uscita sul dispositivo prima che vengano inviati, così contenuti d'odio, offensivi o minacciosi possono attivare un avviso in linea o un percorso di revisione senza mai arrivare ai tuoi server.
Triage dei commenti senza infrastruttura
Fai passare ogni commento in arrivo per Toxic in locale nel client e manda in coda di moderazione solo il probabile hate speech. Il resto non ha mai bisogno di una persona, e nessun commento costa una chiamata in cloud.
Modera in 23 lingue europee
Un solo file di modello copre 23 lingue, dall'inglese, lo spagnolo e il polacco fino al bulgaro, l'estone e l'irlandese. Nessun modello per lingua, e nessun passaggio separato di riconoscimento della lingua.
Cosa fa il modello
- Tre punteggi per testo: hateful, abusive, threat.
- Dieci segnali di target sotto il punteggio sull'odio: razza, colore, religione, discendenza, origine nazionale o etnica, orientamento sessuale, genere, disabilità, età, altro.
- 23 lingue da un unico file di modello, con un'impostazione consigliata per lingua nei metadati del modello.
- Gira interamente sul dispositivo. Nessun testo lascia il dispositivo per essere valutato.
Specifiche
- Lingue
- 23, dall'inglese, dal tedesco e dal francese fino al greco, al lituano e all'irlandese
- Dimensione sul dispositivo
- 80 MB Core ML (4 bit); 91 MB LiteRT (int4); 100 MB ONNX (browser)
- Modello
- XLM-R-base, 12 livelli, 159,6M di parametri
- Accuratezza
- 0,847 macro F1 sulle 7 lingue dell'UE in Multilingual HateCheck, pesi rilasciati; 23 lingue supportate
- Piattaforme
- iOS e macOS (Core ML), Android (LiteRT), browser (ONNX); pesi su Hugging Face, non ancora nell'SDK
Toxic è un ausilio al triage, non un verdetto. Manda le segnalazioni a un revisore umano o a un livello locale più pesante invece di rimuovere in automatico.
Toxic reagisce alle parole d'odio anche quando qualcuno le sta citando o condannando, quindi il controdiscorso e la cronaca possono far scattare la segnalazione. Con l'impostazione predefinita segnala dal 26 al 30% dei testi non d'odio nelle sette lingue dell'UE su cui è stato misurato, e il 12% in inglese.
Toxic distingue bene l'hate speech dal testo ordinario, e molto meno bene l'hate speech dalla semplice maleducazione, quindi un cliente arrabbiato può risultare pieno d'odio.
FAQ
Cos'è Toxic?
Moderazione sul dispositivo che segnala testi d'odio, offensivi e minacciosi in 23 lingue europee, prima dell'invio.
Toxic funziona sul dispositivo?
Sì. Toxic funziona sul dispositivo, senza chiamate a un server, quindi i dati restano con l'utente.
Toxic è già disponibile?
Toxic è in beta chiusa. Richiedi l'accesso anticipato in questa pagina.
Quanto costa Toxic?
Ogni modello è gratuito fino a 100k dispositivi attivi mensili per SDK. Inferenza illimitata per utente. Contattaci per licenze personalizzate.
Quanto è preciso o veloce Toxic?
0,847 macro F1 sul Multilingual HateCheck reale nelle sette lingue dell'UE che copre, da un modello da 80 MB che gira sul dispositivo. Il guard model più vicino con lo stesso harness è lo Shieldstral-1.0-3B di Mistral, a 0,786, e vuole una GPU da 16 GB; quelli delle dimensioni di un telefono ottengono circa 0,65.
Accesso anticipato
Raccontaci cosa stai costruendo e ti aiutiamo a iniziare.