Toxic
Moderação no dispositivo que sinaliza texto de ódio, abusivo e ameaçador em 23 idiomas europeus, antes do envio.

Pegue o discurso de ódio antes do post.
O Toxic pontua três coisas separadamente, então um produto pode tratá-las de formas diferentes. Discurso de ódio é a incitação pública à violência ou ao ódio contra um grupo protegido. Ofensa são insultos, ordenados pela gravidade. Ameaça é violência contra uma pessoa ou um grupo.
No Multilingual HateCheck, um conjunto público de exemplos escritos por pessoas, o Toxic acerta cerca de 85 em 100 nos sete idiomas da UE. O Shieldstral, da Mistral, acerta 79 e quer uma GPU de 16 GB; os modelos “guard” do tamanho de um celular acertam 65.
0,847 em discurso de ódio real, a partir de 80 MB.
0,847 de macro F1 no Multilingual HateCheck propriamente dito, nos sete idiomas da UE que ele cobre, a partir de um modelo de 80 MB que roda no dispositivo. O guard model mais próximo pelo mesmo processo de avaliação é o Shieldstral-1.0-3B, da Mistral, com 0,786, e ele quer uma GPU de 16 GB; os do tamanho de um celular ficam em torno de 0,65.
Medido nos pesos publicados, não extrapolado de um checkpoint de treinamento; três execuções da mesma receita dão em média 0,834. O limiar é de 0,40 para a pontuação de ódio e de 0,50 para as outras duas. Fora do domínio, em corpora sem parentesco comum: 0,724 no textdetox em 5 idiomas e 0,658 no offenseval2020 em 3. Os sete idiomas da UE são avaliados no Multilingual HateCheck propriamente dito; os outros 15 são avaliados em conjuntos sintéticos, porque o HateCheck não tem um conjunto real para eles, e esses números são estimativas de desenvolvimento, não notas comparáveis. A latência ainda não foi medida.
Casos de uso
Pegue o discurso de ódio antes do post.
Avise antes de a mensagem ser enviada
Pontue as mensagens de saída no dispositivo antes de elas serem enviadas, para que conteúdo de ódio, ofensivo ou ameaçador possa acionar um aviso em linha ou um caminho de revisão sem nunca chegar aos seus servidores.
Triagem de comentários sem infraestrutura
Passe cada comentário recebido pelo Toxic localmente no cliente e mande só o provável discurso de ódio para uma fila de moderação. O resto nunca precisa de um humano, e nenhum comentário custa uma chamada à nuvem.
Modere em 23 idiomas europeus
Um único arquivo de modelo cobre 23 idiomas, do inglês, espanhol e polonês ao búlgaro, estoniano e irlandês. Sem um modelo por idioma e sem uma etapa separada de detecção de idioma.
O que o modelo faz
- Três pontuações por texto: ódio, ofensa, ameaça.
- Dez sinais de alvo sob a pontuação de ódio: raça, cor, religião, ascendência, origem nacional ou étnica, orientação sexual, gênero, deficiência, idade, outro.
- 23 idiomas a partir de um único arquivo de modelo, com uma configuração recomendada por idioma nos metadados do modelo.
- Roda inteiramente no dispositivo. Nenhum texto sai do dispositivo para ser pontuado.
Especificações
- Idiomas
- 23, do inglês, do alemão e do francês ao grego, ao lituano e ao irlandês
- Tamanho no dispositivo
- 80 MB Core ML (4 bits); 91 MB LiteRT (int4); 100 MB ONNX (navegador)
- Modelo
- XLM-R-base, 12 camadas, 159,6M de parâmetros
- Acurácia
- 0,847 de macro F1 nos 7 idiomas da UE no Multilingual HateCheck, pesos publicados; 23 idiomas suportados
- Plataformas
- iOS e macOS (Core ML), Android (LiteRT), navegador (ONNX); pesos no Hugging Face, ainda não no SDK
O Toxic é um auxílio à triagem, não um veredito. Encaminhe as sinalizações a um revisor humano ou a uma camada local mais pesada, em vez de remover automaticamente.
O Toxic reage a palavras de ódio mesmo quando alguém as cita ou as condena, então contradiscurso e cobertura jornalística podem disparar a sinalização. Na configuração padrão, ele sinaliza de 26% a 30% do texto não odioso nos sete idiomas da UE em que foi medido, e 12% em inglês.
O Toxic separa bem discurso de ódio de texto comum, e muito menos bem discurso de ódio de simples grosseria, então um cliente irritado pode ser lido como odioso.
FAQ
O que é o Toxic?
Moderação no dispositivo que sinaliza texto de ódio, abusivo e ameaçador em 23 idiomas europeus, antes do envio.
O Toxic roda no dispositivo?
Sim. O Toxic roda no dispositivo, sem chamada a servidor, então os dados ficam com o usuário.
O Toxic já está disponível?
O Toxic está em beta fechado. Solicite acesso antecipado nesta página.
Quanto custa o Toxic?
Cada modelo é gratuito para até 100 mil dispositivos ativos mensais por SDK. Inferência ilimitada por usuário. Fale conosco para licenças personalizadas.
Qual a precisão e a velocidade do Toxic?
0,847 de macro F1 no Multilingual HateCheck propriamente dito, nos sete idiomas da UE que ele cobre, a partir de um modelo de 80 MB que roda no dispositivo. O guard model mais próximo pelo mesmo processo de avaliação é o Shieldstral-1.0-3B, da Mistral, com 0,786, e ele quer uma GPU de 16 GB; os do tamanho de um celular ficam em torno de 0,65.
Acesso antecipado
Conte o que você está construindo e ajudamos você a começar.