Toxic
Moderação no dispositivo que assinala texto de ódio, abusivo e ameaçador em 23 línguas europeias, antes do envio.

Apanhe o discurso de ódio antes de ser publicado.
O Toxic pontua três coisas em separado, por isso um produto pode tratá-las de formas diferentes. Discurso de ódio é a incitação pública à violência ou ao ódio contra um grupo protegido. Ofensa são insultos, ordenados pela gravidade. Ameaça é violência contra uma pessoa ou um grupo.
No Multilingual HateCheck, um conjunto público de exemplos escritos por pessoas, o Toxic acerta cerca de 85 em 100 nas sete línguas da UE. O Shieldstral, da Mistral, acerta 79 e quer uma GPU de 16 GB; os modelos «guard» do tamanho de um telemóvel acertam 65.
0,847 em discurso de ódio real, a partir de 80 MB.
0,847 de macro F1 no Multilingual HateCheck propriamente dito, nas sete línguas da UE que ele cobre, a partir de um modelo de 80 MB que corre no dispositivo. O guard model mais próximo pelo mesmo processo de avaliação é o Shieldstral-1.0-3B, da Mistral, com 0,786, e ele quer uma GPU de 16 GB; os do tamanho de um telemóvel ficam em torno de 0,65.
Medido nos pesos publicados, não extrapolado de um checkpoint de treino; três execuções da mesma receita dão em média 0,834. O limiar é de 0,40 para a pontuação de ódio e de 0,50 para as outras duas. Fora do domínio, em corpora sem parentesco comum: 0,724 no textdetox em 5 línguas e 0,658 no offenseval2020 em 3. As sete línguas da UE são avaliadas no Multilingual HateCheck propriamente dito; as outras 15 são avaliadas em conjuntos sintéticos, porque o HateCheck não tem um conjunto real para eles, e esses números são estimativas de desenvolvimento, não notas comparáveis. A latência ainda não foi medida.
Casos de uso
Apanhe o discurso de ódio antes de ser publicado.
Avise antes de a mensagem ser enviada
Pontue as mensagens de saída no dispositivo antes de serem enviadas, para que conteúdo de ódio, ofensivo ou ameaçador possa acionar um aviso em linha ou um caminho de revisão sem nunca chegar aos seus servidores.
Triagem de comentários sem infraestrutura
Passe cada comentário recebido pelo Toxic localmente no cliente e envie só o provável discurso de ódio para uma fila de moderação. O resto nunca precisa de um humano, e nenhum comentário custa uma chamada à nuvem.
Modere em 23 línguas europeias
Um único ficheiro de modelo cobre 23 línguas, do inglês, espanhol e polaco ao búlgaro, estoniano e irlandês. Sem um modelo por língua e sem uma etapa separada de deteção de língua.
O que o modelo faz
- Três pontuações por texto: ódio, ofensa, ameaça.
- Dez sinais de alvo sob a pontuação de ódio: raça, cor, religião, ascendência, origem nacional ou étnica, orientação sexual, género, deficiência, idade, outro.
- 23 línguas a partir de um único ficheiro de modelo, com uma configuração recomendada por língua nos metadados do modelo.
- Roda inteiramente no dispositivo. Nenhum texto sai do dispositivo para ser pontuado.
Especificações
- Línguas
- 23, do inglês, do alemão e do francês ao grego, ao lituano e ao irlandês
- Tamanho no dispositivo
- 80 MB Core ML (4 bits); 91 MB LiteRT (int4); 100 MB ONNX (navegador)
- Modelo
- XLM-R-base, 12 camadas, 159,6M de parâmetros
- Exatidão
- 0,847 de macro F1 nas 7 línguas da UE no Multilingual HateCheck, pesos publicados; 23 línguas suportadas
- Plataformas
- iOS e macOS (Core ML), Android (LiteRT), navegador (ONNX); pesos no Hugging Face, ainda não no SDK
O Toxic é um auxílio à triagem, não um veredicto. Encaminhe as sinalizações a um revisor humano ou a uma camada local mais pesada, em vez de remover automaticamente.
O Toxic reage a palavras de ódio mesmo quando alguém as cita ou as condena, então contradiscurso e cobertura jornalística podem disparar a sinalização. Na configuração predefinida, ele sinaliza de 26% a 30% do texto não odioso nas sete línguas da UE em que foi medido, e 12% em inglês.
O Toxic separa bem discurso de ódio de texto comum, e muito menos bem discurso de ódio de simples grosseria, então um cliente irritado pode ser lido como odioso.
FAQ
O que é o Toxic?
Moderação no dispositivo que assinala texto de ódio, abusivo e ameaçador em 23 línguas europeias, antes do envio.
O Toxic é executado no dispositivo?
Sim. O Toxic é executado no dispositivo, sem qualquer chamada a servidores, por isso os dados ficam com o utilizador.
O Toxic já está disponível?
O Toxic está em beta fechada. Peça acesso antecipado nesta página.
Quanto custa o Toxic?
Cada modelo é gratuito para até 100 mil dispositivos ativos mensais por SDK. Inferência ilimitada por utilizador. Contacte-nos para licenças personalizadas.
Qual é a precisão ou a rapidez do Toxic?
0,847 de macro F1 no Multilingual HateCheck propriamente dito, nas sete línguas da UE que ele cobre, a partir de um modelo de 80 MB que corre no dispositivo. O guard model mais próximo pelo mesmo processo de avaliação é o Shieldstral-1.0-3B, da Mistral, com 0,786, e ele quer uma GPU de 16 GB; os do tamanho de um telemóvel ficam em torno de 0,65.
Acesso antecipado
Diga-nos o que está a construir e ajudamo-lo a começar.