Desert Ant Labs

Toxic

Triagem de discurso de ódioBeta fechada

Moderação no dispositivo que assinala texto de ódio, abusivo e ameaçador em 23 línguas europeias, antes do envio.

O Toxic está em beta fechada. O model card e os pesos são públicos. Acesso antecipado mediante pedido.

Apanhe o discurso de ódio antes de ser publicado.

O Toxic pontua três coisas em separado, por isso um produto pode tratá-las de formas diferentes. Discurso de ódio é a incitação pública à violência ou ao ódio contra um grupo protegido. Ofensa são insultos, ordenados pela gravidade. Ameaça é violência contra uma pessoa ou um grupo.

No Multilingual HateCheck, um conjunto público de exemplos escritos por pessoas, o Toxic acerta cerca de 85 em 100 nas sete línguas da UE. O Shieldstral, da Mistral, acerta 79 e quer uma GPU de 16 GB; os modelos «guard» do tamanho de um telemóvel acertam 65.

0,847 em discurso de ódio real, a partir de 80 MB.

0,847 de macro F1 no Multilingual HateCheck propriamente dito, nas sete línguas da UE que ele cobre, a partir de um modelo de 80 MB que corre no dispositivo. O guard model mais próximo pelo mesmo processo de avaliação é o Shieldstral-1.0-3B, da Mistral, com 0,786, e ele quer uma GPU de 16 GB; os do tamanho de um telemóvel ficam em torno de 0,65.

0,847
Macro F1
7 línguas da UE, pesos publicados
0,786
Melhor referência
Shieldstral-1.0-3B, mesmos exemplos
80 MB
No dispositivo
Core ML; 159,6M de parâmetros
26-30%
Sinalizações falsas
texto limpo, 7 línguas da UE, configuração predefinida

Medido nos pesos publicados, não extrapolado de um checkpoint de treino; três execuções da mesma receita dão em média 0,834. O limiar é de 0,40 para a pontuação de ódio e de 0,50 para as outras duas. Fora do domínio, em corpora sem parentesco comum: 0,724 no textdetox em 5 línguas e 0,658 no offenseval2020 em 3. As sete línguas da UE são avaliadas no Multilingual HateCheck propriamente dito; as outras 15 são avaliadas em conjuntos sintéticos, porque o HateCheck não tem um conjunto real para eles, e esses números são estimativas de desenvolvimento, não notas comparáveis. A latência ainda não foi medida.

Casos de uso

Apanhe o discurso de ódio antes de ser publicado.

Avise antes de a mensagem ser enviada

Pontue as mensagens de saída no dispositivo antes de serem enviadas, para que conteúdo de ódio, ofensivo ou ameaçador possa acionar um aviso em linha ou um caminho de revisão sem nunca chegar aos seus servidores.

Triagem de comentários sem infraestrutura

Passe cada comentário recebido pelo Toxic localmente no cliente e envie só o provável discurso de ódio para uma fila de moderação. O resto nunca precisa de um humano, e nenhum comentário custa uma chamada à nuvem.

Modere em 23 línguas europeias

Um único ficheiro de modelo cobre 23 línguas, do inglês, espanhol e polaco ao búlgaro, estoniano e irlandês. Sem um modelo por língua e sem uma etapa separada de deteção de língua.

O que o modelo faz

  • Três pontuações por texto: ódio, ofensa, ameaça.
  • Dez sinais de alvo sob a pontuação de ódio: raça, cor, religião, ascendência, origem nacional ou étnica, orientação sexual, género, deficiência, idade, outro.
  • 23 línguas a partir de um único ficheiro de modelo, com uma configuração recomendada por língua nos metadados do modelo.
  • Roda inteiramente no dispositivo. Nenhum texto sai do dispositivo para ser pontuado.

Especificações

Línguas
23, do inglês, do alemão e do francês ao grego, ao lituano e ao irlandês
Tamanho no dispositivo
80 MB Core ML (4 bits); 91 MB LiteRT (int4); 100 MB ONNX (navegador)
Modelo
XLM-R-base, 12 camadas, 159,6M de parâmetros
Exatidão
0,847 de macro F1 nas 7 línguas da UE no Multilingual HateCheck, pesos publicados; 23 línguas suportadas
Plataformas
iOS e macOS (Core ML), Android (LiteRT), navegador (ONNX); pesos no Hugging Face, ainda não no SDK

O Toxic é um auxílio à triagem, não um veredicto. Encaminhe as sinalizações a um revisor humano ou a uma camada local mais pesada, em vez de remover automaticamente.

O Toxic reage a palavras de ódio mesmo quando alguém as cita ou as condena, então contradiscurso e cobertura jornalística podem disparar a sinalização. Na configuração predefinida, ele sinaliza de 26% a 30% do texto não odioso nas sete línguas da UE em que foi medido, e 12% em inglês.

O Toxic separa bem discurso de ódio de texto comum, e muito menos bem discurso de ódio de simples grosseria, então um cliente irritado pode ser lido como odioso.

FAQ

O que é o Toxic?

Moderação no dispositivo que assinala texto de ódio, abusivo e ameaçador em 23 línguas europeias, antes do envio.

O Toxic é executado no dispositivo?

Sim. O Toxic é executado no dispositivo, sem qualquer chamada a servidores, por isso os dados ficam com o utilizador.

O Toxic já está disponível?

O Toxic está em beta fechada. Peça acesso antecipado nesta página.

Quanto custa o Toxic?

Cada modelo é gratuito para até 100 mil dispositivos ativos mensais por SDK. Inferência ilimitada por utilizador. Contacte-nos para licenças personalizadas.

Qual é a precisão ou a rapidez do Toxic?

0,847 de macro F1 no Multilingual HateCheck propriamente dito, nas sete línguas da UE que ele cobre, a partir de um modelo de 80 MB que corre no dispositivo. O guard model mais próximo pelo mesmo processo de avaliação é o Shieldstral-1.0-3B, da Mistral, com 0,786, e ele quer uma GPU de 16 GB; os do tamanho de um telemóvel ficam em torno de 0,65.

Acesso antecipado

Diga-nos o que está a construir e ajudamo-lo a começar.