Toxic
Moderación en el dispositivo que marca texto de odio, abusivo y amenazante en 23 idiomas europeos, antes de enviarlo.

Intercepta el discurso de odio antes de que se publique.
Toxic puntúa tres cosas por separado, así que un producto puede tratarlas de forma distinta. El discurso de odio es la incitación pública a la violencia o al odio contra un grupo protegido. El abuso son insultos, ordenados por gravedad. Una amenaza es violencia contra una persona o un grupo.
En Multilingual HateCheck, un conjunto público de ejemplos escritos por personas, Toxic acierta unos 85 de cada 100 en los siete idiomas de la UE. Shieldstral de Mistral saca 79 y necesita una GPU de 16 GB; los modelos guardianes del tamaño de un teléfono sacan 65.
0,847 en discurso de odio real, desde 80 MB.
0,847 de F1 macro en el Multilingual HateCheck real en los siete idiomas de la UE que cubre, desde un modelo de 80 MB que se ejecuta en el dispositivo. El modelo guardián más cercano con el mismo procedimiento es Shieldstral-1.0-3B de Mistral, con 0,786, y necesita una GPU de 16 GB; los del tamaño de un teléfono rondan el 0,65.
Medido sobre los pesos que se publican, no extrapolado de un punto de control de entrenamiento; tres ejecuciones de la misma receta promedian 0,834. El umbral es 0,40 para la puntuación de odio y 0,50 para las otras dos. Fuera de dominio, en corpus sin linaje compartido: 0,724 en textdetox en 5 idiomas y 0,658 en offenseval2020 en 3. Los siete idiomas de la UE se evalúan con el Multilingual HateCheck real; los otros 15 se evalúan con conjuntos sintéticos, porque HateCheck no tiene un conjunto real para ellos, y esas cifras son estimaciones de desarrollo más que puntuaciones comparables. La latencia aún no se ha medido.
Casos de uso
Intercepta el discurso de odio antes de que se publique.
Avisa antes de que se envíe el mensaje
Puntúa los mensajes salientes en el dispositivo antes de que se envíen, para que el contenido de odio, abusivo o amenazante pueda activar un aviso en línea o una ruta de revisión sin llegar nunca a tus servidores.
Triaje de comentarios sin infraestructura
Pasa cada comentario entrante por Toxic en local, en el cliente, y manda a la cola de moderación solo lo que probablemente sea discurso de odio. El resto no lo tiene que mirar nadie, y ningún comentario cuesta una llamada a la nube.
Modera en 23 idiomas europeos
Un solo archivo de modelo cubre 23 idiomas, del inglés, el español y el polaco al búlgaro, el estonio y el irlandés. Sin un modelo por idioma y sin un paso aparte de detección de idioma.
Qué hace el modelo
- Tres puntuaciones por texto: odio, abuso y amenaza.
- Diez señales de objetivo bajo la puntuación de odio: raza, color, religión, ascendencia, origen nacional o étnico, orientación sexual, género, discapacidad, edad, otro.
- 23 idiomas desde un único archivo de modelo, con un ajuste recomendado por idioma en los metadatos del modelo.
- Se ejecuta íntegramente en el dispositivo. Ningún texto sale del dispositivo para ser evaluado.
Especificaciones
- Idiomas
- 23, desde el inglés, el alemán y el francés hasta el griego, el lituano y el irlandés
- Tamaño en el dispositivo
- 80 MB Core ML (4 bits); 91 MB LiteRT (int4); 100 MB ONNX (navegador)
- Modelo
- XLM-R-base, 12 capas, 159,6M de parámetros
- Exactitud
- 0,847 de F1 macro en los 7 idiomas de la UE de Multilingual HateCheck, con los pesos publicados; 23 idiomas admitidos
- Plataformas
- iOS y macOS (Core ML), Android (LiteRT), navegador (ONNX); pesos en Hugging Face, aún no en el SDK
Toxic es una ayuda de triaje, no un veredicto. Envía las marcas a un revisor humano o a un nivel local más pesado en lugar de eliminar de forma automática.
Toxic reacciona a las palabras de odio incluso cuando alguien las cita o las condena, así que el contradiscurso y las noticias pueden activar la marca. Con el ajuste por defecto marca entre el 26 y el 30% del texto no ofensivo en los siete idiomas de la UE en los que se midió, y el 12% en inglés.
Toxic separa bien el discurso de odio del texto corriente, y mucho peor el discurso de odio de la mera grosería, así que un cliente enfadado puede leerse como odioso.
Preguntas frecuentes
¿Qué es Toxic?
Moderación en el dispositivo que marca texto de odio, abusivo y amenazante en 23 idiomas europeos, antes de enviarlo.
¿Toxic se ejecuta en el dispositivo?
Sí. Toxic se ejecuta en el dispositivo, sin llamadas a servidor, así que los datos se quedan con el usuario.
¿Ya está disponible Toxic?
Toxic está en beta cerrada. Solicita acceso anticipado en esta página.
¿Cuánto cuesta Toxic?
Todos los modelos son gratis hasta 100 000 dispositivos activos mensuales por SDK. Inferencia ilimitada por usuario. Contáctanos para licencias personalizadas.
¿Qué precisión o velocidad tiene Toxic?
0,847 de F1 macro en el Multilingual HateCheck real en los siete idiomas de la UE que cubre, desde un modelo de 80 MB que se ejecuta en el dispositivo. El modelo guardián más cercano con el mismo procedimiento es Shieldstral-1.0-3B de Mistral, con 0,786, y necesita una GPU de 16 GB; los del tamaño de un teléfono rondan el 0,65.
Acceso anticipado
Cuéntanos qué estás construyendo y te lo dejamos listo.