Desert Ant Labs

Toxic

혐오 표현 분류비공개 베타

온디바이스 모더레이션. 유럽 23개 언어의 혐오, 욕설, 위협 표현을 보내기 전에 표시합니다.

Toxic은(는) 비공개 베타 단계입니다. 모델 카드와 가중치는 공개되어 있습니다. 얼리 액세스는 요청 시 제공됩니다.

혐오 표현, 올라가기 전에 잡습니다.

Toxic은 세 가지를 따로 점수 매기므로 제품이 각각 다르게 다룰 수 있습니다. 혐오 표현은 보호 대상 집단을 향한 폭력이나 증오의 공개적 선동을 뜻합니다. 욕설은 심한 정도로 등급을 매긴 모욕입니다. 위협은 개인이나 집단을 향한 폭력을 뜻합니다.

사람이 작성한 예시 모음인 공개 스위트 Multilingual HateCheck에서, Toxic은 7개 EU 언어에 걸쳐 100점 만점에 약 85점을 받습니다. Mistral의 Shieldstral은 79점을 받고 16GB GPU가 필요합니다; 휴대폰 크기의 가드 모델들은 65점을 받습니다.

실제 혐오 표현에서 0.847, 80MB로.

기기에서 실행되는 80MB 모델로, 실제 Multilingual HateCheck의 7개 EU 언어에서 매크로 F1 0.847을 기록합니다. 같은 평가 파이프라인에서 가장 근접한 가드 모델은 Mistral의 Shieldstral-1.0-3B로 0.786이며, 16GB GPU가 필요합니다; 휴대폰에 맞는 크기의 모델들은 약 0.65입니다.

0.847
매크로 F1
7개 EU 언어, 배포되는 가중치
0.786
최고 성능 베이스라인
Shieldstral-1.0-3B, 같은 데이터
80MB
온디바이스
Core ML; 159.6M 파라미터
26-30%
오표시
정상 텍스트, 7개 EU 언어, 기본 설정

학습 체크포인트에서 추정한 것이 아니라 출시되는 가중치에서 측정했습니다; 같은 레시피를 세 번 돌린 평균은 0.834입니다. 기준값은 혐오 점수 0.40, 나머지 둘은 0.50입니다. 도메인 밖, 계보를 공유하지 않는 말뭉치에서: 5개 언어에 걸친 textdetox에서 0.724, 3개 언어에 걸친 offenseval2020에서 0.658. 7개 EU 언어는 실제 Multilingual HateCheck로 채점하고, 나머지 15개 언어는 HateCheck에 실제 집합이 없어 합성 집합으로 채점하므로, 그 수치는 비교 가능한 점수가 아니라 개발 단계 추정치입니다. 지연 시간은 아직 측정하지 않았습니다.

활용 사례

혐오 표현, 올라가기 전에 잡습니다.

메시지가 전송되기 전에 경고

기기에서 발신 메시지에 미리 점수를 매깁니다. 혐오, 욕설, 위협이 담긴 내용은 서버에 닿기도 전에 인라인 경고나 검토 경로를 띄울 수 있습니다.

인프라 없는 댓글 분류

들어오는 댓글을 클라이언트에서 Toxic으로 모두 처리하고, 혐오 표현일 가능성이 있는 것만 모더레이터 대기열로 보냅니다. 나머지는 사람 손을 거칠 필요가 없고, 댓글 하나에 클라우드 호출 비용이 들지 않습니다.

유럽 23개 언어에서 모더레이션

하나의 모델 파일이 영어, 스페인어, 폴란드어부터 불가리아어, 에스토니아어, 아일랜드어까지 23개 언어를 지원합니다. 언어별 모델도, 별도의 언어 감지 단계도 없습니다.

모델이 하는 일

  • 텍스트마다 세 가지 점수: 혐오, 욕설, 위협.
  • 혐오 점수 아래 열 개의 대상 신호: 인종, 피부색, 종교, 혈통, 국가나 민족 기원, 성적 지향, 성별, 장애, 나이, 그 외.
  • 모델 파일 하나로 23개 언어를 다루며, 언어별 권장 임계값이 모델 메타데이터에 함께 들어 있습니다.
  • 전적으로 기기에서 실행됩니다. 점수를 매기려고 텍스트가 기기를 벗어나지 않습니다.

사양

언어
23개. 영어, 독일어, 프랑스어부터 그리스어, 리투아니아어, 아일랜드어까지
온디바이스 크기
80MB Core ML (4-bit); 91MB LiteRT (int4); 100MB ONNX (브라우저)
모델
XLM-R-base, 12개 레이어, 159.6M 파라미터
정확도
Multilingual HateCheck의 7개 EU 언어에서 매크로 F1 0.847, 출시된 가중치; 23개 언어 지원
플랫폼
iOS와 macOS (Core ML), Android (LiteRT), 브라우저 (ONNX); 가중치는 Hugging Face에 있으며 아직 SDK에는 없습니다

Toxic은 판정이 아니라 분류를 돕는 도구입니다. 자동 삭제 대신 표시된 것을 사람 검토자나 더 무거운 로컬 계층으로 보내세요.

Toxic은 누군가 인용하거나 규탄할 때조차 혐오 표현의 단어에 반응하므로, 혐오에 맞서는 발언이나 뉴스 보도가 표시에 걸릴 수 있습니다. 기본 설정에서, 측정한 7개 EU 언어에서는 혐오가 아닌 텍스트의 26~30%를, 영어에서는 12%를 표시합니다.

Toxic은 혐오 표현을 일반 텍스트와는 잘 구분하지만, 혐오 표현을 단순한 무례함과는 훨씬 덜 구분하므로, 화난 고객이 혐오로 읽힐 수 있습니다.

자주 묻는 질문

Toxic은(는) 무엇인가요?

온디바이스 모더레이션. 유럽 23개 언어의 혐오, 욕설, 위협 표현을 보내기 전에 표시합니다.

Toxic은(는) 온디바이스로 실행되나요?

네. Toxic은(는) 서버 호출 없이 기기에서 실행되므로, 데이터는 사용자의 기기에 그대로 남습니다.

Toxic은(는) 지금 사용할 수 있나요?

Toxic은(는) 비공개 베타 단계입니다. 이 페이지에서 얼리 액세스를 요청할 수 있습니다.

Toxic의 비용은 얼마인가요?

모든 모델은 SDK당 월간 활성 기기 10만 대까지 무료입니다. 사용자당 추론은 무제한입니다. 맞춤 라이선스는 문의하기 바랍니다.

Toxic은(는) 얼마나 정확하고 빠른가요?

기기에서 실행되는 80MB 모델로, 실제 Multilingual HateCheck의 7개 EU 언어에서 매크로 F1 0.847을 기록합니다. 같은 평가 파이프라인에서 가장 근접한 가드 모델은 Mistral의 Shieldstral-1.0-3B로 0.786이며, 16GB GPU가 필요합니다; 휴대폰에 맞는 크기의 모델들은 약 0.65입니다.

얼리 액세스

무엇을 만들고 계신지 알려주시면 설정을 도와드리겠습니다.