Who.
온디바이스 화자 라벨링. 녹음을 사람별 발화 구간으로 나누고 얼굴 박스와 타임스탬프를 붙여, 바로 자르거나 자막을 달 수 있습니다.
인터뷰를, 바로 편집할 수 있는 상태로.
두 시간짜리 2카메라 인터뷰를 녹화하면 Who가 화자별로 나눠 주므로, 한 사람이 말한 부분으로 건너뛰거나 화자가 바뀔 때마다 자를 수 있습니다.
Who는 들으면서 동시에 입 모양을 보기 때문에, 발화가 겹치거나 짧게 끼어드는 순간에도 화자 표시가 흔들리지 않습니다. 발화마다 화자 ID, 얼굴 트랙 ID, 정규화된 얼굴 경계 상자, 밀리초 타임스탬프가 담기며, Whisper 전사본과 같은 형태입니다.
화자 추적 편집
화자가 바뀔 때마다 컷을 넣거나 카메라를 전환합니다. 토킹헤드와 멀티캠 영상에서는 얼굴 상자로 화면을 어디에 잡을지 정하십시오.
이름이 붙은 자막
Whisper 호환 전사 발화에 화자 라벨을 붙입니다. 시청자는 이름 없는 텍스트 덩어리가 아니라, 각 줄을 누가 말했는지 읽게 됩니다.
한 사람이 한 말 찾아내기
두 시간짜리 녹화를 기기에서 사람별 발화로 나눕니다. 화자로 걸러 그 발화로 바로 건너뛰면 되고, 타임라인을 훑을 필요가 없습니다.
모델이 하는 일
- 발화 단위: 화자 ID, 얼굴 트랙 ID, 정규화된 얼굴 bbox, 밀리초 타임스탬프.
- 자막 파이프라인을 위한 Whisper 호환 발화.
- 오디오만이 아니라 화면도 함께 씁니다.
사양
- 플랫폼
- Apple (Swift) 우선
자주 묻는 질문
Who은(는) 무엇인가요?
온디바이스 화자 라벨링. 녹음을 사람별 발화 구간으로 나누고 얼굴 박스와 타임스탬프를 붙여, 바로 자르거나 자막을 달 수 있습니다.
Who은(는) 온디바이스로 실행되나요?
네. Who은(는) 서버 호출 없이 기기에서 실행되므로, 데이터는 사용자의 기기에 그대로 남습니다.
Who은(는) 지금 사용할 수 있나요?
Who은(는) 비공개 베타 단계입니다. 이 페이지에서 얼리 액세스를 요청할 수 있습니다.
Who의 비용은 얼마인가요?
모든 모델은 SDK당 월간 활성 기기 10만 대까지 무료입니다. 사용자당 추론은 무제한입니다. 맞춤 라이선스는 문의하기 바랍니다.
얼리 액세스
무엇을 만들고 계신지 알려주시면 설정을 도와드리겠습니다.