신호 독성 언어를 정화하는 책임 있는 AI 디자인사이언스 연구
요약
페이오러티브, 조롱, 무시, 미묘한 무례 등 디지털 업무공간의 독성 언어는 신뢰와 사기, 협업을 저해할 수 있다. 기존 모더레이션 도구는 대부분 유해 메시지를 삭제하거나 차단해 소통을 중단시키고 건설적 해결책을 제공하지 못한다. 이 연구는 디자인사이언스 리서치 접근을 채택해 독성 소통을 탐지하고 정화하는 책임 있는 AI 아티팩트를 만들었다. 이 아티팩트는 미세조정된 트랜스포머 기반 분류기(DistilBERT, DistilRoBERTa)와 독성 텍스트를 의미적으로 동등한 비공격적 문장으로 재작성하는 생성형 디톡스 모델(mT0-XL-Detox-ORPO)을 결합했다. 기술 평가 결과 독성 탐지 정확도가 높았고 재작성된 메시지의 의미 보존력도 강해 대화의 연속성을 지원하면서 존중하는 담론을 뒷받침했다. 논문은 의미 보존과 공정성을 우선하는 책임 있는 AI 모더레이션 설계 원칙을 기여로 제시한다.
분류
주 주제AI·컴퓨팅
부주제노동·일의 미래
지역 메뉴글로벌
영향 지역scope:global
시간 지평0~3년 (2026-08-31)
최종 갱신2026-09-17 14:30 KST
근거 1
- Detoxifying Toxic Communication: A Design Science Approach to Responsible AI arXiv (cs.CY) 2026-08-31 접근 2026-09-17T05:23:12+00:00
속한 트렌드 0
해당 객체가 없다.
직접 연결 이슈 0
해당 객체가 없다.
공개 식별자: fm-1ff44fc420a1
