Signal Detoxifying Toxic Communication: A Design Science Approach to Responsible AI
Summary
Toxic language in digital workplaces -- pejoratives, sarcasm, condescension, and subtle incivility -- can erode trust, morale, and collaboration, yet existing moderation tools primarily delete or block harmful messages, disrupting communication without offering constructive resolution. This study adopts a Design Science Research approach to create a responsible AI artifact that detects and detoxifies toxic communication. The artifact integrates fine-tuned transformer-based classifiers (DistilBERT, DistilRoBERTa) with a generative detoxification model (mT0-XL-Detox-ORPO) that rewrites toxic text into semantically equivalent, non-offensive paraphrases. Technical evaluation demonstrated high accuracy in toxicity detection and strong semantic preservation in rewritten messages, supporting conversation continuity while reinforcing respectful discourse. The paper contributes design principles for responsible AI moderation that prioritize meaning preservation and fairness.
Classification
Evidence 1
- Detoxifying Toxic Communication: A Design Science Approach to Responsible AI arXiv (cs.CY) 2026-08-31 accessed 2026-09-17T05:23:12+00:00
Part of trends 0
No objects.
Directly linked issues 0
No objects.
Public id: fm-1ff44fc420a1
