신호 모델 비공개 상태로 다중집단 공정성을 능동 감사하는 'Bias Probe' 프레임워크
요약
이 논문은 공정성 인지 머신러닝 학습이 실무에서 표준 ERM 대비 제한적 개선만 제공한다는 문제와, 배포 모델에 대한 신뢰할 수 있는 사후 감사의 필요성을 다룬다. 기존 블랙박스 감사는 모델 재구성(추출공격 노출)에 의존하거나 공정성 지표만 직접 추정해, 어느 데이터 영역이 편향을 유발하는지 통찰을 거의 주지 못한다. 저자들은 모델을 재구성하지 않고 목표 공정성 정보만 추출하는 '속성별 감사'가 지금까지 제대로 규명되지 않았다고 지적한다. 이들은 모델 기밀성을 지키며 편향 구조를 드러내는 표적·적응형 질의 'bias probe' 프레임워크와, 이를 학습하는 능동 감사자 ALeBi를 제안해 다중집단 공정성 지표를 효율적으로 추정한다. 속성별 복잡도 척도 기반의 새 표본복잡도 보장을 수립하고, 소유자가 편향을 전략적으로 은폐하는 적대적 설정까지 분석을 넓혀 모델 기밀성과 신뢰성 있는 감사 사이의 근본적 트레이드오프를 밝힌다.
분류
주 주제AI·컴퓨팅
지역 메뉴글로벌
영향 지역scope:global
시간 지평0~3년 (2026-10-02)
최종 갱신2026-10-02 11:32 KST
근거 1
- Efficient Active Auditing of Multi-Group Fairness with Bias Probes arXiv (cs.LG / cs.AI / cs.CY) 2026-09-30 접근 2026-10-01T23:00:11+00:00
속한 트렌드 0
해당 객체가 없다.
직접 연결 이슈 0
해당 객체가 없다.
공개 식별자: fm-6059579203ff
