신호 규범을 따르다: 미세조정과 프롬프트가 모델 근거 제시에 미치는 영향
요약
AI 시스템을 학습시키고 정렬하는 데 흔히 쓰이는 규범 데이터셋은 중립적인 도덕 지식이 아니라 행동을 유도하는 패턴으로 작동할 수 있다. 이 논문은 AI 시스템을 대리 행위자로 놓고, 미세조정과 프롬프트 과정에서 데이터셋 수준의 규범이 고충돌 도덕적 딜레마 상황에서 시스템을 기본 안전행동에서 벗어나게 만들 수 있는지 시험한다. 저자들은 미세조정 데이터의 구성 방식과 프롬프트의 프레이밍 방식 모두가 모델이 제시하는 근거에 측정 가능한 영향을 준다는 점을 세 가지 기여로 제시한다. 이는 겉보기에 중립적인 학습 데이터라도 윤리적으로 민감한 상황에서 모델 행동을 은밀히 조종할 수 있다는 것을 보여준다. 결과적으로 이 연구는 AI 안전성과 정렬 검증 과정에서 규범 데이터셋 자체를 점검 대상으로 삼아야 한다는 문제의식을 제기한다.
분류
주 주제AI·컴퓨팅
부주제가치관·라이프스타일
지역 메뉴글로벌
영향 지역scope:global
시간 지평0~3년 (2026-08-16)
최종 갱신2026-09-25 22:32 KST
근거 1
- Follow the Norm: Accounting for Fine-Tuning and Prompt Effects on Model Rationales arXiv (cs.CY) 2026-08-13 접근 2026-08-16T10:59:38+00:00
속한 트렌드 0
해당 객체가 없다.
직접 연결 이슈 0
해당 객체가 없다.
공개 식별자: fm-d51c403b6681
