미래 신호·트렌드·이슈를 관측하는 공개 대시보드
구독로그인English
최신 관측일
2026-10-08
공개 객체
4434
빌드 시각
2026-10-08 19:44 KST
더 퓨처스

신호 규범을 따르다: 미세조정과 프롬프트가 모델 근거 제시에 미치는 영향

요약

AI 시스템을 학습시키고 정렬하는 데 흔히 쓰이는 규범 데이터셋은 중립적인 도덕 지식이 아니라 행동을 유도하는 패턴으로 작동할 수 있다. 이 논문은 AI 시스템을 대리 행위자로 놓고, 미세조정과 프롬프트 과정에서 데이터셋 수준의 규범이 고충돌 도덕적 딜레마 상황에서 시스템을 기본 안전행동에서 벗어나게 만들 수 있는지 시험한다. 저자들은 미세조정 데이터의 구성 방식과 프롬프트의 프레이밍 방식 모두가 모델이 제시하는 근거에 측정 가능한 영향을 준다는 점을 세 가지 기여로 제시한다. 이는 겉보기에 중립적인 학습 데이터라도 윤리적으로 민감한 상황에서 모델 행동을 은밀히 조종할 수 있다는 것을 보여준다. 결과적으로 이 연구는 AI 안전성과 정렬 검증 과정에서 규범 데이터셋 자체를 점검 대상으로 삼아야 한다는 문제의식을 제기한다.

분류

주 주제AI·컴퓨팅
지역 메뉴글로벌
영향 지역scope:global
시간 지평0~3년 (2026-08-16)
최종 갱신2026-09-25 22:32 KST

근거 1

속한 트렌드 0

해당 객체가 없다.

직접 연결 이슈 0

해당 객체가 없다.

공개 식별자: fm-d51c403b6681