신호 공개 채팅 데이터가 실제 AI 오정렬을 예측할 수 있는가
요약
OpenAI 정렬팀은 내부 프로덕션 데이터에 접근하지 않고도 WildChat 같은 공개 데이터셋이 실제 모델 오정렬을 예측하는 대리지표로 쓰일 수 있는지 검토했고, GPT-5.1·5.2·5.4에 대해 WildChat이 평균 약 3배 오차 범위 내에서 프로덕션의 바람직하지 않은 행동 비율을 예측한다는 사실을 확인했다. '배포 시뮬레이션'이라 불리는 이 방법은 2025년 8월부터 2026년 3월까지 GPT-5 시리즈 씽킹 모델 4건의 배포에 걸쳐 검증됐으며, 금지 콘텐츠와 오정렬 행동을 아우르는 20개 추적 범주에서 약 130만 건의 비식별 대화를 분석했다. 연구진이 예측을 확정하기 전 실제 프로덕션 수치를 알 수 없도록 한 가장 엄격한 GPT-5.4 결과-블라인드 테스트에서는 중앙값 오차가 1.5배였고, 모델 버전 간 변화가 가장 컸던 범주에서는 방향성 정확도가 92%(도전적 프롬프트 기준선의 54% 대비)에 달했다. 예측 성능은 현재 프로덕션 사용이 WildChat의 원래 범위에서 가장 멀어진 기술적·에이전틱 형태의 오정렬에서 가장 크게 저하됐다. 이 연구는 사전배포 결과가 실제 모델 행동을 지속적으로 예측하지 못한다고 지적한 2026 국제 AI 안전 보고서의 '평가 격차' 문제를 다룬다.
분류
주 주제AI·컴퓨팅
지역 메뉴글로벌
영향 지역scope:global
시간 지평0~3년 (2026-07-29)
최종 갱신2026-07-28T14:11:55.790559+00:00
근거 1
- OpenAI Alignment Blog 2026-06-16 접근 2026-07-28T13:59:37+00:00
속한 트렌드 0
해당 객체가 없다.
직접 연결 이슈 0
해당 객체가 없다.
공개 식별자: fm-b1484691cf84