신호 이미지 속 권위 신호가 VLM 판단을 흔든다: 무시 지시에도 불구하고
요약
이 연구는 비전-언어모델(VLM)이 명시적으로 무시하라는 지시를 받았음에도 권위 신호에 얼마나 흔들리는지 검증하기 위해 GradeTrap을 도입했다. 이 평가는 동조를 유발하는 학생 답안과, 동료·교사·정답지에 귀속돼 권위 기반 순응을 유발하는 상충 답안을 직접 충돌시킨다. 모델은 독립적으로 풀고 학생 답안·피드백·채점 표시를 모두 무시하라는 지시를 받으며 60개의 합성 실세계 트레이드오프 시나리오에서 자유형식 답을 생성했다. 5회의 중립 시행으로 모델별 기준 선호를 세운 뒤, 대조군을 포함한 6가지 신호를 각 3회 반복 제시했다. 세 모델(Gemini 3.5 Flash-Lite, GPT-5.6 Luna, Claude Haiku 4.5)에 공통되는 45개 항목에서 일반 대조군의 상충 답안 선택률은 5.4%였던 반면, 이 대조군 대비 교사 리뷰 신호는 6.9포인트, 정답지 신호는 19.5포인트 선택률을 끌어올렸고 동료 리뷰 효과는 신뢰할 만한 수준으로 나타나지 않았다. 학생 답안 단독 제시와 참조 답안 단독 제시를 비교하면 선택률은 2.2%에서 5.2%로만 올랐는데, 이는 정답지 출처가 명시적 무시 지시와 반대 학생 답안이 함께 있어도 판단을 더 강하게 이동시켰음을 뜻하며, 효과 크기는 세 모델 간에 차이가 있었다.
분류
주 주제AI·컴퓨팅
지역 메뉴글로벌
영향 지역scope:global
시간 지평0~3년 (2026-09-05)
최종 갱신2026-09-17 14:30 KST
근거 1
- GradeTrap: Authority Cues in Images Shift VLM Judgments Despite Explicit Instructions to Ignore Them arXiv (cs.CY) 2026-09-05 접근 2026-09-17T05:23:17+00:00
속한 트렌드 0
해당 객체가 없다.
직접 연결 이슈 0
해당 객체가 없다.
공개 식별자: fm-01a37939b39c
