신호 논문, 게임 메커니즘 활용한 AI 마음이론 평가 벤치마크 'Avalon-ToM-Bench' 제안
요약
한 연구가 AI의 마음이론 능력을 평가하는 새 벤치마크 'Avalon-ToM-Bench'를 제안했다. 마음이론은 에이전트 간 상호작용에 필수적이지만, 기존 평가는 정신상태 추론을 지나치게 단순화한 정적 시나리오이거나 진단적 통찰이 제한적인 상호작용형 설정에 머물러 왔다. 이 벤치마크는 사회적 추리게임 '레지스탕스: 아발론'의 비대칭 정보 메커니즘을 이용해 마음이론을 조작적으로 정의한다. 전체 게임플레이를 통째로 평가하는 대신, 인식적 추론과 동기적 추론을 나누는 2x2 분류체계로 마음이론을 잘게 분해한다. 이런 세분화는 AI가 타인의 믿음과 의도를 얼마나 정교하게 추론하는지 더 정밀하게 진단하도록 돕는다.
분류
주 주제AI·컴퓨팅
지역 메뉴글로벌
영향 지역scope:global
시간 지평0~3년 (2026-08-12)
최종 갱신2026-09-25 22:32 KST
근거 1
- Avalon-ToM-Bench: Evaluating Fine-Grained Theory of Mind via Asymmetric Game Mechanics arXiv (cs.AI, cs.CL, cs.CY, cs.GT) 2026-08-10 접근 2026-08-12T11:40:08+00:00
속한 트렌드 0
해당 객체가 없다.
직접 연결 이슈 0
해당 객체가 없다.
공개 식별자: fm-b62600d19643
