신호 AI 벤치마크가 실제로 재는 것: 수렴·판별 타당도로 56개 AI 벤치마크 검증하기
요약
이 연구는 사회과학에서 쓰이는 수렴·판별 타당도 방법론을 빌려와 53개 모델에 걸친 56개 AI 능력·안전 벤치마크를 검증한다. 같은 개념으로 묶인 안전 벤치마크끼리도 모델 순위 상관관계가 대체로 약해, 개념 정의 자체가 일관되지 않음을 시사한다. 반대로 서로 다른 개념으로 분류된 능력 벤치마크들이 같은 개념 벤치마크만큼 강하게 상관되는 경우가 많아 판별 타당도 주장이 흔들린다. 일부 벤치마크는 자신이 속한 개념보다 다른 개념의 벤치마크와 더 강하게 연동되는데, 예컨대 BBQ 정확도는 편향보다 추론 벤치마크와 더 가까운 움직임을 보인다. 이런 결과는 현재 널리 쓰이는 벤치마크들이 실제로 표방하는 바를 측정하고 있는지에 의문을 제기한다.
분류
주 주제AI·컴퓨팅
지역 메뉴글로벌
영향 지역scope:global
시간 지평0~3년 (2026-09-17)
최종 갱신2026-09-25 22:32 KST
근거 1
- What AI Benchmarks Actually Measure: Adapting Convergent and Discriminant Validity to Interrogate Fifty-Six AI Benchmarks arXiv (cs.CY) 2026-09-08 접근 2026-09-17T05:23:21+00:00
속한 트렌드 0
해당 객체가 없다.
직접 연결 이슈 0
해당 객체가 없다.
공개 식별자: fm-5529584f4a3a
