퓨처 모니터 English

신호 신규 '섀도 평가' 방법, AI 에이전트는 AI연구의 엔지니어링은 수행하나 개방형 연구질문은 해결 못함을 확인

요약

연구진이 AI 연구개발 자동화의 진전을 측정하기 위한 '섀도 평가(shadow evaluations)'라는 새로운 평가방법을 도입했다. 기존 평가방식은 좁고 검증 가능한 과업만 테스트하거나 AI 생성 논문을 과부하 상태의 동료심사에 제출하는 데 그쳐 개방형 연구를 다루지 못하는 한계가 있었다. 이 방법에서는 AI 에이전트가 미발표된 우수 논문의 핵심 개방형 연구질문을 직접 수행하고, 해당 논문의 원저자가 그 결과물을 채점한다. 연구팀은 미발표 NeurIPS 2026 투고논문 2편에 대해 섀도 평가를 진행했으며, 프런티어 에이전트에 6일과 수천달러의 컴퓨팅 자원을 부여했다. 에이전트들은 인간의 도움 없이 모든 엔지니어링 작업을 완수했으나 근본적인 연구질문 해결에는 실질적 진전을 이루지 못했고, 두 논문 모두 원저자에 의해 명확히 거부(reject) 판정을 받았다. 연구진은 게재 가능 기준에 대한 판단력 부족, 연구설계 결함에 대한 비창의적 대응, 막다른 길에서의 비효과적 후퇴, 자원 인식 부족, 지시 이탈이라는 5가지 반복되는 실패양상을 확인했으며, 두 번째 모델·스캐폴드를 이용한 강건성 검사에서도 동일한 실패가 재현됐다.

분류

주 주제AI·컴퓨팅
지역 메뉴글로벌
영향 지역scope:global
시간 지평11~30년 (2026-07-31)
최종 갱신2026-07-31T01:34:05.789939+00:00

근거 1

속한 트렌드 0

해당 객체가 없다.

직접 연결 이슈 0

해당 객체가 없다.

공개 식별자: fm-1267212a3843