퓨처 모니터 English

신호 연구, LLM이 주택설문 집계결과는 근사하나 인구집단 내부구조는 재현 못함을 확인

요약

연구진이 도시계획에서 거주민 태도의 저비용 대리지표로 대형언어모델(LLM)을 활용할 수 있는지 검증하기 위해, 미국 저렴주택 설문실험에서 개방형 가중치 LLM 8종을 인간 응답자 843명과 비교했다. 이 연구는 제안된 주택개발 부지가 2마일에서 1/8마일로 가까워질 때 주택소유자와 임차인 간 지지도 변화의 차이를 모델이 재현할 수 있는지 검토했다. Qwen 2.5 14B가 인간 결과(-0.285)에 가장 근접했으며(-0.242) 사전등록된 동등성 기준을 충족한 유일한 모델이었던 반면, 다른 모델들은 약하거나 무효과이거나 역전된 결과를 보였다. 그러나 이 집계수준의 일치는 구조적 실패를 가리고 있었다 — Qwen은 공화당 성향 대비효과를 과소반영하고 무당층 대비효과는 과대반영했으며, 정당×보유형태×항목의 27개 셀에서 평균제곱근오차(RMSE) 0.613을 기록했고, 모델-인간 분산비 중앙값은 0.099에 불과했다. 질문 순서만으로도 측정된 대비효과가 0.367 이동했으며, 정체성 단서를 제거하거나 선택적 무응답을 고려하면 추정 가능한 비교항목 자체가 달라졌다. 연구진은 LLM이 하나의 집계효과는 근사할 수 있지만 그 근저의 인구집단 구조와 측정 안정성은 재현하지 못한다고 결론짓고, 도시계획에서의 모델 평가는 평균효과뿐 아니라 이러한 구조가 시뮬레이션에서도 유지되는지를 검증해야 한다고 주장한다.

분류

주 주제도시·주거
지역 메뉴글로벌
영향 지역scope:global
시간 지평4~10년 (2026-07-31)
최종 갱신2026-07-31T01:34:05.815397+00:00

근거 1

속한 트렌드 0

해당 객체가 없다.

직접 연결 이슈 0

해당 객체가 없다.

공개 식별자: fm-315ed7781174