미래 신호·트렌드·이슈를 관측하는 공개 대시보드
구독로그인English
최신 관측일
2026-10-08
공개 객체
4434
빌드 시각
2026-10-08 19:44 KST
더 퓨처스

신호 LittleLearner: 교육학적으로 통제된 지식 노출 하의 언어모델

요약

현대 언어모델은 이질적인 웹 규모 텍스트로 학습되기 때문에 학습 데이터 속 관련 콘텐츠에 대한 사전 노출 여부를 특정하거나 배제하기가 어렵다. 이 때문에 지식과 역량이 어떻게 습득되는지를 통제된 방식으로 연구하기 힘들다는 문제가 있다. 이를 해결하기 위해 저자들은 미국 초등학교 수준 자료에 맞춰 그 수준을 넘어서는 개념과 사실, 어휘를 명시적으로 배제한 사전학습 말뭉치 LITTLECURRICULUM을 도입했다. 이 말뭉치의 규모는 880억 토큰이다. 연구진은 이 교육학적으로 통제된 말뭉치로 LittleLearner 모델을 학습시켜, 노출 범위가 정확히 알려지고 한정된 환경에서 언어모델의 지식·역량 습득 과정을 연구할 수 있게 했다. 이는 배포 가능한 제품이 아니라 해석가능성과 학습역학 연구를 위한 통제된 과학 인프라 기여로 제시된다.

분류

주 주제AI·컴퓨팅
지역 메뉴글로벌
영향 지역scope:global
시간 지평0~3년 (2026-08-16)
최종 갱신2026-09-25 22:32 KST

근거 1

속한 트렌드 0

해당 객체가 없다.

직접 연결 이슈 0

해당 객체가 없다.

공개 식별자: fm-382fec306fba