신호 멀티모달 비지도 지속 사후학습을 위한 시각 의존도 인지 프레임워크
요약
이 논문은 배치된 멀티모달 대형언어모델(MLLM)이 레이블 없는 스트리밍 데이터로 지속 진화할 수 있게 하는 '멀티모달 비지도 지속 사후학습(MU-CPT)' 과제를 다룬다. 저자들은 기존 비지도 사후학습 기법이 목표 토큰을 균일하게 최적화해 토큰별로 다른 시각 의존도(VD)를 간과한다는 점을 지적하며, 토큰 단위 VD가 MU-CPT에 핵심적임을 보인다. 이들은 두 요소로 구성된 시각 의존도 인지(VDA) 프레임워크를 제안한다 — 새 과제 학습 중 VD의 구조적 왜곡을 최적수송 문제로 정식화해 교차모달 망각을 완화하는 '시각 제약 최적수송', 그리고 VD의 이질성을 활용해 새 과제 학습을 촉진하는 '시각 변조 적응'이다. 이 방법은 기존 과제의 안정성과 새 과제에 대한 적응력을 동시에 유지하는 것을 목표로 한다. 이 논문은 2026년 8월 26일 arXiv cs.AI 카테고리에 제출됐다.
분류
주 주제AI·컴퓨팅
지역 메뉴글로벌
영향 지역scope:global
시간 지평0~3년 (2026-08-27)
최종 갱신2026-08-29 22:50 KST
근거 1
- A Visual Dependence-Aware Framework for Multimodal Unsupervised Continual Post-Training arXiv (cs.AI) 2026-08-26 접근 2026-08-29T13:47:38+00:00
속한 트렌드 0
해당 객체가 없다.
직접 연결 이슈 0
해당 객체가 없다.
공개 식별자: fm-13f9cda1c094
