신호 "신뢰는 점수가 아니다" — 고위험 AI 에이전트를 위한 런타임 보증 계약
요약
이 논문은 기존 벤치마크·감사·에이전트 프로토콜이 성능·권한·복구는 기술하되, 중요 작업 중 관찰된 증거가 에이전트 권한을 실시간으로 어떻게 바꿔야 하는지는 다루지 않는 '보증 전이 공백'을 지적한다. 저자들은 자율 경계·증거 상태·비보상 게이트를 결합한 정책 스키마 '런타임 보증 계약(RAC)'을 제안해, 필수 게이트가 실패·불확실하면 점수와 무관하게 재시도·전환·에스컬레이션·보류·정지를 강제한다. 에이전트 코딩 결함주입 연구(구성 사례 280건)에서 점수 단독 규칙은 차단돼야 할 주입 100건 중 80건을 통과시켰고 검토가 필요한 주입 40건도 전부 통과시켰다. 전향적 합성 홀드아웃(24개 에피소드·행동시도 72건)에서는 블라인드 LLM 심사자 둘이 전건에 동일 라벨을 부여했고 RAC·별도 기준선 모두 그 라벨과 일치했다. 저자들은 이 결과가 합성 사례 메커니즘 검증일 뿐, 실배포 안전성·도메인 간 효과성까지 입증하진 않는다고 명시한다.
분류
주 주제AI·컴퓨팅
지역 메뉴글로벌
영향 지역scope:global
시간 지평0~3년 (2026-10-02)
최종 갱신2026-10-02 11:32 KST
근거 1
- Trust Is Not a Score: Runtime Assurance Contracts for High-Risk AI Agents arXiv (cs.AI / cs.CY) 2026-09-30 접근 2026-10-01T23:00:11+00:00
속한 트렌드 0
해당 객체가 없다.
직접 연결 이슈 0
해당 객체가 없다.
공개 식별자: fm-9d7fe2c4e3cc
