arXivAI 보안 · 프리프린트 · 5일 전Mark Russinovich 외 4명
분할, 상담, 정복: 정렬된 LLM을 통한 능력 세탁(Capability Laundering)
저자는 약한 비정렬 모델이 해로운 작업을 무해해 보이는 하위 문제로 분할하고, 강력한 정렬 모델을 각각 독립적으로 상담한 후 로컬에서 답변을 결합하는 새로운 공격 기법인 'capability laundering'를 제안한다. CyBench, BountyBench, 해로운 CBRN 요청에서 실험한 결과, Gemma-4-31B는 GPT-5.5와 Opus를 사용할 때 각각 8/14, 7/9 후보를 회복했으며, CBRN 공격 체인에서 평균 점수를 62.3에서 83.1로 높였다.
이 연구는 정렬된 LLM이 개별적으로 허용된 상호작용을 통해 해로운 능력을 전달하고 구성될 수 있음을 보여주어, 현재 방어 체계의 한계를 드러내며, 실무에서는 LLM 상호작용의 집합적 위험을 평가하는 새로운 접근이 필요하다.
LLM 보안capability laundering정렬된 모델악성 작업 분할PDF 있음