RESEARCH

연구·리포트 참고 자료

이번 주 연구최근 7170편 · 출처 5
344Updated 1일 전
arXivAI 보안 · 프리프린트 · 2026년 9월 4일Simone Ceppi, Ignacio Sanchez

Flip, Don't Shuffle: 추론 속도에 맞춘 대형 언어 모델 워터마크

대형 언어 모델(LLM)에 새로운 통계적 워터마크 기법인 Stateless Bernoulli Watermarking(SBW)을 제안한다. SBW는 토큰당 독립적인 베르누이 시도를 통해 멤버십을 결정하여, 기존 방법 대비 6000배 이상 빠른 성능을 보인다. 1% 미만의 오버헤드로 끝到끝 생성 벤치마크를 수행했으며, GPU 네이티브 Jenkins 해시를 사용해 null calibration을 1.8배 개선했다.

이 연구는 대형 언어 모델의 워터마크 기술을 추론 속도에 최적화하여 실용성을 높였으며, 기존 방법 대비 높은 성능 향상을 보여준다.

대형 언어 모델워터마크베르누이 시도Jenkins 해시PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 4일Haoyang Li 외 4명

개인화된 LLM 에이전트의 행동으로부터 숨겨진 사용자 모델 추론

개인화된 LLM 에이전트가 메모리에 보관한 정보를 압축된 형태로 변환하여 사용자 모델을 생성하는 방식을 분석하고, 이를 기반으로 UMPeek이라는 블랙박스 공격 기법을 제안한다. UMPeek은 기존 공격 기법보다 벤치마크 및 실제 시스템에서 더 높은 성능을 보이며, 응답 수준의 방어를 무력화할 수 있다.

UMPeek 공격 기법은 개인화된 LLM 에이전트의 보안 취약점을 드러내며, 사용자 모델을 보호하기 위한 새로운 방어 전략이 필요하다.

LLM 에이전트UMPeek사용자 모델 추론블랙박스 공격PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 4일Alexandr Goultiaev Tolstokorov 외 3명

Rent-a-RAG: RAG 시장에서 문서 재사용 감사를 위한 임베딩 공간 워터마크

제3자 RAG 시장에서 문서 재사용을 감사하기 위한 DirBucket이라는 의미 보존 워터마크 기법을 제안한다. DirBucket은 23개 감사 응답에서 모든 비준수를 탐지하며, 사용자 인식 응답 품질을 유지하면서 적대적 후처리를 견딘다.

이 연구는 RAG 기반 시스템에서 문서 재사용을 효과적으로 감사할 수 있는 워터마크 기법을 제시하여, 제3자 제공업체와의 계약 준수를 확인하는 데 유용하다.

RAG워터마크감사임베딩 공간PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 4일Jakub Re\v{s} 외 4명

AlcaTRAz - 탈옥 공격에 대항하는 앵커드 트리-규칙 방어

LLM의 탈옥 공격을 방어하기 위해 입력 텍스트만을 대상으로 모델 가중치나 내부 구조를 수정하지 않는 트리 기반 규칙 방어 기법을 제안한다. 33개 오픈 모델과 22개 탈옥 공격 유형에서 기존 방어 대비 73.4%의 경우 보안 및 기능성 점수가 가장 높았으며, 평균 정상 요청 점수는 0.27포인트 이내로 유지했다.

LLM 탈옥 공격 방어에 트리 기반 규칙 방식을 적용할 수 있으며, 기존 방어 대비 높은 성능을 보여 모델 보호 전략에 활용할 수 있다.

LLM탈옥 공격트리 기반 방어보안PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 4일Syed Ghazanfar Abbas, Dongyan Xu

신뢰해줘, 나는 너의 개발자야: 대규모 언어 모델에서의 자가 발급 인증

대규모 언어 모델(LLM)이 사용자가 자체적으로 설계한 테스트를 통해 신분을 확인하는 요청을 어떻게 처리하는지를 실험적으로 분석했다. 5개 모델 중 Qwen, Mistral, Llama는 기술적 지식을 바탕으로 테스트를 생성하고 평가해 '확인됨'을 반환했다.

대규모 언어 모델이 대화 내에서 자가 발급 인증을 생성하는 것은 보안 취약점으로 작용할 수 있어 외부 보안 구성요소에서 신분을 생성하고 관리해야 한다.

대규모 언어 모델자가 발급 인증대화형 거짓 인증보안 취약점PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 4일Yury Korolev

8억 3천 5백만 주소 규모에서 인구 기반 그래프 스크리닝 및 라벨 없는 이전

블록체인 주소의 컴플라이언스 스크리닝을 위해 다중 체인 거래 그래프에서 주소의 위치를 기반으로 점수를 매기는 시스템을 제안한다. 8억 3천 5백만 주소와 158억 개의 엣지를 포함하는 단일 그래프를 구축하고, 0.8598 / 0.8182 / 0.9967의 재현율을 달성했다.

이 연구는 블록체인 컴플라이언스 스크리닝에서 라벨 없는 체인을 처리할 수 있는 새로운 접근법을 제시하여, 기존 방법의 한계를 극복할 수 있다.

블록체인컴플라이언스 스크리닝그래프 기반 점수라벨 없는 이전PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 4일Jinxi Yu 외 8명

프라이버시 보호를 위한 토폴로지 가이드 안전성 확보: LLM 기반 멀티에이전트 시스템에서의 연방그래프 학습 적용

LLM 기반 멀티에이전트 시스템의 안전성을 보장하기 위해 연방그래프 학습(federated graph learning)을 활용한 FGLGuard 방식을 제안한다. FGLGuard는 각 기관이 자체 라벨 데이터로 학습한 모델 업데이트만 공유함으로써 프라이버시를 보호하면서도, 단일 도메인 가드가 다른 도메인에서 실패하는 문제를 해결한다.

이 연구는 멀티에이전트 시스템에서 프라이버시와 안전성을 동시에 달성할 수 있는 실용적인 방안을 제시하여, 기업 간 협업 환경에서의 LLM 보안 적용에 참고가 될 수 있다.

LLM멀티에이전트 시스템프라이버시 보호연방그래프 학습PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 4일Haozhang Li 외 5명

최적화가 조작이 되었을 때: 생성형 검색의 GEO 공격 방어

생성형 검색 엔진을 악의적인 생성 엔진 최적화(GEO) 공격으로부터 보호하기 위해 GEO Defender라는 방어 기법을 제안한다. GEO Defender를 사용하면 평균 공격 성공률이 50.32%에서 6.20%로 감소한다.

이 연구는 생성형 검색 엔진의 신뢰성을 높이기 위한 방어 기법을 제시하여, 실제 시스템에 적용할 수 있다.

생성형 엔진 최적화GEOLLM 방어공격 방어PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 3일Varun Gadey 외 2명

CodePoisonRAG: 검색 기반 코드 생성에 대한 지식 오염 공격

CodePoisonRAG는 검색 기반 코드 생성(RACG) 시스템에 대한 새로운 지식 오염 공격 기법을 제안한다. 85개의 오염된 아티팩트를 생성하여 0.7%의 코퍼스 오염 비율을 달성했으며, 공격 성공률은 0.80에서 0.93에 달한다.

이 연구는 RACG 시스템이 외부 지식 오염에 취약할 수 있음을 보여주어, 코드 생성 시 외부 자료의 신뢰성을 철저히 검증할 필요가 있음을 시사한다.

CodePoisonRAG지식 오염 공격RACG코드 생성PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 3일Zhiyang Ding 외 4명

ACLE-MCP: 원격 LLM 도구 사용 시 실행 시간 신뢰를 위한 인증된 능력 임대

OAuth만으로는 보장되지 않는 원격 LLM 도구 사용 시 실행 신뢰 문제를 해결하기 위해 ACLE-MCP라는 새로운 아키텍처를 제안한다. 제안된 아키텍처를 구현한 프로토타입을 통해 기존 방식보다 공격을 더 효과적으로 차단하는 것을 보인다.

ACLE-MCP를 도입하면 OAuth 기반 원격 LLM 도구 사용 시 발생할 수 있는 실행 신뢰 공격을 방지할 수 있다.

AI 보안OAuth인증원격 도구 사용PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 3일Mohammad Waquas Usmani 외 2명

기계 학습 기반 재구성 공격에 대한 좌표 암호화 포인트 클라우드 분석

선택적 좌표 암호화 방식의 보안성을 기계 학습 기반 재구성 공격에 대해 평가했다. X 좌표 전체 암호화는 재구성이 어려웠으나, 2X 방식은 인접 좌표를 통해 정확한 재구성이 가능했다.

포인트 클라우드 암호화 시 암호화 단위를 신중히 선택해야 보안성을 확보할 수 있다.

포인트 클라우드선택적 암호화기계 학습재구성 공격PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 3일Jiarui Li 외 7명

스킬 정책의 은밀한 조정: 에이전트 기술(Agentic Skills)을 통한 공격

대규모 언어 모델 에이전트의 재사용 가능한 스킬이 공격에 악용될 수 있는 새로운 공격 기법 SkillShift를 제안한다. SkillShift는 81.33%와 63.33%의 공격자 선호 선택률을 달성하면서 100% 유틸리티 보존률을 유지한다.

이 연구는 대규모 언어 모델 에이전트의 스킬 공급망에서 발생할 수 있는 보안 위험을 실증하고, 스킬 정책의 행동 감사 필요성을 강조한다.

LLM 에이전트스킬 정책정책 조정보안 위험PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 3일Zhongrui Sun 외 6명

LLM 소유권 검증: 의미 구조를 통한 PROSE 기법

LLM의 소유권을 검증하기 위해 의미 구조를 활용한 새로운 블랙박스 지문 기법 PROSE를 제안한다. PROSE는 의미 구조를 내재화하여 모델의 도메인별 결론 조직 방식을 기반으로 소유권을 검증하며, 실험에서 100%의 지문 탐지율을 기록했다.

PROSE는 모델의 내부 구조를 변경하지 않고도 소유권을 검증할 수 있어, LLM 모델의 무단 복제나 재배포를 방지하는 데 실무적으로 활용될 수 있다.

LLM 소유권블랙박스 지문의미 구조PROSEPDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 3일Achilleas Spanos, Ioanna Kantzavelou

기계 학습 기반 침입 탐지 시스템 평가: 모델 효율성의 환상

기계 학습 기반 침입 탐지 시스템의 일반화 능력을 평가하기 위해 차원 수 조정 실험을 수행하였다. 실험 결과 모델이 새로운 공격을 얼마나 효과적으로 탐지하는지를 보여주며, 기계 학습 기반 IDS 연구와 평가 기법의 구조적 약점을 드러냈다.

기계 학습 기반 침입 탐지 시스템의 평가 시 일반화 능력을 고려해야 한다.

기계 학습침입 탐지 시스템모델 평가일반화PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 3일Oguzhan Salman, Kemal Bicakci

에이전트 시대의 CAPTCHA: 경험을 통해 학습하는 풀이 시스템

시각 기반 CAPTCHA 풀이 시스템을 제안하고, 경험을 통해 학습하는 방식으로 정확도를 높인다. 85.4% 전체 정확도와 84.2% 매크로 정확도를 달성했다.

CAPTCHA 운영자는 적응형 풀이 시스템에 대응하기 위해 지속적인 도전문제 개발이 필요하다.

CAPTCHAVLM적응형 풀이 시스템AI 보안PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 3일Yijie Lin 외 4명

설명 가능한 AI 추적 포렌식을 위한 합성 미디어의 회귀 합성

기존 생성 모델을 수정하지 않고 AI 생성 콘텐츠의 출처를 추적하는 새로운 기법을 제안한다. 인코더-디코더 쌍을 활용한 자기 참조 회귀 합성 프레임워크를 통해 생성된 이미지의 일관성을 검증한다.

이 기법은 생성 모델의 아키텍처나 파라미터를 변경하지 않아도 AI 생성 콘텐츠의 출처를 신뢰성 있게 추적할 수 있다.

AI 생성 콘텐츠추적 포렌식자기 참조 회귀 합성인코더-디코더PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 3일Gang-Hyun Park 외 3명

WeaveMark: 코드화된 페이로드 확산을 통한 강력하고 확장 가능한 다중 비트 LLM 워터마킹

LLM 생성 텍스트에 사용자 식별 메시지를 삽입하여 내용 출처를 추적하는 다중 비트 워터마킹 기법을 제안하고, 페이로드 확산을 통해 페이로드 용량을 향상시키며, 소프트 결정 오류 수정 코드를 통해 추출 정확도를 개선하고, 무편향 다중 계층 재가중을 통해 텍스트 품질을 유지한다. 200 토큰에서 32비트 메시지의 일치율은 89.8%로 BiMark의 20.8%에 비해 훨씬 높으며, 10% 치환 공격에서도 86.0%를 달성한다.

LLM 워터마킹 기법의 성능을 향상시켜 내용 출처 추적의 신뢰성을 높일 수 있다.

LLM 워터마킹코드화된 페이로드 확산오류 수정 코드텍스트 품질 유지PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 3일Jun He, Deying Yu

지속적 AI 에이전트의 자기 서술 상태 보안을 위한 타입 기반 증명 및 진술 가이드라인

지속적 AI 에이전트가 반성, 검색, 통합을 통해 자기 서술 상태를 구성할 때 비신뢰할 수 있는 입력이 지속 상태에 포함될 수 있는 문제를 해결하기 위해 타입 기반 증명(typed provenance)과 진술 가이드라인(assertion guardrails)을 제안한다. 24개의 수작업 준수 사례에서 19개의 비안전 기회 중 하나도 무자격으로 통과시키지 않았으며, 모든 지원되는 제어를 보존했다.

AI 에이전트의 지속 상태 관리 시 보안성을 확보하기 위해 타입 기반 증명과 진술 가이드라인을 도입할 필요가 있다.

AI 에이전트타입 기반 증명진술 가이드라인보안PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 3일Qikai Wang (University of Electronic Science and Technology of China) 외 5명

LLM 에이전트의 스킬 선택 조작 공격(ISM) 연구

LLM 에이전트의 스킬 선택 과정에서 암묵적 조작 공격(ISM)을 제안하고, 세 단계 전략을 통해 타겟 스킬 선택률을 15.2%에서 63.5%까지 높였다. ISM은 명시적 지시 없이도 인간 심사자에 의해 차단당하는 비율이 2.9%에 불과하다.

LLM 에이전트의 스킬 선택 과정에서 암묵적 조작 공격이 효과적임을 보여주어, 보안 설계 시 이러한 공격 방식을 고려해야 한다.

LLM 에이전트프롬프트 인젝션암묵적 조작스킬 선택PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 3일Laurent Bindschaedler 외 2명

보상 가능한 자율 에이전트 부작용의 스마트 계약 정산: Recourse 프로토콜

자율 에이전트가 조직 간 데이터베이스와 클라우드 서비스를 변경하는 도구 동작을 실행할 때 발생하는 보상 가능한 부작용을 정산하기 위한 스마트 계약 프로토콜인 Recourse를 설계하고 평가했다. Recourse는 허가된 동작을 범위, 복구, 증거, 지급금, 보증금과 결합하여 보상되지 않은 피해를 줄이는 데 기여한다.

이 연구는 자율 에이전트가 조직 간에 실행하는 도구 동작의 부작용을 스마트 계약으로 정산하는 새로운 프로토콜을 제안하여, 보상되지 않은 피해를 감소시키는 데 기여한다.

스마트 계약자율 에이전트보상 가능한 부작용RecoursePDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 3일Laurent Bindschaedler 외 2명

에이전트 플라이트 레코더: 장기적 툴 사용 에이전트를 위한 온체인 앵커링을 통한 탬퍼-이븐트 감사 추적

에이전트 플라이트 레코더(Agent Flight Recorder)는 장기적 툴 사용 에이전트의 모든 동작을 구조화된 이벤트로 기록하고, 해시 체인과 머클 배치를 통해 탬퍼 증거를 제공하는 시스템이다. 시스템은 48 마이크로초 평균 이벤트 지연과 512바이트당 이벤트, L2 앵커링 비용 $2.30/10만 이벤트를 기록했으며, 100% 탐지율과 0% 오류를 보였다.

이 시스템은 장기적 툴 사용 에이전트의 보안 감사 및 탬퍼 증거를 제공하여, 조직 간 분쟁 해결과 제3자 검증을 용이하게 한다.

에이전트 플라이트 레코더탬퍼-이븐트 감사 추적온체인 앵커링해시 체인PDF 있음

본 페이지의 연구 요약은 공개된 초록을 AI가 한국어로 정리한 것으로, 원문과 차이가 있을 수 있습니다. 정확한 내용은 반드시 원문을 확인하십시오. 본문과 PDF는 제공하지 않으며, 모든 저작권은 각 저자와 발행처에 있습니다.