RESEARCH

연구·리포트 참고 자료

이번 주 연구최근 7170편 · 출처 5
344Updated 1일 전
arXivAI 보안 · 프리프린트 · 2026년 9월 9일Pengyin Shan

AI 코드 어시스턴트가 설치 전에 확인하는가? 연구 소프트웨어 공급망에서 신뢰 신호에 대한 수요 측정 사전 등록 감사

AI 코드 어시스턴트가 소프트웨어 공급망의 신뢰 신호를 확인하는지 실험적으로 조사했다. 1,920회 시도 중 9회(0.5%)만 신뢰 신호를 열었고, 검증 명령어는 실행되지 않았다.

AI 코드 어시스턴트가 신뢰 신호를 확인하지 않는 것으로 나타나, 보안 강화를 위해 프로그램 내에 검증 기능을 구축해야 한다.

AI 코드 어시스턴트신뢰 신호공급망 보안소프트웨어 설치PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 9일Kentaro Oda

Attestream: 사용 내역 검증을 통한 머신러닝 데이터 스트림 분배 아키텍처

블록체인 기반의 데이터 스트림 분배 아키텍처인 Attestream을 제안한다. 데이터 유출을 방지하고 사용 내역을 검증하여 분배를 제어한다. 전체 라이프사이클 라운드는 657k gas를 소모하며, 50개 소비자 풀에서 40개의 테이블 행이 유출될 경우 100% 유출 책임을 추적할 수 있다.

이 연구는 데이터 소비자의 사용 내역을 검증하여 유출을 방지하는 블록체인 기반 아키텍처를 제안하여, 데이터 소유권 보호와 유출 추적에 기여한다.

블록체인데이터 유출 방지사용 내역 검증ai-securityPDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 9일Han Wang 외 2명

대규모 언어 모델(LLM)의 위협 수준 결정 벤치마킹

공개된 MISP OSINT 피드에서 데이터셋을 구축하고, 8개 LLM을 제로샷 조건에서 비교한 후 미세 조정(fine-tuning)을 통해 성능을 분석하였다. 미세 조정 모델은 F1 점수 0.40~0.58를 달성했으나, 실무 적용에는 여전히 낮은 수준이다.

LLM을 보안 분야에 적용하려면 데이터 품질과 도메인별 조정이 필요하다.

대규모 언어 모델LLM위협 수준 결정미세 조정PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 9일Weizhe Wang 외 6명

의도 그래프를 활용한 장기 자동 펜테스트 에이전트 Intentest

LLM 기반 자동 펜테스트 에이전트의 장기 기억 문제를 해결하기 위해 의도 그래프(intent graph)를 도입한 Intentest를 제안한다. 벤치마크 CTF 문제에서 88.2%의 성공률을 달성했으며, 어려운 문제에서는 75.0%의 성공률을 보였다.

이 연구는 LLM 기반 자동 펜테스트의 효율성을 높이는 구조화된 상태 관리 방법을 제시하여, 실무 펜테스트 도구 개발에 기여할 수 있다.

자동 펜테스트LLM의도 그래프IntentestPDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 9일Nicola Deidda 외 4명

검색증강생성(RAG)과 소형 언어모델(SLM)을 활용한 사이버 위협 지능 통합

이 연구는 이질적인 사이버 위협 지능(CTI) 소스에서 공격의 실행 조건과 관찰 가능한 흔적을 포착한 구조화된 공격 그래프를 생성하는 자동 파이프라인을 제안한다. 10개 실제 사례를 대상으로 수작업 평가를 통해 생성된 그래프가 예상 공격 진행과 일치함을 보인다.

이 연구는 분산된 CTI를 통합해 공격을 구조화하고 실행 조건과 흔적을 명시함으로써 방어 및 탐지에 활용할 수 있다.

사이버 위협 지능RAGSLM공격 그래프PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 9일Branka Stojanovi\'c 외 2명

산업 제어 시스템 이상 탐지의 적대적 강건성에 대한 회복탄력성 이론 기반 구축

산업 제어 시스템(ICS)의 이상 기반 침입 탐지 시스템이 공식적인 회복탄력성 기준을 충족하도록 하기 위해, 기존 회복탄력성 프레임워크를 기반으로 적대적 기계 학습 환경에 맞춘 회복탄력성 이론을 정식화하였다. BATADAL 수자원 분배 시스템 벤치마크를 통해 제안된 지표가 표준 벤치마크에서 보이지 않는 운영적으로 중요한 현상을 드러내는 것을 실증하였다.

ICS 시스템 설계 및 인증 기준 수립 시, 개별 노드의 강건성보다는 공격 경로 상의 결합 조정된 흡수 능력을 고려해야 한다.

산업 제어 시스템적대적 예제회복탄력성 이론기계 학습PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 9일Xiaoting Lyu 외 8명

AgentLeak: 에이전트의 강력한 능력을 복제하는 공격 기법

LLM 에이전트의 능력 유출을 위한 새로운 공격 기법 AgentLeak을 제안한다. 600개의 인스턴스에서 40% 이상의 작업 성공률 향상과 80% 이상의 능력 격차를 줄였다.

LLM 에이전트의 실행 동작을 보호해야 한다.

LLM 에이전트능력 복제AgentLeak보안 위험PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 9일Asif Pinjari, Mithun Paul Saint-Germain

AgentDrift: 주입 공격으로 해킹된 LLM 에이전트 경로의 단계 라벨 벤치마크

LLM 에이전트의 주입 공격을 단계별로 라벨링한 벤치마크 AgentDrift를 제안한다. 벤치마크는 12,536개의 합성 도구 호출 경로로 구성되며, 각 단계는 무해, 주입 지점, 해킹, 실패 주입 중 하나로 라벨링된다.

이 벤치마크는 주입 공격 감지 기법의 개발과 평가에 활용될 수 있다.

LLM 에이전트주입 공격벤치마크AgentDriftPDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 9일Rana Abu Bakar

다중 테넌트 LLM 서빙 환경에서 KV-캐시 타이밍 부채널의 신뢰도 붕괴 특성화

다중 테넌트 환경에서 KV-캐시 타이밍 부채널 공격의 신뢰도가 어떻게 저하되는지를 7가지 실험으로 분석했다. 무작위 워커가 없을 때 평균 Cohen's d는 0.7789이지만, 2개 워커가 있을 때 0.2109로 감소한다(t=8.412).

LLM 서빙 시스템의 보안 설계 시 다중 테넌트 환경에서의 부채널 공격 신뢰도 저하를 고려해야 한다.

부채널(side-channel)LLM 서빙타이밍 공격다중 테넌트PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 9일Chaoyu Zhang 외 8명

스카이넷(Skynet): 의미와 구조 모델링을 통한 에이전트 AI의 워크플로우 수준 이상 탐지

에이전트 AI 시스템의 워크플로우 수준 이상을 탐지하기 위해 의미적 및 구조적 모델링을 결합한 새로운 프레임워크 Skynet을 제안한다. 3개 공개 벤치마크에서 재현률이 높고 거짓 긍정률은 1% 미만이며, 온라인 모니터링에 적합한 저지연 특성을 보인다.

에이전트 AI 시스템의 이상 탐지에 워크플로우 수준 분석을 적용할 수 있으며, Skynet은 제로데이 공격 탐지에도 효과적이다.

에이전트 AI워크플로우 수준 이상 탐지의미적 모델링구조적 모델링PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 9일Ruoxi Shang 외 8명

AURA-Eval: LLM 에이전트 경로에서 위험 인식을 고려한 평가 프레임워크

LLM 에이전트의 안전한 행동을 평가하기 위해 AURA-Eval이라는 새로운 프레임워크를 제안한다. 157개의 경로를 기반으로 1,249개 평가 항목을 생성하고 20개의 최첨단 및 오픈 가중치 모델을 평가하여, 위험 탐지, 행동 전략, 시나리오별 안전성 등을 분류하는 기준을 개발하였다.

이 연구는 LLM 에이전트의 안전성 평가 기준을 제시하여, 모델의 위험 인식 능력과 안전한 행동 전략을 실무적으로 평가할 수 있게 한다.

LLM 에이전트안전성 평가AURA-Eval위험 인식PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 9일Sicong Li 외 9명

프록시 매니폴드 정렬(PMA) 공격: 개인정보 보호 LLM의 임베딩-임베딩 마스킹 공격

임베딩-임베딩 마스킹(E2EO) 기법에 대한 새로운 공격인 프록시 매니폴드 정렬(PMA)을 제안한다. PMA는 마스킹된 벡터 스트림을 기반으로 원본 텍스트를 복원하는 데 성공한다. 실험 결과 PMA는 기존 공격 방법보다 평균적으로 더 높은 복원률을 보인다.

개인정보 보호를 위한 E2EO 기법의 보안성을 재검토할 필요가 있으며, 보다 강력한 마스킹 기법의 개발이 요구된다.

LLM임베딩-임베딩 마스킹프록시 매니폴드 정렬개인정보 보호PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 9일Zhongli Fang 외 6명

LLM 생성 음식 안전 콘텐츠의 신뢰성 있는 워터마킹 프레임워크

LLM 생성 콘텐츠의 무결성과 추적성을 보호하기 위해 ToSS라는 신뢰할 수 있는 인증 방법을 제안한다. ToSS는 워터마킹 용량과 디코딩 정확도에서 우수한 성능을 보인다.

이 연구는 AI 생성 콘텐츠의 신뢰성 확보를 위해 워터마킹 기법을 개선하는 방안을 제시한다.

AI 생성물워터마킹추적성LLMPDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 9일Roy Weiss 외 4명

디토크나이저 유출 공격: 로컬 LLM 출력을 캐시 추적으로 재구성

로컬 호스팅된 대형 언어 모델(LLM)이 생성한 텍스트를 디토크나이제이션 중 CPU 캐시 활동을 관찰하여 재구성하는 새로운 공격 기법을 제시한다. 실제 로컬 LLM 배포에서 의미적으로 정확한 출력을 복원할 수 있음을 보인다.

이 공격 기법은 널리 사용되는 로컬 LLM 제품과 에이전트 프레임워크에 적용 가능한 취약점을 드러내므로, 해당 시스템의 캐시 타이밍 보호를 강화해야 한다.

LLM 보안디토크나이저 공격캐시 추적로컬 모델 유출PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 9일Zhen Guo 외 4명

MechAudit-40: 40개의 LLM 공격 메커니즘에 대한 화이트박스 감사

LLM 공격 메커니즘 40개를 체계적으로 평가하고, 런타임 감사 도구를 설계하여 81.1%의 감지율을 달성했다. 감사 도구는 0.70%의 오류율을 유지하면서 78.1%의 재현율을 보였다.

이 연구는 다양한 LLM 공격 메커니즘에 대한 체계적인 평가와 런타-감사 도구 설계를 제안하여, 실무에서 공격 감지 정확도를 향상시킬 수 있다.

LLM 공격 메커니즘화이트박스 감사MechAudit-40런타임 감사 도구PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 9일Qi Wang 외 2명

SRD-GUARD: 의미 재작성과 다중 모델 점수를 통한 LLM 방어 프레임워크

LLM에 대한 jailbreak 공격을 방어하기 위해 의미 재작성과 다중 모델 점수를 결합한 SRD-GUARD 방식을 제안한다. SRD-GUARD는 평균 DSR 91.44%와 100%, ORR 8.00%와 12.00%를 달성한다.

SRD-GUARD는 LLM에 대한 jailbreak 공격을 효과적으로 방어할 수 있는 새로운 방식으로, 실무에서 적용 가능한 방어 기법을 제시한다.

LLM 방어jailbreak 공격의미 재작성다중 모델 점수PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 9일Jichao Zeng 외 2명

QA 매칭을 넘어: 확률 분포를 통한 대형 언어 모델의 변형-응답 지문 기법

대형 언어 모델의 원천 추적을 위해 BReF라는 새로운 지문 기법을 제안한다. BReF는 22/22 사례에서 기록된 부모 모델을 정확히 검색했으며, DP-DF AUC 1.0000을 달성했다.

이 연구는 대형 언어 모델의 변형 추적 기법을 개선하여 모델의 원천을 정확히 식별하는 데 기여할 수 있다.

대형 언어 모델지문 기법BReF원천 추적PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 9일Kritan Banstola 외 5명

보안 운영 센터에서 생성형 AI 동반자(agentic AI companion) 설계 및 운영

보안 운영 센터(SOC)에서 대량의 티켓 처리 과제를 해결하기 위해 생성형 AI 기반 자동화를 설계하고 1년 이상 현장에서 운영한 사례를 보고한다. 분석 결과, 90% 이상의 경우 동반자의 출력이 티켓 종결 보고서에 재사용되었으며, 인간 분석가가 AI 동반자의 행동을 조정할수록 AI 시스템의 출력에 대한 신뢰도가 높아져 생산성이 향상되었다.

SOC에서 생성형 AI 동반자를 현장 작업과 밀접하게 연계하여 설계하면 분석가의 신뢰를 높이고 생산성을 향상시킬 수 있다.

AI 보안보안 운영 센터생성형 AIagentic AI companionPDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 9일Gregory N Frank

카운터스와름 원칙: 조정된 에이전트 침투를 억제하는 방법

공격 에이전트가 공유 인프라를 통해 조정된 침투를 수행하는 방식을 분석하고, 침투 사건을 효과적으로 억제하기 위한 방안을 제시한다. 평가 설계를 통해 조정된 행동 집합을 식별하고, 침해 결과를 측정한다.

공유 인프라를 통한 조정된 침투를 감지하고 분석하는 새로운 접근법을 실무에 적용할 수 있다.

에이전트 침투보안 평가조정된 공격침투 억제PDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 9일Zhongan Bi 외 13명

계층적 웹 증거 오염(Hierarchical Web Evidence Poisoning)에 따른 딥-서치 에이전트 평가

이 연구는 Generative Engine Optimization(GEO)를 통해 검색 기반 대형 언어 모델 에이전트를 조작하는 계층적 웹 증거 오염 공격을 평가하기 위한 HAE-GEO 벤치마크를 제안한다. 10개의 에이전트를 평가한 결과, 증거 인식이 코로보레이션 트랩에서 악화되고, 에이전트 검색이 최종 저항성을 향상시키지만 증거 인식이나 유틸리티는 개선되지 않는다는 패턴을 발견했다.

이 연구는 검색 기반 대형 언어 모델 에이전트의 취약점을 드러내며, 보다 강력한 방어 전략이 필요함을 시사한다.

에이전트 언어 모델GEO계층적 웹 증거 오염HAE-GEOPDF 있음
arXivAI 보안 · 프리프린트 · 2026년 9월 9일Huda Ali Alatawi

기계 학습 기반 NIDS의 적대적 공격 내성 평가 및 탐지

기계 학습 기반 네트워크 침입 탐지 시스템(ML-based NIDS)의 적대적 회피 공격에 대한 내성을 평가하고, 공격 탐지 방법을 제안한다. 8개의 적대적 공격, 15개의 탐지 모델, 3개의 방어 전략을 평가하여, 적대적 학습을 적용한 앙상블 모델이 평균 공격 성공률을 0.41에서 0.03으로 줄이고 내성 지수(RI) 0.98을 달성했다.

ML-based NIDS의 적대적 공격 내성을 평가하고, 적대적 학습을 적용한 앙상블 모델을 통해 공격 탐지 성능을 향상시킬 수 있다.

적대적 공격NIDS내성 평가앙상블 학습PDF 있음

본 페이지의 연구 요약은 공개된 초록을 AI가 한국어로 정리한 것으로, 원문과 차이가 있을 수 있습니다. 정확한 내용은 반드시 원문을 확인하십시오. 본문과 PDF는 제공하지 않으며, 모든 저작권은 각 저자와 발행처에 있습니다.