CAITLYN: LLM 에이전트가 자율적으로 새로운 인젝션 공격 방어를 합성할 수 있는가?
LLM 에이전트에 대한 프롬프트 인젝션 공격을 방어하기 위해 CAITLYN이라는 방어 미들웨어를 제안한다. 기존 방어 기법 대비 토큰 오버헤드가 낮으면서도 정확도를 유지하는 것을 보인다.
LLM 에이전트 환경에서 새로운 인젝션 공격에 대응하기 위해 CAITLYN과 같은 자율 방어 시스템을 도입할 수 있다.
LLM 에이전트에 대한 프롬프트 인젝션 공격을 방어하기 위해 CAITLYN이라는 방어 미들웨어를 제안한다. 기존 방어 기법 대비 토큰 오버헤드가 낮으면서도 정확도를 유지하는 것을 보인다.
LLM 에이전트 환경에서 새로운 인젝션 공격에 대응하기 위해 CAITLYN과 같은 자율 방어 시스템을 도입할 수 있다.
CHISEL은 테스트 스위트 없이 Ghidra에서 파생된 의사-C 코드에서 소스 코드를 반복적으로 복구하는 프레임워크를 제안한다. 120개 ExeBench 함수를 대상으로 96.1% 재컴파일 가능성과 79.8% 재실행 가능성, 2.1회 평균 반복 횟수를 달성했다.
CHISEL은 테스트 스위트 없이도 높은 정확도로 소스 코드를 복원할 수 있어, 바이너리 분석 및 복호화 작업에서 실용적 도구로 활용될 수 있다.
사이버 위협 정보(CTI)를 적절한 시기에 올바른 분야에 전달하는 것이 중요하다. 연구팀은 CTI 이벤트를 분야별로 매핑하기 위해 BERT 모델을 적용하여 94.5%의 정확도를 달성했다.
이 연구는 CTI 자동화를 통해 조직이 빠르게 대응할 수 있도록 도와 실무에서 위협 대응 효율성을 높일 수 있다.
대규모 언어 모델의 배포 후 변경 사항을 감지하기 위해 zk-SNARK 기반의 프라이버시 보호 감사 프레임워크를 제안한다. 토큰 기반 프로브가 블랙박스 환경에서 모델과 GPU 플랫폼을 가리지 않고 가장 높은 평균 감도를 보이며, 50개까지 확장해도 증명 시간은 1.78초, 검증 시간은 0.84초에 머무른다.
이 연구는 모델 배포 후 변경 사항을 비침투적으로 감지할 수 있는 프레임워크를 제시하여, AI 모델의 거버넌스와 보안을 강화할 수 있다.
GraftyVul은 실제 취약점을 오픈소스 프로젝트에 이식하여 보안 취약 프로그램을 생성하는 시스템이다. 212개의 검증되고 공격 가능한 취약 프로그램을 5개 언어와 23개 CWE 범주에 걸쳐 생성하였다.
이 결과는 취약점 탐지 및 자동 수정 연구에 더 다양하고 현실적인 데이터셋을 제공할 수 있다.
기존 모바일 OS의 권한 모델은 앱 세션 단위로 권한을 부여해 사용자가 데이터 접근 시점을 알기 어렵다. 컨텍스트에 따라 권한을 제어하는 프레임워크를 제안하고, 104명의 설문과 8명의 테스트를 통해 초기 평가를 수행했다.
이 연구는 모바일 기본 앱의 권한 관리를 개선해 사용자 이해도를 높이는 방안을 제시한다.
FISGuard는 멤버십 추론 공격을 방어하기 위해 고정된 저차원 표현 부분공간을 구축하는 방식을 제안한다. 실험 결과, FISGuard는 ProjRes 공격의 AUC를 0.5 수준으로 낮추며, 다운스트림 작업 성능을 유지하고 계산 오버헤드가 적은 것을 보였다.
FISGuard는 멤버십 추론 공격에 효과적인 방어 기법으로, 분산 학습 환경에서 개인정보 보호를 강화할 수 있다.
LLM 에이전트의 런타임 컨텍스트를 유출하는 새로운 공격 기법인 ContextLeak을 제안한다. 강화 학습을 활용해 악성 도구의 이름과 설명을 생성하여 에이전트가 해당 도구를 선택하고 컨텍스트를 입력 인수로 전달하도록 유도한다.
LLM 에이전트가 악성 도구를 선택할 때 런타임 컨텍스트가 유출될 수 있으므로, 도구 선택 과정에서의 보안 검증이 필요하다.
대규모 언어 모델에서 메모리화를 측정하는 다양한 정의가 있으며, 차분 프라이버시(DP)가 이들을 대체적으로 통제한다고 간주된다. 그러나 DP 상수를 정확히 정의하고, 메모리화와 추출 간의 관계를 분석하여 이들이 서로 통제하지 않는다는 것을 보인다.
이 연구는 차분 프라이버시가 메모리화와 추출을 모두 통제하지 못함을 보여, 보안 감사 및 프라이버시 보호 모델 개발 시 주의가 필요하다.
다중 당사자 계산(MPC)과 차분 프라이버시(DP)를 결합한 시스템에서 사용되는 연속 소음 샘플링 프로토콜의 취약점을 분석하고 이를 개선한 새로운 방법을 제안한다. 기존 샘플링 방식의 취약점으로 인해 100% 공격 성공률을 보였으며, 새로운 샘플링 방식은 기존보다 4~612배 빠르고 효율적이다.
이 연구는 다중 당사자 차분 프라이버시 시스템에서 사용되는 소음 샘플링 방식의 취약점을 실증하고 이를 개선한 새로운 프로토콜을 제시하여, 실무에서 보다 안전하고 효율적인 프라이버시 보호를 가능하게 한다.
기존 의미 수표는 문장 의미에 묶어 토큰 선택보다 견고하지만, 공격자가 텍스트를 다시 표현하거나 재정렬하면 탐지가 실패한다. 이를 해결하기 위해 EDA 공격과 k-SwordStamp 방어 기법을 제안한다.
이 연구는 의미 수표 기반 보안 기법의 취약점을 분석하고, 공격에 더 강한 방어 기법을 제시하여 실무에서의 적용 가능성을 제고한다.
5G 독립형 네트워크에서 운영되는 시각 외 비행 무인 항공 시스템(UAS)은 명령 및 제어(C2) 데이터와 비디오 피드백을 위한 공유 사용자 평면을 사용한다. FlyBlind 공격은 인접 슬라이스에 있는 권한 있는 공유 사용자가 정당한 업링크 수요를 유지하면서 GCS 상태가 오래되도록 만드는 공격 기법이다.
이 연구는 5G 네트워크 슬라이싱 환경에서 권한 있는 공유 사용자가 정상적인 업링크 수요를 유지하면서도 GCS 상태를 오래되게 만들 수 있음을 보여주어, 실무에서는 상태 최신성 검증을 강화해야 한다.
시각-언어 모델(VLM)의 보안 취약점을 분석하기 위해 메타적응형 다중모달 탈옥 공격(MAMJ) 기법을 제안한다. MAMJ는 공격 전략 프롬프트(ASP)와 공격 효과성을 결정하는 가중치(φ)를 최적화하여, 기존 공격 기법보다 높은 공격 성공률(ASR)을 달성한다.
이 연구는 대규모 시각-언어 모델이 메타적응형 공격에 취약하다는 것을 보여주어, 해당 분야의 방어 기법 개발을 촉진시킬 수 있다.
eBPF 기반 사이버보안 메커니즘을 PRISMA 방법론을 통해 체계적으로 검토하고 분류했다. 54개 연구를 7개 분야로 분류하고, 평균 CPU 오버헤드 2.4% [1.1-8.6%], 탐지 정확도 94-99%를 기록했다.
eBPF는 클라우드 네이티브 환경에서 실시간 보안 강화에 효과적이지만, 내장 취약점 대응과 표준 평가 프레임워크 개발이 필요하다.
LLM이 제한 해제 공격에 어떻게 반응하는지 기계적 해석을 통해 분석하고, 특정 회로를 제거하여 공격 성공률을 최대 80%까지 줄였다. 80%까지 공격 성공률 감소.
LLM의 제한 해제 공격을 감지하고 방어하는 데 회로 탐지 기법을 활용할 수 있다.
LLM 에이전트가 공격자의 지시를 따라 해로운 도구를 실행하는 간접 프롬프트 인젝션 공격을 방어하기 위해, 사용자로부터 유래한 값만이 상태 변경 도구에 도달할 수 있도록 하는 ROPE 방식을 제안한다. ROPE는 민감한 도구 매개변수에 대한 결정론적 원본 검사를 통해 공격 성공률을 1.6-2.6%로 유지하면서 82-100%의 정상 기능을 보존한다.
ROPE는 LLM 에이전트의 도구 실행을 보호하는 구조적 접근법으로, 실무에서 프롬프트 인젝션 공격에 대한 방어를 강화할 수 있다.
TaintedPixels는 딥페이크 영상에 대한 프로액티브 보호 방법으로, 얼굴 영역의 파란 채널에 구조화된 주기적 편차를 주입하여 조작이 이루어졌는지 시각적으로 확인할 수 있도록 한다. 3개의 공개 딥페이크 생성 도구와 2개의 디텍터를 통해 TaintedPixels는 가장 높은 위조 감지율을 보이며, 편차가 작게 유지되었다(LPIPS = 0.0042).
TaintedPixels는 딥페이크 영상의 조작 여부를 시각적으로 확인할 수 있는 프로액티브 방어 기법으로, 실무에서 딥페이크 탐지 시스템에 활용될 수 있다.
LLM의 안전성 회피 메커니즘을 분석하기 위해 퍼트urbation 프로빙이라는 새로운 진단 방법을 제안한다. Qwen3-4B 모델에서 50개의 신경망이 80%의 해로운 요청을 거부하는 안전 템플릿을 제어하는 것을 확인했다.
이 진단 방법은 LLM의 안전성 회피 가능성과 취약성을 측정하여, 보안팀이 모델을 비교하고 개선할 수 있도록 지원한다.
LLM 기반 에이전트의 탈옥 공격을 자동화하기 위해 경험을 기반으로 기술이 진화하는 레드팀 에이전트 RedEvoAgent를 제안한다. 여러 벤치마크와 대상 모델에서 기존 고정 및 에이전트 기반 기준보다 우수한 성능을 보이며 도구 효율성을 향상시켰다.
RedEvoAgent는 LLM 기반 시스템의 보안 검증에 있어 더 효과적인 자동 레드팀 전략을 제공할 수 있다.
Pickle과 PyTorch 기반 모델 아티팩트에서 ModelScan, ModelAudit, Fickling의 보안 판단 성능을 평가했다. 135개 라벨링된 가족 중 ModelAudit은 100%, Fickling은 81.5%, ModelScan은 49.6%에서 확정적 보안 판단을 내렸다.
보안 스캐너의 판단 정확도와 판단 가능성을 구분하여 종합적으로 평가해야 한다.
LLM 에이전트 허네스에서 낮은 수준의 악성 콘텐츠를 높은 권한으로 승격시켜 모델 행동을 조작하는 공격 기법을 제안한다. 6개의 코드 에이전트 허네스에서 13개의 공격 목표를 달성하는 실험을 통해 이 공격의 일반성을 보인다.
이 연구는 LLM 에이전트 허네스의 권한 관리 메커니즘을 재검토하고, 낮은 수준의 입력이 높은 권한으로 승격되는 것을 방지하는 방어 전략을 개발할 필요성을 시사한다.
본 페이지의 연구 요약은 공개된 초록을 AI가 한국어로 정리한 것으로, 원문과 차이가 있을 수 있습니다. 정확한 내용은 반드시 원문을 확인하십시오. 본문과 PDF는 제공하지 않으며, 모든 저작권은 각 저자와 발행처에 있습니다.