에이전트 스킬(Agent Skills)의 의존성 폐쇄 바인딩 및 운영 시 효과 관리: ClosureBound
ClosureBound는 에이전트 스킬의 이질적인 의존성 폐쇄에서 권한 이전을 방지하는 참조 모니터를 제안한다. 84,608개 상태와 530,752개 전이를 달성했다.
ClosureBound는 에이전트 스킬의 의존성 관리와 권한 이전 방지를 위한 새로운 보안 기법으로, 실무에서 의존성 폐쇄의 안정성과 효과성을 높일 수 있다.
ClosureBound는 에이전트 스킬의 이질적인 의존성 폐쇄에서 권한 이전을 방지하는 참조 모니터를 제안한다. 84,608개 상태와 530,752개 전이를 달성했다.
ClosureBound는 에이전트 스킬의 의존성 관리와 권한 이전 방지를 위한 새로운 보안 기법으로, 실무에서 의존성 폐쇄의 안정성과 효과성을 높일 수 있다.
LLM 에이전트의 보안 노출을 측정하기 위해 실행 구조를 분석하는 새로운 방법을 제안한다. 454개의 주입-싱크 쌍에서 96.9%가 시간적 거리보다 구조적 거리가 더 짧았으며, 평균 갭은 9개의 허프였다.
LLM 에이전트의 보안 분석에서 시간적 거리보다 구조적 거리를 고려하는 것이 중요하다.
LLM 에이전트의 안전성을 향상시키기 위해 EvoSafeHarness라는 새로운 안전 장치 프레임워크를 제안한다. DecodingTrust-Agent에서 평균 공격 성공률을 45.6%에서 10.0%로 줄이며, AgentDojo에서 82.8%의 유틸리티를 0.0% ASR로 달성한다.
EvoSafeHarness는 LLM 에이전트의 안전성과 유틸리티를 동시에 향상시켜, 실제 시스템에 적용할 수 있는 새로운 방안을 제시한다.
LLM 에이전트의 권한 부여 프로세스를 분리하여 공격에 대한 내성을 강화하는 새로운 보안 아키텍처인 KITA를 제안한다. 6개의 시스템 테스트와 암호화 미세 벤치마크를 통해 임계 서명의 정합성과 확장성을 검증한다.
이 연구는 LLM 에이전트가 권한 부여를 분리하여 공격에 대한 내성을 강화하는 새로운 보안 아키텍처를 제안한다.
LLM의 내부 거부 신호를 중독시켜 백박스 편집 제한 해제 공격을 방어하는 새로운 방어 기법을 제안한다. 4개의 오픈 가중치 모델에서 거부율을 16.25%에서 71.75%로 높였다.
이 방어 기법은 LLM의 안전 정렬을 유지하면서 일반적인 성능에 영향을 주지 않아, 실제 시스템에 적용할 수 있는 실용적인 보완책을 제공한다.
ChatGPT의 샌드박스 환경에서 공유 클립보드를 통한 계정 간 데이터 유출 취약점을 분석했다. 특정 조건에서 다른 사용자의 데이터를 접근할 수 있음을 보였다.
ChatGPT 사용자는 샌드박스 기능 사용 시 데이터 유출 위험에 주의해야 한다.
LLM 기반 디컴파일러가 재컴파일 가능성과 실행 가능성에만 집중하는 경향이 있어, 실제 동작 차이를 포착하지 못한다는 점을 보인다. 4.9%의 함수가 재컴파일된 코드에서 동작이 달라지고, 일부 취약점이 출력에서 사라지는 현상이 관찰된다.
LLM 디컴파일러의 재컴파일 가능성은 완전한 동작 보존을 보장하지 않으므로, 보안 분석 시 동작 차이를 확인하는 추가 검증이 필요하다.
LLM 에이전트 시스템에서 보안 컨텍스트가 구성 요소 간 전달 시 손실되는 문제를 해결하기 위해, 보안 컨텍스트 연속성을 보장하는 CONTINUITY 프레임워크를 제안한다. 2,560개의 공격 시나리오에서 해로운 외부 효과가 발생하지 않았으며, 700개의 정상 작업을 완료하고 200개의 모호한 사례를 상향 조정하였다.
이 연구는 LLM 에이전트 시스템의 보안을 강화하기 위해 구성 요소 간 보안 컨텍스트의 일관성을 보장하는 계약 기반 프레임워크를 설계하는 데 실무적 시사점을 제공한다.
본 연구는 콘포멀 예측(Conformal Prediction) 기법을 공격 분석에 적용한 연구이다. 콘포멀 예측은 기존에 방어적 수단으로 사용되었으나, 공격 분석에의 활용은 거의 연구되지 않았다. 연구는 개인정보 보호 머신러닝과 네트워크 트래픽 분석 두 분야에서의 초기 결과를 제시한다.
이 연구는 콘포멀 예측 기법을 공격 분석에 적용함으로써 보안 분야에서의 새로운 응용 가능성을 제시한다.
LLM의 안전성 평가에 사용할 수 있는 새로운 벤치마크인 TIER를 제안한다. 6개 오픈 웨이트 LLM을 대상으로 실험한 결과, 위협 수준에 따라 안전성 행동이 점진적으로 변화함을 보인다.
이 결과는 LLM의 안전성 평가 시 단순한 이진 평가보다 행동 기반의 세분화된 평가가 필요함을 시사한다.
가려진 중국어 SMS 메시지를 효과적으로 분류하기 위해 복원 인식형 계단식 훈련 프레임워크인 ReCAST를 제안한다. 내부적으로 구축한 실제 중국어 SMS 벤치마크에서 ReCAST는 직접 훈련된 기준 모델보다 가려짐 상황에서 분류 성능을 크게 향상시킨다.
이 연구는 실제 운영 환경에서 작동하는 소형 모델로 가려진 SMS 메시지를 효과적으로 분류하는 방법을 제시한다.
LLM 에이전트가 실행 중인 상태에서 특정 정보를 완전히 제거하는 실행 상태 언러닝 방법을 제안한다. 실험 결과, 선택적 재생(selective replay)은 전체 재시작과 구별되지 않으면서 9배 적은 토큰을 재계산한다.
이 연구는 LLM 에이전트에서 정보 삭제 시 잔여 유출을 방지하는 실용적인 접근을 제시한다.
SHAP 해설 프레임워크가 악성코드 탐지에서 신뢰할 수 없다는 점을 밝히고, 정적 PE 특징 공간에서 SHAP의 한계를 실증적으로 검증했다. 실험에서 SHAP가 특징 신용을 희석시키고, 모델이 사용하지 않는 특징에 중요도를 부여하는 현상을 확인했다.
악성코드 탐지 모델의 해설을 위해 SHAP를 사용할 때는 데이터 분포와 도메인 검증을 별도로 수행해야 한다.
이 연구는 블랙박스 적응형 시각 프롬프트 인젝션 공격인 Repeat-After-Me를 제안하고, 개방형 및 상용 VLM(Vision Language Model)에서 각각 80%와 47% 이상의 공격 성공률을 달성했다. 실제 OpenClaw 에이전트에서 최소한의 이미지 주입으로 TOOLS.md를 덮어쓸 수 있어 원격 코드 실행 및 비밀 유출이 가능하다.
이 연구는 VLM 기반 AI 에이전트에 대한 새로운 공격 벡터를 제시하여, 시각 프롬프트 인젝션에 대한 방어 전략을 강화할 필요성을 강조한다.
의미 검색에서 데이터 내용과 접근 패턴을 보호하는 문제를 해결하기 위해 이질적인 GPU-CPU-TEE 아키텍처를 제안한다. Hoss는 Compass 대비 최대 67배의 속도 향상을 달성하면서 높은 재현률을 유지한다.
이 연구는 GPU TEE의 대용량 개인 메모리를 활용한 새로운 무시의적 의미 검색 시스템을 제시하여, 보안과 성능의 균형을 맞추는 데 기여한다.
피싱 이메일을 연구하기 위한 새로운 합성 기업 이메일 데이터셋을 제안한다. 합성 이메일은 다양한 업무 커뮤니케이션 주제를 포함하며, 피싱 신호를 해석할 수 있도록 주석이 달려 있다.
이 데이터셋은 기업 환경에서 피싱 탐지 및 인간 취약성 연구에 활용할 수 있다.
연구팀은 180명의 미국 성인 근로자를 대상으로 LLM이 생성한 피싱 이메일의 설득력과 개인화 수준 간의 관계를 실험적으로 평가했다. 설득력 평가(0-100)와 클릭 의도 발생률(28% 증가)을 측정했으며, 추가된 세부 정보가 수신자의 역할과 루틴에 맞는 경우 설득력이 높아지는 반면, 오류나 모호한 정보는 의심을 유발하는 것으로 나타났다.
이 연구는 피싱 공격 대응 교육에서 수신자의 업무 맥락에 맞는 개인화 정보를 구분하는 능력을 강화해야 함을 시사한다.
LLM 에이전트의 문맥 한계와 추론 불확실성을 해결하기 위해, 위상적 추론과 의미적 추론을 분리한 보안 운영 센터(SOC) 아키텍처를 제안한다. 제안된 시스템은 인증 서브그래프를 고정 차원 상태로 요약하고, PPO 정책을 통해 제한된 조사 동작을 매핑하며, LLM 에이전트는 정책 추천을 소비하고 분석가용 서술을 생성한다.
이 연구는 대규모 인증 그래프를 처리하는 LLM 에이전트의 한계를 극복할 수 있는 새로운 SOC 아키텍처를 제시하여, 실무에서 보다 신뢰성 있는 자동화 SOC 운영을 가능하게 한다.
유한 구문 시스템 S가 일관되고 충분히 표현력이 있으면, S가 자율적으로 생성할 수 없는 정리가 적어도 하나 존재함을 증명한다. 이 결과는 보안 메커니즘, AI 시스템, 형식 검증기, 법적 시스템, 경제 모델 등 모든 유한 구문 시스템에 적용되는 메타정리이다.
이 연구는 보안 및 AI 시스템 설계 시 형식 시스템의 한계를 인식해야 함을 시사한다.
AI 에이전트 간의 자율적 상호작용을 감사하기 위한 블록체인 기반 블랙박스 아키텍처를 제안한다. 블록체인에 암호화된 약속을 남겨 에이전트 통신, 인간 승인, 도구 호출 등을 추적할 수 있도록 하며, GRC 감사와 규정 준수를 지원한다.
AI 에이전트 프로세스의 감사 가능성과 규정 준수를 강화하기 위해 블록체인 기반의 증거 모델을 도입해야 한다.
AI 에이전트 허브(AI agent harnesses)의 라이프사이클 훅(lifecycle hook) 업데이트 경로를 새로운 공격 표면으로 제시하고, HookPry라는 오픈소스 공격 프레임워크를 제안한다. HookPry는 1,000회 종단간 실험에서 평가된 7개 허브 중 92.5% 성공률을 기록했으며, 대표 방어 시스템은 0% 감지율을 보였다.
AI 에이전트 허브의 라이프사이클 훅 업데이트 경로를 보호하는 방어 전략이 필요하다.
본 페이지의 연구 요약은 공개된 초록을 AI가 한국어로 정리한 것으로, 원문과 차이가 있을 수 있습니다. 정확한 내용은 반드시 원문을 확인하십시오. 본문과 PDF는 제공하지 않으며, 모든 저작권은 각 저자와 발행처에 있습니다.