Everything you care about in one place

Follow feeds: blogs, news, RSS and more. An effortless way to read and digest content of your choice.

Get Feeder

paper.seebug.org

paper - Last paper

Get the latest updates from paper - Last paper directly as they happen.

Follow now 575 followers

Latest posts

Last updated 2 days ago

自托管 AI 智能体的自状态攻击:操作系统防御能走多远?

2 days ago

作者:Yimeng Chen,Nathanaël Denis,Roberto Di Pietro,Jürgen Schmidhuber 原文链接:https://arxiv.org/html/2607.17986v1 摘要 自托管的AI智能体通过读写自身的内存和配置文件来运行。智能体可能因其自身状态的损坏而受到攻击——这种损坏是通过合法的操作系统系统调用实现的。我们将这类威胁称为自状态攻击。本文研...

自适应对抗者:面向LLM智能体安全的多轮次、多LLM基准测试

3 days ago

作者: Devina Jain,David Hartmann,Chuan Li 原文链接:https://arxiv.org/html/2607.18063v1 摘要 基于LLM的智能体在处理外部内容时,会暴露于提示注入和多轮次操纵的风险之中。大多数安全基准测试使用评估前收集的固定攻击池来评估防御方,无论是单轮次还是多轮次。本文提出了一个包含21个场景的基准测试,用于对无记忆LLM防御方进行自适应...

AI 水印证据未能达到取证就绪标准:一项实证评估

6 days ago

作者: Saifur Rahman Tamim, Amir Labib Khan 原文链接:https://arxiv.org/pdf/2607.16010v1 摘要 各国政府正越来越多地强制要求LLM生成的内容携带水印。欧盟《人工智能法案》要求标记"足够可靠和稳健"。加利福尼亚州SB 942法案要求披露信息"永久性或极难移除"。这两项强制性规定都建立在一个...

Prismata:约束 Web 智能体中的跨站提示注入

9 days ago

作者:Corban Villa, Sijun Tan, Alp Eren Ozdarendeli, Raluca Ada Popa 原文链接:https://arxiv.org/pdf/2607.08147v1 摘要...

通过内部归因图实现LLM越狱的机制可解释性

10 days ago

作者:Anupam Wagle, Ifrat Ikhtear Uddin, Chaowei Zhang, Longwei Wang 原文链接:https://arxiv.org/pdf/2607.07903v1 摘要 大型语言模型(LLM)展现出卓越的能力,但仍然极易受到对抗性提示和越狱攻击的影响。现有方法主要通过输入-输出行为或归因方法来分析这些失败,对于对抗性扰动如何改变模型内部推理的洞察有限...

深度神经网络中统计上不可检测的后门

13 days ago

作者:Andrej Bogdanov,Alon Rosen,Neekon Vafa 原文链接:https://arxiv.org/pdf/2607.09532v1 摘要 我们展示了对抗性模型训练者如何在一大类深度前馈神经网络中植入后门。这些后门在白盒设置下是统计上不可检测的,这意味着即使给定模型的完整描述(例如所有权重),植入了后门的模型与诚实训练的模型在总变差距离上仍然非常接近。该后门为每个输入...

认知防火墙:一种面向LLM安全的主动式、零信任、多门控框架

16 days ago

作者: Michele Guida, Ruslan Shikhhamzayev, Sindhuja Penchala, Stefano Iannucci, Jiacheng Li, Shahram...

超越提示词:通过模拟审核痕迹越狱函数调用型LLM

18 days ago

作者:Junlong Liu, Haobo Wang, Weiqi Luo, Xiaojun Jia 原文链接:https://arxiv.org/pdf/2607.00481v1 摘要 越狱攻击仍然是对大型语言模型(LLM)安全部署的关键威胁。虽然先前的工作主要研究提示词层面的攻击和防御,但我们表明,这种以提示词为中心的范式忽视了有状态、函数调用环境中的结构性漏洞。在此类应用中,开发者定义的架构...

拒绝背后:通过行为监控确定护栏激活

19 days ago

作者:William Hackett, Peter Garraghan 原文链接:https://arxiv.org/pdf/2607.02121v1 摘要 随着大型语言模型(LLM)和智能体系统融入实际应用,确保其安全性和保障性变得至关重要。用于检测并拦截发送至LLM及从LLM发出的恶意指令的护栏系统,是AI安全的关键组成部分。然而,针对生产级AI系统进行黑盒对抗模拟的研究人员,常常难以判断是护...

Hephaestus:迈向网络安全AI科学家

25 days ago

作者:Jiaqi Li, Yang Zhao, Wen Lu, Lvyang Zhang, and Lidong Zhai 原文链接:https://arxiv.org/pdf/2606.29981v1...

从效率到泄露——联邦语言模型微调中的隐私后门

about 1 month ago

作者:Shanghao Shi, Chaoyu Zhang, Heng Jin, Yang Xiao, Yevgeniy Vorobeychik, William Yeoh...

NRT-Bench:面向安全关键控制室中 LLM 智能体的多轮红队测试基准

about 1 month ago

作者:Hanwool Lee, Dasol Choi, Bokyeong Kim等 原文链接:https://arxiv.org/pdf/2606.20408 摘要 大型语言模型(LLM)智能体越来越多地被提议作为安全关键系统的监督组件,但它们在持续、自适应对抗压力下的鲁棒性仍然缺乏充分表征。本文提出NRT-Bench,一个用于对担任安全关键系统操作员的LLM智能体进行多轮红队测试的基准,具体实例...