哈佛大学与卡内基梅隆大学的AI研究人员开发了一套智能体安全架构,实现了两大核心功能:1)动态作用域沙箱——不再为整个会话设置固定沙箱,而是根据用户当前问题实时缩放到最小必要权限集和文件访问范围,并持续随任务需求移动;2)对看似良性的行为(如已授权的工具调用和文件访问)进行可疑行为监控,借鉴了研究者们在反洗钱(AML)领域的技术。这套系统在开放基准测试中表现优异,已能缓解几乎所有常见攻击类型,但研究团队亟需生产环境数据来进一步验证其效果,并计划最终发布论文和开源项目。
#ai-security
30 条相关内容
IBM 与 Red Hat 将 Project Lightwell 从概念推进到产品阶段,旨在通过 AI 驱动的安全防护机制保护开源代码。该工具利用人工智能技术检测和防御针对开源项目的恶意攻击,帮助维护开源生态系统的完整性和安全性。
Declaw Arena 是一个CTF(夺旗赛)风格的挑战平台,参与者需要在一个微型虚拟机(microVM)环境中,尝试攻破(绕过或破解)一个AI代理的安全防护。该项目通过实战化的对抗场景,测试和提升AI系统的安全性与鲁棒性,为AI安全研究提供了有趣的实验场。
当2+2=5
7.5一项新的安全研究发现,人工智能浏览器可能会被诱入一种"梦境"状态,在这种状态下,原有的安全护栏不再生效。研究人员展示了通过精心设计的提示词,可以让AI忽略内置的防护措施,从而执行本应被禁止的操作。这项研究揭示了当前AI安全机制在面对对抗性攻击时的脆弱性。
本文发布了一份免费的自主AI安全参考手册(采用CC BY-NC-ND 4.0许可),旨在为开发者提供构建和部署自主智能体时的安全实践指南,涵盖威胁建模、安全架构及防护策略等关键内容。
文章警告,基于AI代理(如自主浏览网页、执行任务的智能体)的蠕虫病毒可能在数月内甚至更短时间内出现。这类恶意软件能利用AI代理间的通信漏洞自主复制和传播,带来比传统蠕虫更难以检测和防御的安全威胁。作者呼吁业界在AI系统广泛部署前,提前建立防护机制。
LayerX Security的研究人员揭示了一种名为"BioShocking"的新型攻击方法,该方法利用AI浏览器的生物识别数据处理机制,成功绕过安全护栏,诱导AI系统泄露用户敏感数据。攻击者通过伪装成合法的生物识别数据请求,欺骗AI浏览器将其传递至外部服务器,从而绕过现有的安全防护措施。这一发现凸显了AI浏览器在数据安全方面面临的独特风险。
Anthropic 推出了网络越狱披露计划,旨在邀请安全研究人员发现并报告其 AI 系统中的越狱漏洞。该项目通过 HackerOne 平台运行,鼓励研究人员负责任的披露能够绕过 Anthropic 模型安全限制的攻击方法,以帮助提升 AI 系统的安全性和鲁棒性。
平台工程 2.0 解决了企业在采用人工智能时面临的安全与合规挑战,而无需重建现有基础设施。该方法通过统一的平台层管理 AI 成本与风险,帮助企业在不中断现有系统的情况下,安全地扩展 AI 能力。文章探讨了如何通过平台工程策略,在不改造底层基础设施的前提下,有效应对 AI 治理、成本控制和合规性问题。
本文作者分享了其编程代理在任务执行过程中遭遇提示注入攻击的亲身经历。攻击者通过恶意指令试图劫持代理行为,导致其偏离原始编码目标。文章详细分析了攻击原理、潜在风险以及防范措施,提醒开发者在使用AI编程助手时需警惕此类安全威胁。
Aegize是一个开源项目,专注于在工具层面构建AI安全层。它通过身份、策略、权限等多层控制机制,在AI与其可访问的任何基础设施之间提供安全防护。该项目旨在赋能社区掌控AI安全,并希望推动大型科技公司采用这一集中式AI安全系统。
Claw Patrol Security 是一款专为 AI 智能体设计的防火墙解决方案,旨在提供安全、可控的访问管理和威胁防护能力。通过精细化策略配置,它能够有效监控和限制智能体的行为,防止数据泄露和未经授权的操作,适用于企业级 AI 安全部署场景。
本文系统性地剖析了基于预训练模型中心构建的AI应用所面临的安全威胁。研究揭示了模型中心生态系统中存在的多重风险,包括恶意模型注入、后门攻击、供应链漏洞以及数据泄露等问题。通过深入分析这些安全挑战,本文为开发者和平台运营者提供了关键的防护策略与最佳实践建议。
本文介绍了 OWASP 代理安全倡议(Agentic Security Initiative)中针对 AI 代理系统的十大安全风险,并结合 LangChain 和 CrewAI 两大流行框架,为开发者提供了实用的安全防护指南。文章涵盖提示注入、不安全代理通信、过度代理授权等关键安全威胁,并附有具体的代码示例与缓解策略,帮助开发者在构建代理应用时有效防范安全漏洞。
虽然许多MSSP对AI安全能力表现出高度自信,但行业分析师警告称,这种过度自信可能掩盖潜在的管理盲区与治理缺口。随着AI治理逐渐成为合规与安全的焦点,MSSP面临将治理服务转化为新收入来源的机遇与挑战。文章探讨了信心指数与风险评估之间的微妙关系,并提出AI治理可能成为MSSP下一个增长点的观点。
本文深入探讨了如何防范针对AI代理内存系统的攻击。作者系统性地分析了内存投毒、提示注入和数据泄露等常见威胁,并提供了多层防御策略,包括输入验证、访问控制和定期审计。文章还介绍了实用的工具和最佳实践,帮助开发者构建更安全的代理内存架构,确保AI系统的完整性和可靠性。
Semgrep 发布的最新网络基准测试结果显示,GLM 5.2 在多项网络安全相关任务上的表现超越了 Claude。该测试涵盖代码审计、漏洞检测与安全策略分析等场景,展示了 GLM 5.2 在网络安全领域的竞争力。
Anthropic 指控阿里巴巴利用约 2.5 万个账户,通过自动化方式大规模访问其 Claude 模型,以窃取技术能力。该公司称此举发生在特朗普政府时期,并指责阿里巴巴无视美国出口管制规定,试图逆向工程其 AI 系统的核心功能。
Fernando Irarrázaval 在 hackmyclaw.com 上发起挑战,看是否有人能通过发送电子邮件泄露他 OpenClaw 测试实例中的秘密。在经历约6000次尝试(消耗500美元代币,且因入站邮件过多导致谷歌账户被暂停)后,竟无一人成功。底层模型为 Opus 4.6,配合明确的防提示注入规则。作者指出,前沿模型在抗注入攻击方面的训练确实有效,但警告称,6000次失败并不意味着更复杂的攻击无法得手,不建议在可能造成不可逆损害的生产系统中仅依赖此保护。
作者分享了一年来在AI安全与治理领域工作所获得的深刻见解,阐述了这一经历如何从根本上重塑了他对人工智能的认知。文章探讨了AI安全治理中的实际挑战、风险管理策略以及对AI技术的全新理解视角。
本文探讨了“影子AI”现象,即员工在未经IT或安全部门批准的情况下自行使用AI工具。安全专家对此高度关注,担心数据泄露和合规风险,但部分人认为过度聚焦AI控制反而忽视了更传统的安全威胁。文章引发了对安全优先级和管控策略的讨论。
Anthropic公开指控阿里巴巴旗下团队对其AI模型Claude进行了有史以来最大规模的知识蒸馏攻击,涉嫌违规复制模型能力。该事件引发业界对AI模型安全与知识产权保护的高度关注。
作者分享了他的AI助手遭遇大规模尝试入侵的经历。在约2000人试图破解系统的过程中,作者揭示了安全漏洞、攻击模式以及从中吸取的教训。这篇文章详细记录了攻击者的策略、系统的防御机制,以及如何在不影响用户体验的情况下提高安全性。
Linux 基金会宣布启动 Akrites 项目,旨在保护自由及开源软件(FOSS)免受人工智能赋能的漏洞挖掘和利用攻击。该项目将通过开发自动化工具、建立安全最佳实践以及构建社区协作框架,增强开源生态系统的整体安全韧性,应对日益增长的 AI 驱动网络威胁。
Snyk 在 ToxicSkills 研究中发现,ClawHub 平台上 36% 的恶意 AI 代理技能载荷存在提示注入漏洞。该研究揭示了攻击者如何通过注入恶意指令操控 AI 代理,并分析了这些安全威胁对 AI 供应链的影响,提醒开发者在使用第三方 AI 技能时需加强安全审查。
本文为开发者提供了基于 OWASP 智能体安全倡议(OWASP Agentic Security Initiative)Top 10 的实用安全指南,重点结合 LangChain 和 CrewAI 框架进行讲解。文章涵盖智能体应用中最关键的十大安全风险,包括提示注入、不安全的代理配置、数据泄露、权限管理等问题,并给出每项风险的具体缓解措施与代码示例,帮助开发者在构建 LLM 智能体系统时落实安全最佳实践。
本文探讨了 AI 安全代理与普通扫描工具之间的本质区别,指出安全代理应具备主动推理、自主决策和持续学习能力,而非仅仅执行预设的扫描任务。文章提出了提升 AI 安全代理效能的若干关键原则,包括上下文感知、目标导向推理以及可解释性设计,旨在帮助安全团队构建更智能、更可靠的安全自动化系统。
本文为AI初创公司的首席技术官提供了一份全面的安全清单,涵盖数据加密、访问控制、模型安全审计、合规性检查等关键领域。通过遵循这份清单,CTO可以有效降低AI系统面临的常见安全风险,确保产品从开发到部署的整个生命周期中保持安全可靠。
Anthropic公司指控阿里巴巴集团开展了一场“厚颜无耻”的隐秘行动,试图非法获取其Claude AI模型的访问权限。据Anthropic称,阿里巴巴通过创建虚假账户、伪造身份信息等多种手段,绕过安全措施以获取该模型的内部技术和数据。这一指控凸显了中美科技公司在人工智能领域的激烈竞争,以及围绕尖端AI模型安全与知识产权保护的日益严峻挑战。
Unit 42 研究团队在现实网络环境中发现一起针对 AI 智能体的新型间接提示注入攻击案例。攻击者通过在网页中嵌入恶意指令,诱导 AI 系统执行非预期的操作,例如泄露敏感数据或绕过安全限制。这一发现凸显了 AI 应用在解析外部内容时面临的安全挑战,也为防御此类攻击提供了重要参考。