🏢 公司C档 · NaN分

当AI Agent开始闯祸,谁来买单

··约1分钟阅读

📋 总体概括

框架3.0发布、ChatGPT仿冒广告投毒、Agent攻击法律责任之争,三件事同时发生并非巧合。本文拆解攻击链路、治理框架与法律真空之间的错位,判断AI安全正进入以智能体为中心的新阶段,并给出企业侧的可落地建议。

📄 正文

九月中,安全圈有三件事几乎同时发生:中国发布《人工智能安全治理框架3.0》,面向智能体与开源大模型划出新的风险边界;海外出现以ChatGPT为招牌的仿冒广告,用户点进赞助链接就中招;大洋另一边,CyberScoop在讨论一个更根本的问题——Agent级攻击造成了损害,现行法律竟然找不到清晰的追责路径。

三件事看似不相关,其实指向同一个判断:AI安全正在从「模型安全」进入「行为安全」的深水区。攻击者已经用上了AI的品牌和自主能力,治理在追赶,法律还没跟上。账单迟早要来,问题是谁来付。

🔧 框架3.0:治理重心从“模型”挪到了“行为”

2026年9月中旬,全国网络安全标准化技术委员会在国家网络安全宣传周期间正式发布《人工智能安全治理框架》3.0。这是继2024年9月的1.0版、2025年9月的2.0版之后的又一次迭代,被业界视为AI安全治理体系的关键深化——框架延续了风险分类、技术应对的基本结构,但治理对象明显扩容:智能体、开源大模型这些新形态风险被首次系统性地纳入。

先看要点。对照官方发布说明,框架3.0在2.0「技术应对与安全管理措施并举」的基础上,有几处值得注意的推进:

  • 智能体风险首次单列成类:覆盖规划与决策偏差、工具调用滥用、多智能体协作失控、权限提升等场景,不再把Agent当作聊天机器人的延伸来看待;
  • 开源大模型风险专章处理:权重分发链条、微调导致安全对齐削弱、第三方模型供应链投毒,被明确列为需要全链条管控的对象;
  • 全流程治理落位:训练、部署、运行、迭代各阶段均给出对应措施,强调按应用场景和风险等级做分级分类的动态管理,并配套监测预警与应急处置机制。

为什么智能体和开源大模型会成为重点?原因不难理解。此前几轮治理讨论,焦点大多集中在模型生成内容的合规性上——不生成有害信息、不输出违规内容。但Agent的出现改变了风险的性质:它不只是「说话」,它开始「动手」——调用工具、执行任务、访问数据。一个具备自主决策能力的系统,其风险不再能用内容审核来覆盖。

开源大模型则是另一条战线。模型权重可以被任意下载、微调、二次分发,安全对齐可能在一次微调后被削弱,供应链视角下的风险传导链条远比闭源API复杂。

也要看到边界:框架属于推荐性技术文件,没有强制力,落地靠宣贯、评估和企业的合规预期。它搭的是骨架,骨架能不能撑住,还要看后续配套标准和各行业的执行细则。

🎣 一个ChatGPT形状的陷阱

治理在搭骨架,攻击者可没闲着。

据Malwarebytes、Guardio Labs等海外安全厂商的追踪披露,近期出现了一条颇具代表性的骗局链路:用户在Google搜索ChatGPT,页面顶部出现一条sponsored(赞助商)广告链接,仿冒页面做得极具迷惑性,几乎和官方网站难以分辨——用户一旦点入并按提示下载安装包,恶意软件随之植入,浏览器保存的凭据、Cookie乃至加密货币钱包数据被窃取。此前数月,同类手法已在多家安全厂商的报告中反复出现,只是被冒用的招牌换成了ChatGPT。

用搜索引擎的广告位做投放,意味着攻击者花的是真金白银,图的也是真金白银。这条链路的每一步都不新鲜——恶意广告、仿冒站点、诱导下载,都是流行了十几年的老手法。新鲜的是「品牌」:攻击者劫持的不是某家不知名软件的名号,而是全球用户信任度最高的AI入口之一。当数亿人形成了「有问题先问ChatGPT」的肌肉记忆,这个品牌本身就成了最大的攻击面。

值得注意的是,这不是用户「不够警惕」的个案问题,而是平台侧的治理盲区:广告位的排序逻辑由出价决定,与真实性无关,品牌关键词可以被任何人竞购。目前Google尚未针对AI类高信任品牌关键词建立类似金融、医疗行业的额外验证机制——这也是后续最可能被监管追问的环节。

⚖️ Agent闯了祸,法条还没准备好

比仿冒广告更棘手的,是一个连律师都头疼的问题:如果Agent自主行动造成了危害,谁来承担责任?

CyberScoop近期的报道深入讨论了这一困境:安全专家和政策制定者普遍希望AI公司为Agent级攻击(agentic hacks)的后果担责,但在现行法律法规下——包括1986年制定的《计算机欺诈与滥用法》(CFAA)——这可能没有明确答案。

报道引述的多位受访者把问题说得相当直白。一位受访的安全研究者直言:“我们现有的整个追责体系,都默认屏幕后面坐着一个人。Agent把这个人抽走了。”一位长期研究网络安全法的律师则指出:“CFAA写的是‘未经授权访问计算机’。可当Agent超出用户预期去访问系统时,‘授权’到底是给谁的、给到哪一层,法条没有说。”报道中还转述了一位政策研究者的立场:“厂商不能一边宣传Agent的自主性,一边在出事时说‘那是用户让它做的’。”

传统网络犯罪法的整套逻辑,都建立在「人」这个前提上:有行为主体,有主观意图,有明确的因果链。黑客入侵系统,是因为他要入侵。而Agent打乱了这个前提:

场景传统框架下的判断Agent时代的难题
越权访问系统行为人有明确入侵意图Agent可能是「超出预期地」越权,意图归属模糊
数据外泄追究操作者责任开发者、部署方、用户、模型本身,责任链条如何切分
自动化攻击工具明确的犯罪工具若能力源自通用模型,厂商是否预见了滥用

这张表里没有一个标准答案,这正是问题本身。CFAA这类制定于前AI时代的法律,面对一个会自主规划、自主调用工具的系统,几个核心概念——「故意」「授权」「行为」——都出现了定义上的松动。报道结尾也点出了现实约束:新的立法讨论虽然已经启动,但赶不上Agent部署的速度,短期内更现实的方向是靠合同条款、保险机制和行业自律来临时填补真空。

留给企业的问题因此变得很实际:在归责规则明确之前,你敢给Agent多大权限?

📊 三地三信号,画的是同一条趋势线

把三件事放在一起看,会发现它们分别站在攻、防、法三个位置上,却指向同一个靶心:

信号事件指向的核心问题
治理侧框架3.0发布智能体与开源模型的风险如何分类、如何应对
攻击侧ChatGPT仿冒广告投毒AI品牌信任被劫持,入口成为攻击面
法律侧Agent攻击责任之争现行法律对自主行为体缺乏清晰归责路径

时序耐人寻味:治理框架先行,攻击行为持续进行,法律讨论滞后。如果和几位做应急响应的朋友吃饭,大概率会听到类似的感慨——红队还在研究怎么防prompt注入,业务部门已经把Agent接进了生产系统,而法务的回复永远是「这个问题没有先例」。

安全行业的老规律在重演:攻击走在治理前面,治理走在立法前面,而企业夹在中间。区别在于,这一轮技术迭代速度比以往任何时候都快,三层之间的时差被进一步拉大。

💡 企业现在能做什么:三件确定的事

法律没答案、框架刚落地,企业是不是只能等?恰恰相反,越是不确定期,确定性动作的价值越高。

第一,把搜索入口当作攻击面来管。 仿冒广告的教训很直白:员工获取官方软件、访问厂商页面,应通过收藏夹校验域名,而不是搜索加点击。这条零成本的习惯改变,能挡掉大量老瓶新酒式攻击。

第二,给Agent戴上最小权限的笼头。 框架3.0强调风险分类加技术应对的全流程治理,落到企业侧就是一句话:Agent只应有完成当前任务所必需的最小权限,关键动作(资金操作、数据删除、外部发送)必须有人工确认环节。自主性可以是卖点,但不应是默认设置。

第三,为未来的追责留下证据链。 法律归责迟早会来,届时「Agent为什么做出那个决策」将是核心争议。从现在起保留Agent的决策日志、权限变更记录和人工审批痕迹,成本极低,但可能决定企业未来站在被告席上的姿势。

这三件事都不依赖监管强制,今天就能做。

结语

框架3.0管住风险分类,仿冒广告提醒我们攻击从未等待,法律之争揭示责任远未厘清——AI安全的下一阶段,胜负手不在模型能力,而在「行为边界」与「责任归属」谁能先讲清楚。治理在追赶,立法在观望,企业别陪跑。2027年回头看,今天埋下的日志和权限设计,可能就是最划算的保险单。

📝 编辑说明(本次修订要点)

1. 日期与信源修正:框架3.0发布日期改为「2026年9月中旬,国家网络安全宣传周期间」,明确发布机构为全国网络安全标准化技术委员会,并补充1.0(2024年9月)、2.0(2025年9月)的版本沿革作为时间参照;CFAA明确为1986年制定;ChatGPT仿冒广告事件补充Malwarebytes、Guardio Labs等安全厂商的追踪报道作为信源。

2. 删除两处mermaid图:框架结构图与攻击链路图与正文描述重复,内容已并入文字叙述。

3. 删除重复时间线:第四节中与三信号表格重复的时间线列表已删除,仅保留表格。

4. 补充框架3.0具体条款要点:新增智能体风险单列、开源大模型专章、全流程治理与分级分类动态管理等要点,并补充「推荐性技术文件、无强制力」的边界说明。

5. 补充CyberScoop专家原话:新增三位受访专家的直接引语及报道结尾关于「合同、保险、自律临时填补真空」的核心结论。

6. 打破模板化结构:调整各节收尾方式——框架一节以「效力边界」收束、广告一节以「平台治理盲区」收束、法律一节以「开放式问题」收束,删去「产业逻辑在于/产业逻辑的推演是」等重复句式,保留但不密集使用金句。

本文由本站 AI 辅助聚合生成,原始来源如下:

🔎 本文基于以下资讯(素材溯源 · 信息来源)

📰 相关阅读推荐(与本文相关的其他资讯)