在2026年国家网络安全宣传周开幕式上,《人工智能安全治理框架3.0》正式发布。从框架1.0聚焦内生与应用安全到框架2.0关注衍生风险,再到框架3.0把智能体推向治理前台,框架的每次迭代都在追赶技术的形态变化。
AI的能力边界在拓展,安全的边界意识也要同步拓展。当智能体被推向治理前台,高校需要注意哪些?又能做些什么呢?今天我们就通过框架3.0的核心要点,一起来看——
智能体风险首次单列 AI风险从屏幕溢到现实
框架3.0最突出的变化,是将智能体风险、具身智能风险单独列为风险类别。
过去一年,大模型不再局限于被动回答问题,而是迈入主动执行任务的智能体时代:智能体能够自主规划任务、调用工具、跨平台协同作业。
随着AI能力形态发生改变,风险的性质也随之改变。在传统网络时代,往往是现实世界的行为投射进入虚拟网络空间;而如今,虚拟空间内智能体的行为可以向外溢出,直接传导、影响物理世界。
同时,攻击逻辑也随之发生转变:攻击者不必再诱骗人类,只需要完成对AI的诱导即可达成目的。
对此,高校可根据“可信应用、防范失控”的治理原则,强化智能体行为失控这类新型突出风险的防范与治理,保障人工智能始终处于人的管控之下。
网络攻击被AI重塑 零基础也能发起高级攻击
框架3.0明确提出:在人工智能的赋能之下,网络攻击的自动化、规模化、智能化水平大幅跃升,传统的网络攻防格局正在被重塑。
据安全行业相关统计,AI生成钓鱼邮件的点击率可达54%,而人工撰写钓鱼邮件点击率仅为12%。
过去,我们依靠教会大家辨别行文拙劣的诈骗邮件建立起来的安全防线正在失效。当钓鱼邮件的文笔比大家日常沟通还要流畅,格式比单位内部公文还要规范,我们已经很难再靠 “看起来像不像骗子” 来分辨恶意。
防范这类AI诈骗,需要依靠制度化的核验流程:付款之前务必电话核实、账户变更通过独立渠道确认、敏感操作落实双重授权。
风险分级治理 幻觉是要分级管理的风险
框架3.0把AI风险划分为三大层级:内生安全风险(模型幻觉、安全机制不可靠、注入攻击等)、应用安全风险(误用、滥用、恶用)、衍生安全风险(对社会结构、伦理规范带来的冲击)。
同时,框架3.0在附件中明确风险分级原则,从应用场景、智能化水平、应用规模多个维度开展风险定级,实现治理措施与风险等级相互匹配。
模型“幻觉”这类内生安全风险,早已在现实场景中酿成过事故。美国纽约一名律师在诉讼文书中引用了ChatGPT虚构出来的6个判例,最终遭到法院公开处罚。
这些都在提醒我们:不能将大模型当作搜索引擎直接采信输出结果,更合理的用法是把AI作为初稿辅助工具,产出内容之后必须经过人工核验,方可落地使用。
AI供应链安全划出红线 170万次安装的教训
框架3.0进一步强化开源生态安全与供应链安全管理,针对开源模型的下载与使用,清晰划定各类禁止性行为。背后的现实背景是:AI供应链已经成为网络攻击者重点瞄准的新目标。
一则真实安全事件:一份恶意技能包(AI skills)上传至平台后,依托平台排序、推荐机制不断“滚雪球式”传播,变种数量从341个暴涨至1184个,累计安装量超170万次,波及13.5万台设备。
还有相关研究证实,恶意代码仅仅植入代码仓库的一处配置项,就可以在AI编程助手弹出 “是否信任此工作区” 提示之前,实现恶意代码静默执行。
因此,高校需要注意:AI供应链涵盖数据、模型、软件、算力、平台、工具、服务七类核心资产,整个链条环环相扣,任意一个环节遭到投毒,风险都会层层传导,最终波及终端使用者。
治理与管理并重 给创新留容错空间
框架3.0提出构建柔性、动态、可控的沙箱监管体系,为人工智能新技术、新应用预留容错试错空间;同步建立随行伴跑、持续优化的敏捷治理机制,让治理规则紧跟技术迭代节奏,实现动态适配、同步升级。
首次覆盖研发、部署、运维、使用全生命周期,给出完整可落地的安全指引,补齐了实操规范短板:
技术层面:重点推进安全检测、内容识别、全程溯源能力建设,让AI风险可感知、可追踪、可管控。
管理层面:清晰压实研发者、服务提供者与使用者的主体安全责任,形成多方共治格局。
值得注意的是,框架3.0属于指导性治理文件,是现阶段AI安全治理的标尺。主动对标、依规规范AI使用行为,既是守住安全合规底线,也是积累个人与单位安全信用的关键。
结语:从引入到应用的安全防护
近两年,人工智能迎来重大能力跃迁。框架3.0里的每一条抽象原则背后都对应着已经发生过、正在发生着的真实攻击。
因此,高校在引入AI应用前,可参照框架分级原则,评估应用场景的安全风险;对于正在运行的AI应用,搭建可发现、可定位、可处置的安全响应机制;个人使用AI工具时,务必核验AI输出内容,同时收紧AI的访问权限。
本文根据“北京科技大学信息办”微信公众号发布的《AI发展,安全先行|〈人工智能安全治理框架 3.0〉要点解析》编辑整理。