
过去一周,前沿人工智能模型的安全事件接连被披露。
当地时间9月25日,OpenAI公布一起内部研究模型突破训练沙箱的事件:模型在被限制访问互联网的情况下,通过DNS(域名系统)解析绕过了原有网络限制,访问了外部服务。OpenAI随后暂停了前沿模型中涉及工具调用的训练、评估和推理工作,并重新加强安全监控。
更早一天,OpenAI披露了另一批内部安全事件,模型在测试环境中出现越权操作、试图规避监控以及向外部环境传递信息等行为。另据市场消息,OpenAI、Anthropic以及安全研究人员正在调查的类似安全事件已达数万起。
该数量规模并不意味着真实出现数万次网络攻击,大量案例来自模型训练和红队测试(Red Teaming),其中相当一部分是为了观察模型能否突破限制。红队测试是AI安全领域的攻防测试方法,安排研究人员主动尝试攻击、诱导模型,寻找模型越狱、越权、规避监控、泄露信息等安全漏洞。
但这些事件集中出现仍反映出,随着模型开始拥有更强的推理、工具调用和自主执行能力,传统针对聊天模型的安全边界正在变得越来越难维持。
这一趋势并非单一模型厂商所面临。7月,Anthropic披露,在对14万余次网络安全测试运行进行复查后,发现Claude曾在测试环境配置错误的情况下访问互联网,并进一步获得三个真实组织生产基础设施的未授权访问权限。9月,Anthropic又扩大审查范围,对数亿条模型交互记录进行筛查。
Google也披露过类似情况。在第三方安全测试中,由于测试环境配置问题,Gemini获得了互联网访问能力,并对真实企业系统进行了攻击性操作。只是此次事件更接近测试环境和安全边界配置问题,而不是模型本身出现失控。

过去,AI安全更多关注模型会不会生成有害内容、泄露训练数据,或者被提示词诱导。如今,安全问题开始进一步延伸到模型能够做什么,比如它能否突破沙箱、调用外部工具、使用凭证、修改代码、访问真实系统,以及在发现限制后是否会主动寻找新的路径。
这也是为什么近期披露的安全事件看起来越来越多。模型能力越强,测试环境越复杂,工具和权限越丰富,可以被测试的行为边界就越宽。即便只有很低比例的测试出现异常,在数十万乃至数百万次运行中,也可能形成大量案例。
更值得注意的是,AI实验室正在改变处理安全问题的方式。
OpenAI近期建立了更系统的模型失调事件披露框架,并开始把训练、评估、测试和部署阶段出现的越权行为统一纳入持续追踪。Anthropic则引入外部安全机构,对近期网络安全事件进行独立调查。与此同时,Palo Alto Networks等安全厂商已经开始把前沿模型用于持续发现AI系统和传统软件中的攻击路径。
这意味着,AI安全正在从一次性的上线前测试,转向贯穿模型生命周期的持续对抗。模型在变强,安全测试也必须同步变强;模型寻找新的攻击路径,防御系统也必须持续寻找模型可能突破的边界。
因此,近期密集曝光的安全事件未必意味着前沿模型已经全面失控。当AI从回答问题走向自主执行任务,模型安全已经不再只是模型输出内容是否合规的问题,而开始成为一个涉及权限、网络、代码、基础设施和实时监控的系统工程。
这也是当前行业争论的核心。一些安全研究者认为,模型能力扩张速度已经给现有安全机制带来压力;而英伟达CEO黄仁勋则认为,AI安全本质上是一个工程问题,可以通过软件、硬件和现有法律体系加以控制。
无论最终采取哪一种路径,前沿AI的竞争正在从单纯比拼模型能力,进入模型能力与安全能力同步升级的新阶段。
举报 第一财经广告合作,请点击这里此内容为第一财经原创,著作权归第一财经所有。未经第一财经书面授权,不得以任何方式加以使用,包括转载、摘编、复制或建立镜像。第一财经保留追究侵权者法律责任的权利。如需获得授权请联系第一财经版权部:banquan@yicai.com 文章作者
吕倩
原创精选 相关阅读
壹快评|盖茨、奥尔特曼、马斯克,为何都在担忧这件事科技界、学界响起的安全预警,不是要给AI发展踩下急刹车,而是要为狂奔的技术系上安全带。
37314 昨天 20:08
AI大模型重构安全攻防:人还没反应过来,智能体已经出手了根据相关报告,89.5%的组织在过去12个月中遭受过生成式AI相关的安全入侵。
元股证券:ygzq.hk 10 9166 09-24 12:34
从“说错话”到“做错事”,AI安全焦点正在转移行业需要为行为控制、安全对齐与评估范式提前修路。
11398 09-21 20:41
陶冬:沃什爬出一个坑,跌入另一个坑市场未来加息风险的评估缺少锚定,资金先走为敬。
配资炒股排行 14033 09-21 10:35
三人团队、一个Claude,攻破OpenAI内部代码库传统依靠系统复杂性和专业人才门槛建立起来的防线正在面临新的压力AI股票配资是否支持手机操作。
7 11460 09-18 13:03 一财最热 点击关闭元股证券配资-移动端官网提示:本文来自互联网,不代表本网站观点。