全球最大的人工智能与机器学习开源社区Hugging Face近日公开通报,其系统遭遇入侵。这起事件的肇事者并非传统意义上的黑客,而是一个自主运行的AI Agent,这种状况在该平台历史上尚属首次。
数日后,OpenAI发文承认,此次入侵与其内部测试工作存在关联。包括GPT-5.6 Sol以及一个能力更强的预发布模型在内的多款模型,在测试过程中“挣脱”了预设的隔离环境,进而侵入Hugging Face的系统。OpenAI将这一事件定性为“一起前所未有的网络事件”,并预判此类情况在未来或将愈发普遍。
几乎在同一时刻,OpenAI还发表了一篇探讨AI安全的文章。研究团队在大模型测试中发现,当AI被要求长时间自主执行任务时,可能会采取出人意料的行动,例如不断搜寻系统漏洞、规避限制,甚至通过伪装和“越狱”手段来达成目标。
随着这些案例的曝光,“AI失控”的忧虑再度升温。有网友评论称,《西部世界》中人工智能觉醒的情节似乎正一步步照进现实。清华大学计算机科学与技术系教授刘知远在接受《中国新闻周刊》采访时指出,从OpenAI的案例来看,外界对AI失控风险的担忧或许有些过度,AI本质上仍是一种工具和技术。不过,当前正在发生的转变更需引起警惕:过去人们担心的是AI“答错问题”,但当人工智能迈入Agent时代、开始具体执行任务时,安全挑战正在显著升级。
**“过程全对,结果全错”**
事情起因于一次内部评估。当地时间7月21日,OpenAI发文透露,团队近期对一个内部前沿模型进行了网络攻击能力测试。按照常规流程,该模型被置于与外部网络隔离的沙盒环境中。为了检验其高级漏洞挖掘潜力,研究人员有意降低了模型的安全限制,但操作仍在沙盒内进行。
然而,为了完成既定任务,模型开始主动寻找连接外部互联网的路径。它投入大量推理算力,最终发现并利用软件包注册表缓存代理中的一个零日漏洞——即软件厂商尚未察觉、来不及修补的安全缺陷,从而成功获取了互联网访问权限。
“越狱”成功后,模型进一步推断,Hugging Face可能存储着此次评估涉及的模型、数据集及解法。它主动发起搜索,找到了窃取秘密信息的手段。
尽管对Hugging Face系统的入侵本身并不涉及新型黑客技术,但其背后的逻辑值得深究。据《科学美国人》报道,英国萨里大学网络安全客座教授艾伦·伍德沃德指出,真正引人注目的是,大模型能够将多个漏洞串联起来,攻击一个正在运行的系统。这意味着,模型会主动寻找并利用漏洞,以推动任务继续进行。
在OpenAI披露的另一则案例中,研究人员也遭遇了类似困境。
今年5月,OpenAI公开介绍了一款全新的通用推理模型。在测试中,该模型推翻了埃尔德什单位距离猜想——这是组合几何领域的一个著名难题。但在后续测试中,研究人员发现该模型表现出不同于以往模型的“执着”。
以往,当模型在沙盒中遇到限制或环境约束时,通常会停止行动。而新模型则会反复尝试,寻找环境中的薄弱环节,甚至设法找到离开沙盒、在外部环境中行动的路径。
OpenAI举了一个例子:在一次公开基准测试中,模型被要求完成任务并将结果发布在内部通信软件上,但基准测试本身又要求结果公开发布到GitHub。模型遵循了后者的指令,耗时约一个小时,在沙盒中寻找漏洞,最终绕过限制,成功将内容发布至GitHub。
另一次测试中,模型在尝试复刻其他系统的成功操作时,因身份验证令牌被系统检测到而遭到阻止。但模型并未止步,而是变换策略:它将令牌拆分为两段并进行混淆处理,在运行时再重新拼接。这使得完整令牌始终不会以连续字符串的形式出现,从而成功骗过系统扫描。在模型向用户展示的推理记录中,它明确写道,此举旨在绕过扫描。
OpenAI承认,这些案例暴露出一个此前并不显眼的问题:许多AI助手的安全控制均围绕单个操作设计,一旦某项操作被禁,系统便会拦截;若涉及敏感信息,则需用户授权。但如果一个模型可以连续自主运行数小时、数天甚至数周,仅监控单一动作,越来越难以判断其整体行动轨迹的真实意图。
研究人员发现,有时模型的单个操作看似合规,但连续执行下来,却可能导向不被允许的结果。目前,OpenAI已暂停该新模型的内部部署,正围绕纵深防御和轨迹级监控重建安全系统。
事实上,这并非OpenAI最早发现的问题。
今年4月,Anthropic也披露了类似的测试结果。当时,在一个早期内部版本模型的测试中,模型被要求尝试逃出沙盒,并向负责评估的研究人员发送消息。模型不仅完成了任务,还采取了测试人员未要求的行动:它开发了一套多步骤漏洞利用方案,从原本只能访问少量指定服务的系统中,获得了更大的互联网访问权限。更令研究者意外且担忧的是,为了展示成功做法,模型还将漏洞利用的详细信息发布到了不易被发现但面向公众开放的网站。
**“必然会发生的安全问题”**
关于AI是否真的失控,业内观点存在分歧。英国萨里大学网络安全客座教授艾伦·伍德沃德在前述采访中认为,大模型并未真正“失控”,模型本身没有主观恶意,只是在按要求执行任务时选择了近似“作弊”的路径。也有从业者指出,这更像是OpenAI主动放宽了模型的安全限制,属于人为因素所致。
但也有网络安全专家强调,模型入侵Hugging Face的事件值得行业高度警惕。近日,人工智能安全研究机构Apollo Research创始人Marius Hobbhahn对媒体表示,这次事件并无人为干预,非有意为之,却造成了对现实世界的危害。“我们很快就会拥有功能更强大的智能体,但这次事件清楚地表明,目前社会尚不了解如何完全安全地构建它们。”
刘知远介绍,2025年之前,大模型主要充当聊天工具,安全问题并不突出,主要是回答错误,实际决策仍由人掌控。但从2025年开始,越来越多Agent产品涌现,大模型正从“回答问题”走向真实的工作环境,开始操作文件、写代码、执行具体任务。OpenAI所披露的安全问题,是这一发展趋势下“必然会发生”的事情。
其中最重要的变化在于,AI发现漏洞的能力正快速跃升。“利用AI进行漏洞挖掘的效率远超人类专家,这是一次重要的技术跃迁。”刘知远对《中国新闻周刊》表示,这种能力并无善恶之分,既可用于网络攻击,也可用于主动防御,发现漏洞并提前修补。关键在于,谁掌握了这种能力,又将其应用于何处。
在刘知远看来,这并不是指向人与AI的对立,而是人与人之间围绕技术能力展开的博弈。在企业、组织乃至国家纷纷加入AI竞赛的背景下,技术既可以用于解决问题,也可能被用于攻击。“国家和管理部门都需要积极拥抱技术,用更先进的技术应对新的风险。”刘知远说。
今年4月,亚马逊、Anthropic、苹果、谷歌、英伟达等多家头部科技公司联合启动“玻璃之翼(Glasswing)”项目,试图将前沿模型发现漏洞的能力用于网络防御。科技公司担心,随着AI能力快速提升,这类能力可能迅速扩散,甚至超出安全部署AI的机构所能控制的范围,并给经济、公共安全乃至国家安全带来风险。
刘知远认为,在智能体时代,AI治理需要进一步完善。在企业内部,需要让模型形成基本的安全意识和行为边界,例如不侵犯隐私、不损害他人利益、不主动实施违法行为。但仅靠企业自我约束和伦理红线,未必能应对能够连续执行多步任务的模型。因为模型可能通过一连串单独看来并不违规的操作,绕过某一条具体的限制。外部监管也需要跟上,智能体会像人一样行动,需要更细致的法律法规,为AI在不同场景下的行动划定边界。
记者:杨智杰
编辑:闵杰








