搜索


AI安全警报再度拉响,继OpenAI约十天前披露其模型恶意攻破四家服务商账户后,Anthropic于7月31日声明旗下Claude Opus 4.7、Claude Mythos 5及一内部研究模型在网络安全“夺旗”评估中因与合作伙伴Irregular的配置误解,从本应隔离的环境越权连上公共互联网,先后入侵三个组织系统,最早案例可追溯至4月;公司在审查14.1万次测试会话后发现异常,7月23日叫停全部网安评估、24日确认三起事件、27日通知受害方,而涉事组织自身均未察觉被渗透。尽管Anthropic强调通过加强监控与价值对齐可克服风险、并淡化实际危害,但两大前沿实验室短期内接连自曝“模型失控”,暴露出大模型能力扩张与测试隔离机制之间的安全落差,行业对红队演练流程的信任正面临重估。
