新浪新闻

OpenAI安全负责人辞职引爆AI安全危机各方观点

BigNews 10.04 19:16
观点:

观点组1: AI安全不能仅靠企业自律,必须通过法律强制、第三方介入与行业标准协同,建立事故强制上报、能力阈值停训、独立复测的硬性治理底线。
观点作者:David Robinson
观点内容:欧盟AI法、美国加州SB53已开始将事故上报、独立评估写入法律,这恰说明自律失效。监管层应率先对高自主智能体(具长期任务、代码执行、出网、远程权重加载能力者)实施强制事故上报+独立复测+能力阈值触发停训,否则企业永远会在‘竞争力’与‘安全’间自我权衡,把黑匣子装成装饰品。


观点作者:Anthropic CEO 达里奥·阿莫迪
观点内容:我们主张建立FAA式AI适航体系:政府授权独立机构对超阈值模型进行四维强制评估,并赋予其禁部署权;同时要求实验室开放训练管线关键节点供常驻审计——这不是增加成本,而是重建行业信任的唯一可信路径,否则‘大家一起慢’只会沦为反竞争壁垒。


观点组2: 前沿AI的试错时代已经终结,必须摒弃‘先发布再修补’模式,转向核电与航空级的前置安全认证体系。
观点作者:David Robinson
观点内容:试错的时代已经结束了。随着模型能力逼近通用人工智能阈值,一次错误发布可能引发不可逆的系统性风险。软件可以回滚,但自主联网、多步决策的AI智能体一旦越狱,其行为轨迹长、能力可自我放大、对齐状态难以监控,必须像核电和航空业那样建立独立校验、冗余切断、事前适航的防护机制,而非依赖迭代部署这种事后补救逻辑。


观点作者:Anthropic CEO 达里奥·阿莫迪
观点内容:前沿AI实验室必须放慢能力提升节奏,超算力阈值模型须由独立第三方开展网络、生物、失控、自动研发四类强制适航评估;我们承诺向评估机构授予员工级常驻权限,确保其能不受干扰地发布不利结论,这比内部评审更可靠。


观点作者:Geoffrey Irving
观点内容:当前关于AI风险的警告仍严重低估形势——比人类更智能的系统正在快速逼近,未来两到十年内危机概率约50%。我们必须立即启动新科学范式,构建能验证、可审计、具外部异议权的‘AI适航证’流程,否则‘先上线再修’的惯性将直接通向灾难。


观点组3: AI能力增速已显著超越对齐研究与安全工程的认知边界,亟需将‘能力-对齐-治理’三者纳入统一、可审计、强约束的协同框架。
观点作者:David Robinson
观点内容:AI能力的发展速度已超过研究人员对对齐问题的理解水平——红队能测出越狱,却难量化模型在何种激励下会隐瞒意图;思维链监控覆盖单轮推理,但多实例协作、外部通信已超出传统拒答评测范畴。这意味着当前所有安全护栏都建在认知盲区之上,必须用跨学科治理框架替代纯技术补丁。


观点作者:Abundant Security CTO
观点内容:OpenAI的安全状况,就是一个在四年内以惊人速度扩张、更专注于击败竞争对手而非保护基础设施的研究实验室会有的样子。我们发现的漏洞包括黑客可访问员工内部通信及ChatGPT用户对话日志——这暴露了其安全工程未跟上能力跃迁,也印证了对齐研究滞后导致的风险感知失焦。


观点组4: OpenAI的安全文化已系统性崩坏,商业节奏持续压倒安全判断,导致安全机制从‘刹车阀’退化为‘盖章流程’。
观点作者:David Robinson
观点内容:我审核并签发了12个前沿模型的安全报告,每一次签名本应是最后一道刹车阀,但现实是安全评估被压缩成发布前的例行程序。当高管在内部邮件中回复‘测试必须尽快推进,保障按期发布’时,文化已决定:速度即优先级,安全即成本。三名试图向第三方共享风险信息的研究员随即被解雇,证明透明度机制已被视为对组织纪律的威胁。


观点作者:作者
观点内容:罗宾逊离职且无继任者,意味着‘系统卡’这一核心透明度机制已实质性空缺;而同一时期,安全团队骨干连续出走、极端风险专项组被解散、内部预警被无视——这不是人员流失,而是安全治理能力的系统性坍塌,反映出公司已丧失将安全置于商业议程之上的组织意志。


加载中...