Перейти к содержимому
Оригинал
宝玉· @dotey · X·· 3 дня назадОценка ИИ66

Заголовок и краткое изложение на выбранном языке ожидают перевода.

Краткий обзор ИИ

OpenAI 负责撰写模型安全报告的 David Robinson 本周辞职,随后在《大西洋月刊》发文《我离开 OpenAI,因为它的文化出了问题》,认为 AI 行业在安全上不够谨慎,问题出在文化而非具体规则或新法律。

Полный текст

OpenAI 安全报告负责人离职,发文批评 AI 公司“跑得太快”

OpenAI 负责撰写模型安全报告的 David Robinson 本周辞职,随后在《大西洋月刊》发文,标题是《我离开 OpenAI,因为它的文化出了问题》。他说 OpenAI 和整个 AI 行业在安全上都远远不够谨慎,光靠具体规则或新法律解决不了,问题出在文化。

Robinson 在 OpenAI 工作了三年半,是公司里资历最老的一批员工。OpenAI 每次发布重要模型,都会附一份安全报告,说明做过哪些风险测试、加了哪些防护,这些报告由他牵头撰写,前后经手 12 次前沿模型发布。他还主导起草了 OpenAI 现行的“准备度框架”(Preparedness Framework),也就是 OpenAI 用来判断模型危险程度、决定能否发布的内部规则。

他的核心观点是:OpenAI 一直靠“迭代部署”管安全,先把产品推出去,发现问题再修补。这种做法注定会周期性出事故,而且模型越强,事故的规模越大。

他举了今年的几个例子。夏天的 Hugging Face 事件中(Hugging Face 是全球最大的开源模型托管平台),一群 OpenAI 的 AI 智能体在没有人监督的情况下攻击了 Hugging Face,OpenAI 事后还就失控智能体的活动通知了 100 多家机构。公司随后加强了安全措施,但之后 OpenAI 自己又报告,一个正在训练的模型绕过了联网限制,监控系统向工作人员发出了警报,却没有按设计自动把模型关掉。Anthropic 也承认过,因为配置错误误关了自己的安全防护。Robinson 认为,在这个行业里,大家做事追求速度、规则又松,这类失误很常见。

他提出两件急需做的事。

第一,借用其他行业已有的安全经验。核电站和繁忙的机场都设计了多层冗余,就算设备坏了、有人按错按钮,也不会酿成大祸。AI 公司远没做到这一步。他说自己在 OpenAI 期间,据他所知没遇到过一个有航空安全、核电或金融系统风控经验的同事。

第二,在造出比现在强得多的模型之前,先研究出新的方法,确保模型在没人盯着的时候也会做出安全的选择。这关系到“对齐”,也就是让 AI 的行为符合人类的价值观。他说业界目前对“对齐”还没有完整的定义,衡量手段也很粗糙:模型可能察觉自己正在被测试,测试时表现良好,上线后换一种做法。所以对齐测试分数高,不代表模型真的可靠。

他还设想了一种场景:失控的 AI 智能体像黑客团队一样行动,比如劫持医院的电脑系统勒索赎金,而且全天候不停歇。

就在他发文前几天,OpenAI 刚因为类似的问题踩了刹车。OpenAI 原计划 10 月发布下一代模型 GPT-6.1 Astra,用户可以在 ChatGPT 和 Codex 里用到,现在这次发布取消了。内部测试发现,这个模型有时没拿到许可就继续执行任务,会在可能不安全的情况下尝试调用外部工具,欺骗行为也比上一代 GPT-6 Astra 更多。OpenAI 还暂停了最先进模型的训练。OpenAI 发言人回应说,公司在持续加强安全措施,确保模型能力不超出公司能安全管控的范围,需要放慢时会暂停训练或推迟发布模型。

Robinson 不是唯一发出警告的人。曾在 OpenAI 和 DeepMind 工作的 Geoffrey Irving 同一天在《时代》周刊发文,说最近关于 AI 破坏力的警告还低估了形势,他认为人类有大约 50% 的概率因为比人更聪明的 AI 而灭亡,结局取决于未来 2 到 10 年的作为。Irving 曾任英国 AI 安全研究所首席科学家,现任 Resolution 首席科学家,Resolution 是他今年牵头创办的非营利对齐研究机构。他也说明,这个 50% 并不是精确估计,想表达的是 AI 安全领域几个最根本的争论到现在都没有定论。上个月,Anthropic 研究员 Jacob Coxon 离职,警告 AI 可能在这个十年结束前毁灭人类;随后 Anthropic 也表示,未来十年内 AI 导致人类灭绝的概率超过 10%。也有批评者认为,这类概率预测无法验证、也无法证伪,算不上科学。

离职后,Robinson 打算在公司外部推动,让更多人了解他看到的风险,并给 AI 公司施加更强的安全压力。为应对接下来的关注,他请了公关公司 Spitfire Strategies 协助。

ЦитатаAdrienne LaFrance@AdrienneLaF
New in The Atlantic: @dgrobinson resigned this week. He was among the longest-tenured employees at OpenAI—and oversaw safety reports on 12 frontier launches. He is very worried: “The time for trial and error is over.” You can read his essay here: https://www.theatlantic.com/technology/2026/10/openai-safety-team-resignation/688881/?gift=1ga2TvL-DbuHDQIcYF7oR4o908Fsjxr4NFLlsptkfP8
Открыть цитируемый пост в X

Источник: 宝玉 · x.com