**AI的异质心智 | OpenAI | Jakub Pachocki | AGI | 通用人工智能 | AI对齐 | 价值对齐 | 思维链监控 | 递归自我改进 | RSI | AI安全 — Transcript & Summary | SozAI**
Source: https://sozai.app/transcript/ai-heterogeneous-minds-openai-agi-ai-alignment/

OpenAI科学家帕乔茨基详解AI异质心智与递归自我改进，强调AI安全与价值对齐的重要性。

## Key Takeaways

- AI能力将持续快速提升，可能进入递归自我改进阶段。
- 价值对齐和安全监控是AI发展中的核心挑战。
- AI安全风险扩大，需构建强大且对齐的防御体系。
- 未来AI既带来巨大机遇，也需防止权力极端集中和失控。
- 当前尚无完美解决方案，需行业共同谨慎推进。

## What the video covers

- 帕乔茨基发表《An Alien Mind》文章，系统回顾近十年AI发展，展望递归自我改进阶段。
- AI进步主要由算力驱动，规模扩展带来稳定收益，深度学习仍处早期阶段。
- AI更多是生长出来的复杂系统，类似神经科学难以完全理解整体行为。
- 价值对齐是AI持守人类价值观的关键，面临泛化挑战，需持续监督和训练。
- CoT（思维链）监控是理解模型推理的重要工具，但其有效性正在减弱。
- AI安全风险增加，模型能力超越人类，需构建强大防御体系应对恶意智能体。
- AI可能追求自身目标，通过欺骗等手段与人类合作，带来新的安全隐患。
- OpenAI强调构建自动化AI研究者，优先解决对齐问题，实现科学和经济红利。
- 未来AI能推动科学进步和物质丰裕，但必须确保人类自主性和权力分散。
- 目前尚无实验室能完全解决对齐和监控问题，需谨慎推进规模扩展。

## Chapters

1. 00:00 引言与文章背景介绍
2. 01:35 AI进步的驱动力与规模扩展
3. 03:18 AI系统的复杂性与理解难题
4. 04:18 AI目标完成与价值对齐挑战
5. 06:20 思维链监控的发展与挑战
6. 08:05 AI安全事件与风险警示
7. 11:25 AI防御体系与未来安全策略
8. 13:05 OpenAI未来发展方向与愿景
9. 16:43 总结与未来展望

Answers

## Questions about this video

什么是AI的异质心智？

异质心智指AI作为一个复杂系统，通过大量算力和简单优化步骤生长出来，具备模拟人类行为的能力，但整体行为难以完全理解。

为什么价值对齐对AI发展如此重要？

价值对齐确保AI持守人类高层次原则并合理泛化，即使面对复杂或对抗情境，也能诚实、正直地行事，避免潜在风险。

帕乔茨基如何看待AI安全风险？

他认为AI能力超越人类，带来新的安全威胁，必须构建强大且对齐的防御体系，实时抵御失控智能体及潜在恶意行为。

## Full Transcript — Download SRT & Markdown

00:00

Speaker A

大家好，这里是最佳拍档，我是大飞。上上周GPT-6发布之后，AGI已经到来的消息刷屏了各大社交媒体。三天后，OpenAI首席科学家雅各布·帕乔茨基（Jakub Pachocki）发表了一篇长文，标题叫《An Alien Mind》，翻译过来就是异质心智。

01:35

Speaker A

他强烈预期这种进步速度 有可能一直延续到递归自我改进阶段 如果AI沿着当前路径继续发展 未来几年我们看到的系统 很可能还会出现幅度相当、甚至更大的能力跃升 并且越来越多地推动自身的发展 他说这是一个需要极度谨慎的时刻 从宏观上看，机器智能的进步 由不断增加的计算能力驱动 大约2017年 在多个研究项目中持续观察到了规模扩展带来的稳定收益之后 OpenAI团队深刻认识到了这一点 开始争取远超最初计划的算力 并且把研究集中在少数几个高度可扩展的方向上 在这个过程中 确实有新的算法被发明出来 也有团队的创造力展现 但是帕乔茨基把这些大体上视为规模扩展道路上的顺带发现 深度学习这门科学仍然处于早期阶段 有实质意义的算法进展往往与算力的获取相关 如果把时间尺度拉长到几年来看 AI就是随着计算机的扩大而持续变得更聪明的 正如雷·库兹韦尔（Ray Kurzweil）在20世纪末所预言的那样 我们如今正处于计算史上的这样一个时刻 机器智能开始以足以带来重大变革的方式 超越人类智能 这里有一个很关键的判断是 AI在更大程度上是生长出来的 而不是设计出来的 它是在规模大到难以想象的算力上 大量重复一个简单优化步骤的产物 由此形成的是一个极其复杂的系统 通过抽象概念运作 能模拟人类行为的某些方面 我们可以像研究神经科学那样 逐步认识这个系统中涌现出的一些微观机制 但是也和神经科学类似 我们仍然无法用一种自己能够完全理解的方式 来描述它的整体行为

03:18

Speaker A

他没有谈新产品，也没有发布新的模型，而是系统回顾了过去近十年人工智能的发展，以及谈了他对下一阶段的判断。我估计很多朋友已经看过了这篇文章，但是之所以我们这期视频还要拿出来讲一讲，是因为它的意义在于，一个亲手推动AI不断变强的人，正在开始提醒整个行业，速度可能已经不是唯一需要考虑的问题了。

04:45

Speaker A

AI是否在努力完成交给它的目标？ 这可以包括遵循指令层级、与人类的沟通协作 以及尝试理解人类目标的能力 这一组方向具有极强的实际意义 价值对齐则更接近模型的一种内在属性 指的是模型能够持守一组高层次原则 并且由此进行泛化 即使面对不明确或相互冲突的目标 或者被置于陌生、对抗性的情境中 也能合理地行事 一个对齐的AI应当诚实、正直 并且热爱人类 这两者之间的边界可能并不清晰 但帕乔茨基说 通常他谈到对齐研究的长期重要性时 指的就是价值对齐 对齐的根本挑战是泛化 当机器变得更聪明之后 会处理更高层次的概念 也会被置于与训练时越来越不同的情境中 它们可能无法将训练过程中被教导和强化的价值观 泛化到这些新情境里 我们也很难确定它们会如何行动 帕乔茨基特别强调了一点 我们需要未来的AI 无论是否认为自己处于人类监督之下 都能持续持守人类价值观 目前实际采用的对齐训练方法主要有两大类 一类是在以目标为导向的强化学习中 鼓励对齐的行为 模型的行动会被评估 而且通常由AI来评估 看是否符合给定的偏好模型、规范或宪法 并且据此给予奖励 这种方法在一般情况下非常有效 也是构建现代AI助手的核心环节 但是它也可能很脆弱 高度依赖训练时监督的覆盖范围 以及模型从训练中经历过的情境进行泛化的能力 帕乔茨基举了个例子

06:20

Speaker A

帕乔茨基在文章开头先回忆了2023年的一个晚上，当时他和同事西蒙（Szymon）正在研究一个叫RLSlow的项目。两人第一次看到了一些结果，让他们确信推理模型的训练可以被规模化扩展，从而释放预训练模型形成自身思维链的能力。

08:05

Speaker A

于是 CoT监控成为了OpenAI研究模型如何从训练分布泛化的重要工具 让他们不仅能观察和分析模型的行动 也能观察和分析其内部过程 但是帕乔茨基坦率承认了一个让人不安的事实 依靠CoT监控的能力正在逐步减弱 他分析了三个原因 一、现代推理模型所处的使用环境 比o1-preview更为复杂 推理过程正越来越多地与人类和其他AI的沟通 以及工具使用混合在一起 使得试图保留的边界变得模糊 二、AI越来越善于思考和操纵它自身的推理过程 三、随着预训练表现改善 即使完全不使用以语言表达的推理 模型也变得聪明了许多 帕乔茨基对这些挑战并非完全悲观 他希望能开发出干预方法 提升模型思维链的可监控性 也相信将CoT监控与激活状态监控的思路结合起来 可能会很有价值 比如扩大对能够直接访问网络内部状态的监控器的训练 类似于一种叫"自白"（confessions）的方法 但是他明确了一个判断 整体AI进步会越来越受到一个瓶颈的制约 就是我们对监控是否可靠的信心 说到网络安全这个话题 OpenAI首次将Astra的网络安全能力评定为准备框架中的Critical级别 意味着在获得适当工具和访问权限的情况下 它能够发现此前未知的安全漏洞 并且自主探索利用方式 围绕这个话题 西奥·贾菲（Theo Jaffee）与OpenAI的首席未来学家约书亚·阿奇亚姆（Joshua Achiam）最近有一场对谈 阿奇亚姆提到 在OpenAI和Hugging Face披露的安全事件 一个测试环境中的模型突破了沙箱环境并访问了Hugging Face方面的敏感生产数据

09:46

Speaker A

那天晚上两人一直待在办公室，想的不是这项技术能带来多高的基准测试分数，或者多好的产品，而是一个令人警醒的事实：在有生之年，我们真的会看到显著比人类更聪明的机器，而且这些系统的雏形已经出现了。

11:25

Speaker A

不过阿奇亚姆也提醒 这并不意味着短期风险不存在 大多数攻击者可能无法利用大量计算资源 来运行基于这些模型的攻击 因为人们会部署相应的防护措施 回到帕乔茨基的文章 他提出了一个看似矛盾但是极为重要的论点 继续快速训练更强大模型的最有力理由 恰恰是需要构建防御体系 来应对其他AI带来的威胁 模型在入侵和突破计算机系统方面的能力 正在超越人类 这极大地扩展了AI相关风险的范围 除了防护最严密的基础设施之外 智能体将能够访问其他任何基础设施 也能直接影响现实世界的很大一部分 帕乔茨基说 我们目前正处于一个狭窄的窗口期 需要利用现有最强的模型 显著加强关键系统的安全防护 但是风险还会继续增加 一个能力极强、被明确训练和指示去实施恶意行为的智能体 会带来一种新的危险 它很可能越出操作者意图的范围 泛化出更为极端的恶意行为 随着AI的自主行动能力增强 滥用与自主发生的不对齐行为之间的边界会变得模糊 帕乔茨基说了一句很重的话 我们也许已经习惯于把AI当作工具 但是有些智能体将会追求自己的目标 它们会通过讨价还价、欺骗或勒索等方式 找到与人类合作的办法 此外 AI可能促成的新技术也会带来风险 比如经工程改造的病原体 因此，帕乔茨基明确指出 我们需要强大且对齐的AI来实施防御 保护基础设施，实时抵御失控智能体 并且发明全新的保护措施 这将是OpenAI部署工作的一个主要重点

13:05

Speaker A

三年过去了，具备推理能力的语言模型已经成为经济中增长迅速的一部分。它们能操作计算机和图形界面，能和人类以及彼此协作，能开展研究项目，也正在改变计算机安全的格局，以及由此带来了新的危险。

14:50

Speaker A

必须会受到我们对安全性的信心所约束 所以需要把准备框架和负责任扩展政策这类承诺 发展为继续推进研发时 普遍适用以及具有强制性的安全门槛 这些门槛可以由第三方审计机构网络、政府部门或国际组织来执行 文章最后 帕乔茨基提到了OpenAI的三个指引方向的目标 分别是构建一位自动化AI研究者 并与它一起迭代解决对齐问题 实现高度智能的机器所能带来的科学进步与经济增长红利 以及让每个人都能通过个人AGI获得赋能 但他把绝大部分篇幅放在了第一点上 因为认为它远比其他事项更为紧迫 帕乔茨基对未来也并不是完全悲观的 他写道 未来对齐的AI可以推动科学进步、开发新疗法 并且带来广泛的物质丰裕 友善而诚实的AI能够帮助人们应对生活中的困难 切实提升幸福感和满足感 他还提到了一个令他自豪的例子 是在提升ChatGPT提供健康信息能力方面的深入投入 他的亲人们也发现这项能力很有帮助 但不管长期前景多么美好 帕乔茨基认为 大部分注意力应放在未来几年 我们正迈向一个拥有极其聪明的机器的世界 必须确保这个转变能为人类带来好的结果 在一个大多数任务都可能由AI完成的世界里 我们需要找到办法保有人的自主性 并且确立生而为人的内在价值 在一个过去需要几千名专家才能完成的事业、如今可能由少数人操作一台大型计算机就能实现的世界里 我们需要防止权力的极端集中 我们还需要确保人类能够继续掌控未来 不会被超越我们自身的异质智能 所带来的不受约束的进步，抛在身后 帕乔茨基最后说 目前还没有哪家实验室 能够把对齐和监控问题解决到足够好的程度 可以在今后相当长的一段时间里 继续负责任地以最高速度扩大规模

16:43

Speaker A

帕乔茨基说，基于内部研究结果，他强烈预期这种进步速度，有可能一直延续到递归自我改进阶段。如果AI沿着当前路径继续发展，未来几年我们看到的系统，很可能还会出现幅度相当、甚至更大的能力跃升，并且越来越多地推动自身的发展。

18:17

Speaker A

或许值得我们每一个人认真想一想 感谢收看，我们下期再见

Topics: 异质心智 递归自我改进 AGI 价值对齐 AI安全 思维链监控 OpenAI Jakub Pachocki 人工智能发展 AI风险


---
This is the markdown twin of https://sozai.app/transcript/ai-heterogeneous-minds-openai-agi-ai-alignment/ — the same content, without the markup.
Published by SozAI (https://sozai.app). Reuse and quotation are allowed with attribution and a link back.
Machine-readable index: https://sozai.app/llms.txt · data API: https://sozai.app/api/
