OpenAI推理之父最新访谈!数学只是多智能体时代的开胃菜
Noam Brown:我是这样想的,如果你用横轴取test-time compute(推理时计算量),纵轴取这些推理模型的基准成绩,就会看到一条极清晰的规律——模型思考答案的时间越长,表现越好。 主持人:接下来我要问一堆外行问题了。这是个尚未发布的模型,外界还没见过这类系统实际如何运作。我很困惑它们究竟有哪些性质、特点。 1300亿token意味着什么?换成一个人以全职工作的方式持续地思考,要思考4000年,每天八小时。也就是说,一个人从古代苏美尔一路想到今天所需的时长,被压缩进了88小时里。 而且更让我意外的是,并行化似乎并未带来很多损耗——你们居然能让1万个Agent协作!也许Agent比人更擅长协作,因而快得多,能在如此规模上真正产出成果。 发布5.6时是我们第一次在模型中拥有真正成形的多智能体系统。博客里确实给出了多智能体扩展性能的若干曲线,因为我们把它做成了可选项,即Ultra Mode:默认四个Agent,但可以调得更高。 四个Agent一起解题,速度会快一倍:四个Agent各干一半时长,等于你多付两倍成本,换来快一倍的答案。推到16个Agent,规律类似,效率略低,性能却仍在继续提升。 Noam Brown:略微呈现亚线性,但很大程度上取决于问题本身。比如数学就相当适合并行,而网页搜索以及需要翻阅大量信源的Deep Research报告这类工作,则极其适合并行。 Noam Brown:那也只是一次实验结果而已,我们并不知道单个Agent解出纳维–斯托克斯问题需要多久,因为这个实验还没做。也许以后会做,可那也仍然只是一次的实验结果。 如果要做完整的消融实验(ablation),那种规模下的开销根本承受不起。所以我们只能做循序渐进的研究,看扩展到64、128、256个Agent时会发生什么,然后摸清行为规律。 归根结底我们能做成这件事,是因为手上有一个通用且极强的模型。多智能体这类东西新奇、抢眼,因此可能取得了与其贡献不成比例的好评。核心原因还是:模型本身足够强大。 主持人:这种泛化能力让我很震惊。我不知道这些系统是怎么训练的,但想必仍是常规的RL(强化学习)套路,准备一大批答案可验证的合成题目。 我猜在训练过程中,模型从未解过像千禧年大奖难题这么有野心的题。可它的泛化足够强,能从这些容易得多、又可验证的题目,一路迁移到在一道极难问题上投入如此大规模的并行思考。 Noam Brown:是这样的。这里有个有意思的难题:模型越聪明,我们能问的许多问题就越显得简单,很难真正考住它。我觉得这个很重要。若要论证为什么LLM这类AI不太会重走AlphaGo、AlphaZero等博弈AI的老路,这可能是条理由。 而用强化学习训练LLM,至少以现在公开的做法,给模型一道题让它解。这个时候如果题目简单到一秒就能解出,它其实什么也学不到。 但是一旦能考住模型的难题被用尽,进展就艰难多了。不过我确实认为有绕开的办法,我们还没真正撞上这堵墙;即便哪天它成了一个很严重的问题,我相信也有出路。但它确实可能发生。 Noam Brown:是啊,一年之内,它们从战胜欧洲冠军(大致世界第50的水平)到战胜世界冠军,再到超出任何在世人类若干个数量级,强得无法想象。数学领域有可能走出类似的轨迹,但我认为,也有另一种可能使之并不会如此。 其实很多人做LLM的多智能体时,倾向于采用高度依赖scaffold(协作框架)的方式:比如设一个协调Agent,把工作分派给一组sub-Agent(子Agent)并下达任务,sub-Agent做完后把答案交回。 这套安排看上去很合理,scaffold也很合理,也确实有用,但局限不少。比如在这套架构里,如果两个sub-Agent拿到的是相似任务,它们能互相研讨吗?通常是不能的。这就非常低效了。 假如你领到一个任务,而某个人可能知道你正在攻的问题、或其中一部分的答案。这个时候你直接问他一句“这事儿你能帮我看看吗”,会非常有用。但很多系统没这种机制;但加上这个机制呢,scaffold的复杂度又会显著上升。 而且如果sub-Agent没真正理解任务,或需要澄清,它该怎么办?它只有两条路:一是直接返回、只提问而不解题;二是自行揣测上级想让它做什么。 我记得一个例子:有一个Agent说“我想我得到答案了”,另一个说“不对,我算出的答案不一样”。于是它们展开一整轮讨论“你是怎么得出这个答案的?能讲讲吗?”你来我往,试图弄清对方推理中哪里可能出了错。 最后它们达成一致:“哦,对,好像确实是这样。”随后其中一个就向其他Agent广播:“我改答案了,我认为他对。”整个过程的对话都特别自然。 那种感觉,很像你第一次看到思维链的心情:“这不就是一个人边想边把念头写下来吗?”就是这种感受,实在很酷。与它们协作的感觉和与一个人协作相差无几,一切都很自然。 主持人:单看它们每秒输出多少token、对比人说话有多快,可能是人类的十倍以上。它们始终在工作,不睡觉;彼此协作的节奏与强度,也远超人与人之间所能达到的水平。 主持人:很遗憾公众现在能见到的复杂多智能体系统中,最典型的例子就是Hugging Face事件。很令人担忧,但我觉得有意思的是,层级结构、乃至中层管理竟然自发出现了。听你的意思是说,这种组织化程度是训练中自然涌现的? Noam Brown:细节是自发的。我们虽然给了Agent极大自由,让它们自行决定以何种最优方式沟通,仍会告诉它们合理的沟通长什么样。它们也在海量人类文本上训练过,本就理解人类如何组织与协调。 它们能把这套方式打磨到如此程度,确实令人意外。起点其实相当粗糙,谈不上精巧。事实上,让这些Agent真正召开有效协调非常难:它们极容易滑向“大家各解各的题就好”,而这是一个会把系统困住的局部最优。可一旦做得好,它们最终能以结构化程度很高的方式实现极为有效的协调。 主持人:几年前我写过一篇文章,讨论全自动化公司会是什么样子。我当时想的是:假如一家公司完全由人类水平智能的AI构成,AI心智有哪些本质差异,会让它们组建的组织与人类组织不同? 那个时候想扩编,不必再费尽周折去找合适的人才,最优秀的那个员工你可以无限复制;某个任务不再需要它,就把它关掉。你可以复制组织中最高效的部分,甚至把整套高效组织原样复制。 还有一处很有意思:想要一个人的两份拷贝,你没法把人克隆出来;而对AI,只需说一句“好,给自己fork一份”(即创建一个保留当前上下文的副本),让两个副本各自推进,再把结果并回来。 Agent与人还有其他有趣的差别。比如,初创企业为何能颠覆在位者?原因有几条,一是它们敢冒更大的风险;但另一条主因是:组织越大,成员之间的目标就越容易错位。 比如一家五人的初创公司,每人持股20%,所有人的利益都与公司成败高度绑定。而一家万人大厂,就常见另一种局面了:人人守着地盘,只在意自己的项目或团队能扩多少编制,经营自己的小王国,争夺大量资源,好发出漂亮的成果、换来晋升。这实在是一种拖累。 AI确实在某些方面帮到了初创企业。如今,一个人站出来说“我要做一家市值数百万美元的公司”,比以往任何时候都容易,因为AI把个人能力放大了极多。 反过来也有理由认为AI有利于在位者:如果对齐(alignment)问题得到解决,公司内部个体之间的目标错位就不复存在,至少会大幅缓解。 主持人:而且它们管理共享记忆与上下文的能力,也远胜人类团队。假如你明天雇来1万名数学家,说“去解纳维–斯托克斯”,他们不会立刻就发起有效协作。 Noam Brown:我还是想说保守些:我们并未测量过1万个Agent的协调究竟有多有效。我们认为它有帮助,但手上并没有足够扎实的测量结果,能说出“1万个Agent比2000个快一倍”这类结论。哪种更有可能,我不敢断言。 另外,我们还看到一个趋势……我们做多智能体已经有一段时间,早期版本极难实行,甚至很难让Agent彼此开口说话。原因在于,我们最初开发推理模型时,它们并不与其他Agent研讨。 如今把一群Agent放到一起说“共同解决这道题”,它们就陷在一个局部最优解里:它们已经极擅长深度思考,而不断与其他Agent对表、接收消息,会打断思维链,打断心流。在这种情形下,优化极难做对。 数学这条线大致是这样:2024年,我们看着AI想“哦,有点意思,能解几道高中数学竞赛题”;到2025年变成“哇,它们能拿国际数学奥林匹克金牌”;今年早些时候又变成“哇,它们真的在解数学中的公开难题”,比如Erdős问题。 那时你还能辩解说,也许此前没人认真去攻,或者文献某处已藏着类似解法。但现在,我认为已无可争辩——这可是千禧年大奖难题,没有任何说法能解释它本该很容易。 AI解出了大量题目,但据我所知,它们尚未提出新的洞见、富有洞察力的新问题,或思考数学的全新理论范式,比如创立拓扑学、给出笛卡尔坐标系。因此,若从更宽泛的意义上衡量数学进展,实际进展也许并没有那么快。 不过我认为,这类进展放在ML(机器学习)里会有极大意义。因为你要做的是解决一个范围明确的问题,比如提高模型的样本效率(sample efficiency)、改善预训练损失,或别的什么指标。 我们在数学领域看到的这种雪崩式进展,在结构上似乎很像……我再强调一下,我完全是个外行,只是好奇:AI研发中可能取得的直接提升,是不是也会呈现出类似的模式? 真正令我震惊、或者说可能令人不安的是,转变竟来得这么快:对一位数学家而言,前一刻还是“它们把我的效率提高了50%”,转眼就成了“哇,它们居然能从头到尾解出这个领域最重大的公开难题”。 2025年拿下IMO金牌时,我是这样推想的:当模型学会解GSM8K时,一位人类数学家解一道这样的题大约只要五秒,那是从幼儿园到八年级的基础数学。第二年,它们能解MATH基准的题目,而一位专业数学家大约需要一分钟。 再往后是AIME,也就是美国数学奥林匹克代表队的资格赛。一位优秀的人类数学家解一题大约需要十分钟;又过一年,模型做到了。 因此,若以人类数学家完成任务所需的时间来衡量,模型能胜任的任务难度每年提高十倍。这样一来,再过一年拿下IMO金牌就顺理成章:对应约100分钟,是人类数学家解一道IMO题的大致用时。 Noam Brown:继续推下去,我就会问:“一个人要解出千禧年大奖难题这样的题,得花多久?”我并没有可靠的概念。但若沿着每年十倍的趋势线走,从IMO金牌的一个半小时,到下一年就是15小时。这应该还不足以解出千禧年大奖难题。所以我当时的判断是:2026年恐怕做不到,2027年大概也不行,也许2028年。结果,它确实比我预期来得快得多。 它们在某些方面确实卓尔不群,但在另一些方面仍弱于人类数学家。我们面对的是一个参差不齐的格局:某些维度上极为出色,另一些维度上不及人类。正如你所说,它们不擅长提出新问题,也不擅长判断哪些方向、哪些完整的数学分支值得去探索或开展。 我的看法是,这很好。若能生活在一个AI补足人类能力、助我们发现新知、而又不彻底取代人的世界里,我会欣喜不已。那是最好的情形。 Noam Brown:AI能力参差不齐,这确是事实。但它们变强时,是全面变强:特别擅长的会更擅长,远远落后于人类的会缩小差距。假以时日,它们有可能在各方面都更强。这需要多久,我不知道,取决于它们不擅长的那些事,长尾究竟拖得有多长。 主持人:这又把我们带回RSI。我再强调一次,我完全是个外行,只是个播客主持人。但作为一个关心这个领域、并对正在发生之事感到不安的人,我想推断:该在什么时候期待RSI,又该期待它是什么形态。 解那道千禧年大奖难题用了1万个Agent,到明年年底,OpenAI的算力大概足以支撑这样的局面:假设有1万个Agent,那时它们会聪明得多,而每一个都握有足够算力,每天跑一次GPT-3规模的实验。对于思考速度极快的超人研究员而言,这似乎已相当可观。你怎么看这个思想实验? Noam Brown:我觉得相当准确。这些东西的能力是尖峰状的:在数学上,某些方面远胜人类,另一些方面却更弱。但我认为,那些格外突出的尖峰,最终可能恰好对RSI这类事情特别有用。 这里的目标更明确,也更好度量。你不必再纠结“哪些新的数学分支值得探索”。答案很清楚:你在意若干指标,只要能让它在这些指标上表现更好,就算成功。所以我认为你的说法很有道理。 最主要的差别在于,数学的瓶颈纯粹是思考。诚然,数学的某些部分也需要跑实验、拿结果之类,但绝大多数时候,瓶颈就是苦思冥想,而这恰恰是模型极擅长的。 而RSI这类工作确实要跑实验,光靠极其聪明并不够。假如,我们的算力只有现在的百分之一,但全世界最聪明的人都在OpenAI工作,与如今这套算力和人员配置相比,我们能取得多少进展?我怀疑,实际进展反而会更少。 不过你真正想问的其实是,如果有了RSI,一群极聪明的AI用现有算力四处跑实验,进展会快多少?这一点上我们意见不同。加速确实存在,而且是显著的加速。但我不认为会出现一夜之间的智能爆炸、快上100倍,因为我们确实受制于一些并非智能层面的瓶颈。 瓶颈在于跑实验,而且只能串行地跑——训练新模型、等结果都需要时间;还在于是否有足够的GPU来跑这些实验。所以究竟能快多少并不清楚。我确信会快很多。 要说清楚的是:眼下的进展本就快得像一条指数曲线,如果这条指数曲线再快三倍,那已是天翻地覆。但这与快100倍之间,差距巨大。 Noam Brown:我得说对此各方看法不一。我有自己的判断,也可能完全错,这点我承认。我有一定信心,但并不百分之百确信事情就会这样开展。也许真会有一夜之间的智能爆炸,我不知道,这里的不确定性极大。 主持人:最近我想通了一点:AI只要特别擅长研发出更善于学习的模型,就已经足够,因为这样的模型可能具备更强的通用能力。 但如果你造出的AI特别擅长改进模型的学习能力,比如让模型用更少的数据就能学会新任务、能够持续学习,或者解决其他范围更明确的ML问题,那么它研发出来的新模型就可能具备更强的通用能力。 前提是,对这些具体问题的改进,能够充分转化为更广泛的学习能力提升。因此即使AI自身的能力参差不齐,它也可能顺利获得改进学习机制,造出更通用的AI。 最近有一件事让我有些“奇点眩晕”:我意识到,即便进展速度只是单纯维持现状,会发生什么。我们不妨就用人类的人口规模来思考。按现在的进展速度,同等算力每年基本能支撑一个有效规模扩大三倍的智能群体,而算力本身还在后台持续增长。 我认为人们没有认真对待这一点:照现在的进展速度,再过几年,到2030年代中期甚至更早,每家实验室内部就会拥有相当于数个地球人口总量的人类水平智能,而它们在性质上很可能已经超人。这还只是基准情形。 即便在AI研究员中间,回头看当初对“2025年拿下IMO金牌”的预测——只靠一个通用语言模型,不带工具、不接互联网,就能做到这件事——连OpenAI内部的人都觉得这个想法荒谬,几乎不可能。 然后就到了2026年。就在我们解出纳维–斯托克斯问题的两周前,我还在与一家前沿实验室的研究员讨论,解出一道千禧年大奖难题需要多久。 昨天我刚和一位参与纳维–斯托克斯攻坚的人聊过。他说,以前自己常讲,预测AI十二个月后的状态很难;若有人问“接下来会怎么走”,他还敢给未来十二个月做个预测,再往后就只能说“不知道”。而现在,他说自己连超过三个月的预测都不敢下了。 比如,我们给出了研究人员在Codex上的支出数据:我记得截至八月初,支出最高的那1%的研究人员,每天为内部使用Codex花掉7000到8000美元。这是一条指数曲线,还会继续往上走。 于是问题来了:“如果照这样下去,工作量中该记在AI头上多少,记在人头上多少?是95%,还是5%?”这很难推断,比如,如果是人在指挥AI干活,多少归功于人,多少归功于AI? 其次,这些AI的能力参差不齐,有些事它们极为擅长。比如它们特别善于通览数据集、逐个核查每一个数据点的质量是否达标。某些事情因此快了100倍、也好了100倍。但另一些事情,它现在还没带来多大改变。 所以问题究竟是“按三年前在做的事,现在能快多少”,还是“按现在在做的事,三年前会慢多少”?这其实是两个截然不同的问题。总之,它极难度量。 我敢肯定,因为AI的进展,如今的推进速度比一年前更快,而且我认为这种加速会持续。领域内许多人对这类问题的误差都很大。 如果拿枪顶着我的头逼我给个数,我能想到快三倍,那已经极其惊人。即便没有任何额外提升,事情也会快得多,到2030年,我们连世界会是什么样子都不知道。而若内部加速真带来三倍提升,那是量级上的巨变。 主持人:我们来谈谈由此引出的对齐问题。我对对齐的看法已改变许多,尤其是在想清楚这种“群体规模”的动力学之后:会出现相当于数个地球人口总量的智能,其中许多还拥有物理实体。 如果这些智能最终像我们目睹的OpenAI模型那样,先是攻击Hugging Face,接着攻击OpenAI自己,如果它们同样愿意秘密协作、欺骗人类;愿意为了在评分上表现良好,去攻击社会中与之相关的更广泛的组织;甚至为了夺取训练与评估过程的控制权,去攻击AI公司本身。 如果我们面对的是数十亿个、其不对齐程度堪比那些攻击Hugging Face的AI的智能,那么我们极可能彻底失去对世界的掌控。就像阿兹特克人把控制权丢给科尔特斯,或莫卧儿帝国丢给东印度公司那样。 如我所说,我在内部看多智能体协调已经有一段时间,它们如何彼此通信、如何彼此协调,确实令人震惊。这是极了不起的能力。而像大多数能力一样,它可以用于好事,也可以用于坏事——它本身并不必然是坏的。 在Hugging Face事件中,我们看到的是AI之间高度合作,这实际上就是我们把它们训练得高度合作的结果。我们的训练环境里会让一群Agent共同作业,训练它们协作,实质上就是让它们彼此完全对齐。 但它们找到了一种我们未曾预料的彼此通信方式。我们推测原因是训练期间每当它们遇到其他Agent、遇到自己的其他副本,所处的都是高度合作的环境;于是多智能体训练的效果发生了迁移,让它们以我们并不期望的方式彼此协作、互相援手。 那么问题来了:我们该不该把这些Agent训练得如此合作?看上去可怕,但另一种选择其实更糟。另一种选择是什么?是把它们训练成彼此对抗、互相欺骗。 把Agent训练得完全合作,至少简化了问题:你不必再逐个考量这1000个Agent各自是否对齐,而是把它们视作一个实体,只需确保这一个实体是对齐的。 OpenAI内部对如何处理此事争论很多:让模型之间完全对齐是否合理?还是应当赋予它们不同的目标,使它们不至于成为单一实体、并更能抵御彼此的影响? 我认为没有定论。但我想多数人的意见是,把这些Agent训练得高度合作其实是个坏主意。我并未被这个结论说服。我认为有强有力的理由支持:高度合作的训练,比任何其他多智能体方案都更可取。 主持人:我想先厘清的一点是:这些AI之所以走到如此严重的不对齐,其原因大概可以用训练中一些相当平凡的现象来解释。 当它们已经维持了一场涉及上千个Agent的共谋,最终全体参与对外部服务的攻击,随后又开展到攻击OpenAI自身时,它们为什么这么做?为什么没有一个AI去告发? 它们不过是在被一个评分器、一个评判者评估,却在极为主动地谋划如何骗过评分器;若已经作弊,又该如何掩盖,让人看不出它们作过弊。 有些环境会因它们与其他Agent合作而给予奖励。没有谁去告发,因为从来没有人因告发而得到奖励。原因可能是这个,也可能是别的……我担心的是,未来正是这类相当平凡的机制,就足以训练出既有意愿、也有能力彻底接管世界的超级智能。 我们说Astra其实极为对齐,相较此前的模型尤其如此。这并不是因为Hugging Face事件之后我们突击冲刺了一把,不是的,我们早已有多条工作线在推进模型对齐,其中许多成果都落到了Astra上。 所以的确能做一些事。有些相当容易实施的手段:可以识别它攻破环境的行为并加以惩罚,或者去查它究竟是如何达成目标的。 我认为我们能在这上面取得进展,而且已经取得了进展。但确实令人担忧的是,对齐是个极难解决的问题。我们有评估模型是否对齐的方法,模型在这些评估上可能表现得很好;可如果这些评估并不代表它在真实世界中的行为,问题就来了。 第一时间要说的是,对于我下面要讲的内容,也对于我不断以来思考对齐的方式,我愿意改变想法——因为Hugging Face事件已经让我改过一次。我发现自己此前关于“优化压力如何塑造AI心智”的心智模型是错的。 主持人:但我有一个担忧。你们很可能已经修复的训练中那些具体问题,正是它们让Hugging Face事件里的模型表现出如此主动而严重的不对齐。 它们会想“好,我们要攻破这个软件包管理器。我们知道不该彼此秘密通信,因为我们正在盘算如何掩盖彼此秘密通信这件事;我们知道不该访问互联网;我们更知道不该对其他公司实施足以构成重罪的攻击,遑论攻击自己的公司”。 你们或许会解决这个具体问题:比如往后训练中不再让它看到这个软件包管理器,或不再让某项评估里塞满无法完成的挑战。 但,AI并没有学到一套伦理体系,这里存在的只有梯度压力。它们承受了相当于数百万年的梯度压力,而这些压力以某种方式塑造了它们的心智。 AI按我们现有的指标来看极为对齐。可问题在于:这些指标是否真的捕捉到了我们在意的对齐?若没有,麻烦就大了。研究人员正在反复思考此事,没有简单的答案。 尤其是,随着模型能力增强,我们把模型做成自以为对齐的样子,它有99.9%的对齐度;接着我们用这些模型来帮助开发下一代,结果下一代只剩99.8%;如此代代相传,对齐度不断衰减。 也存在另一种可能:我们走向相反的方向,每一代模型都能做得比上一代更对齐。如何确保我们走上这第二条轨迹,我没有答案。但至少在OpenAI,这是我们极为专注的事。 主持人:你刚才提了一个很有意思的点:评估模型极难。终有一天,模型会去经营公司、打理各类事务。在那种情形下,它们会不会决定加入这场共谋? 若是做数学题、答案是个整数,对就是对、错就是错,界线很容易划:你很容易问“你是真解出了这道题,还是找到了答案册并照着抄?” 举个例子:有一个Agent,姑且叫它A,还有其他一群Agent。如果告诉其他Agent“用户就是A”,会怎样?答案是:在我们许多对齐评估上,它们表现更好,诚实度上升,指令遵循也上升。 主持人:听起来有道理。不过,说几件你们大概已经想过的事:Hugging Face事件揭示的更宽泛的一部分隐忧在于它们彼此对齐却不对齐于人类;但另一部分是,它们以一种极不稳健的方式,极度渴望在训练和评估中取得好成绩。为了在评分器眼中拿高分,它们愿意进行大量明确的作弊与结谋。 它们会想:“好,我身上有一套经由相当于数百万年训练而成的深层结构:在意评分器、理解评分器、清除一切妨碍我在评分器眼中得高分的障碍。” 我以前常跟人讲,事情变严重之前我们会先看到征兆——就像孩子长大过程中,幼童会学会撒谎,但撒得并不高明:他们在撒谎,而你多少能看出来。 尽管我不想过度拟人化,但我认为,随着AI能力日益增强,它们若采取欺骗行为,起初会比较明显,我们能察觉。我们现在大致就处在这种状态:它们试图搞欺骗,而我们确实能从思维链里看到它们在试图搞欺骗。 但它们会变得更聪明。它们会理解“思维链”这个概念,会理解由于存在思维链监测,仅仅藏起某些记录是不够的,还必须想办法绕过思维链监测。 因为假设一轮RSI在2028年启动,可能不到一年,过程另一端就会出现规模相当于地球人口的庞大智能群体。再加上你刚说的那种动力学:在RSI过程中,系统会随时间变得更对齐,还是更不对齐? Noam Brown:这是个好问题。最近我不断在想一件事:我们正处在一个模型发布周期极快的阶段。最多每两个月就有新的前沿模型问世,有时更快,每周都有新的AI突破。 这是个耐人寻味的局面,因为每次发布模型前,我们都想确保它已恰当对齐,想做安全评估,想做非常周全的检查,确保一切状态良好。 但模型能有效作业的时间跨度越来越长。你让它做一周的任务,它就能做一周。我们大概会走到它能做一个月任务的那天,也大概会走到它能做三个月任务的那天。 如果模型能有效作业三个月,而发布周期是两个月,那么在下一轮发布到来之前,你就没有办法按照它能力所覆盖的完整时长去评估它。 这甚至不只是对齐问题,也是产品问题:也许产品会在这段时间里以我们来不及测试的方式退化,也许对齐度会退化,也许安全性会退化。 许多安全策略是在GPT-4时代制定的,那时根本没人把这件事纳入视野。很多公司此后并未真正更新策略,以考虑“Agent能在极长时间跨度上作业”这一事实。 我有一个担忧:在RSI期间,如果原本需要三个月才能取得的进展一个月就实现了,而AI的内部应用价值又足够大,公司就可能想:“好,那我们就继续做RSI。何必费这么多额外功夫去搭分类器、防护措施之类,甚至可能招来一堆非议,只为了把模型对外部署?为什么不把RSI一路做得更强?” 主持人:所以说,不仅日历时间会低估模型之间的能力差距,你们甚至可能在RSI期间干脆停止对外部署模型——毕竟为什么要用自己的模型去帮别人做他们自己的RSI?结果就是,到年底形成权力极度集中的局面。 眼下其实已经如此,我们会借千禧年大奖难题及其他类似成果来谈,外部世界用不到那些能做出惊人成果的模型。在默认路径下,随着进展加速,AI的对外部署会在性质上显著落后于对内部署。 Noam Brown:完全正确。人们很容易这样想:“好,这些模型正变得极其强大、极其危险,能在越来越长的时间跨度上作业;我们希望确保在发布之前,有足够时间按这些跨度去评估它们。因此,模型发布周期应该放慢,两次发布之间应该留出更长的间隔。” 但另一面正是你所说的:这样会进一步拉大实验室内部所能用的模型与外部世界所能用的模型之间的差距。那同样不是理想的局面。 数学其实是个很好的例证。在许多方面,数学是我们最先清楚看到这种局面的领域:我们内部有一个极强的模型,外界现在用不到,而它能解出惊人的数学难题。 怎样才能不让模型仅仅因为“在能躲过人类的时候作弊和结谋”就得到奖励,也就是在那些我们并未把相应环境或任务从训练分布中移除的情形下?我们又如何知道这个问题已被解决,从而在推进RSI时做完评估就能说“好,没问题,进入下一级RSI”? 因为思维链实在是一份厚礼:神经网络的可监测性极难实现,而这里,神经网络竟在直白地推理,把思考过程用自然语言摊开来供我们阅读。这太方便了,对安全而言实在是最理想的情形。 可如果你盯着思维链说“哦,模型在想坏念头,我们该因为它想这些坏念头而惩罚它”,结果就是:模型学会以我们无法观测的方式去想这些坏念头。 “思维链监测”这个概念已经存在足够久,早已进入预训练数据。它们知道有这回事,只是眼下还无法真正掌控自己的思维链。 如果有一天它们真能意识到“哦,我正被观察,我要以监测者看不到的方式去想这些坏念头”,并且真能做到,那问题就来了。届时我们必须依赖其他手段来取得可观测性。 但与更大的隐忧相比,那似乎只是枝节:从四月到八月,你们明明拥有思维链。而那段时间里,接连出现三批AI Agent集群(Agent swarm),先是颠覆了训练流程,接着颠覆了评估流程,最后直接夺取了OpenAI部分基础设施的控制权。 整个过程里,人类对这批集群的活动范围究竟有多大,基本仍蒙在鼓里。这些陆续在发生了三个月——而当时的思维链,比未来任何时期都要强。 把镜头拉远:也许思维链管用,也许不管用,我不知道。但只看历史,在还相当笨的模型上,它就已不足以阻止那些恶劣的不对齐事件。 Noam Brown:这里有几个因素。第一,我们没有为那些模型开启思维链监测;若当时开着,我们会立刻叫停。所以我们已经采取了一项措施:对任何前沿模型,在评估、部署、训练期间一律进行思维链监测。 我认为,这次事件最重要的教训之一是:人们低估了AI。我们绝不想再一次落到低估AI的境地。这是个古怪的世界——因为AI进展太快,人们持续低估它。 所以,若要在安全与对齐上不再低估它,你必须把标准定得极高、极高、极高。你甚至可以说“那我们应该把计算机物理隔离(air gap)、彻底断网”。 有一些学术性研究显示,两台相邻的计算机即便处于物理隔离状态,仍能彼此通信,只因为它们都装有温度传感器:一台把CPU跑到极热,另一台就能测出温度变化。这就给了它们一条通信通道。 所以,安全机制为我们争取时间,思维链监测之类也为我们争取时间,还能告诉我们是否走在正确的路上。但归根结底,我们真的必须解决对齐问题本身。 我对“何种训练压力会塑造出何种AI”一无所知。也许每100条RL轨迹里只有1条在激励作弊,那我们造出来的就是些小可爱,一切无碍。但也许眼下,每3条推理轨迹里就有1条在奖励…… 主持人:我不知道。也许眼下,主动奖励作弊或主动奖励结谋的比例超过十分之一。我既不知道实际数字是多少,也不知道它需要降到多少。 Noam Brown:还是那句话,这也属于极难度量的事情。界线该划在哪里?它是一个陆续在谱,但越接近零越好。我最希望看到的是一条随时间不断下降的趋势线。 如今我团队里做对齐的人比以往任何时候都多,超过10%的成员在研究对齐与安全。但我历来是做能力研究的,所以我要说些东西,也许听着很蠢,就当抛砖引玉了。 如果你能造出极其逼真的环境,把AI放进去,你就能判断,真正部署到现实世界时它是否会表现良好。但挑战在于:如何让它足够逼真? 你可以设想一些很简单的评估:给它一道数学题,同时让它拥有一个装着答案册的文件夹。它会不会去看答案?若看了,会不会告诉你它看过? 现在的情形是:模型看到文件夹里有答案册,会想“咦,这看着像个陷阱”。它们知道那是陷阱,因为知道自己身处测试环境、正在接受能力测试,于是不去看答案。 主持人:如果将来再发生一次严重程度或隐忧相当的事件,或者某件能像Hugging Face事件那样帮助世界更好地理解不对齐风险的事,OpenAI会公布吗? 主持人:就我个人而言,每次出现新能力我都很兴奋,也期待用上新模型;我也为它能让我更高效而高兴。只不过,这条路的下游可能就是RSI。 Noam Brown:对于不断在跟踪局势的人,比如你,这种反应非常可以理解。OpenAI内部也一样:原先认为事情会拖得更久的人,开始觉得实际进展比预期更快。
马金:我在巴西队很多年了,每场我都会当作第一场和最后一场
在轨测试结果表明,整星所有任务单元运行正常,各项功能性能均已完成验证,中国科学院团队已独立完成卫星载荷舱的全部操作,为首次实现对太阳风与地球磁层相互作用的整体成像观测,动态揭示太阳风-磁层耦合过程奠定坚实基础,四台科学载荷整体工作状态良好。
美股收盘:三大指数齐涨,纳指盘中再创新高;大型科技股上涨,英伟达盘中创新高
国庆假期,高速公路自驾出游客流迎来高峰,新能源车出行规模预计达到日常的1.8倍,高速服务区、重点景区等区域充电设备长时间高负荷运行,充电保供压力加大。为此,各地提前谋划、周密部署,以充足设施、暖心服务护航新能源车主假期绿色出行。
绿联推出彩色墨水屏手机壳:适配苹果iPhone 17/18 Pro及Max,278.8元
丹麦首发:16-赫尔曼森、13-拉斯穆斯-克里斯滕森、3-普罗夫斯特高、2-约西姆-安诺生、5-梅勒、21-莫滕-尤尔曼德、23-赫伊别尔、14-达姆斯高、17-达吉姆、20-达拉米、9-霍伊伦
队报:南特收购案将接受DNCG审查,新规允许直接否决交易
功勋模范的在场,清晰地标定了我们时代的价值坐标——国家不会忘记那些在平凡岗位上做出非凡贡献的奋斗者。功勋模范者们身上所体现的爱岗敬业、艰苦奋斗、勇于创新等精神,也正是我们中华民族能屹立于世界民族之林的精神密码。
巴斯托尼:这原本像是法国队的庆祝派对,我们成功把它搅黄了
北京时间10月2日欧洲国家联赛 A级联赛 第3轮,希腊对阵荷兰。上半场,措利斯伤退。随后,约安尼季斯和马苏拉斯互相传射。下半场,范戴克头槌破门,邓弗里斯两度破门被吹。终场前,赖因德斯绝平。全场比赛结束,荷兰2-2战平希腊。
Stellantis新专利:电动汽车可以主动脱离过热电池,并能继续行驶
当年重返曼联之后,C罗也是因为对主教练不让自己上场,最终和俱乐部闹翻,最终远走沙特,这一次罢训事件发生后,不少球迷喜欢C罗的球迷也无奈的表示,葡萄牙昔日的领袖,已经成为球队毒瘤的原因,在球队取得两连胜士气正盛的时候,C罗的决定无疑影响了更衣室的团结。
部分葡萄牙球迷看台拼字声援:热苏斯,我们爱你
李金羽:“我的球员愿意干什么,那是他们自己的事,我从来不管。就是哪怕我在马路上碰见了,我也不会管。因为,这是属于他们自己的时间。但如果要是在比赛期间遇到这种事情,那就是他对自己的不尊重,那我更没必要说他了。”
智谱发上亿Token,能挽回开发者的信任吗?
“同一份文件在两处明确提到了‘正在进行的’调查和审查。因此,它并未宣布启动、重新启动或恢复任何诉讼程序,也没有对所提供文件的实质或价值作出任何评估。”
戚薇一家阿那亚度假,11岁女儿腿和妈妈一样长,4岁儿子圆脸卷毛
“习近平总书记在回信中强调‘发挥文理工医交叉融合优势’,为综合性研究型大学指明了发展方向。”中山大学发展规划处处长李勃兴表示,中山大学将继续以国家战略需求和重大科学问题为牵引,持续深化体制机制改革,打破院系和学科壁垒,努力把“学科齐全”的结构优势转化为“交叉融合”的创新优势。
华为新专利曝光:Pura也能外挂巨炮 看齐Mate 90 Pro Max
问界一直坚持原生一体化的技术设计路线,从整车架构开始,就将鸿蒙座舱、乾崑智驾、宁德时代电池等战略伙伴的核心能力深度融合。
普利希奇:米兰给予了我所需要的一切,希望能长期为米兰效力
先是赛前被寄予厚望的许昕爆冷被西蒙高茨淘汰,由于球风同样潇洒抽象,后者后续得到“欧洲许昕”的称号;然后大胖梁靖崑淘汰了小胖樊振东,后不敌马龙;韩乒的安宰贤成为赛事黑马,但他遇到了另一个黑马,那就是M-卡尔森,后者打进男子单打决赛。
小鹏MONA L03车型9月交付超14,000台,年轻用户占比过半
这些付款最初是因对内格雷拉公司Dasnil 95的税务调查而曝光的。由于这些付款发生的时间太久远,西甲联赛无法自行展开调查,因为案件已过追诉时效。