E242|最快半年AI跑通自进化?与陈天桥首席科学家聊聊硅谷模型必争之地
频道: 硅谷101
视频: https://podcasts.apple.com/cn/podcast/%E7%A1%85%E8%B0%B7101/id1498541229?i=1000775574801
原文语言: zh
统计: 共 70 轮
[0:00]
哈喽大家好,欢迎收听硅谷101,我是泓君最近Anthropic他承认了一件事,他们现在80%的代码已经不是人写的,是Claude自己写的这家全世界最谨慎的AI公司同时发出了一个警告AI可能很快就要自己设计,自己去训练下一代的AI了他们管这个叫做递归自我提升,英文是RSI也是硅谷今年对模型能力最热的讨论方向之一那今天这期节目呢,我们的罕集量高了我们请到了两位真正正在做这件事情的研究员他们所在的公司叫做Apodex背后是陈天桥出资创立并亲自主导的那这家公司给自己的定位也非常的特别他们不做图片生成,不做视频生成,只做一件事他们自己呢叫做Heavy Duty Solver意思是专啃那些没有标准答案人类自己都不知道从哪下手的难题那他们管自己想做的模型叫做Discovery Model
[1:12]
不是从已知的信息里面找答案而是要提出人类还没有想到过的假设然后自己想办法去验证它去解决这个世界上还没有被解决的科学难题这也是为什么这家公司叫Apodex因为词源就是希腊语里的证明和论证如果AI真的可以教自己人类科学家还剩下什么让我睡不着觉的一个问题就是我们怎么知道这个模型在自我进化的时候它没有跑偏同时贝斌也在这集节目里面讲到了他自己蒸馏自己的想法这个在过去职业生涯里曾经每天都在跟马斯克跟陈天桥讨论技术问题的研究员我采访的时候有那么一瞬间觉得他下一刻就工作不保了于是我问他我们假设真的把贝斌蒸留了你会担心自己失业吗说不担心肯定是假的但是即使我担心我其实还是乐观的吧那这一集我们就站在AI自进化的分界点上与两位一线的研究员聊一聊硅谷模型的核心发展趋势以及未来模型能不能超越人类顶尖科学家的水平
[2:29]
真正的去提出问题去发现问题下面就请收听我们今天的节目那今天跟我在一起的两位嘉宾一位是Simon杜少雷嗨 Simon你好你好对 Simon是华盛顿大学计算机系的副教授同时也是Apodex的首席科学家负责训练与推理方向那还有一位嘉宾是Apodex的首席科学家负责代码与自进化方向的李贝斌哈喽贝斌你好你好那欢迎两位啊我们刚刚提到了今年有一个词很火嘛就是RSI然后我发现其实这个大模型它的预训练后训练包括它的核心的训练方向啊它可能是每年都有一些新的方向出来我记得前几年我们在聊的最火的是Deep Research深度研究再到Coding就代码方向今年呢就到了自进化Self-Evolve的方向首先想请贝斌跟Simon大家一起来分析一下这后面其实是几个不同的方向还是说它有一个核心的主线在主导这个模型往哪个方向走的
[3:35]
我感觉从训练的角度来看其实是同一个能力在提高其实都是推理的能力长链推理的能力还有就是在环境中进行一些探索执行一些动作获得了这个信号之后再进行下一步的探索不管是在Deep Research还是Coding这些环境下其实它的内核都是一样的只是它的方向有一些细微的区别我们说的自我进化这个概念其实并不是一个新的概念了我就不说远的在八九十年代关于AI和Machine Learning的自我进化我就光说Language Model的自我进化其实往前推的话也可以推到大概三年前左右那个时候Google就有一篇论文叫做LM as an Optimizer就是说用语言学习模型当做一个优化器可以优化不同的东西当时我在Autogen那边也有我的同事有出一个类似的概念叫做Agent Optimizer
[4:33]
就是说智能助手可以自己的进化自己的优化自己只不过这两年的话大家发现模型的能力越来越强了它可以自我优化的东西越来越多了就比如说Anthropic有八成的代码是可以自己写的训练模型呢不管是从哪个角度来说从合成数据的生成自然语言数据的清理还是自我训练学习的代码算法以及Infra底层代码其实它都是一种代码的形式一旦模型的写代码能力变强了用它来进行自我提升自己训练自己其实是非常自然的一件事情所以我并不觉得突然今年偶尔大家发现我们要自我学习自我进化让模型自己训练自己其实早在两三年前大家已经开始慢慢地做这件事情了贝斌你之前的背景是一直在关注模型的自我进化这条线是吗要不要简单介绍一下自己的背景对我最开始是在微软研究院那边做多智能体的合作当然那个时候我们不叫做自我进化因为那个时候智能体都是一个比较新的概念
[5:36]
所以大家一般对外说都是说智能体但是实际上我同事的一些工作就已经开始进行一些自我进化的当时我们叫做Agent Optimizer和Teacherable Agent智能体可以教智能体下一次在做类似的事情的时候可以用哪一些技能和现在的我们说的Skills这个概念有点像但那个时候大家用的概念还是说比如说Context Management或者是Prompt Engineering就是上下文管理以及Prompt Engineering就是工程学怎么样修改这个Prompt后来我去了Meta和XAI在XAI的时候我们就已经开始关注智能体RLAgenticRL就是通过强化学习来加强智能体的一些能力比如说用工具的能力写代码的能力当时还有一个概念叫做MCP Tools当然现在也非常火用MCP工具的这些能力
[6:25]
所以我们其实在早期Simon和我大概一年前左右就发现了其实模型提高自己是非常可行的一件事情包括我们当时做的一些强化学习的数据生成其实有很大一部分是代码写的到今年年初的时候Anthropic发表了关于Auto Research就是自己进行科研的一个项目突然一下这个概念就爆火了对我觉得非常好的这个自我进化的总结今年说到模型的自我进化跟往年来说模型的自我进化有什么不一样的地方吗我觉得今年大家再提到RSI的时候它说的是一种递归自我提升贝斌你要不要跟大家解释一下这个概念以及就比如说我们说这个概念的时候是不是说以前我们在让AI进化的时候考官还是人现在考官逐渐变成AI了它是不是在解决更难的问题对的这是一个非常好的问题其实自我进化如果大家想象成是一个圆环的话比如说模型自己找问题自己出题自己解答
[7:26]
然后自己训练自己那SI里面的R就代表是recursive递归就有点像垂直的递归慢慢向上增长这一点确实是跟以往的一些自进化有一点点不一样当然这个idea也不是新的今年跟往年的最大的区别就是在于模型的能力变强了比如说Anthropic发表的论文或者是说发表的blog有提到80%的代码是他们写的然后他们可以做人类大概一天左右时间做的事情这个能力上来了之后因为它是可以完成非常长程的任务所以在一个长程的任务里面这个模型可以提高自己好几遍不像过往的比如说我们说LM as Optimizer或者是Agent Optimizer的时候LM只会一次可能优化自己大概两三个小时因为你优化太久了它可能因为自己的BIAS或者自己的能力不足就很难继续往下迭代因为它可能会犯一个小错误然后那个小错误会自我积累
[8:26]
越积累越大到之后就没有办法进行自我的迭代而今年为什么这个Recursive这个R出来了因为大家发现这个模型可以进行很长程的任务所以它可以让这个模型自己Recursive多提高几遍对 我看这篇文章里面有一个数据就是说2024年3月份Claude 3的Opus它可以完成人类约4分钟完成的任务一年后呢就是3.7 Sonnet就可以处理需要1.5小时处理的任务又过了一年这个Claude 4.6 Opus可以处理长达12个小时的任务整个我们看到大模型的改进速度是在翻倍的嘛而且这个比我们计算机领域的经典的摩尔定律它的翻倍的速度还要快对 是的当然这个业界各家都有不同的说法但是好像大家比较接受的判断是这个模型能做的事情对于人类时间来说每七个月会翻一倍对 对然后您刚刚提到这个RSI它可以处理长程任务
[9:24]
我们理解这个长程是不是可以理解成它是一个需要很多个步骤很多个环节来互相印证的一系列任务假设我给一篇音频的文字稿给到模型去校正这个事实性的错误这只算一步但是比如说它能从开始的规划一直到最终这个播客做出来这中间可能有十几个步骤它能把每一个步骤都做好长程任务是指这个意思吗对 是的我说的长程任务是这个意思当然不同的人对长程的定义也有点不一样但是大体方向大家都同意这一点就是模型可以自己在人类不监督的情况下可以工作很长像您刚刚说的对于播客文件处理就比如说这个模型可以先剪切一下这个音频然后自己听一遍发现哪里剪的不对然后重新剪这样可以循环几次然后就可以进行到下一个点这种任务可能平时对于一个人类来说可能要花20个小时或者30个小时可以做完在这个时候如果我们的模型可以在人类不监督的情况下把这个任务完成的话
[10:27]
那我觉得它就完成了这个长程的任务你觉得它是怎么做到的呢这里就有非常多的技术细节首先就是在模型的架构上可能就要进行一些创新比如说传统的self-attention其实是一个on-square就是我们在算法里说的是一个polynomial time的算法所以当我们的tokens比较多的时候特别是在100万个上下文的时候其实模型首先就是在推理的时候就会花非常多的resource这个我们有很多现成的解法就比如说GDNGDN v2DeepSeek v4pro它也有自己的一套架构第二就是训练数据我们要100万上下文inference support其实不是特别的难就是我们只要把模型训练好了放到SGLang或者vLLM里面给它参数都设置好它可以支持100万上下文甚至更多的上下文但是如果你的模型
[11:22]
没有在这种非常长的数据下进行训练的话那它可能就是我们所谓的out of distribution因为100万上下文是非常非常长的一个概念就大概哈利波特好几部书放在一起而我们的代码即使是最大的report也很难会saturate来满足这100万的上下文所以在预训练和后训练的数据处理上也是非常大的一个挑战第三点就是infra也是一个难度不仅是说在testing time的infra而且是在训练时候的infra因为你要如果让这个语言模型就直接输出100万个token的话我们需要就比如说在GPU上做些什么样的优化在kernel上改一些什么样的代码这些也是非常困难的事情所以这个就是为何训练这种长程任务相对于普通任务会是指数级的难度增长了解了解Simon有补充的吗还有就是真想解决长程问题的话
[12:18]
可能从agent的架构上也可以有很多可以做的因为即使我们有100万的上下文可以处理但是真正长程的任务可能都还是不止100万那这个时候我们还是需要比如说在有限的上下文里处理甚至无限的上下文那怎么做呢还是需要一些比如说agent的技术记忆的技术等等去处理这种超长程任务所涉及的超长上下文这样的问题我们听起来很简单但是这个中间可能涉及到了很多具体细分的技术体系之前我记得贝斌你有讲过训练一个模型其实本质就是data数据infra基础架构和算法这三件事儿其实这三件事儿都高度的依赖写代码所以我们今天看到像Claude它能表现出这么强的基础模型的研发能力主要是因为它coding能力的提升自进化的能力它也是跟coding的能力是紧密相关的我可以这样理解吗对我基本上同意这个看法对所以coding它会变成所有模型的一个标配的底座
[13:22]
我觉得它会变成大部分模型的标配底座但并不是所有模型的就比如说聊天型的模型可能不太需要写代码的能力当然了聊天型的小模型可能也是通过一个大模型进行蒸馏的所以它后面这个大模型需要非常大的比如说reasoning推理能力需要自我进化所以能自我进化来蒸馏到小模型里面所以它背后的这些大模型肯定还是需要高度优化写代码的能力的我可不可以理解成单纯的聊天还好因为现在我们其实都在讲怎么让agent完成一系列的事情如果一旦涉及到了多步骤然后让agent去完成不同的复杂的任务的时候coding能力就会变得特别的关键了是的没错因为coding其实写代码不仅是写代码本身而且可以通过写代码训练自己另外的话它在coding里面要进行的归纳演绎这些逻辑推理的基本的思想和算法其实也可以帮助模型在其他的一些方向上
[14:24]
进行优化和generalize就是可以泛化到其他不同的领域里我发现在学术界其实自我进化它还有一个很根本的障碍就我看大家起了一个学术的名词叫做递归漂移它的意思就是说模型在自己去生成它的训练数据的时候那它推理的错误会在一次的错误中一代一代去累积就比如说有的时候我们看它给我们的一个答案这个答案的结果可能是对的但是它的推理过程可能是错的在这种让它自我进化的过程中它就会把这个错误一代一代累积最后可能进化的结果就越来越歪这是两位在真正的训练模型中遇到的一个比较根本性的难题吗我非常同意这个看法这个现象其实也是我们大家一直有注意到的Apodex有一个不一样的地方就是我们比较注重verification就是自我验证就是模型自己在训练自己的时候如果它的验证有任何的漂移或者是bias的话会对结果造成不好的影响
[15:31]
因为它可以累积起来所以我们在做比如说写代码和做数学计算的这些任务的时候我们比较容易验证可以通过rule-based就可以通过跑一套测试代码来确定它有没有对所以在代码领域相对来说更好解决这个recursive drift的问题当然了如果对代码领域有了解的一些专家可能还会发现即使是有test script即使有这个test code它其实偶尔还是会发生漂移就比如说test case不管是人还是AI在写测试代码的时候可能偶尔会太宽偶尔会太窄太宽的时候可能会让错误的解题代码通过但如果太紧的话有时候会惩罚写的对了代码所以这种情况下也是还会发生细微的递归漂移但是它会简单很多对我其实很好奇就是你们怎么去做验证因为我知道Apodex验证其实是你们主打的一个核心功能因为我去试用了一下你们的产品
[16:32]
之后我是有收到一封邮件这个邮件的标题非常有意思它叫做很多AI系统生成答案而Apodex验证它们后来我才知道原来你们公司的名字Apodex它是源自于一个希腊语它的意思就是证明跟论证所以相当于你们从成立的开始就把验证较真写到了名字里面对 验证这一步我们有很多套方法因为不同的领域确实需要不同的验证方法比如说代码一般来说你可以用单元测试进行验证当然你怎么写有时候会过宽又过窄这是另一个很难的问题了数学可以通过证明然后证明现在有LIN这样的formal验证的方法去验证但不得不说还是有很多的问题其实是更多依赖于人的一种判断甚至都并不是一种百分之百正确或不正确这种时候我们其实是依赖于一个agent系统去做我们现在Apodex 1.0的验证我们管这个叫agent team大概就是说把一个问题最开始会分解
[17:40]
然后我们会有不同的子agent有的是去解决这个问题然后我们会有另一个子agent单独的去验证另一个子agent写出来的解法之所以要分成两个子agent还是因为上下文的问题不要让一个agent干所有事情分成两个agent它其实效果会好很多这是一个细节吧对而且一定要拆成两个agent同时两个agent给他的指示也不太一样除此之外呢还有一些比较重要的技巧吧我们最好是有一些冗余同一个问题你让不止一个agent去做然后我们会得到不止一份答案其实这个冗余的思想在计算机里面有很长的历史了但我们得到不止一个答案之后呢我们会让一个全局agent去判断一下哪个agent返回的答案更准确一些这样会比只用一个agent去解一个方面的任务会效果好很多就是从agent的方面我们有这些设计去做一些验证
[18:37]
在训练的时候我们也会专门针对验证去训练一些了比如说我们会让agent去判断一下不同信息源搜集的信息哪些是更靠谱一些哪些不靠谱一些比如说一个论坛上的可能就不如教材上得到关于同样的问题靠谱了那贝斌有补充吗另外的话我们在进行强化学习的时候我们的裁判也会在训练的过程中一起学习这样的话可以避免模型学会一些不好的行为可以避免他进行一些奖励黑客因为现在我们说市场上的很多公司他们可能都在做RSI然后也都在做验证那大家觉得在这么多的模型公司里面该怎么去判断一个公司这块的能力是不是真的强它是一个技术问题还是一个比如说我把更多的精力跟时间投入到这儿它是一个意愿的问题呢我觉得两个问题都是首先技术问题肯定是需要有的因为在自我递归和自我进化的时候如果它底层的代码infra或者是训练代码有问题技术不达标的话
[19:47]
这个是肯定做不成的另外意愿也是很重要有一些公司可能还没有意识到自我进化的一些需要强化的点在哪里对真是要判断一个公司的技术能力可能还是需要去了解一些细节自我进化这方面其实有很多种比如说我就在Harness这个小手架上进行进化然后有的是在预训练的各种配方上进行进化有的是在后训练包括搜集数据以及后训练的一些配方进行进化如果真的想判断一个公司技术水平我觉得还是要深聊一下看看他们到底是在哪方面据我们了解说实话在脚手架上进行进化是不成合比较低的一个原因确实它的成本比较低因为你基本只用调API你就可以自我进化这些Harness这些脚手架了所以这方面即使开源社区包括学术界也有很多的结果据我了解学术界包括科学社区做的也都不错当然公司里可能会有这么多资源但其实这些技巧上可能细节上其实不用那么多资源
[20:55]
你可以做得很好但如果真的要涉及比如后训练这样自我进化比较难的一些方向确实你需要很多的资源跟这些公司聊的时候可以知道他们比如说是通过什么样的方式去进行后训练一些进化然后预训练这方面现在可能大家看到的都是一些auto research比如说什么自动去训练nano GPT这些确实都是一些比较玩具型的一些任务因为他们的模型都比较小然后你可能调一个更好的优化器更好的超三数等等这些也是最近的私人化的一些paper但真正把这个能不能scale到产品级或真实大模型其实是需要特别了解的如果他们光说我是在一个公开的一些auto research一个benchmark上我怎么怎么样其实这个并不是代表什么嗯嗯讲的特别好你们现在是怎么做的或者说你们一个理想式的目标未来会怎么做然后现阶段是有哪些路径
[21:53]
可以去达成对我们其实在自我进化的时候把它分成了不同的阶段我们有预训练和后训练阶段预训练阶段的话就是在数据的采集清理上面会进行不同的自我进化的一些方法在后训练里面自我进化可能更加有效一点因为我们在一个模型出来了经过了后训练之后我们才知道它会有一些什么样的问题所以我们的后训练自我进化就包括诊断自己有什么症状哪里不达标然后基于自己的诊断来照不同的训练的配方第三步拿到自己训练的数据和配方来自己训练自己在其中需要verify就是验证自己每一步做的是否正确最后回到第一步再诊断自己有什么缺陷另外在脚手架harnet上面我们也有一些自进化同时在脚手架和后训练因为它其实挺难解藕的所以模型在后训练上进化之后我们的脚手架也会进行一个新的进化你可以把它想象成两只不同的脚左脚会踩一下然后右脚会踩一下
[23:02]
让这个模型往前跑我理解刚刚根据贝斌你说的就是你们所有的三种方式预训练后训练包括整个harnet的环境全部会用到对的因为我们公司其实就是把自我进化当作是主要的方法论所以我们在每一个方面基本上都会用到自我进化的思想难怪你们可以把验证就写到你们的整个的slogan里面对的这个我稍微补充一下吧一个是验证能力是非常重要的然后验证能力里其实一个是像代码这些你可以去formally去这种验证还有很多的时候是模型本身的我们管它叫原能力或者meta能力包括判断这个答案对不对分析现在模型的问题根据模型的一些output所以这些是一些这种原的能力这个是需要特别的去训练的还有一点我想强调一下是搜索能力尤其对于后训练是非常重要的因为后训练绝大部分的方法吧就是说你发现你的模型有什么缺点假设你的模型已经可以判断出来
[24:11]
当前这个模型有什么缺点那么你需要去针对性的造一些任务以及对应的答案吧去提高模型这个能力那这个造任务其实非常依赖于搜索能力基本上你造任务还是需要去网上搜索对应的一些不管是预料啊还是代码啊或者相关的资料然后造出对应的题目所以search搜索本身是一个非常重要的能力这个也是我们为什么最开始先去做deep research因为deep research是一个非常general的能力吧其中搜索可能是一个非常本质的能力因为它就代表了当你模型需要提高哪个能力的时候它可以指引你或找到对应的这些数据去提高对应的能力嗯对对对然后你刚刚提到了deep research现在应该是你们现在Apodex放出来的这个版本中目前最强的一块对不对但这应该只是第一步是的就像我最开始说的吧自进化你最开始有一个
[25:03]
先做deep research然后相当于你可以收集目前已有的信息以及当前模型的能力你可以制定一个计划然后你去写code去提高自己的模型然后你得到一些反馈再做deep research就可以这样recursively的提高所以deep research是一个比较重要的一款对然后我了解到Apodex你们的这个模型是在通义千问的基础上做后训练做出来的Simon你要不要跟大家讲一下deep research它的训练范式它有发生一些什么样的变化比如说通过预训练做出来的deep research跟通过后训练做出来的deep research它有什么不一样为什么你现在会先选择后者因为我们公司也是刚建立嘛所以我们先开始从一个开源的模型就是千问3.5上进行后训练得到目前的一个模型后训练上我们会有一些原子能力
[25:57]
特别的提高比如说模型最开始做计划这个我们会生成特别多的对应的数据去专门提高模型这样的能力然后另一个能力就是搜索能力搜索能力也是我们造了很多对应的题目针对性的去提高模型的这些能力还有就是说跟agent team结合我们去造了一些题目这是就像贝斌说的左胶才右脚这样一种感觉我们需要agent team和数据一起开发然后达到最后的效果这是我们主要后训练做的事情吧当然有了预训练之后我们这个模型会越来越强然后预训练我们也是正在开发之中之后也会从预训练的角度去做deep research包括去训练模型是的我们公司最后会有一个完整的链路就是从预训练开始到最后成品到产品都会有的OK我注意到你们现在是在好几个deep research的榜单上都拿了第一名对吧是的要不要讲一下对这些包括Browse Comp
[27:01]
这是OpenAI的一个benchmark然后还有deep searchQAFrontier Science这些都是这些Frontier Lab出的benchmark吧Browse Comp其实它更关注的就是搜索能力它就搜索特别刁钻的一些问题比如说我要搜索一本书它是几几年之前出的它的首字母是什么ZY啊大概这样的一些问题这方面我们是Sota对Sota就是最高水准的意思就是比包括闭源模型都要好一些Frontier Science呢更多的是给你一个实际中的科研问题你能不能制定一个计划然后一步一步的该怎么做大概是这样一类的问题这个它会用一个LM as a judge去判断一下你这个合理不合理当然它在原来的benchmark里有很多具体的判别标准去看你生成的合理不合理这两方面我们都是说深入研究
[27:55]
而且造出了对应的题目吧去提高我们模型的能力然后还有一方面就是我们之前讨论过的agent team整个的范式包括verification这个验证啊还有最后有一些冗余然后如果通过更多的冗余去判断达到一个更全局的结果去做生成一个答案这整个的系统是让我们拿到了搜它的水平然后我看见像这种一般是能上网的模型啊它有的时候它那个答案不是AI推理出来的可能是因为它是搜索到了然后它就会有一些失真所以我注意到你们自己在做评测的时候还是专门把这种能搜到答案的网站给屏蔽了是吧自己去做的是的这还是一个现在尤其搜索类问题的一个general的问题因为这个benchmark只要它公开了那么它的答案就是大家也知道你可能直接在github上新生成一个页面上面把答案放上面那我新的一个模型直接就可以搜到这个答案
[28:57]
那我就算做对了但这样并不是真正这个benchmark的目的这个benchmark目的还是比如说去考验你一个叫深度搜索的这样的一个能力所以我们一般还是会看一下我们自己生成的答案是不是进行这些作弊的行为如果有这种作弊行为我们会把比如说github屏蔽掉但有些榜单其实已经污染的比较厉害了干脆后来也就不报了嗯嗯对然后我注意到你们在这个deep research的后训练环节就是其实你们相当于是用一个整个的agent的团队去替代单个agent的验证的然后呢你一个比如说复杂的人物你能调动上百个子的agent你会认为是一个聪明的AI反而干不过一个会相互check的团队吗嗯对我非常相信这一点吧因为这是目前我认为是基于self attention结构的一个本质问题而且我认为即使你用linear attention这样一些新的结构
[29:52]
应该也解决不了超长上下文这样的问题上下文越长attention的注意力它这个效果就越差所以你当个模型只要在目前的技术范式下它还是有上限的当然这个跟人类也很像嘛就是说人的脑子它还是有限的所以你才需要纸笔啊把一些信息记录下来然后之后你再调用它嘛至少在近期我其实不太相信用一个agent能解决特别特别特别长的上下文的问题所以这种时候你就需要多个agent以及记忆力机制以后多个agent去解决不同的问题包括记忆机制把这些信息保存起来互相分享整个的一个系统去解决一些超长程的问题嗯所以你觉得现在啊我们说到deep research它的能力的话它的工程能力跟模型能力谁更重要呢我认为这两个属于一加一大于二的一个结果吧你当然可以一直去强化模型能力而且模型能力我认为现在还是可以继续提高的但是当模型能力达到一定程度的时候
[30:55]
你稍微做一些agent上面的优化你可能就一下子大幅提高这个能力当然你agent这个工程它总是有限的或者说agent的harness交流加上的提高总是有限的然后这个时候你还是需要一些模型能力的本质提高进一步提高deep research或generally整个这个系统的能力吧所以我觉得这两个基本上是一个一加一大于二的一个感觉对我虽然知道你们主要是在做模型的但是想替创业者问一个问题我们说之前大家在创业的时候最担心的一个问题就是说你的模型的基础能力一升级基本上所有这些干agent的干垂直方向领域的它的能力很快就会被这个模型的基础能力给覆盖掉那如果按照我们刚刚讲的一个聪明的AI由于attention的transformer的整个架构上的一些限制它反而干不过一个相互check的能力
[31:46]
是不是说现在一个能把工程能力做到极致把很多个子agent它用的非常好的团队它也具备自己一个非常深的护城盒不太容易被模型之力的提升给覆盖掉我基本上是同意这一点的agent的系统本身我们也是经过大量实验才验证出来我们这个目前的系统是比较合理而且是效果很好的如果一个创业团队真的是证明了自己在用整个agent的系统达到了一个非常好的效果那肯定他们之前也是做了大量的实验去验证这个确实是非常work的但是怎么说这个领域相对也比较卷吧能做这种实验的团队可能也不少因为这个并不说训练一个模型确实还是需要很多资源但是去调或者做agent相关的实验还是相对来需要的资源少一些你基本上只要调API就可以了当然有些垂直领域其实你可以越做越深了包括金融法律确实还有些具体领域的知识经验其实还是挺有意义的
[32:51]
对 贝斌有补充的吗往后退一步想的话如果一个模型或者说一个single agent单智能体能做得很好那如果我们把它harness设计得更好的话来多个智能体一起合作那可以把这个问题做得更深更好所以我觉得在垂直领域做这种agent teams或者是做脚手架的公司未来肯定还是有发展的而且是有非常多的机会的就是有一点要注意因为现在模型的发布非常的快可能每个月都会有一两个比较强大的模型出来所以有了新的模型可能这个脚手架的设计也要微调一下因为新的模型会有新的一些能力有自己的一些品位模型自己的一些行为都会不太一样所以这个脚手架调一调可能会做得比以前还要好这个也是我们在之前做自我进化的时候发现的为什么在后训练以及在做这个脚手架的时候很难解偶如果你的模型能力或者是说训练数据稍微变一下的话那它对新的脚手架的适应能力可能也会有一些微微的改变
[33:55]
你可能可以设计出更好的一加一大于二的效果或者是说模型变强了你的脚手架变得也很强然后放在一起可以打出一个爆炸性的效果听起来现在还是一个行业很卷很辛苦要时刻跟着模型迭代去更新自己架构的这样的一个行业对的我同意AI行业一周可能相当于传统行业一个月甚至一个季度那接下来就可能是聊到我最兴奋的一个板块了就是Apodex它是要做Discovery Model的Simon你要不要跟大家先介绍一下整个Apodex它是一个什么样的模型它其实是大家很关注的陈天桥先生创建的它是说自己要去做一个让AI做发现做科学这样的一个模型对我们的长期愿景是Heavy Duty Solver然后我们强调的是解决很难的问题而不是比如说一个聊天机器人这样的大模型初期的一些应用然后我们的手段是通过自我进化这是我们一直在强调的
[34:58]
我们相信大模型最终是能解决人类之前解决不了的这些问题从经济的角度来说现在大部分的模型厂商都是在卖Token但我们相信真正通过大模型去解决了一些人类没有解决的问题那么解决问题本身所创造的价值应该是远大于卖Token的价值所以我们陈天桥陈总这边的目标就是说我们直接去解决最难的问题从经济上来说我们可以得到直接解决最终问题的这个价值从问题角度来说现在考虑的领域包括生物材料科学等等然后我们这边也有一个专门的团队我们叫Heavy Duty Discovery就是专门去找到最难的问题的一个团队然后我们会针对性的比如说进行模型训练等等去解决那些最难的问题比如说你刚刚提到的你们内部有一个Heavy Duty Discovery的团队他们现在具体是在找哪些问题就现在你们第一步想要切的是生物医药领域对吗
[36:01]
是的 是的第一步是生物医疗吧包括制药 把点发现呀 老药 新用也包括疾病诊断很多问题确实是非常具体领域的问题所以我们需要一个专门的团队去找到什么样的问题是合适去解决的那很期待你们的下一步然后那我觉得我们可以说一下让这个模型解决问题然后我发现其实你们也给自己的定位说你们要做的是Discovery Model而不是Generative Model中文说就是你们要做的是发现的模型而不是生成模型那贝斌你要不要跟大家解释一下这两个模型它在根本上的区别是什么对 让模型提出一个假设其实并不是特别难的但是难的就是提出了这个假设特别的out of distribution就是可能在pre-training data在网上比较难找到或者说比较难想到的一个假设这是第一第二个更大的难点是说我们要怎么样验证这个假设
[37:00]
当然这个跟怎么样做verification怎么样自我验证也是强相关的一个部分所以如果我们把Discovery切系来看的话第一需要非常的有创新性能提出新的假设第二需要能判断这个假设成不成立当然这里也有很多不同的方法可以做就比如说可以用deep research的方法收集已有的信息找更好的假设也有可以用写代码或者是self verification的这些方法来好一些实验如果我们能在计算机上好一些比如说模拟的话也可以让我们对这个提出的新假设更加的有信心所以Discovery的瓶颈第一就是未知领域其实很难有标准答案也很难照这种simulation environment得到可信的验证所以self evolution是我们通向heavy duty solver和discovery的一个主要方法
[37:52]
对我们在说到discovery model的时候刚刚你提到了我们要做很多假设然后要去求证其实这让我想到了科学领域最基础的一个方法就是搭个字嘛大胆假设小心求证我觉得这其实也是我自己开始做记者做报道的时候一直在贯彻的一个价值观就是要大胆假设提出傻的问题然后再去求证思路跟这个问题是不是对的但是同时如果我们把这个交给模型的话大家以前一直对这个模型的印象就是说一个模型它能从网上从人类现有的知识库里面找到以知识的答案就已经很不错了那现在模型的智力怎么样才能够让它做到理解贯穿人类的知识同时还能提出问题因为我觉得这个已经不是说在让AI去做一个解题者了这个更像是让AI去做一个科学家他能够提出问题发现问题这个是很难的对你刚刚提到这些其实是现在的一个难点因为怎么样训练一个generative model
[38:56]
其实市面上已经有非常多的可信性方法相关的recipe和训练配方其实也是特别成熟的但是如何让这个模型进行一些假设和discovery这个其实是大家还在调没有完全调通的一件事情回到刚刚你说的一点怎么样像科学家一样在未知中提出问题这里也可以再往下切细一点比如说在写代码这个领域比如说Swe Verify的这种类型的题目其实我们都是在训练模型怎么样做一个解题家但是会提问其实是一个我们叫做的meta能力更高维的一个能力这个其实也涉及到了我刚刚说后训练的一个loop就是要自我诊断然后再自我造体然后再自我训练你要怎么样在这个模型现在的回答里面或者是所有的收集的这些信息里面怎么样诊断出哪里的能力有问题或者是哪里的hypothesis需要往深入更看一下的话这个是我们接下来会注重的一个领域和方向
[39:58]
对在学术界大家都知道有好的paper跟灌水paper其实我们也想培养模型变成一个真正的好的科学家那么你就需要培养一个非常好的taste就是学术品味吧你提出一个新的问题肯定是需要先做deep research找到已有的知识但你提出什么样的问题其实是仁者见仁、智者见智的你可以提出一个比较我们叫incremental的问题它可能比较容易但是你可以发一个paper但你也可以提一个比较本质的fundamental的问题它可能不是那么解决但解决了它真的是能让科学有所突破所以这个也是我们之后会进一步训练模型就是说让它有更好的学术品味其实训练方法上可能还是需要跟人类最顶级的科学家去对提这些陈天桥陈总这边其实也是经常会让我们和一些顶级的科学家一起去讨论甚至他们提供一些insight或者数据等等
[40:59]
去帮助我们模型有更好的品味我觉得其实两位也是顶级的科学家顶级的科学家大家觉得他们有什么样的共性比如说我们从他们身上学到的特质怎么把它转换成一种计算的方法或者说是跟AI交互的方法这块大家有什么样的思考吗我们一般说什么样的是一个顶级科学家一般不是看它有多少篇paper一般是看它最好的paper质量有多高所以我们一定要追求顶点解答这些最本质的问题所以这个甚至要写在模型宪法里然后具体实操上训练方法上可能还是目前已有的一些吧比如说RLHF这种人类偏好SFT监督学习或者RL这里可能一个最简单的方法当然就是偏好比如说你问一个科学家两道题他一般是能判断出来哪个是一个灌水题哪个不是一个灌水题然后你应该要模型去多提一提非灌水题AI现在能判断哪个是灌水题哪个是非灌水题吗只要经过这方面的训练我觉得还是没什么问题的
[42:08]
贝斌你觉得在跟一些顶级科学家交互的过程中你有学到什么以及你觉得这些思想怎么可以用到模型的训练中去对我想来想去可能还是品味这个字其实AI马上就能进行自我进化了我对这一点非常的艰辛不疑要么是接下来半年要么是一年反正在接下来两三年内肯定自我进化就会成功了那在那个时候我们还需要顶级的AI科学家干嘛呢或者是说我们还需要人类干嘛呢然后想来想去就是品味这个字因为训练这些不同的模型的时候我发现了这个品味是真的同样读完一篇paper之后你可以想到一个非常小的改进或者你可以想到一个substantial improvement就是一个非常长的非常大的假设但是要干非常多的活要卖非常大的布子才能解决的问题这是一个非常好的例子其实我现在觉得即使是市面上最好的模型它的品味其实也是远低于一个普通的AI科学家的
[43:13]
这也是为什么现在AI写代码写得很好但是还是不能把模型的训练全部自动化进行起来所以我觉得接下来不管是作为一个人类AI顶尖的科学家还是说作为一个researcher一个engineer在训练这个模型都是需要把控模型的品味的这个其实是非常难的一件事情因为如果大家用过很多不同种类的模型大家会发现所有模型其实有一些通病吧就是他们或多或少都挺喜欢拍马屁的一个喜欢拍马屁的模型其实很难提出一个大胆的假设另外除了拍马屁这个缺点之外它其实还是有一点我们叫做hedging behavior或者是一些对冲的行为就是说这也对那也对对用户你说的非常对刚刚是我的疏忽但是我说的也没有错你说的更全面你想要问其他的问题吗就我们可以看到这些AI模型经常会用这样的方法来回答用户问题所以我们在训练不管是说verifier
[44:16]
还是self evolve还是discovery的时候都会对模型的提出假设的能力进行一个后训练就比如说这个diagnose里面但是这也是有另外一个缺点就是我们怎么样能保证我们训练的新的模型不会出现鸡蛋里挑骨头的那种行为呢这就是要品味来平衡就是模型不要拍马屁也不要鸡蛋里挑骨头能真的是实打实地提出一个非常好的假设然后再像您说的就是小心验证把它验证出来这个假设你刚提到了模型拍马屁啊就是用户说什么它什么就是对的我确实发现我在用很多模型的过程中这是我觉得最痛苦的一部分就是它不会给你一个事实性的答案它给你的永远是迎合你的那个答案这一块是不是跟在训练模型的时候把这个模型的参数往哪边调然后给它注入什么样的人格特质是有一定关系的而且每一家模型其实我觉得大家的风格细微上都会有一些不一样对 当然这个我们Apodex
[45:15]
因为不做聊天模型所以可能会稍微好一点就是因为我们不管是哪家公司在后训练的时候或多或小的会有一个RLHF的一个阶段这个RLHF它的来源数据基本上是用户投票的数据就有点类似于LMSYS Arena那种形式也有可能是模型训练公司自己让员工去标的一个preference偏好数据人不是完美的嘛所以人类作为本身就会可能有特殊的偏好比如说偏好说好话拍马屁的模型答案可能偏好写得非常强的答案可能偏好格式上非常的结构化像有非常多section非常多list的一个markdown的格式即使这个markdown它本身没有什么实际的意义就是因为这种人为的一些bias才会让这个模型有不同的拍马屁的行为Apodex因为想做heavy duty的server所以我们不会用网上大众的这些人类的偏好来训练这个模型
[46:13]
所以可以或多或少的避免些许这样的问题未来我们在训练这个模型的时候肯定是想要最顶尖的人类来标这些preference数据或者是说给不同的模型答案打分确保公正公平也可以从数据源头稍微解决这些问题我觉得这几个方向都还挺重要的然后你刚刚提到了既不要拍马屁的模型也不要鸡蛋里面挑骨头的模型可能不做拍马屁因为你们不做2C的用户端这个对你们来说是稍微简单一点的不做鸡蛋里面挑骨头这块你会有经验吗以及就是我们知道了两个步那要做什么样的模型要把什么样的人格注入到这个模型里面大家有什么样的想法吗对的刚刚我们其实是聊的品味这个我把左和右两个步打出来中间就是我们要的就是要有品味的就不管是这个模型通过research找到了一些相关的信息还是通过写代码得到了一些答案有了这些所有的原始材料之后这个模型要通过自己的思考
[47:17]
自己的推理来给出一个相对比较合理的解释Agent Team的话其实也能稍微把这个问题解决一点对拍马屁这个事情我们其实是在做的就是说用户让我们做的事情但如果我们觉得不合理那么我们应该告诉用户我们应该去拍马屁我们其实是有一整个系统去达到这样的目的的包括我们的Constitution AI就是说我们这个宪法这个概念应该是Anthropic几年前就提出来了然后这个给我们整个模型定义了一个性格这个我们都是把这种性格训练在模型的权重里了去实现它当然还有很多比如说我们注重真实性比如说如果用户说错了我们要去纠正它那这样的里面的细节就是通过验证Worthification或者Agent Team整个的形式或多或少会去验证用户说的对还是不对然后我们会去反驳它至于什么样的问题是好问题就是不在鸡蛋里挑骨头
[48:15]
这个确实是一个品位问题这个可能你甚至让我们去写一个宪法或者写一个Doc告诉你什么是好问题什么是不好问题也是很难写出来的这方面更多的还是通过和顶级科学家去聊以及顶级科学家提供的一些比如说偏好数据等等去培养这样的品位其实这个也是和平时我们在学校培养PhD是一样的比如他们来问我们是什么样的一个题目值得做什么不值得做我们也会告诉他确实我们公司有这种能接触到各行各业的顶级科学家的资源这是非常重要的一点所以这也是陈天桥陈总从一开始的一个vision就是说我们从一开始就要做Heavy Duty Solver所以我们就需要和顶级科学家进行对齐然后去培养这样的品位这点提得特别好我确实知道陈天桥先生这边跟很多主流顶级科学家都保持着非常密切的联系然后我在想因为人类的顶级科学家这个数据量的样本是非常小的
[49:17]
然后我们说大模型它大很重要嘛就有scaling law顶级科学家人工去判断的品位标注的数据跟用更大量的数据去训模型来比在里面它能贡献的核心的比例是多少呢因为它的数据样本还是很小嘛是的从数据这个角度来说呢预训练方面确实需要大量的数据所以才有scaling law后训练相对来说需求会少一些而且现在已经有更多的方法去把一个人类的品格呀或者性质总结出来比如说Meta最近也是在振留员工啊等等其实也在振留三号他们的性格或行为习惯对吧所以其实最近越来越多的还是说把一个人类的一些品格性格去总结出来还是慢慢的可以做到的这也是一个比较新的方向嘛就是说一个个体它的能力性格等等能不能用一些自然语言或者说一些方式把它转化到让大模型可以去利用起来嗯嗯对我记得在音乐模型刚刚兴起的时候就是Suno的那一部啊
[50:23]
当时呢就是我有问做这个音乐模型的科学家我说Suno做的歌太一般了我觉得它就是一个大街上的口水歌然后我说他能做出像周杰伦Taylor Swift这些非常好的有很好品味的歌曲吗他当时给我的答案是他说可以但是这个事情它不是受限于技术它是受限于版权因为版权的因素他们不敢拿顶级音乐人的歌曲去训练所以他们用的呢就都是那种版权库里面一些简单配乐的歌但是如果你真的用这些人类最精华最好的歌曲去训的话他觉得是完全可以训出来的如果我们说用顶级科学家的品位去模型是不是也是同样的道理对的对的我很同意这一点我们人类也是从比如说一个婴儿开始嘛最后有的就成为了顶级科学家尤其从一个顶级科学家这条路其实也是别人给他的这些反馈告诉他什么是好的什么是不好的而且得到的数据也并没有那么多我们还是相信通过顶级科学家给我们的这些指导
[51:29]
我们可以拥有顶级科学家的品位对然后我注意到其实想让AI去做科学家自己去做发现的模型啊几乎也是所有的现在我们说顶级模型公司都在做的比如说OpenAI他已经把能自己扛下一个大型研究课题的AI研究员定成了未来几年的头号目标DeepMind呢他创立的那天起他也是为科学而生的我们之前讲过DeepMind的创始人的历程大家有兴趣的话可以回听一下我们那期的播客啊AlphaFold他还拿了诺奖现在呢包括Gemini他也是说自己要去做多智能体的co-scientist就是共同合作开发的科学家同时呢Anthropic他的Dario他也想要有一个国家级的科学家的天才所以我听上去啊现在所有的顶级模型公司都想去做科学家都想让AI去做发现去提出好的问题你们觉得Apodex他的核心优势是什么呢我觉得不做2C类的模型应该也可以算是一个核心优势
[52:34]
因为他可以去调一个模型的权重还有其他的吗就这个战场是相当激烈的你们进入了最激烈的战场这个我很同意但这个战场的球线价值是很大的因为他真正解决的那种难的科学问题它是有很大意义的另外科学问题其实还是一个非常广的因为这个世界上有那么多学科呢其实你解决其中几个问题就已经足够说是一个很大的突破了所以我觉得不止一家公司可以成功了Apodex这边的优势呢我觉得就是我们比较专注一是就像你说的我们不是一个聊天机器人这样的模型我们基本也不取用户的一些特别的偏好其实到现在大模型的整个发展比如说训练的各种recipe或者这些配方算法什么的大家也都知道了大差不差更多比拼的就是一种执行力吧以及整个组织架构我觉得我们这边自上到下从陈总那边开始他自己也是一个非常非常卷然后整天会和我们进行交流整天会和AI进行交流
[53:37]
并且给我们不管从方向上还是一些其他方面都提供很多指导以及帮助然后我们下面呢执行力都很强因为我们还是一个非常小的start up的culture所以我们还是比较focus就做好这一件事情做一个heavy duty solver我觉得从这个组织形式上我们还是和大厂大公司相比有很大优势我们这边摩擦也比较小然后交流成本也很低这些或多或少都是很重要对于一个大模型公司能快速发展的关键嗯 贝斌有补充吗我其实做所谓的AI for science这个概念已经做了有十多年了我在读博士之前就在做AI for science当时主要是在医疗行业和自闭症用AI其实刚刚你说的现在很多公司都开始往AI for science做我其实觉得并不是一个竞争反而我觉得看到的是希望的曙光因为过去十几年来说科学技术或者说IT技术
[54:33]
for科学研究其实是没有太多真实非常scalable的成果的但是因为LMgenerative model和discoverative model的技术的提升我觉得在未来比如说五到十年真的做出非常有科研价值和现实意义的成果是有非常大的希望的这个世界上所有的科研问题是无限的或者是说有价值的科研问题也是无限的但是我们的人的精力是有限的整个世界的GPU也是有限的要怎么样在有限的resource和资源里面找到最有价值的问题去解决这个才是最重要的一步所以Apodex有一个HDD团队叫做Heavy Duty Discovery这个团队我们是有full time的员工跟不同的顶级科学家交流在从几千个科研问题里面找到最有价值的问题来做这个可能是我们Apodex和市面上一些其他不同公司的一个比较大的区别吧
[55:32]
我觉得你这点讲得特别好真的是我们说AI for Science科学问题它是无穷无尽的刚刚我们提到了生物医药我们之后还会有一期会专门聊Deep Mind他们是怎么去做自己的生物医药大模型的那Deep Mind这条线也很有意思它从最早去解决蛋白质怎么折叠到现在呢它是预测药物和蛋白怎么结合的而且我觉得它也只解决了新药研发流程上偏上游就是计算预测的这一段它离真正把药做出来送进临床中间还是有一个巨大的空间的但是光就这一段它已经是撑起30亿美元的融资了呀所以哪怕我们说都做生物医药它这个里面的问题也是无穷大的所以科学问题还是很广阔的包括我们之后还说有什么物理问题探索太空的问题材料的问题对 无穷无尽对的另外我再补充一点就是我们Apodex不是做AI for Science只不过AI for Science
[56:32]
跟Heavy Duty Solver有非常大的重叠的地方所以我们就会focus上比如说医药领域和生物领域AI for Science跟Heavy Duty Solver这两个你能不能简单解释一下你们做的方向上的区别是什么现在有很多模型它们叫垂域模型就它们真的是会用大量某一个具体领域数据去训练这个模型在这个领域里的能力但我们这边的Heavy Duty Solver我们还是一个比较通用的模型我们会强调一些特别的原能力包括验证能力包括分析能力搜索还有计划Planning这样的能力这些原能力我们相信是对真正的一些难题都是有意义的这些能力这是我们会去着重训练的但我们不太会针对某一个特别的领域比如说生物我们会放50%的data这个是我们不会去做的刚刚贝斌你提到的有一个小细节我非常感兴趣
[57:29]
就是你说AI还有半年它就能完成自我的进化跟提升了这句话我当时觉得很有意思但是你能不能详细地解释一下它是什么意思对我说的半年是说最快可能半年之内能开始把闭环跑通闭环的话我觉得难度最大的其实是Post Training我觉得在半年之内它这个闭环能跑出一环如果说RSI这个R是Recursive要跑很多很多环但我觉得它跑完一环应该是半年到一年左右就能做完就比如说我们这个模型可以在随便一个Domain就比如说Coding for Material Science可以在这里面发现自己的写的代码会有什么问题会照很多这样的训练环境和训练数据在此基础上自我验证是否这道题训练完之后是有提升一次迭代它这样迭代一个loop一次循环我觉得半年之内应该是能成功的因为Anthropic在这几个月也发过一篇Blog
[58:25]
说大概80%的代码是写的但是现在有一些问题这个问题即使是现在市面上最强的模型也没有完全解决但是从我们最近的一些observation和训练的结果来看我觉得很快就会有一些突破了它指的问题是什么这是没有解决的问题当然这个问题有很多但我觉得让我睡不着觉的一个问题就是我们怎么知道这个模型在自我进化的时候它是满足人类的需求它没有跑偏这个跑偏可以是说在安全上面的跑偏也可以是说在目标上的跑偏如果我们只是简单的说你给我造一个更好的做材料科学的一个模型或者是一套算法它可能真的造出来了但是它在你没有观测的一些点就比如说cost或者是说在一些其他的比如说输水性这种性能上可能会有非常大的一些compromise这个是我比较担心的因为人和人交流的时候一般说需求会说的比较的模糊但是特别是在训练模型的时候
[59:28]
如果你跟模型或者是说这个evolution说的比较模糊的话他可能就会用户让我迭代写代码的能力但我这边碰到了一个瓶颈但是anyway让我换一个方法来达到这个目标这个我们要对模型这个行为进行一个监控是让我觉得最大的一个问题你觉得现在某种程度上这两个问题一个是安全一个是他达到目标不择手段的这两个能力这两个问题现在解决了吗我个人看来还是没有解决但我还是一个非常乐观的人所以我觉得应该是很快就会有解决方法了然后你刚刚提到这是一个让你睡不着觉的问题从你的角度来说有哪些方向的解决方案会让你现在觉得稍微安心一点我们当然能想到的一个是从举尽可能多的可能性但是这个看起来是不是有点笨对这里也是为什么我们还没有完成全自动化我其实现在做的最多的一件事情就是在每天工作时间读这个模型的输出和读智能体的每一步的操作
[1:00:29]
确表它每一步的操作或者是说整一个大概吧都在我可以理解可以控制的范围之内一旦我发现比如说它这里有一些比较蠢的一些行为或者是说我感觉有一点不太对的一些解决方法我就会赶快停下这个智能体的loop稍微手动的改一改调一调然后让它进行进一步的一个提升这个的话就是刚刚我们说到的一个蠢方法但是我现在是首条未来的话能不能有一个智能体就代替我帮我做这个首条对吧就是现在大家提的很火也是很搞笑的一个概念就是员工蒸馏能不能把我每天做的事情蒸馏到这个智能体里面或者是甚至蒸馏到这个模型的capability里面我觉得这个idea虽然说大家是说笑话但我觉得是可行的如果我们在三个月之内能把我或者是说我的同事蒸馏到Apodex的模型里面或者是我们的交手架里面那其实有很多我们现在每天在做的事情不管是读代码改代码
[1:01:29]
还是读模型的输出读智能体的输出都是能加速自我进化自我迭代的流程的我们假设真的把贝斌蒸馏了你会担心自己失业吗说不担心肯定是假的但是即使我担心我其实还是乐观的吧当然了不同的人有不同的例子什么有汽车代替马车的例子对吧有什么AT&T自动转接机的例子但其实我觉得这一次可能跟之前的工业革命有点不太一样我确实有点担心自己会被代替我记得非常非常清楚是2021年我就开始有这个担心了当时是GPT3年代连GPT3.5都没有GPT3被微软放到了GitHub Copilot里面当时我打了一个function的名字然后它能把整一个function给我补全当时我还在读博士的最后一年我又觉得我整个人就摊在椅子上了我觉得完蛋了我毕业级事业我整一个phd整一个博士学的东西它都能一行帮我补全我以后是不是就没工作了
[1:02:31]
但是你看现在五年之后我还在这里我还有工作只不过我day to day每天做的工作不一样了我不在一个function一个function的携带码而是我会在更高的一个维度更高的一个层面监控不同的智能体携带码所以对这个模型会取代我今天做的事情但它不一定能取代我五年之后会做的事情对你刚刚提到了你每天在给模型去评判它的质量行不行然后去再做验证的这些工作如果未来有了一个假设贝斌的AI agent它可以带你去做监督教验验证的这个环节以后那其实相当于AI就开始自己变成了一个考官它所有的行为都是在模仿你的这个行为你的品位你的价值观去做类似的判断那是不是说当有了这样的一个AI以后整个这一套就是让AI去验证的RSI它的这个闭环就跑通了这就是你说的还有半年的时间可以做到RSI的SI就跑通了R可能还要再多花个一年两年
[1:03:36]
R是什么R是recursive就是把它这个迭代起来因为现在即使我们跑通了我们每一次迭代之后或者说每几次迭代之后我们其实还是要人为的去看有没有之前我们聊过的Rrecursive drift飘移的问题所以半年一年我们可以解决这个loop但是没有办法完全的解决飘移但是我还是有信心几年之内这个飘移的问题也可以把它完全解决现在我们把这个飘移问题可以不停的缩小假设现在普通的模型每一次可以飘移10%如果我们能把这个飘移降到1%那就会很好了但是我们未来的目标是把它降到0.1%甚至0.01这样我们可以非常有信心这个模型自我迭代比如说三个月六个月之后再回来看它有没有超过就相当于我们monitor我们监控的周期不需要这么频繁了了解了解对那这个应该是整个业界基本上是一个共识大家都在往这个方向走然后你觉得在整个走的过程中
[1:04:35]
就其实我们刚刚提到了现在AI自我进化最后的一道坎一个是提出问题的品位一个是判断结果可不可信其实这两个方向你们都在压着一个是discovery一个是verification那你觉得这个品位它是谁的品位它是科学研究员的品位还是说它是创始人的品位就是这之间它是怎么互相体现的OK 这是一个很好的问题我觉得现在来说大部分是AI研究员的品位但是研究员的品位是被我们叫做indirectly被创始人的品位影响的因为陈天桥陈总他在选择研究员的时候肯定会根据自己的品位选择研究员但是这一些我其实都不担心因为品位没有对或者是错的区别也没有好或者坏的区别就只有适合和不适合的区别这是第一第二是不管怎么样这个模型虽然说现在是用我们的数据或者是说我个人来监控这个模型的行为但是未来我相信我们把这个线放长一点
[1:05:37]
放到五年之后可能我们的品位对这个AI模型的影响会越来越小就像alphaGo在最初训练的时候是受到训练数据或者是说奇谱的影响很大但到alphaZero出来之后它已经不是从人类的品位中学习这个技术了而是会自我品位自我回放自我reason来学习它有自己独特的一套品位所以AI会在它整个过程中再通过RSI这个R形成自己的品位对没错我觉得我们的品位只是一个我们如果放在训练这个语言里面叫做warm start就只是给它热启动了一下以后AI会有自己的品位对对对然后你刚刚提到了陈天桥先生对Apodex的品位具体他在工作上主要是关注在哪些方向他怎么样去保证大家研究的焦点始终是在一些重要的问题上对这也是一个很好的问题陈总在战略方面有非常多的把控也经常跟我们开会聊和研究以及对齐我们所有的战略方向
[1:06:41]
因为我们都有不同的背景就比如说我之前做过很多年的AI for Science然后Simon之前做过很多年的强化学习我们总会把之前在学校或者是说学术界的一些习惯带到Apodex这个时候陈总就可能会发现我们的一些压注可能和公司的大战略方向不是特别的对齐这个时候陈总一般都会跳进来跟我们开个会指出我们的一些错误或者是哪里偏离了公司的使命然后会把我们掰回到正确的道路上能举一个具体的小例子吗比如说我们heavy duty solver本身就是说它应该有很强的推理能力所以当你碰到一个问题的时候你应该先去把这个问题分解再去进行搜索搜集相关的信息再去总结这些信息然后去给出答案这是比较合理的一个heavy duty solver或者一个比较强的注重推理能力模型的行为但是我们之前很多的时候为了注重它的搜索能力
[1:07:41]
所以我们放入了很多搜索的相关的数据然后模型的行为会上来去进行搜索而不是上来先去仔细思考这样的问题把它分解成一些子问题然后再进行搜索所以这从行为上陈天桥称动自己去用这个模型才能看出来这个模型的行为并不是真正的heavy duty solver这样的一个行为所以从这个时候我们就要去改变这个方向首先我们要去改行为不管从数据还是从agent等等形式上吧这里也涉及到我之前说过的我们模型的宪法基本上也是陈总自己制定的这个我们也是用到了比如说模型的训练呀各种调优里面都会用到陈总参与撰写的这个constitution对OK了解之前我知道两位马斯克也是大家的老板然后你们觉得马斯克的风格跟陈天桥先生的风格有什么不一样吗我觉得他们性格来说是比较类似的但是陈总他的眼光或者是说对看待问题的方法跟马斯克很不一样
[1:08:41]
就比如说陈总非常注重AI for science或者是说heavy duty solver这个马斯克其实之前跟我们说过非常类似的话当然他的原话不是这个heavy duty他会用一些其他的terminology说但是说的话和做的事其实不太一样的就比如说大家可以看到马斯克特别喜欢在X和推特上发文他经常用AI做一些小的比如说画一些图或者是回答一些问题马斯克对这些非常的上行他甚至之前可能会每一周都会问一下Grok for X发展的进步是怎么样了所以他其实是非常注重Chat的这个feature的但是陈总就是他说的和做的其实是非常一样他口上说非常看重heavy duty solver那他的focus就是heavy duty solver他对做聊天模型视频生成图片生成一点兴趣都没有所以这个我觉得
[1:09:34]
是非常align的地方非常专注对的陈总这边基本上从头至尾一直就是强调做heavy duty solver也跟我们说像图片视频生成和这个目标基本上是正交的所以我们根本就不做这些方向谢谢大家我觉得这期非常精彩了那在聊完这期节目的时候我始终在想品味的问题Simon的那句顶级科学家不是看发了多少paper而是看最好的那篇paper的质量有多高他其实点出了一个更大的问题就是说如果现在AI的品味它是从人类顶级科学家那里的热启动的那么这个品味它本质上可以说还是被少数人去塑造的那么未来这些面向更加普罗大众的比如说这些2C的AI它们到底应该代表谁的价值观呢关于AI的哲学思考也是我们这个时代急需的讨论大家有什么样的评论欢迎给我们留言播客的听众可以通过小宇宙苹果播客喜马拉雅蜻蜓FMSpotify来收听我们
[1:10:43]
视频的听众可以通过哔哩哔哩和YouTube搜索硅谷101播客来找到我们我是泓君感谢大家的收听感谢大家的收听