与 Kimi 创始人杨植麟对话:向着绵延而未知的雪山前进
Moonshot AI 创始人杨植麟谈 AGI、Scaling Law、Kimi、商业化、Sora,以及为什么通用人工智能需要一种新的组织形式……

编辑注:本文是对 Zhang Xiaojun 于 2024 年 3 月 1 日发布的 Yang Zhilin 采访的英文译文;该译文由 Kimi K3 生成,并由作者于 2026 年 7 月重新发布在 X 上。正文内容保持英文原文不变。

这是我对 Yang Zhilin 的第一次采访,拍摄于 2024 年初,并于 2024 年 3 月 1 日发表——恰逢 Kimi 成立一周年。那时,Kimi 只有 80 人,办公地点是他们的第一间办公室,条件相当简陋。入口处没有任何标志,门边只立着一架白色钢琴。
这篇文章当时在中国科技圈引起了相当大的轰动。
那时我还是纸媒记者,所以这次采访只以文字和音频播客的形式存在。
正如我们现在可以看到的,这篇文章中的许多观点后来都得到了印证。
只要重读两年前写下的这些内容,你真的会不由得惊叹于世界在这段时间里发生了多么剧烈的变化!
(本译文由 Kimi K3 生成。)
Yang Zhilin:“如果每个人都觉得你很普通——如果你的梦想是任何人都可能拥有的那种梦想——那么它并不会为人类的梦想总量增加任何东西。”
By Zhang Xiaojun
就在一年前,AI 科学家 Yang Zhilin 在 Silicon Valley 做过一次精确计算。他意识到,如果决定启动一家面向 AGI 的 foundation-model 创业公司,那么在接下来的几个月里,他需要筹集超过 1 亿美元。
但那还只是入场券。一年后,这个数字已经增长了十三倍。
对于 foundation-model 公司来说,竞争与其说是一场科学竞赛,不如说首先、也是最重要的,是一场残酷的金钱战争。当投资人捂紧钱包时,你就必须在融资、购买更多 GPU 以及争夺更多人才上跑在对手前面。
“这需要人才的集中和资本的集中,” Moonshot AI 的创始人兼 CEO Yang Zhilin 说道。Moonshot AI 是一家成立于 2023 年 3 月 1 日的 foundation-model 公司。
在过去一年里,中国的 foundation-model 公司似乎一直在生存的紧绷与挤压中前行。表面上看,每家公司手里都握有相当可观的现金。但一方面,他们必须立刻把新融资投向极其昂贵的研究,以追赶 OpenAI——先是追 GPT-3.5,甚至还没来得及触及 GPT-4,Sora 就已经出现。另一方面,他们又必须不停地奔跑,去寻找可行的真实应用场景,以证明自己是一家公司,而不是只会烧钱的研究院。即便如此也还不够:对于每一个这样的项目,无论退出路径是 IPO 还是 M&A,出路都依然完全不明朗。
在中国这些 foundation-model 创业公司的创始人中,Yang Zhilin 是最年轻的一位,出生于 1992 年。业内把他描述为一位坚定的 AGI 信仰者,以及一位极具技术魅力的创始人。他的大部分学术和职业经历都与通用 AI 相关,而他的论文已被引用超过 22,000 次。
2023 年年中,中国科技圈对 foundation models 的态度突然从亢奋转向冷淡,而加速落地应用则成为务实主流旋律。这不可避免地把 foundation-model CEO 们撕扯在理想与现实之间。
在中国 AI 生态里,人人都在高喊 PMF(product/market fit),人人都在高喊商业化,而这位创始人——一位训练有素的 AI 研究者——却并不急躁。
Moonshot AI 只有 80 人,是中国头部 foundation-model 公司中规模最小的团队。不同于竞争对手,Yang 没有选择更稳妥的 B2B 模式,也没有试图切入医疗或游戏等垂直领域。他只打造了一个——而且只有一个——消费级产品:AI 助手 Kimi,支持最多输入 200,000 个中文字符。Kimi 也是 Yang Zhilin 的英文名。
Yang 喜欢把自己的公司看作一个结合了科学、工程和商业的系统。你可以这样理解:在人的世界之上,他正在搭建一座 AI 实验台——一只手做实验,另一只手把前沿技术带入现实世界,通过与人的互动来探索应用,并把这些应用交到消费者手中。理想情况下,前者会烧掉数十亿到数百亿美元的资本;后者则会把这笔钱成百上千倍地赚回来。无论怎么听,这都像是在钢丝上行走,既令人兴奋,又极其危险。
“AI 不是在未来一两年里我要找到什么 PMF;而是在未来十到二十年里,我要如何改变世界,” 他说。
这种抽象而理想化的思路,让人不免替他捏一把汗:一位年轻的 AI 科学家,真的能在务实的中国开辟出一片生存空间吗?
2024 年 2 月,Moonshot AI 逆势完成了一轮大额融资。据悉,公司完成了超过 10 亿美元的 B 轮融资,投前估值超过 15 亿美元,由 Alibaba 领投,Monolith Management、Xiaohongshu 等跟投。交易完成后,Moonshot AI 的投后估值约为 25 亿美元——这使得该公司在当时成为中国 foundation-model 竞赛中估值最高的独角兽。(公司拒绝对该问题作出回应或评论。)
在这第三轮融资中,我们与 Yang Zhilin 坐下来,聊了聊他创业第一年的经历——这只是中国 foundation-model 公司从起跑线飞驰而出的一年之中的一个缩影。
他的公司并没有把办公室设在北京的 Sohu Network Plaza,那是 foundation-model 公司聚集的地方。对于一家累计融资约 9 亿 RMB 的公司来说,这间位于 Liangzi Xinzuo 大楼里的办公室显得简陋而破旧。甚至在入口处也没有公司 logo——只有一架白色钢琴静静地立在门边。
会议室在一个角落里;窗户很小,里面相当昏暗,取暖器嗡嗡作响,向外吹出热风,对抗着冬日的寒冷。
在昏暗的光线里,Yang 描述了过去一年他是什么感受:“这有点像是在开车,前方是一整片绵延的雪山。你不知道里面有什么。你只能就这样继续往前走,一步一步地走。”
以下是对 Yang Zhilin 的完整采访。(为便于阅读,作者对原文做了少量编辑。)
这张照片拍摄于 2024 年初,地点是 Kimi 在北京的第一间办公室。他们现在已经搬离了这个地方。入口沿线没有任何 logo——只有一架白色钢琴安静地立在门边。
第1部分
站在起点
“你必须乘上浪潮”
Zhang Xiaojun:
最近怎么样?
Yang Zhilin:
忙——事情很多。但我仍然非常兴奋。我们正站在一个行业的起点上,还有无数空间可以去想象。
Zhang Xiaojun:
我刚才进来的时候,看到你们公司入口处放着一架崭新的白色钢琴。
Yang Zhilin:
上面还有一张 Pink Floyd 的专辑。我也不知道是谁把它们放在那里的——前几天我才意外看到,还没来得及问。(Pink Floyd 是发行了专辑
The Dark Side of the Moon
的英国摇滚乐队。)
Zhang Xiaojun:
在 2022 年 11 月 ChatGPT 发布那天,你在做什么?
Yang Zhilin:
我之前就已经在为这件事做准备了——招人、组建团队、交流新的想法。看到 ChatGPT 的时候,我非常兴奋。三到五年前——甚至在 2021 年——那几乎是不可想象的。那种高阶推理在此前是很难实现的。
我感觉市场上的很多变量都要变了:一边是资本,另一边是人才——AI 的核心生产要素。
如果这些变量都到位,那么就能建立一家体面的公司来做这件事——一个为 AGI 而生、可以从 0 到 1 的组织。
这是一个很大的顿悟。独立做一家公司的想法听起来更合理,但那不是你想做就能立刻做的事;ChatGPT 让这些变量发生了震动,并把生产要素拉近了。你必须乘上浪潮。
Zhang Xiaojun:
在你决定成立一家 AGI 公司之后,你做了哪些准备?你是如何把资本和人才这两个生产要素聚拢起来的?
Yang Zhilin:
这是一个曲折的过程。ChatGPT 需要时间去扩散。有些人很早就知道,有些人知道得晚;有些人一开始怀疑,后来震惊,再后来变成信徒。找人和找钱都和时机紧密相关。
我们从 2023 年 2 月开始把重点放在第一轮融资上。如果拖到 4 月,基本上就没有机会了。但如果在 2022 年 12 月或 2023 年 1 月做,也不太行——那时候疫情还在,大家也还没来得及消化。
所以,真正的窗口其实只有一个月。
有一晚在美国,我做了一个非常精确的计算。算完之后,我得出的结论是,我们至少需要在几个月内融资 1 亿美元。那时候市场上很多人还没开始融资,而且很多人不相信你能融到这个数额。但最后还是做到了——甚至更多。
人才市场也开始动起来了。受到 ChatGPT 的启发,2023 年 3 月或 4 月,很多人都有了这样的认识:未来十年里,这就是唯一值得做的事情。你必须在对的时间接触对的人。一两年前,人才能聚到这个程度。当时更多人还在做传统 AI 或与 AI 相关的方向——而不是通用 AI。
Zhang Xiaojun:
总结一下:2 月是融资窗口,3 月和 4 月是招聘窗口?
Yang Zhilin:
大致是这样。
Zhang Xiaojun:
在美国的那个晚上——你做这个计算的时候,是几点?你具体是怎么算的?
Yang Zhilin:
从 2022 年底到 2023 年初,我在美国待了大概一两个月,一直在和人聊天。我是在自己住的地方算的。你要计算需要多少 FLOPs、训练成本、推理成本,以及用户数量。
Zhang Xiaojun:
当时硅谷的主流氛围是什么?
Yang Zhilin:
产品很早就开始吸引很多用户,主要集中在科技圈。我们也在那个圈子里,所以感受非常明显。在硅谷的大公司里,大家每六个月都要写绩效评估,而很多人已经开始用 ChatGPT 来写了。以前写作并不太专业的一些人,交上来的评估却是用 ChatGPT 写的,每个人看起来都非常认真。
暗流正在涌动。很多人在思考自己的下一份工作,或者考虑创业。后来和我们聊过的相当一部分人都去创业了。而且有很强的 FOMO——害怕错过。没人睡得着。不管是半夜、凌晨 1 点还是 2 点,只要你联系,他们都在。多少有点焦虑,有点 FOMO,但也非常兴奋。
Zhang Xiaojun:
就是你算出需要融资 1 亿美元的那个晚上——你熬到几点?
Yang Zhilin:
还好——计算本身并没有花太多时间。但之后,我不能告诉太多人。如果我说出去,没人会相信这件事能做成。
第2部分
技术血脉
“让自己摆脱无穷无尽的打磨”
Zhang Xiaojun:
当风险投资界谈到你时,他们会说:“创始人非常出色,很有技术气质,而且整个团队都是技术明星。”所以在谈你的 foundation-model 公司之前,我想先从你的学术背景开始。你本科在 Thanh Hoa 学习计算机科学,后来在 Carnegie Mellon 的 School of Computer Science 拿到了博士学位。AI 一直都是你的重心吗?
Yang Zhilin:
我出生于 1992 年,2011 年开始上大学。从大二到现在——十多年了——我一直在这个领域。最初我探索得比较分散,四处看看;我做过一些与图和多模态相关的工作。到了 2017 年,我收敛到了语言模型。当时我觉得语言模型是一个相当重要的问题;后来我逐渐认为,它是唯一重要的问题。
Zhang Xiaojun:
2017 年时,AI 行业整体是如何看待语言模型的,这种认知后来又是怎样变化的?
Yang Zhilin:
那时候它只是一个用来给语音识别结果排序的模型。(笑。)一段音频被识别出来后,你会得到多个候选结果,然后用语言模型去看哪个结果的概率最高,输出最可能发生的结果。它的应用非常有限。
但后来你会意识到,这其实是一个基础性问题,因为你在建模世界的概率。语言是有限的,但它是世界的一个投影;从理论上讲,如果你把 token 空间——所有可能 token 的空间——做得足够大,你就可以构建一个通用的世界模型。这个世界里的一切是如何形成和发展的,都可以赋予一个概率。所有问题都可以归结为概率估计。
Zhang Xiaojun:
你的学术导师都非常知名:你的博士导师是 Ruslan Salakhutdinov,Apple 的 AI 负责人,以及 William W. Cohen,Google AI 的首席科学家。两位都处在工业界和学术界之间。
Yang Zhilin:
过去几年里,工业界和学术界的联系更紧密,但现在这个趋势正在转变:
更有价值的突破会发生在工业界。
这是发展的必然规律。它先从探索性研究开始,然后逐步转向更成熟的工业化过程。这并不意味着在工业化阶段研究就不重要——只是纯研究很难再产生有价值的突破。
Zhang Xiaojun:
你从这些知名导师身上学到了什么?
Yang Zhilin:
我学到最多的是在 Google,那是我长期实习的地方。我从 2018 年底开始做基于 Transformer 的语言模型。
我学到最多的一点,是把自己从无休止的“雕刻”中解放出来——也就是对表层细节过度打磨的执念。这非常重要。
你应该看大方向是什么,看大的 gradient 是什么。当你面前有十条路时,普通人会想着如何先刹住前面那条路上的行人——这些都是短期细节。但更重要的是:在这十条路里该选哪一条。
这个领域过去确实有这样的问题。比如,在一个只有一两百万 token 的数据集上,你会去看怎么把 perplexity 降得更低、怎么把 loss 压得更低、怎么提高准确率——然后你就会陷入无休止的雕刻。人们发明了很多奇怪的架构;这些都是雕刻式技巧。雕刻之后,你也许能在那类数据集上做得更好,但你却错过了问题的本质。
本质是分析这个领域缺什么。第一性原理是什么?为什么 scaling law 可以作为第一性原理?你只需要找到一个满足两个条件的结构:第一,它足够通用;第二,它可以扩展。通用意味着你可以在这个框架下建模所有问题;可扩展意味着只要你投入足够的 compute,它就会持续变好。
这是我在 Google 学到的思维方式:如果某件事可以被更基础的东西解释,就不要在上层过度雕刻。有一句我特别认同的话非常重要:如果一个问题可以通过规模来解决,那就不要用新的算法来解决它。一个新算法最大的价值,在于它能让你更好地扩展规模。当你摆脱雕刻之后,你就能看到更多。
Zhang Xiaojun:
Google 当时也是 scaling law 的追随者吗?他们是如何实践第一性原理思维的?
Yang Zhilin:
那里确实存在很多这样的想法,但 Google 并没有把它们执行得特别好。他们有那种思维方式,但没法把它组织成一个真正的 moonshot。它更像是:这里有五个人在追求我的第一性原理,那里有五个人在追求他们的。并没有自上而下的指挥。
Zhang Xiaojun:
在读博期间,你与图灵奖得主 Yann LeCun 和 Yoshua Bengio 合作发表了论文——而且你还是那些论文的第一作者。这些合作是怎么促成的?我的意思是:他们是图灵奖得主,而且并不是你的导师——你是凭什么吸引到他们的?
Yang Zhilin:
学术界非常开放。只要你有一个好想法和一个有意义的问题就可以了。两个大脑——或者 n 个大脑——一起产生的东西,通常会多于一个人的大脑。这在 AGI 发展中也一样。AI 里有一个重要策略叫做“ensembling”——使用多个不同的模型或方法,并结合它们的预测来获得更好的性能。其实做的也是同一件事:当你有更多不同的视角时,就能激发出很多新东西。合作带来的收益极大。
Zhang Xiaojun:
你是先有想法,再去问他们是否感兴趣吗?
Yang Zhilin:
大致是这样。
Zhang Xiaojun:
哪个更难:说服研究领域的学术泰斗,还是说服融资中的资本大佬?两者有什么相似之处?
Yang Zhilin:
“说服”并不是一个好的说法——其背后本质上是合作。合作意味着双赢,因为互利是合作的前提。所以其实没什么不同:你需要为别人带来独特的价值。
Zhang Xiaojun:
你是怎么赢得他们的信任的?你觉得你的“礼物”是什么?
Yang Zhilin:
没有什么特别的礼物——只是努力工作。
第 3 部分
旧系统已经不再有效
“AGI 需要一种新的组织形态”
Zhang Xiaojun:
你刚才说“更有价值的突破会发生在产业界”——这是否也包括 startups 和巨头公司的 AI labs?
Yang Zhilin:
Labs 是历史。Google Brain 曾经是业内最大的 AI 实验室,但它是一个位于大公司内部的研究组织。这种组织可以探索新想法,但很难做出一个优秀的系统——它可以做出 Transformer,但做不出 ChatGPT。
如今的发展路径演化成你正在构建一个巨大的系统,这需要新的算法、扎实的工程,甚至还需要大量的产品和商业化工作。
这有点像 2000 年代初:你不可能在实验室里研究信息检索;它必须存在于真实世界中,作为一个庞大的系统、一个有用户的产品——就像 Google。
因此,研究和教育系统会把自己的职能主要转向培养人才。
Zhang Xiaojun:
你会怎么描述这种新系统的形态?OpenAI 是它的原型吗?
Yang Zhilin:
它是目前这种类型里最成熟的组织,而且还在不断演化。
Zhang Xiaojun:
那是不是可以理解为:它是为人类伟大科学目标而建立的一种组织?
Yang Zhilin:
我想强调:这不是纯科学——而是科学、工程和商业的结合。它必须是一个商业组织、一家公司,而不是一个研究院。但这家公司是从 zero 到 one 构建起来的,因为 AGI 需要一种新的组织形态。第一,生产方式不同于互联网时代;第二,它从纯研究转向研究、工程、产品和商业的结合。
它的核心应该是一个 moonshot 项目,并伴随大量自上而下的规划——但在这个框架里仍然要给创新留出空间,因为并不是所有技术都已经被事先定义好。
自下而上的因素存在于自上而下的框架中。
这样的组织以前从未存在过,但它必须适应技术,因为技术决定生产方式;如果它们不匹配,你就无法高效生产。我们认为,它很可能需要从头重新设计。
Zhang Xiaojun:
在去年 OpenAI 董事会会议室里的那场“政变”中,Sam Altman 的一个选择是加入 Microsoft,并领导 Microsoft 的一支新 AI 团队。那和担任 OpenAI 的 CEO 的核心区别是什么?
Yang Zhilin:
你得在一种旧文化里面培育一个新组织——这极其困难。
Zhang Xiaojun:
你想打造“中国的 OpenAI”——我们可以这么说吗?
Yang Zhilin:
不完全准确。我们不想成为任何“中国”的东西,也不一定想成为 OpenAI。
第一,真正的 AGI 肯定会是全球性的。至少从长远看,不会有一家 AGI 公司因为市场保护机制而被限制在某个区域市场里。
全球化、AGI,以及拥有一个用户量非常大的产品:这三点最终都是必要条件。
第二,有必要成为 OpenAI 吗?如果看 2017–2018 年,OpenAI 的名声非常差。当我们圈子里的人找工作时,他们通常会考虑 Google 之类的地方。很多和 OpenAI 首席科学家 Ilya Sutskever 聊过的人,之后都会觉得这人疯了而且过于自负——OpenAI 要么是一群疯子,要么是骗子。但他们很早就下注,找到了非共识的东西,也找到了如今在 AI 里唯一有效的第一性原理:通过预测下一个 token 进行 scaling。
我相信会出现一家比 OpenAI 更大的公司。一家真正伟大的公司可以把技术理想与出色的产品结合起来,并与用户共同创造——AGI 最终会是通过与所有用户一起工作而被创造出来的。所以,这不只是技术问题;它还需要务实精神和现实世界中的追求——最终是两者的完美结合。
不过,我们应该学习 OpenAI 的技术理想主义。
如果所有人都觉得你很普通——如果你的梦想是任何人都能做的梦——那它就不会为人类的整体梦想贡献什么。
第 4 部分
Moonshot 的第一步是“long context”——那么第二步是什么?
“接下来的两个大里程碑即将到来”
Zhang Xiaojun:
回到你决定创办公司的时候——你是在回到中国后立刻启动第一轮融资的吗?
Yang Zhilin:
它是去年 2 月在美国开始的,有一部分是远程完成的。最后,国内投资者占了多数。
Zhang Xiaojun:
第一轮融资是 100 万美元对吗?
Yang Zhilin:
第一轮没有那么多;后面的轮次超过了那个数字。我们在 2023 年完成了两轮,总共接近 20 亿元 RMB。
现在这是第三轮。我们还没有正式公布融资金额,所以我现在不能评论。
Zhang Xiaojun:
有人说从 2023 年下半年开始,就没有人想投资基础模型公司了。他们错了吗?
Yang Zhilin:
还是有的。确实可以看到情绪在变化,但并不是没有人投资——至少目前,市场仍然有相当多的投资兴趣。
Zhang Xiaojun:
除了资本和人员之外,你在 2023 年还做了哪些关键决定?
Yang Zhilin:
决定要做什么。这就是像我们这样的公司的优势——有技术视野,能够在最高层级做决策。
我们做 long context。这要求对未来作出判断:你需要知道什么是基础,接下来一切会往哪里走。再一次,这是第一性原理——“de-carving” 过程。如果你只专注于 carving,你只能去看 OpenAI 做了什么,然后设法复现它。
你会发现,Kimi 里的无损 long-text compression 给产品带来了独特的体验。当你阅读英文文章时,它会以惊人的方式帮助你理解它们。今天使用 Claude 或 GPT-4,你未必能做得这么好;这需要事先打下基础。我们已经为此工作了半年多。这和今天看到 long-context 趋势,就急忙把两个团队合并起来、以最高速度推进,是很不一样的。
当然,马拉松才刚刚开始;后面还会有更多差异化,这要求你提前判断什么才算“与众不同但仍然正确的判断”。
Zhang Xiaojun:
这个决定是在几月份做出的?
Yang Zhilin:
二月或三月——公司一成立,这个决定就定下来了。
Zhang Xiaojun:
为什么长上下文是 moonshot 的第一步?
Yang Zhilin:
因为它是基础性的。它是新电脑的记忆。
旧电脑的记忆在过去几十年里提高了几个数量级,而新电脑也会发生同样的事情。它可以解决今天的很多问题。比如,现有的多模态架构仍然需要一个 tokenizer,但有了无损压缩的长上下文,你就不需要它了——你可以直接把原始输入放进去。再往前走一步,它还是让新的计算模型变得更通用的基础。
旧电脑可以用 0 和 1 表达一切;所有东西都可以被数字化。但今天的新电脑还做不到——因为上下文还不够,所以它还不够通用。要成为一个通用的 world model,你需要长上下文。
第二,它使个性化成为可能。AI 的核心价值是个性化交互;最终价值会落到个性化上,而 AGI 会比上一代推荐系统更个性化。
但个性化不是通过 fine-tuning 实现的——而是通过支持非常长的上下文。你和机器的全部历史都是上下文,而这段上下文决定了个性化的过程。它不能被复制,并且它会产生更直接的对话——一种能够产生信息的对话。
Zhang Xiaojun:
这方面还有多大的扩展空间?
Yang Zhilin:
非常大。一方面,单纯扩展窗口本身还有很多空间——几个数量级。
另一方面,你不能只扩展窗口,也不能只看数字;现在窗口是几百万 token 还是几十亿 token,本身并没有太大意义。你必须看它在这个窗口里带来的推理能力、faithfulness——也就是对原始信息的贴合程度——以及遵循指令的能力。你不应该追逐单一指标;必须把指标和能力结合起来。
如果这两个维度继续提升,你就能做很多事情。它可以遵循一条长达数万字的指令,而这条指令本身就可以定义出很多 agents——非常个性化。
Zhang Xiaojun:
long context 背后的技术和追赶 GPT-4 可以复用吗?它们是同一回事吗?
Yang Zhilin:
我不这么认为。它更像是补充了一个新维度——一个 GPT-4 没有的维度。
Zhang Xiaojun:
很多人说,中国的头部基础模型公司现在都在做差不多的事情——2023 年追赶 GPT-3.5,2024 年追赶 GPT-4。你同意吗?
Yang Zhilin:
提升通用能力当然有关键里程碑,所以这个说法在某种程度上是对的——作为后来者,你必然要经历追赶的过程。但它也比较片面。除了通用能力之外,还有很多空间去发展特定能力,并在某些方向上做到 state-of-the-art。Long context 就是一个例子。DALL-E 3 的图像生成能力被 Midjourney V6 完全拉开了差距。所以你必须两条腿走路。
Zhang Xiaojun:
用于通用能力和新维度的时间与资源比例是多少?
Yang Zhilin:
它们必须结合起来。一个新维度不可能脱离通用能力而存在,所以很难直接给出一个比例。但仍然需要足够大的投入,才能把新维度做好。
Zhang Xiaojun:
所有这些新维度都会由 Kimi 来承担吗?
Yang Zhilin:
Kimi 当然是我们非常重要的一个产品,我们也会有一些其他尝试。
Zhang Xiaojun:
你怎么看 Shixiang 创始人 Li Guangmi 的说法:目前中国基础模型公司的技术特色还没有那么高?
Yang Zhilin:
我觉得也还好——现在我们已经做出了相当多的差异化。主要还是时间问题;今年你会看到更多维度。去年,大家还只是先搭架子,把东西跑起来。
Zhang Xiaojun:
如果 moonshot 的第一步是 long context,那么第二步是什么?
Yang Zhilin:
前面会有两个大里程碑。第一,真正统一的 world model——一个把不同模态统一起来的模型,一个真正可扩展、通用的架构。
第二,让 AI 在不需要人类输入数据的情况下继续进化。
Zhang Xiaojun:
实现这两个里程碑需要多久?
Yang Zhilin:
两到三年——也许还会更快。
Zhang Xiaojun:
那么再过三年,我们看到的世界就会和现在完全不同了。
Yang Zhilin:
按照目前的发展速度,是的。技术现在正处于萌芽阶段,增长非常快。
Zhang Xiaojun:
你能想象三年后会有哪些东西吗?
Yang Zhilin:
会有一定程度的 AGI。我们今天做的很多事情,AI 也会做得到——甚至比我们更好。但关键在于我们怎么用它。
Zhang Xiaojun:
那对你来说——对于 Moonshot AI 作为一家公司来说——第二步是什么?
Yang Zhilin:
我们会去做那两件事。其余所有问题都源自这两个因素。今天大家在谈的推理和 agents,都是解决这两个问题的副产品。还需要一些细微打磨,但没有根本性障碍。
Zhang Xiaojun:
你会全力追赶 GPT-4 吗?
Yang Zhilin:
GPT-4 是通往 AGI 之路上一个必要的停靠点。关键不在于满足于只做到 GPT-4。
第一,你必须问,当前真正的非共识是什么:除了 GPT-4,下一步是什么?GPT-5 和 GPT-6 应该是什么样子?第二,你要看自己在其中有哪些独特能力——而这一点更重要。
Zhang Xiaojun:
其他基础模型公司都会公布自己的能力和模型排行榜。你们似乎没有这么做?
Yang Zhilin:
追逐排行榜名次没什么意义。最好的排行榜是用户——你应该让用户投票。很多排行榜都有问题。
Zhang Xiaojun:
成为中国第一家达到 GPT-4 的基础模型公司,这是不是你的目标?快一点或慢一点会有区别吗?
Yang Zhilin:
当然有区别。在足够长的时间尺度上,最后大家都会做到。但问题在于你领先还是落后多久。领先六个月或更多是有意义的——而且这也取决于你能用这段时间做什么。
Zhang Xiaojun:
你预计什么时候能达到 GPT-4?
Yang Zhilin:
应该会比较快,但我不能向公众公布具体时间。
Zhang Xiaojun:
你会是最快的吗?
Yang Zhilin:
这个要灵活看待——但我们确实有真正的机会。
Zhang Xiaojun:
在 Kimi 上线后,你的北极星指标是什么?
Yang Zhilin:
现在是把产品做得更好,并补充更多维度。比如,我们不应该只为一个搜索场景死磕——未来搜索只会是这个产品价值里很小的一部分;产品必须有大得多的增长。
比传统搜索工具好 10% 或 20% 并不算什么——只有真正具有突破性的东西,才配得上“AGI”这三个字。
你的独特价值是你增量的智能。你必须守住这一点:智能始终是核心增值。如果产品的核心价值只有 10%–20% 来自 AI,那它就站不住脚。
第5部分
我完全不担心商业化
“用户规模和模型规模需要同时进行”
Zhang Xiaojun:
2023 年年中是一个非常大的转折点——市场迅速从狂热转向冷却。你如何看待这一点?
Yang Zhilin:
我并不完全同意这种描述——我们在下半年还是完成了一轮融资。而且新的东西还在不断出现。今天的模型能力,在去年年底是无法想象的。越来越多 AI 公司的用户数和收入也还在持续增长。它一直在不断证明自己的价值。
Zhang Xiaojun:
对你来说,上半年和下半年之间有什么不同?
Yang Zhilin:
没有太大变化。当然会有一些变量,但最终你还是会回到第一性原理——如何为用户提供一个好产品。归根到底,我们必须满足用户需求,而不是赢下一场竞赛。
我们不是一家为了竞争而建立的公司。
Zhang Xiaojun:
这个行业认为,2023 年上半年和下半年最显著的差异是重心转移:上半年更偏 AGI;下半年转向如何把应用落地和商业化。你们也做了这种转移吗?
Yang Zhilin:
当然,我会做 AGI——这是未来十年里唯一有意义的事情。但这并不意味着我们不做应用。或者更准确地说,它不应该被定义为一个“应用”。
“应用”听起来像是你已经有了一项技术,然后去寻找使用场景,带着一个已经闭环的商业循环。但“应用”并不是准确的说法。它和 AGI 是相辅相成的。它既是通往 AGI 的手段,也是达到 AGI 的目的。
“应用”听起来更像一个目的:我想让它有用。你必须结合东方和西方的哲学——你必须赚钱,也必须有理想。
今天,用户帮助我们发现了许多我们从未想到过的场景。有人用它来筛选简历——这是我们在设计产品时从没想到过的,但它自然地奏效了。反过来,来自用户的输入又会让模型变得更好。为什么 Midjourney 这么好?它是在用户侧扩展开来的——用户规模和模型规模必须同时进行。反过来,如果你只专注于应用,而忽视了模型能力的迭代提升——忽视 AGI——那么你的贡献将非常有限。
Zhang Xiaojun:
GSR Ventures的管理合伙人Zhu Xiaohu,只投资于基础模型应用。他的一个观点是:最难的核心问题是AIGC的PMF——如果十个人找不到PMF,一百个人也一样;这跟人力多少或成本高低没什么关系,所以不要往里烧钱。他说,“在LLaMA上训练两三个月,你至少可以达到前30人的水平——它可以立刻替代人。”你怎么看这个观点?
Yang Zhilin:
AI不是我在一两年内能找到什么PMF的问题;而是十到二十年后如何改变世界的问题——这是两种不同的思维方式。
我们是坚定的长期主义者。当AGI或者更强的东西实现之后,今天的一切都会被重写。PMF当然很重要,但如果你急着去找PMF,很可能会再遭遇一次“降维打击”——被更高维的技术碾压。这种事已经发生过太多次了。过去,很多人做客服、对话系统、填槽,规模也还不错。但最后都被更高维的一击扫平了。很痛苦。
不是说这种做法从来没效果。假设今天你找到了一个场景,现有技术就够用,0-to-1的增量价值极大,而1-to-n的空间又不大——这种场景就很好。Midjourney就是这样,或者广告内容生成——相对简单的任务,0-to-1效应非常明显。这是只做应用的一方的机会。但最大的机会不在这里。如果你的前提是商业化,你不能把它和AGI割裂开来想。如果我现在只做应用——可以,但一年之内你可能就会被碾碎。
Zhang Xiaojun:
你可以悄悄把底层基础模型升级上去,对吧?
Yang Zhilin:
但那样做永远不可能比模型本身更大。技术是这个时代唯一新的变量;其他变量都没有变化。回到第一性原理,AGI是一切的核心。因此我们推导出:一个超级应用一定需要最强的技术能力。
Zhang Xiaojun:
可以用开源模型吗?(最新消息是Google发布了开源模型Gemma。)
Yang Zhilin:
开源正在落后于闭源——这也是事实。
Zhang Xiaojun:
这种落后会不会只是暂时的?
Yang Zhilin:
至少到目前为止,看起来不是这样。
Zhang Xiaojun:
为什么开源追不上闭源?
Yang Zhilin:
因为现在开源的开发方式已经变了。以前,任何人都可以为开源做贡献;今天,开源本身仍然是中心化的。
很多开源贡献可能并没有经过算力验证。闭源受益于人才和资本的集中,所以最终闭源一定会更好——这是一个中心化的过程。
如果今天我有一个领先模型,把它开源很可能是不理性的。也许只有落后的一方才会这么做,或者开源一个小模型——为了搅动市场;毕竟,如果你不开源,它也没有什么价值。
Zhang Xiaojun:
如何应对中国的焦虑?大家说,一个基础模型公司如果不能尽快做出商业场景和让投资人满意的产品,就很难融到下一轮。
Yang Zhilin:
长期和短期之间需要平衡。
完全没有用户、没有收入肯定不行。
正如我们看到的,从GPT-3.5到GPT-4解锁了很多应用;从GPT-4到GPT-4.5再到GPT-5,很可能还会继续解锁更多——甚至以指数级更多。所谓“场景的摩尔定律”,指的是可用场景数量会随着时间呈指数级增长。我们需要一边提升模型能力,一边寻找更多场景——就是这样的平衡。
这是一种螺旋上升。它取决于你的投资里有多少部分用于短期,多少部分用于长期。你是在能活下来的前提下追求长期。长期绝对不能忽视,否则你会错过一个时代。现在下结论其实还太早。
Zhang Xiaojun:
您同意Wang Huiwen,Meituan联合创始人兼Light Year创始人提出的“双轮驱动”想法吗?
Yang Zhilin:
这是个好问题。在某种程度上,这个逻辑是有道理的。但真正拉开差异的是你的执行方式。你是否真的能实现那些“非共识且有正期望值的赌注”?
Zhang Xiaojun:
据我理解,他们的双轮驱动也要求尽快找到新的应用场景;否则技术也没有办法落地。
Yang Zhilin:
归根结底,还是模型规模化和用户规模化之间的区别。
Zhang Xiaojun:
在中国,除了您之外还有谁在走模型规模化这条路?
Yang Zhilin:
这不是我能评价的事情。
Zhang Xiaojun:
也许大多数人走的是用户规模化路线。或者换句话说:这是不是学术派和商业化派的区别?
Yang Zhilin:
我们不是学术派。学术派肯定不行。
Zhang Xiaojun:
很多基础模型公司通过B2B商业化——毕竟,B2B确定性更高。那你们呢?
Yang Zhilin:
我们不是。从第一天起,我们就决定走B2C。
这取决于你想要什么。如果你知道某样东西不是自己想要的,你就不会FOMO——因为即使得到了,也没什么意义。
Zhang Xiaojun:
在过去一年里,您有感到焦虑吗?
Yang Zhilin:
更多的是兴奋和激动。因为这件事我已经想了很久了。也许我们是最早想去探索月球暗面的人之一。今天,你会意识到自己其实正在造一枚火箭,而且每天都在讨论该加哪种燃料才能让它跑得更快——以及怎样才能不让它炸掉。
Zhang Xiaojun:
总结一下您做过的那些“概率正向的不一致性下注”——除了 B2C 和 long context 之外,还有什么?
Yang Zhilin:
还有很多正在推进中;我希望能尽快和大家分享。
Zhang Xiaojun:
中国上一代创业者已经在应用和场景中尝到了成功的滋味,所以他们更关注产品、用户和数据飞轮。您所代表的新一代 AI 创业者,能否创造一个新的未来?
Yang Zhilin:
我们也非常关注用户。用户是我们的最终目标,但这也是一个共同创造的过程。
最大的不同是,这一次会更多由技术驱动。
还是马车和汽车的问题:我们正处在从马车到汽车的跃迁中,应该把全部精力放在如何为用户造出一辆汽车上。
Zhang Xiaojun:
您会感到孤独吗?
Yang Zhilin:
哈哈哈……这个问题挺有意思的。我觉得还好,因为我身边还有几十——接近上百——人在和我一起战斗。
第6部分
在我们追上 GPT-4 之前,Sora 已经出现了
“现在就像是 GPT-3.5 之于视频生成的那个时点”
Zhang Xiaojun:
Sora 今年突然出现——有多少在您的预料之中,又有多少不在预料之中?
Yang Zhilin:
生成式 AI 能达到这样的效果,是在预料之中的;意外的是时间点——它来得比我们估计的更早。
这也反映出 AI 现在发展得有多快:很多规模化带来的红利还远没有被充分释放。
Zhang Xiaojun:
去年,行业普遍认为 2024 年的基础模型一定会在多模态叙事上展开激烈竞争,而视频生成质量会像 2023 年的 text-to-image 一样迅速提升。Sora 的技术能力超出了、符合还是低于您的预期?
Yang Zhilin:
它解决了很多以前非常困难的问题。比如,保持在相对较长时间跨度内生成过程的一致性——这是关键点,也是一个很大的进步。
Zhang Xiaojun:
这对全球行业格局意味着什么?在 2024 年,基础模型会出现哪些新故事?
Yang Zhilin:
第一,短期应用价值:它可以继续提升生产流程中的效率,当然我们也期待基于现有能力进一步构建更多扩展。第二,与其他方式结合。它本身就是一个世界模型;基于这些知识,它是现有文本的绝佳补充。在此基础上,无论是在 agent 还是在连接物理世界方面,都还有相当多的空间和机会。
Zhang Xiaojun:
总体来看,您如何评价 Sora?
Yang Zhilin:
我们之前也规划过类似方向,并且已经在上面做了一段时间。从方向上看并没有什么太意外的——主要还是技术细节上的差异。
Zhang Xiaojun:
哪些技术细节值得学习?
Yang Zhilin:
OpenAI 也没有把其中很多点解释得很完整。他们只描述了大方向;而那些关键细节,你得从它的输出或者现有信息,再结合我们之前的实验去反推。至少对我们来说,这为研发过程提供了更多数据点——更多数据输入。
Zhang Xiaojun:
和文本生成相比,视频生成的主要瓶颈是什么?这一次您觉得 OpenAI 找到了什么解决方案?
Yang Zhilin:
最大的瓶颈——核心仍然是数据:如何实现大规模数据的匹配?这一点此前并没有被验证过,尤其是在运动复杂、而生成结果又像照片一样真实的情况下。
在这种条件下,还能扩展规模——这就是这一次它解决的问题。
尚未解决的包括,比如,对统一架构的需求。DiT 仍然不是一个足够通用的架构。
对纯视觉信号的边际概率建模可以做得很好,但如何把它推广成一个通用的新型计算机?仍然需要更统一的架构——这里还有空间。
Zhang Xiaojun:
您读过 OpenAI 的 Sora 报告《Video generation models as world simulators》吗?其中哪些点值得强调?
Yang Zhilin:
我读过。以当前的竞争态势来看,他们肯定不会把最重要的点写出来。但它仍然非常值得学习。基本上,这些都是已经付费换来的内容——如果没有它们,你可能要花很多实验成本才能学到。现在你可以不用为那些实验付钱,就先知道其中一部分,并形成一个初步认识。
Zhang Xiaojun:
您从中提炼出的关键信号是什么?
Yang Zhilin:
这东西可以扩展到一定程度。另外,它也相当具体地描述了架构是如何搭建的。不过也有可能,不同架构对这个问题并不会造成本质性的差异。
Zhang Xiaojun:
您同意他们那句话吗——“扩展视频生成模型是构建物理世界通用模拟器的一条有前景的路径”?
Yang Zhilin:
我完全同意。这两件事优化的是同一个目标函数——这一点几乎没有什么可怀疑的。
Zhang Xiaojun:
Ông nghĩ gì về việc Yann LeCun một lần nữa lên tiếng phản đối AI sinh? Quan điểm của ông ấy: “通过生成 pixel 来建模世界是浪费且注定会失败。生成之所以能在文本上奏效,是因为文本是离散的,符号数量有限。在这种情况下,处理预测中的不确定性很容易;而在连续、多维的感觉输入中处理预测不确定性则是不可解的。”
Yang Zhilin: 现在我认为,当你对视频的边际概率进行建模时,本质上就是无损压缩——这与语言模型里的下一个 token 预测并没有本质区别。只要你压缩得足够好,你就可以解释这个世界里任何可以被解释的东西。
但仍然有一些重要工作没有完成:它如何与已经被压缩出来的能力结合?你可以把这看作两种不同的压缩。一种是压缩原始、粗糙的世界——这就是视频模型所做的。另一种是压缩人类所产生的行为,因为人类行为已经经过了人脑——而人脑是世界上唯一创造出智能的东西。
你可以把视频模型看作是在做第一种,而文本模型在做第二种,尽管视频模型也包含了第二种的一部分:一些由人类创造的视频中包含了创作者的智慧。最终,也许会是混合的——你需要通过这两种方法从多个角度学习,而它们都会促进智能的增长。
所以,生成也许并不是目标;它只是一个压缩函数。如果你压缩得足够好,生成最终也会非常好。反过来,如果一个模型本身都不能生成,它还可能压缩得极好吗?这值得怀疑。也许,能很好生成是很好压缩的必要条件。
Zhang Xiaojun:
Sora 和去年的 ChatGPT 是两个不同的里程碑。哪个更大?
Yang Zhilin:
两者都非常重要。
现在它很像 video generation 的 GPT-3.5 时刻——一个台阶式跃升。
模型目前还相对较小,而且可以预见会有更大的模型出现,这意味着能力提升是确定的。
Zhang Xiaojun:
也有人认为,从多模态角度看,Google Gemini 的突破更重要。
Yang Zhilin:
Gemini 走的是 GPT-4V 的路线,也包含了那方面的理解。两者都很重要;最后一步是把这些东西都整合进同一个模型里,而这件事还没有解决。
Zhang Xiaojun:
为什么把它们放进同一个模型里会这么难?
Yang Zhilin:
目前还没人知道怎么做。还没有经过验证的架构。
Zhang Xiaojun:
Sora + GPT 会带来什么?
Yang Zhilin:
Sora 可以直接应用到视频生产中,但如果和语言模型结合,它可以把数字世界和物理世界连接起来。你也可以以更 end-to-end 的方式完成任务,因为你现在的世界建模比以前更好了——它甚至可以用来提升对多模态输入的理解能力。所以,最终你可以在不同模态之间相当灵活地切换。
总之:你更好地理解了世界;你可以在数字世界中完成更多 end-to-end 任务;你甚至可以搭一座通往物理世界的桥,在那里完成任务。这是起点。
比如自动驾驶,或者一些家务——理论上,这些都是与物理世界连接的案例。因此,数字世界中的突破是确定的,但它也蕴含着通向物理世界的潜力。
Zhang Xiaojun:
Sora 对中国的基础模型公司意味着什么?正确的应对方式是什么?
Yang Zhilin:
它并没有改变太多。这本来就是一个确定的方向。
Zhang Xiaojun:
中国的基础模型还没有追上 GPT-4,而现在 Sora 又出现了。你怎么看?两个世界似乎正在越拉越开——你会感到担心吗?
Yang Zhilin:
那只是一个客观事实。但现实差距可能仍在逐步缩小——这是技术发展的规律。
Zhang Xiaojun:
你的意思是?技术曲线一开始很陡,然后逐渐变平?
Yang Zhilin:
对。我也并不太惊讶——OpenAI 一直在持续开发下一代模型。客观上,这种差距还会存在一段时间,而且中国不同公司之间的差距也会存在一段时间——这就是技术爆发期。
但再过两三年,很可能中国头部公司在这里的基础工作会做得更好——包括技术基础设施、人才储备以及组织文化的沉淀。经过这样的打磨,他们在某些方面更有可能领先——但这需要一点耐心。
Zhang Xiaojun:
中国和美国最终会形成截然不同的 AI 技术生态吗?
Yang Zhilin:
如果从产品和商业化角度看,生态可能会不同。但从技术角度看,通用能力不会走向完全不同的技术路线——基础通用能力肯定会是相似的。因为 AGI 的空间非常大,所以在通用能力之上的差异化更有可能发生。
Zhang Xiaojun:
在 Silicon Valley 有一个长期争论:“一个模型统治一切”还是“多个(小)专用模型”——是一个通用模型解决所有任务,还是很多专用小模型分别处理具体任务。你的看法是什么?
Yang Zhilin:
我站第一种。
Zhang Xiaojun:
在这一点上,中国和美国会有很大的分化吗?
Yang Zhilin:
我不这么认为,从长期看不会。
第7部分
我接受失败是一种可能
“它改变了我的人生”
Zhang Xiaojun:
中国的基础模型创业公司是一种相当特殊的生物:你已经筹到了很多钱,但似乎大部分都被用在了科学实验上。在这种情况下,你是怎么说服投资人掏钱的?
Yang Zhilin:
和美国没什么不同。
到目前为止,我们融资的金额也还没那么多。
所以我们还有很多要向 OpenAI 学习。
Zhang Xiaojun:
我想知道:要到 GPT-4 还需要多少钱?要到 Sora 还需要多少钱?
Yang Zhilin:
GPT-4 和 Sora 都不需要那么多。现在的钱主要是留给下一代——或者再下一代——模型的,用于探索前沿。
Zhang Xiaojun:
中国的基础模型创业公司已经拿到了大厂的钱,但大厂也在自己训练模型。你怎么看基础模型创业公司和大厂之间的关系?
Yang Zhilin:
既有竞争,也有合作。大厂和创业公司的第一优先级不同。看看今天任何一家大型科技公司:它的第一优先级和一家 AGI 公司的第一优先级是不一样的。你的第一优先级会塑造你的行动和结果,并最终决定生态中的不同关系。
Zhang Xiaojun:
为什么大厂会把小额投资撒到很多家基础模型公司上,而不是重注一家?
Yang Zhilin:
这是阶段性问题。
后面还会有更多整合——公司数量也会更少。
Zhang Xiaojun:
有人说基础模型公司的结局是被大厂收购。你同意吗?
Yang Zhilin:
我不认为一定会这样。但他们很可能会有非常深的合作关系。
Zhang Xiaojun:
比如说,他们可以怎么合作?
Yang Zhilin:
OpenAI 和 Microsoft 就是经典的合作模式。大部分可以借鉴,也有一部分可以改进。
Zhang Xiaojun:
过去一年里,创业的转折点在你看来体现在哪里?
Yang Zhilin:
外部变量很多——资本、人才、GPU、产品、R&D、技术。既有高光时刻,也有必须跨过的困难。拿 GPU 来举例。
这期间有很多起伏:供应有一段时间很紧张,后来又改善了。
最极端的时候是价格按天变——一台机器今天可能是 260,明天就是 340,后天又降回来。这是一个不断变化的局面。你必须紧跟它。
价格不断变化,策略也就不断变化:用什么渠道、买还是租——选择非常多。
Zhang Xiaojun:
是什么推动了这些波动?
Yang Zhilin:
地缘政治原因;生产本身是分批进行的;市场情绪也起了作用。我们观察到很多公司开始退回 GPU,意识到他们不一定需要用它们来训练这个模型。当市场情绪和大家的决策发生变化时,供需也会随之变化。好消息是,总体来看,最近供应已经改善了很多。
我的个人判断是,至少在未来一到两年里,GPU 不会是很大的瓶颈。
Zhang Xiaojun:
你似乎一直在思考组织问题。你是怎么搭建团队的?
Yang Zhilin:
我们的招聘方式一直在随着时间变化。全球范围内的 AGI 人才极其稀缺,而有相关经验的人更少。我们最初的招聘画像,重点是寻找那些技能直接相关的天才。这被证明非常成功。那些做过模型“手术”、有超大模型训练实战经验的人,可以非常快地把事情做起来。包括 Kimi 的发布——资本效率和组织效率都真的很高。
Zhang Xiaojun:
花了多少?
Yang Zhilin:
一个相当小的数字——相比很多其他支出,这是花小钱办大事。很长一段时间里我们只有 30–40 个人。现在是 80 个人。我们追求人才密度。
后来,人才配置也变了。最初,我们招的是天才,相信他们的能力上限很高——一家公司能力的上限由其中人的能力上限决定。后来,我们补充了更多维度的人才——产品运营侧的人、偏领导型的人、那些能把事情推到极限的人。现在这是一支更完整、更有韧性、也能打仗的团队。
Zhang Xiaojun:
在中国做了一年基础模型创业之后,你怎么看目前这个阶段性的成果?
Yang Zhilin:
我们已经造出了一个火箭原型,现在正在试射。我们已经组建起了团队,找到了一些燃料配方,基本上也能看到一个雏形 PMF。可以说,我们已经迈出了登月任务的第一步。
Zhang Xiaojun:
你怎么看 Yann LeCun 的观点?他对当前的技术路线并不乐观——他认为自监督语言模型无法真正获得世界知识,而且随着模型规模扩大,出错的概率——机器幻觉——只会增加。他提出了一个 “world model” 的概念。
Yang Zhilin:
没有什么根本性的瓶颈。只要 token 空间足够大,它就会变成一种新的计算机,用来解决通用问题——那本身就是一个通用的 world model。
他这番话背后有一个重要点:任何人都能看到当前的局限。但解决方案未必需要一个全新的框架。AI 里唯一真正有效的是 next token prediction 加上 scaling law。只要 token 足够充足,一切都能做出来。当然,他现在提到的问题确实存在——但你是通过把 token 空间做得真正通用来解决它们。就这样而已。
Zhang Xiaojun:
所以他是在夸大这些限制。
Yang Zhilin:
我认为是这样。基础原理是对的——只是还有一些小的技术问题没有解决。
Zhang Xiaojun:
你怎么看深度学习之父 Geoffrey Hinton 一再呼吁关注 AI 安全?
Yang Zhilin:
他把重点放在安全上,其实说明他非常相信技术能力即将大幅提升。这两件事是相互对立的。
Zhang Xiaojun:
怎么解决幻觉问题?
Yang Zhilin:
还是 scaling law——只不过被 scale 上去的是别的东西。
Zhang Xiaojun:
最终,scaling law 结果证明是死胡同的概率有多大?
Yang Zhilin:
概率几乎为零。
Zhang Xiaojun:
你怎么看 CMU 校友 Qi Lu 的观点:OpenAI 一定会比 Google 更大——只是大一倍、五倍还是十倍?
Yang Zhilin:
未来最成功的 AGI 公司一定会比今天所有公司都更大——这毫无疑问。
最终,这可能是 GDP 的两倍或三倍。可能不一定是 OpenAI;也可能是另一家公司。但肯定会有这样一家公司。
Zhang Xiaojun:
如果你碰巧成了这个 AI 帝国的 CEO,你会怎么保护人类?
Yang Zhilin:
现在去思考这个问题,还缺少一些前提条件。不过我们肯定愿意与社会中的不同主体合作并向他们学习,包括在模型中加入更多安全措施。
Zhang Xiaojun:
你对 2024 年的目标是什么?
Yang Zhilin:
第一,技术突破——现在我们应该已经能够构建出一个比 2023 年好得多的模型。第二,用户和产品——我希望能有更多大规模用户,以及更强的留存。
Zhang Xiaojun:
你对 2024 年全球基础模型行业的预测是什么?
Yang Zhilin:
今年会出现更多能力,但格局不会和现在差太多——头部几家还是会领先。在能力方面,下半年可能会出现一些相当大的突破,很多突破来自 OpenAI;它肯定有下一代模型——可能是 4.5,可能是 5。那感觉像是一个高概率事件。视频生成模型肯定还能继续扩展。
Zhang Xiaojun:
那你对 2024 年中国基础模型行业的预测呢?
Yang Zhilin:
第一,你会看到新的、不同的能力出现。中国模型——由于更早投入并且团队合适——会在某些维度上达到世界领先的能力。第二,会出现拥有更大用户基础的产品——这种可能性很高。第三,在路线选择上会有更多整合与分化。
Zhang Xiaojun:
创办这家公司时,你最害怕的是什么?
Yang Zhilin:
其实也没什么——就是无所畏惧地向前冲。
Zhang Xiaojun:
你想对你的同事们说些什么?
Yang Zhilin:
让我们一起继续努力。
Zhang Xiaojun:
请提出一个关于基础模型行业、你 هنوز 还不知道答案但最想知道的问题。
Yang Zhilin:
我不知道 AGI 的极限会是什么样——它会创造出一种什么样的公司,而那家公司又会创造出什么样的产品。这是我现在最想知道的。
Zhang Xiaojun:
当 AGI 继续这样发展下去时,你最不想看到的唯一一件事是什么?
Yang Zhilin:
我对此相当乐观。它可能会把人类文明带到下一个阶段。
Zhang Xiaojun:
有人说过你太理想主义吗?
Yang Zhilin:
我们也非常现实。实际上我们已经做出了一些真正的东西——我们不是只会空谈。
Zhang Xiaojun:
如果你今天融资到的这笔钱是你今生最后一笔钱,你会怎么花?
Yang Zhilin:
我希望这种情况永远不会发生,因为未来我们还会需要更多资金。
Zhang Xiaojun:
如果你没有成功,你会把自己看作失败者吗?
Yang Zhilin:
这也没那么重要——我接受失败是一种可能。
这段旅程已经彻底改变了我的人生,我无比感激。
(完)
内容仅供参考,不构成投资、法律、税务或财务建议。