對話 Kimi 創始人楊植麟:向延綿而未知的雪山前進
月之暗面創始人楊植麟談 AGI、Scaling Law、Kimi、商業化、Sora,以及為什麼通用人工智慧需要一種新的組織。

編者註:本文為張小珺於 2024 年 3 月 1 日發佈的楊植麟訪談英文譯文,譯文由 Kimi K3 生成,並由作者於 2026 年 7 月重新發佈在 X。正文保留英文版本。

This was my first interview with Yang Zhilin, conducted in early 2024 and published on March 1, 2024—exactly the first anniversary of Kimi's founding. At the time, Kimi had only 80 people, working out of their first, somewhat run-down office. There was no logo at the entrance. Only a white piano standing guard by the door.
This article generated quite a stir in China's tech community at the time.
Back then, I was still a print journalist, so this interview exists only as text and an audio podcast.
As we can see, many of the views expressed in this article have since been borne out.
Just rereading these words from two years ago, you really can't help but marvel at how dramatically the world has changed!
(This translation was generated by Kimi K3.)
Yang Zhilin: “If everyone thinks you are normal—if your dream is one that anyone could have—it adds nothing to the sum total of humanity’s dreams.”
By Zhang Xiaojun
Just one year ago, AI scientist Yang Zhilin did a precise calculation in Silicon Valley. He realized that if he decided to launch a foundation-model startup aimed at AGI, he would need to raise more than $100 million within the next few months.
Yet that was merely a ticket to the game. A year later, that figure had multiplied thirteenfold.
For foundation-model companies, competition is less a scientific contest than, first and foremost, a brutal contest of money. With investors holding their purse strings tight, you have to stay ahead of your rivals in raising more money, buying more GPUs, and grabbing more talent.
“It requires a concentration of talent and a concentration of capital,” says Yang Zhilin, founder and CEO of Moonshot AI, the foundation-model company established on March 1, 2023.
Over the past year, Chinese foundation-model companies have seemed to live on a tense, constricted edge of survival. On the surface, each of them holds hefty sums of cash. But on one hand, they must immediately pour freshly raised money into extremely costly research to chase OpenAI—first catching up to GPT-3.5, and before GPT-4 is even reached, along comes Sora. On the other hand, they must race nonstop to find viable real-world use cases, to validate for themselves that they are companies, not research institutes that only devour capital. And that is not enough: for every one of these ventures, whether the exit is an IPO or an acquisition, the way out remains anything but clear.
Among the founders of China’s foundation-model companies, Yang Zhilin is the youngest, born in 1992. The industry describes him as a staunch AGI believer and a founder with rare technical charisma. Much of his academic and professional record is tied to general-purpose AI, and his papers have been cited more than 22,000 times.
In mid-2023, China’s tech community turned abruptly from euphoria to chill on foundation models, and accelerating real-world deployment became the pragmatic mainstream melody. This inevitably left foundation-model CEOs torn violently between ideal and reality.
In a Chinese AI ecosystem where everyone chants PMF (product/market fit) and everyone chants commercialization, this founder—an AI researcher by training—is in no particular hurry.
With 80 people, Moonshot AI has the smallest headcount among China’s leading foundation-model companies. Unlike his rivals, Yang did not opt for the safer B2B business or seek deployment in verticals such as healthcare or gaming. He built one—and only one—consumer product: the AI assistant Kimi, which accepts inputs of up to 200,000 Chinese characters. Kimi is also Yang Zhilin’s English name.
Yang prefers to see his company as a system that combines science, engineering, and business. You might picture it this way: above the human world, he is erecting an AI laboratory bench—with one hand he runs experiments, and with the other he brings cutting-edge technology down into the real world, discovering applications through interaction with people and delivering those applications into consumers’ hands. Ideally, the former burns through billions and tens of billions of dollars of capital; the latter earns that money back hundreds or thousands of times over. However you hear it, it sounds as thrilling—and as perilous—as walking a tightrope.
“AI is not about what PMF I can find in the next year or two; it’s about how to change the world over the next ten to twenty years,” he says.
Such abstract, idealistic thinking makes one sweat nervously on his behalf: can a young AI scientist carve out room to survive in a realist China?
In February 2024, Moonshot AI closed a large funding round against the market tide. It is understood that the company raised a Series B of more than $1 billion at a $1.5 billion pre-money valuation, led by Alibaba with follow-on participation from Monolith Management, Xiaohongshu, and others. Upon completion of the deal, Moonshot AI’s post-money valuation stood at roughly $2.5 billion—making it, at this stage, the highest-valued unicorn in China’s foundation-model race. (The company declined to respond to or comment on the matter.)
In the midst of this third funding round, we sat down with Yang Zhilin to talk about his first year of entrepreneurship—a cross-section, in miniature, of a year in which Chinese foundation-model companies raced ahead from the starting line.
His company did not set up in Sohu Network Plaza in Beijing, the hub where foundation-model companies cluster. For a company with total funding of about RMB 9 billion, this office in the Liangzi Xinzuo building looks crude and run-down. There is not even a company logo at the entrance—only a white piano standing guard by the door.
會議室位於角落;由於窗戶很小,裡面顯得昏暗,而暖氣機在對著冬日寒意吹出暖風時嗡嗡作響。
在昏黃的燈光下,楊描述了過去一年對他的感受:「有點像是開在一條路上,前方綿延著一片雪山。你不知道裡面會有什麼。你只是一直往前走,一步一步地走。」
以下是楊植麟的完整訪談。(為了可讀性,作者做了一些文字編輯。)
這張照片拍攝於 2024 年初,地點是 Kimi 在北京的第一個辦公室。他們現在已經搬離這個地方了。入口處沒有任何標誌——只有一架白色鋼琴安靜地靠在門邊。
第 1 部分
站在起點上
「你得乘上這股浪潮」
張小軍:
你最近怎麼樣?
楊植麟:
很忙——事情很多。不過我還是很興奮。我們正站在一個產業的最開始,想像空間非常大。
張小軍:
我剛進來的時候,看到你們公司入口處有一架純白色的鋼琴。
楊植麟:
上面還放著一張 Pink Floyd 的專輯。我也不知道是誰放上去的——我前幾天才突然注意到,還沒來得及問。(Pink Floyd 是發行專輯
The Dark Side of the Moon
的英國搖滾樂隊。)
張小軍:
在 2022 年 11 月 ChatGPT 發布的那一天,你在做什麼?
楊植麟:
我當時已經在為這件事做準備了——招人、組團隊、交流新的想法。看到 ChatGPT 的時候,我非常震撼。往前三到五年——甚至在 2021 年——這都是不可想像的。那種更高階的推理能力一直非常難以實現。
我感覺市場上的許多變量即將發生變化:一邊是資本,一邊是人才——也就是 AI 的核心生產要素。
如果這些變量到位了,就有可能真正做出一家能把這件事做成的公司——一個為 AGI 而生的組織,能夠從 0 到 1。
那是一個重大的頓悟。獨立創業公司顯然更合理,但這不是你想做就能立刻做成的;ChatGPT 攪動了各種變量,把生產要素重新聚攏起來。你得乘上這股浪潮。
張小軍:
在你決定創辦一家 AGI 公司之後,你做了哪些準備?你是如何湊齊資本和人才這兩個生產要素的?
楊植麟:
這是一個曲折的過程。ChatGPT 的影響擴散需要時間。有些人很早就知道,有些人很晚才知道;有些人一開始懷疑,後來震驚,最後成為信徒。找人和找錢,和時機緊密綁定。
我們從 2023 年 2 月開始集中推進第一輪融資。要是拖到 4 月,我們基本上就沒機會了。但如果放在 2022 年 12 月或 2023 年 1 月做,也不行——那時疫情還在,大家還沒真正消化這件事。
所以真正的窗口期其實只有一個月。
在美國的一個晚上,我做了一次精確的計算。算完之後,我得出的結論是:我們必須在幾個月內融到至少 1 億美元。市場上很多人那時還沒開始融資,也有很多人不相信真的能融到這麼多。但事實證明是可行的——而且還不止這些。
人才市場也開始動了起來。受 ChatGPT 啟發,很多人會在 2023 年 3 月或 4 月有這樣的想法:接下來十年,只有這件事最值得做。你得在對的時間找到對的人。再往前一兩年,人才不會聚集到這種程度。那時候更多人做的是傳統 AI 或 AI 相關業務——但都不是通用人工智能。
張小軍:
總結一下:2 月是融資窗口,3 月和 4 月是招人窗口?
楊植麟:
差不多。
張小軍:
你在美國算出那個數字的那天晚上——你當時在哪裡?你具體是怎麼算的?
楊植麟:
從 2022 年末到 2023 年初,我在美國待了一兩個月,一直在跟人交流。我是在自己住的地方算的。就是把你需要多少 FLOPs、訓練成本、推理成本,以及用戶數量都算出來。
張小軍:
當時矽谷的整體氛圍是什麼樣的?
楊植麟:
這個產品開始吸引很多早期使用者,而且主要集中在科技圈。我們自己也在那個圈子裡,所以感受得特別明顯。在矽谷的大公司裡,人們每六個月要寫一次績效評估,很多人開始用 ChatGPT 來寫。有些平時寫作不是那麼專業的人,用 ChatGPT 寫出來的評估報告交上去之後,大家看起來都一本正經。
暗流正在湧動。很多人都在考慮下一份工作,或者考慮創業。後來和我們聊過的好些朋友,之後都去創辦了公司。還有很強烈的 FOMO——害怕錯過。沒有人睡得著。無論是午夜、凌晨 1 點還是 2 點,只要你聯絡對方,大家都在。多少有點焦慮,有點 FOMO,但又非常興奮。
張小軍:
你算出需要融 1 億美元的那個晚上,熬到幾點?
楊植麟:
還好——計算本身沒有花太久。但算完之後,我不能跟太多人說。如果我說了,沒人會相信這件事能做成。
第 2 部分
技術脈絡
「把自己從無止境的雕琢中解放出來」
張小軍:
風投圈談到你的時候,會說「這位創始人很聰明,有技術魅力,團隊裡也都是技術明星。」所以在我們討論你的基礎模型創業之前,我想先從你的學術背景聊起。你本科在清華大學學的是計算機科學,博士則是在卡內基梅隆大學計算機科學學院拿的。你一直都把 AI 當作重點嗎?
楊植麟:
我出生於 1992 年,2011 年開始讀本科。從大二到現在——十多年了——我一直在這個領域。最開始我探索得比較發散,到處看;我做過一些與圖相關和多模態相關的工作。2017 年,我收斂到語言模型。當時我覺得語言模型是一個相對重要的問題;後來我開始覺得,這是唯一重要的問題。
Zhang Xiaojun:
2017 年時,AI 產業整體是怎麼理解語言模型的?這種理解又是如何演變的?
Yang Zhilin:
那時候它還只是用來對語音識別結果排序的模型。(笑。)語音片段被識別之後,會得到很多候選結果,你會用語言模型去看哪個概率最高,輸出最可能的那個。它的應用非常有限。
但你會逐漸意識到,這其實是一個基礎性問題,因為你是在對世界的概率進行建模。語言是有限的,但它是世界的一個投影;理論上,只要你把 token 空間——所有可能 token 的空間——做得足夠大,就可以構建一個通用世界模型。世界中的一切如何產生、如何發展,都可以被賦予一個概率。所有問題都可以歸結為如何估計概率。
Zhang Xiaojun:
你的學術導師都很有分量:你的博士導師是 Apple AI 負責人 Ruslan Salakhutdinov,還有 Google AI 首席科學家 William W. Cohen。兩位都橫跨產業與學界。
Yang Zhilin:
前些年,產業和學界還是更融合的,但現在這個趨勢正在發生變化:
更有價值的突破會發生在產業裡。
這是發展的必然規律。它先從探索性研究開始,然後逐漸轉向更成熟的工業化過程。這並不意味著工業化階段不需要研究,而是說純研究很難再產生有價值的突破。
Zhang Xiaojun:
你從這些知名導師身上學到了什麼?
Yang Zhilin:
我在 Google 學到的最多,那裡我實習了很長時間。我從 2018 年年底開始做基於 Transformer 的語言模型。
我最大的收穫,是讓自己從無止境的「雕花」中解放出來——那種對表面細節的執著打磨。這一點非常關鍵。
你應該看的是大方向,是大梯度。當十條路擺在你面前時,普通人會糾結於這條路上前面是否有行人,要怎麼剎車——這些短期細節。可真正最重要的是,這十條路裡你該走哪一條。
這個領域以前恰恰有這個問題。比如在只有一兩百萬 token 的數據集上,你會想怎麼把 perplexity 壓得更低,怎麼把 loss 壓得更低,怎麼提升準確率——然後就陷入無止境的雕花。人們發明了很多奇怪的架構;這些都是雕花技巧。雕完之後,你可能在那類數據集上表現更好,但你卻錯過了問題的本質。
本質是分析這個領域到底缺什麼。第一性原理是什麼?為什麼 scaling law 可以成為第一性原理?你只需要找到一個同時滿足兩個條件的結構:第一,它足夠通用;第二,它具有可擴展性。通用,意思是你可以在這個框架下對所有問題建模;可擴展,意思是只要你投入足夠的算力,它就會持續變好。
這就是我在 Google 學到的思路:如果某件事可以被更底層的東西解釋,就不要在上層過度雕花。有一個很重要的觀點我非常認同:如果一個問題可以用規模來解決,就不要用新的算法去解決它。新算法最大的價值,在於它如何讓你更好地擴展規模。當你從雕花中解放出來,你能看到的東西會多得多。
Zhang Xiaojun:
Google 當時也是 scaling law 的追隨者嗎?它是怎麼落實第一性原理思維的?
Yang Zhilin:
那裡其實已經有很多這樣的想法,但 Google 並沒有把它們執行得特別好。它是有這種思維的,但它沒辦法把自己組織成一個真正的 moonshot。更像是:這裡有五個人在做我的第一性原理,那邊又有五個人在做他們的第一性原理。沒有自上而下的統一安排。
Zhang Xiaojun:
你在博士期間,曾與圖靈獎得主 Yann LeCun 和 Yoshua Bengio 合作發表論文,而且你還是那些論文的第一作者。這些合作是怎麼促成的?我的意思是:他們是圖靈獎得主,而且也不是你的導師——你靠什麼吸引到他們?
Yang Zhilin:
學術界非常開放。只要你有一個好想法、一個有意義的問題,就可以。兩個腦袋——或者 n 個腦袋——產生的東西,一定比一個腦袋單打獨鬥更多。這在做 AGI 的時候也是一樣。AI 裡有一個很重要的策略叫做「ensembling」——用多個不同的模型或方法,把它們的預測結果結合起來,以獲得更好的表現。本質上就是在做同一件事:當你有不同的視角時,就能激發出很多新東西。合作非常有益。
Zhang Xiaojun:
你會先有一個想法,然後再問他們有沒有興趣嗎?
Yang Zhilin:
大致就是這樣。
Zhang Xiaojun:
哪個更難:在研究上拿下學術大咖,還是在融資上拿下資本大咖?兩者有什麼相似之處?
Yang Zhilin:
「拿下」這個詞不太好——它背後的本質其實是合作。合作意味著雙方都贏,因為互利是合作的前提。所以其實沒有什麼不同:你需要為別人提供獨特的價值。
Zhang Xiaojun:
你是怎麼贏得他們信任的?你覺得你的天賦是什麼?
Yang Zhilin:
沒有什麼特別的天賦——就是努力工作。
第 3 部分
舊系統已經不再管用
「AGI 需要一種新的組織形態」
Zhang Xiaojun:
你剛才說「更有價值的突破會發生在產業裡」——這是否也包括創業公司和大公司的 AI 實驗室?
Yang Zhilin:
實驗室的時代已經成為歷史。Google Brain 曾經是業界最大的 AI 實驗室,但它是一個嵌入在大公司內部的研究組織。這種組織可以探索新想法,但它很難做出一個優秀的系統——它可以做出 Transformer,卻做不出 ChatGPT。
現在開發演進的方式是,你在構建一個龐大的系統,這需要新的演算法、紮實的工程能力,甚至大量的產品與商業化工作。
這就像 2000 年代初:你不可能在實驗室裡研究資訊檢索;它必須活在真實世界裡,以一個龐大系統、帶有用戶的產品的形式存在——就像 Google。
因此,研究和教育系統的功能會逐漸轉向以培養人才為主。
張小珺:
你會如何描述這種新的系統形態?OpenAI 是它的原型嗎?
楊植麟:
它是當下這類組織中最成熟的一個,但它也還在持續演進。
張小珺:
所以,它可以被理解為一個為人類宏大科學目標而建立的組織?
楊植麟:
我想強調:它不是純科學——它是科學、工程和商業的結合。它必須是一個商業組織,一家公司,而不是研究機構。但這家公司是從零到一構建出來的,因為 AGI 需要一種新的組織形態。第一,生產方式不同於網際網路時代;第二,它從純研究轉向研究、工程、產品和商業的結合。
從本質上講,它應該是一個 moonshot 計畫,帶有大量自上而下的規劃——但在這種規劃之中仍然有創新的空間,因為並不是所有技術都是預先確定的。
自下而上的元素存在於自上而下的框架之中。
這樣的組織以前並不存在,但組織必須適應技術,因為技術決定生產方式;如果兩者不匹配,就無法有效生產。我們認為,它很可能需要從頭重新設計。
張小珺:
去年 OpenAI 董事會政變期間,Sam Altman 的一個選項是加入 Microsoft,並帶領一支新的 Microsoft AI 團隊。這和擔任 OpenAI CEO 的本質區別是什麼?
楊植麟:
你得在一種舊文化裡長出一個新組織——這是極其困難的。
張小珺:
你想打造「中國的 OpenAI」——我們可以這樣說嗎?
楊植麟:
不太準確。我們不想成為中國的任何東西,也不一定想成為 OpenAI。
第一,真正的 AGI 一定是全球性的。至少從長期來看,不存在因為市場保護機制而侷限在某個區域市場的 AGI 公司。
全球化、AGI,以及擁有非常龐大用戶基礎的產品:這三者最終都是必要條件。
第二,是否要成為 OpenAI?如果看 2017–2018 年,OpenAI 的風評其實很差。當時我們圈子裡的人找工作,一般都會考慮 Google 這類地方。很多和 Ilya Sutskever 這位 OpenAI 首席科學家聊過的人,最後都覺得這個人很瘋,而且過於自負——OpenAI 不是瘋子就是騙子。但他們很早就下注,找到了非共識,並且找到了如今 AI 領域唯一有效的第一性原理:透過 next-token prediction 做 scaling。
我相信會出現一家比 OpenAI 更偉大的公司。一家真正偉大的公司可以把技術理想主義與優秀的產品結合起來,與用戶共創——AGI 最終會是透過與所有用戶協作而產生的東西。所以它不只是技術問題;它也需要務實和對真實世界的追求——最終,是二者的完美結合。
不過,我們仍然應該向 OpenAI 的技術理想主義學習。
如果每個人都覺得你很正常——如果你的夢想是任何人都可能有的夢想——那它對人類夢想總量的貢獻就為零。
第 4 部分
Moonshot 的第一步是「長上下文」——第二步是什麼?
「接下來還有兩個大里程碑」
張小珺:
回到你決定創業的那一刻——你是在回國後立刻啟動第一輪融資的嗎?
楊植麟:
是去年 2 月在美國開始的,有一部分也是遠端進行。最後,國內投資人佔了大多數。
張小珺:
第一輪融了 1 億美元嗎?
楊植麟:
第一輪沒有那麼多;後面幾輪超過了這個數字。我們在 2023 年完成了兩輪,總共接近人民幣 20 億元。
現在是第三輪。我們還沒有正式公布融資,所以我暫時不便評論。
張小珺:
有人說,從 2023 年下半年開始,已經沒人願意投基礎模型公司了。這種說法對嗎?
楊植麟:
還是有的。你確實能看到情緒上的變化,但並不是沒人投——至少到目前為止,市場上的投資意願還是相當多的。
張小珺:
除了資本和人才之外,你們在 2023 年還做了哪些關鍵決策?
楊植麟:
決定做什麼。這就是像我們這樣的公司的優勢——在最高層面上,能以技術視野來做決策。
我們做長上下文。這要求你對未來作出判斷:你需要知道什麼是根本性的,以及下一步會朝哪裡走。還是第一性原理——「去雕刻化」的過程。如果你只聚焦於雕刻,你只能看 OpenAI 已經做了什麼,然後想辦法複製它。
你會發現,在 Kimi 裡做無損長文本壓縮,會讓產品具備獨特的體驗。當你閱讀英文論文時,它能幫你非常出色地理解內容。用今天的 Claude 或 GPT-4,不一定能做到同樣好;這需要提前鋪墊。我們為此做了超過半年。這和今天才看到長上下文趨勢,匆忙拉兩個團隊,然後以最高速度去做,是完全不同的。
當然,馬拉松才剛剛開始;接下來還會有更多分化,而這就要求你事先預判,什麼才算是「一個真正成立的非共識」。
Zhang Xiaojun:
這個決定是在幾月做出的?
Yang Zhilin:
2月或3月——公司一成立就決定了。
Zhang Xiaojun:
為什麼長上下文是登月計畫的第一步?
Yang Zhilin:
因為它是基礎。它是新電腦的記憶體。
過去幾十年,舊電腦的記憶體規模增長了好幾個數量級,新電腦也會經歷同樣的事情。它可以解決今天很多問題。比如,當前的多模態架構仍然需要 tokenizer,但如果有無損壓縮的長上下文,就不需要了——你可以直接把原始輸入放進去。再往前看,它是讓新計算範式更通用的基礎。
舊電腦可以用 0 和 1 表示一切;一切都可以被數位化。但今天的新電腦還不行——上下文還不夠,所以還沒有那麼通用。要成為一個通用的世界模型,就需要長上下文。
第二,它能實現個性化。AI 的核心價值是個性化互動;價值最終會落在個性化上,而 AGI 會比上一代推薦引擎更個性化。
但個性化不是靠微調實現的——而是靠支撐非常長的上下文。你和機器之間的全部歷史都是上下文,而這段上下文定義了個性化過程。它無法被複製,而且能帶來更直接的對話——能產生資訊的對話。
Zhang Xiaojun:
這件事還有多大的擴展空間?
Yang Zhilin:
非常大。一方面,單純擴大窗口本身還有很長的路要走——好幾個數量級。
另一方面,你不能只擴大窗口,也不能只看數字;今天窗口是幾百萬個 token 還是幾十億個 token,本身並沒有意義。你得看它在這個窗口內所能帶來的推理能力、faithfulness——對原始資訊的忠實度,以及遵循指令的能力。你不能只追一個指標;必須把指標和能力結合起來看。
如果這兩個維度持續提升,你就能做很多事情。它可以按照一段長達數萬字的指令運作,而且指令本身還可以定義很多 agent——高度個性化。
Zhang Xiaojun:
長上下文和追趕 GPT-4 背後的技術,彼此可重用嗎?它們是同一件事嗎?
Yang Zhilin:
我不這麼認為。它更像是增加了一個新維度——一個 GPT-4 還沒有的維度。
Zhang Xiaojun:
很多人說,中國頭部基礎模型公司現在做的事情都大同小異——2023 年追 GPT-3.5,2024 年追 GPT-4。你同意嗎?
Yang Zhilin:
提升通用能力確實有關鍵里程碑,所以這種說法有一定道理——作為後來者,你不可避免地要經歷追趕過程。但這也比較片面。除了通用能力之外,還有很多空間去發展有特色的能力,並在某些方向上做到 state-of-the-art。長上下文就是其中之一。DALL-E 3 的圖像生成能力,已經被 Midjourney V6 全面超越了。所以你得兩條腿走路。
Zhang Xiaojun:
在通用能力和新維度之間,時間和資源的比例大概是多少?
Yang Zhilin:
它們必須結合起來。新維度不可能脫離通用能力單獨存在,所以很難直接給出一個比例。但要把新維度做好,必須投入足夠的資源。
Zhang Xiaojun:
這些新維度都會由 Kimi 承載嗎?
Yang Zhilin:
Kimi 當然是我們非常重要的產品,我們也會有一些其他嘗試。
Zhang Xiaojun:
你怎麼看 Shixiang 創始人李廣密說的那句話——今天中國基礎模型公司的技術獨特性還不是很高?
Yang Zhilin:
我覺得挺好——我們今天已經做出了相當多的差異化。這是時間問題;今年你應該能看到更多維度。去年大家其實都是先把腳手架搭起來,先把事情跑通。
Zhang Xiaojun:
如果 moonshot 的第一步是長上下文,那第二步是什麼?
Yang Zhilin:
前面會有兩個大里程碑。第一,真正統一的世界模型——把所有不同模態統一起來,一個真正可擴展、通用的架構。
第二,讓 AI 在沒有人工資料輸入的情況下持續進化。
Zhang Xiaojun:
要多久才能到這兩個里程碑?
Yang Zhilin:
兩到三年——也可能更快。
Zhang Xiaojun:
所以三年後,我們看到的世界就已經和今天完全不同了。
Yang Zhilin:
按照目前的發展速度,是的。這項技術現在正處於萌芽、快速增長的階段。
Zhang Xiaojun:
你能想像三年後會出現什麼嗎?
Yang Zhilin:
會有一定程度的 AGI。我們今天做的很多事情,AI 也都能做——甚至比我們做得更好。但關鍵是我們怎麼使用它。
Zhang Xiaojun:
那對你來說——對 Moonshot AI 這家公司來說,第二步是什麼?
Yang Zhilin:
我們就去做那兩件事。其餘所有問題,都是由這兩個因素推導出來的。今天大家在談的推理和 agent,其實都是解決這兩個問題的副產品。還需要一些額外的打磨,但沒有根本性的阻礙。
Zhang Xiaojun:
你會全力去追趕 GPT-4 嗎?
Yang Zhilin:
GPT-4 是通往 AGI 路上的一個必要站點。關鍵不是只滿足於和 GPT-4 打平。
第一,你要問現在真正的 non-consensus 是什麼:超越 GPT-4 之後,下一步是什麼?GPT-5 和 GPT-6 應該長什麼樣?第二,你要看自己在這個範圍內有什麼獨特能力——而這更重要。
Zhang Xiaojun:
Other foundation-model companies publish their model capabilities and rankings. You don’t seem to have done that?
Yang Zhilin:
追逐排行榜名次沒有什麼意義。最好的排行榜是使用者——你應該讓使用者投票。很多排行榜都有問題。
Zhang Xiaojun:
在中國的基礎模型公司裡,率先達到 GPT-4 是你的目標嗎?快與慢有差別嗎?
Yang Zhilin:
當然有。放到足夠長的時間尺度來看,大家最後都會到。但要看你的領先或落後有多長。如果有六個月甚至更久的差距,那是有意義的——而且還要看你能不能利用這段窗口期。
Zhang Xiaojun:
你預計什麼時候能達到 GPT-4?
Yang Zhilin:
應該很快了,但具體時間我不方便公開透露。
Zhang Xiaojun:
你會是最快的嗎?
Yang Zhilin:
這得動態評估——但我們確實有機會。
Zhang Xiaojun:
推出 Kimi 之後,你的北極星指標是什麼?
Yang Zhilin:
現在就是把產品做得更好,增加更多維度。比如說,我們不應該只是圍繞一個搜尋場景拼得你死我活——搜尋之後只會是這個產品價值中的很小一部分;產品應該有更大的增量。
比傳統搜尋引擎好 10% 或 20% 並不值得什麼——只有真正顛覆性的東西,才配得上那三個字母「AGI」。
獨特的價值是你的增量智慧。這一點你一定要抓住:智慧永遠是核心的增量價值。如果只有 10%–20% 的核心價值來自 AI,那就立不住。
第 5 部分
我一點都不焦慮於商業化
「使用者擴張和模型擴張需要同時發生」
Zhang Xiaojun:
2023 年中是一個巨大的分水嶺——市場很快就從狂熱轉向冷靜。你是怎麼感受到的?
Yang Zhilin:
我不太認同這種說法——我們在下半年確實完成了一輪融資。而且新的東西還在不斷出現。今天的模型能力,在去年年底根本無法想像。越來越多 AI 公司的用戶數和收入都在持續上升。它一直在證明自己的價值。
Zhang Xiaojun:
對你來說,上下半年之間,感受最不同的是什麼?
Yang Zhilin:
沒什麼太大變化。變數當然存在,但你還是要回到第一性原理——怎麼給使用者提供一個好產品。歸根結底,我們要滿足的是使用者需求,而不是贏得一場競賽。
我們不是一家為競爭而生的公司。
Zhang Xiaojun:
業界認為,2023 年上下半年的一個顯著差異,是關注點的轉移:上半年更偏向 AGI;下半年則轉向如何落地應用、如何商業化。你有做這種轉變嗎?
Yang Zhilin:
我當然會做 AGI——這是未來十年唯一有意義的事。但這不代表我們不做應用。或者說,它不應該被定義成「應用」。
「應用」這個詞聽起來像是你有了一項技術,然後去找一個地方把它用起來,商業閉環也完成了。但「應用」不是準確的說法。它和 AGI 是相互補充的。它既是實現 AGI 的手段,也是實現 AGI 的目的。
「應用」聽起來更像是一種目的:我要讓它變得有用。你得把東西方哲學結合起來——既要賺錢,也要有理想。
今天,使用者幫我們發現了很多我們從沒想過的場景。有人拿它來篩履歷——這是我們在設計產品時根本沒想到的,但它天然就能工作。反過來,使用者輸入又會讓模型變得更好。為什麼 Midjourney 這麼好?它在使用者側做了擴張——使用者擴張和模型擴張必須同時發生。反過來,如果你只關注應用,而忽略模型能力的迭代——忽略 AGI——那你的貢獻就會很有限。
Zhang Xiaojun:
高榕創投管理合夥人朱嘯虎只投基礎模型應用。他有一個觀點:AIGC 最難的核心問題是 PMF——如果十個人都找不到 PMF,一百個人也找不到;這和人數、成本都沒關係,所以不要在這上面燒錢。他說:「在 LLaMA 上訓練兩三個月,至少能達到人類前 30 名的水平——可以立刻替代人。」你怎麼看他的觀點?
Yang Zhilin:
AI 不是我未來一兩年能找到什麼 PMF 的問題;而是未來十到二十年我如何改變世界的問題——這是兩種不同的思維方式。
我們是堅定的長期主義者。當 AGI 或更強的東西被實現之後,今天的一切都會被改寫。PMF 當然重要,但如果你急著去找 PMF,那很可能會被另一種「降維打擊」擊中——被更高維的技術碾壓。這樣的事發生過太多次了。以前很多人做客服和對話系統,做槽位填充——其中不乏規模還不錯的公司。但它們都被更高維的一擊給打沒了。那很痛苦。
這不是說這種路徑從來都行不通。假設你今天找到一個場景,現有技術已經足夠,在那裡 0 到 1 的增量價值很大,而 1 到 n 的空間沒那麼大——那這個場景就很好。Midjourney 就是這樣,或者文案生成也是——相對簡單的任務,0 到 1 的效果非常明顯。這些是純應用派的機會。但最大的機會不在那裡。如果你的前提是商業化,你就不能脫離 AGI 去思考。如果我現在只做應用——可以,但一年之後你可能就被碾壓了。
Zhang Xiaojun:
你可以悄悄升級底層模型,不是嗎?
Yang Zhilin:
但那種做法永遠不可能做得比模型本身更大。技術是這個時代唯一的新變量;其他變量都沒有變。回到第一性原理,AGI 是一切的核心。由此我們推導出:超級 App 一定需要最強的技術能力。
Zhang Xiaojun:
你們可以用開源模型嗎?(最新消息是 Google 公布了開源模型 Gemma。)
Yang Zhilin:
開源落後於閉源,這也是事實。
Zhang Xiaojun:
這種落後會不會只是暫時的?
Yang Zhilin:
目前看起來不像。
Zhang Xiaojun:
為什麼開源追不上閉源?
Yang Zhilin:
因為現在開源的方式不一樣了。以前大家都能參與開源;現在開源本身還是中心化的。
很多開源貢獻可能沒有經過算力驗證。閉源享受了人才和資本的集中,最後閉源一定會更好,這是一種整合。
如果我今天有一個領先模型,把它開源很可能是不理性的。反而是落後者可能會這麼做,或者開源一個小模型——用來攪局;畢竟如果你不開源,它本來也沒有價值。
Zhang Xiaojun:
你怎麼看待中國的焦慮?大家都說,一家基礎模型公司如果不能很快做出符合投資人預期的商業場景和產品,下一輪融資就會很難。
Yang Zhilin:
你需要在長期和短期之間取得平衡。
完全沒有用戶、沒有收入肯定不行。
正如我們看到的,從 GPT-3.5 到 GPT-4 釋放了很多應用;從 GPT-4 到 GPT-4.5,再到 GPT-5,之後很可能還會持續釋放更多,甚至指數級更多。所謂「場景的摩爾定律」,就是可用場景的數量會隨著時間指數增長。我們需要一邊提升模型能力,一邊尋找更多場景——就是這種平衡。
這是一個螺旋。取決於你的投入有多少放在短期,多少放在長期。在能活下來的前提下去追求長期。長期絕對不能放棄,否則你會錯過整個時代。今天就下結論,真的還太早了。
Zhang Xiaojun:
你認同美團聯合創始人、Light Year 創辦人王慧文提出的「雙輪驅動」嗎?
Yang Zhilin:
這個問題很好。某種程度上,邏輯是成立的。但真正怎麼做,差別很大。你能不能真正做出一些「勝率高的非共識賭注」?
Zhang Xiaojun:
據我理解,他們的雙輪驅動也需要快速找到新的應用場景;不然技術就沒有落地方式。
Yang Zhilin:
說到底,還是模型擴展和用戶擴展之間的差別。
Zhang Xiaojun:
在中國,除了你,還有誰是走模型擴展路線的?
Yang Zhilin:
這不是我能評判的。
Zhang Xiaojun:
大多數人可能走的是用戶擴展路線。或者我們可以這麼說:這是不是學術派和商業化派的差別?
Yang Zhilin:
我們不是學術派。學術派肯定是不行的。
Zhang Xiaojun:
很多基礎模型公司會通過 B2B 來商業化——畢竟 B2B 更確定。你們呢?
Yang Zhilin:
我們不做。我們從一開始就決定走 B2C。
看你要什麼。如果你知道某件事不是你想要的,那你就不會有 FOMO——因為就算得到了,也沒有多大意義。
Zhang Xiaojun:
你過去一年有焦慮嗎?
Yang Zhilin:
更多是興奮和亢奮。因為這件事我想了很久。我們大概是最早那批想去探索月球背面的人。今天你會發現自己其實是在造火箭,而且每天都在討論要加什麼燃料讓它飛得更快——以及怎麼讓它別炸掉。
Zhang Xiaojun:
總結一下你做出的「勝率高的非共識賭注」——除了 B2C 和長上下文,還有別的嗎?
Yang Zhilin:
還有更多正在路上;希望很快能和大家分享。
Zhang Xiaojun:
中國上一代創業者是靠應用和場景嘗到成功的,所以更重視產品、用戶和數據飛輪。你所代表的新一代 AI 創業者,能否代表一個新的未來?
Yang Zhilin:
我們也非常重視用戶。用戶是我們的最終目標,但這也是一個共創的過程。
最大的不同在於,這一次會更技術驅動。
這仍然是馬車和汽車的問題:我們現在正處在從馬車到汽車的躍遷中,應該盡可能聚焦於怎麼把一輛汽車提供給用戶。
Zhang Xiaojun:
你會感到孤獨嗎?
Yang Zhilin:
哈哈哈……這是個有意思的問題。我覺得還好,因為我身邊還有幾十個——接近一百個——人在和我一起奮戰。
第 6 部分
在我們還沒追上 GPT-4 之前,Sora 就來了
「現在就像影片生成的 GPT-3.5 時刻」
Zhang Xiaojun:
Sora 今年突然出現——有多少是在你的預期之內,又有多少是出乎預料的?
Yang Zhilin:
生成式 AI 能做到這種效果是在預期之內的;出乎預料的是時間點——它比我們估計的來得更早。
這也反映了現在 AI 發展有多快:很多 scaling 的紅利還沒有被充分收割。
Zhang Xiaojun:
去年,業內判斷 2024 年的基礎模型一定會在多模態敘事上激烈競爭,而且影片生成質量會像 2023 年的文生圖一樣快速提升。Sora 的技術能力是超出、達到,還是低於你的預期?
Yang Zhilin:
它解決了許多此前很難解決的問題。比如,保持生成在相對較長時間窗口內的一致性——這是關鍵點,也是巨大的提升。
Zhang Xiaojun:
這對全球產業格局意味著什麼?2024年基礎模型會看到哪些新敘事?
Yang Zhilin:
第一,短期應用價值:它可以進一步提高生產流程的效率,當然我們也希望在現有能力之上延伸出更多應用。第二,與其他模態結合。它本身就是一個世界模型;有了這些知識後,它對現有文本是一個很好的補充。在此基礎上,無論是 agents,還是與物理世界的連接,都還有相當大的空間和機會。
Zhang Xiaojun:
整體來看,你怎麼評價 Sora?
Yang Zhilin:
我們自己之前也在規劃類似方向,並且做過一段時間。方向上並沒有太出乎意料——更多是技術細節上的問題。
Zhang Xiaojun:
有哪些技術細節值得學習?
Yang Zhilin:
OpenAI 也沒有完全講清楚很多細節。他們描述了大致輪廓;有些關鍵細節,你需要從它的輸出或現有資訊中推斷,再結合我們自己早先的實驗。至少對我們來說,它為發展過程增加了更多資料點——更多的資料輸入。
Zhang Xiaojun:
和文本生成相比,視頻生成的主要瓶頸是什麼?你覺得 OpenAI 這次找到了解決方案的有哪些?
Yang Zhilin:
主要瓶頸——核心還是數據:你怎麼把數據在大規模下擬合好?這在之前沒有被驗證過,尤其是在運動很複雜、生成結果又是寫實風格的情況下。
在那種條件下,能夠擴展規模——這次它解決的就是這個。
尚未解決的部分包括,例如,需要一個統一架構。DiT 仍然不是一個非常通用的架構。
對純視覺信號的邊際概率建模可以做得很好,但你怎麼把它泛化成一個通用的新電腦?你還是需要更統一的架構——這裡仍然有空間。
Zhang Xiaojun:
你看過 OpenAI 的 Sora 報告《Video generation models as world simulators》嗎?裡面有哪些重點值得強調?
Yang Zhilin:
看過。考慮到當前的競爭情況,他們肯定不會把最重要的點寫出來。但它仍然值得學習。這本質上算是付費內容——那些你可能要自己花很多實驗成本才能學到的東西。現在你不用為那些實驗付費,也能知道其中一部分,並形成一個粗略的理解。
Zhang Xiaojun:
你從中提取出了哪些關鍵信號?
Yang Zhilin:
這件事在某種程度上是可擴展的。另外,它也比較具體地說明了架構是怎麼搭起來的。但也有可能,不同架構在這個問題上並沒有那麼本質的差別。
Zhang Xiaojun:
你認同他們那句話嗎——“Scaling video generation models is a promising path towards building general-purpose simulators of the physical world”?
Yang Zhilin:
我非常同意。這兩件事優化的是同一個目標函數——這點沒什麼疑問。
Zhang Xiaojun:
你怎麼看 Yann LeCun 再次公開反對生成式 AI?他的觀點是:“通過生成像素來對世界建模是浪費且注定失敗的。生成之所以在文本上奏效,只是因為文本是離散的,符號數量有限。在這種情況下,處理預測中的不確定性很容易;而處理高維連續感官輸入中的預測不確定性則是不可行的。”
Yang Zhilin:我現在認為,當你對視頻的邊際概率建模時,本質上就是無損壓縮——和語言模型裡的 next-token prediction 沒有本質區別。只要你壓縮得足夠好,你就能解釋這個世界上任何可以被解釋的東西。
但還有一項重要工作要做:它如何與那些已經被壓縮過的能力結合?你可以把它看作兩種不同的壓縮。一種是對原始世界的壓縮——這就是視頻模型在做的事。另一種是對人類產生的行為的壓縮,因為人類行為經過了人類大腦——世界上唯一產生智能的東西。
你可以把視頻模型看作在做第一種,文本模型在做第二種,雖然視頻模型中也包含了一些第二種:有些人類製作的視頻包含了其創作者的智能。最終,這大概會是一個混合體——你需要通過這兩種方式從不同角度學習,而它們都會促進智能的增長。
所以,生成也許不是目標;它只是壓縮函數。只要你壓縮得足夠好,最終生成就會非常好。反過來,如果一個模型本身都不能生成,那它還有可能壓縮得極好嗎?這很可疑。也許生成得非常好,是壓縮得非常好的必要條件。
Zhang Xiaojun:
Sora 和去年的 ChatGPT 是兩個不同的里程碑。哪個更大?
Yang Zhilin:
兩者都非常重要。
現在有點像視頻生成的 GPT-3.5 時刻——一個階躍式提升。
模型現在還相對較小,可以預見之後還會有更大的模型,而更大的模型意味著能力上的確定性提升。
Zhang Xiaojun:
也有人說,對於多模態來說,Google Gemini 的突破更重要。
Yang Zhilin:
Gemini 走的是 GPT-4V 那條線,也把那種理解納入進來。兩者都很重要;最後一步是把這些東西放進同一個模型裡,而這件事還沒有被解決。
Zhang Xiaojun:
為什麼把它們放進同一個模型這麼難?
Yang Zhilin:
目前還沒有人知道怎麼做。現在還沒有經過驗證的架構。
Zhang Xiaojun:
Sora + GPT 會產生什麼?
Yang Zhilin:
Sora 可以立即應用於影片製作,但如果與語言模型結合,就能連接數位世界與實體世界。你也可以更端到端地完成任務,因為你對世界的建模現在比以前更好——它甚至可以用來提升你對多模態輸入的理解。所以到最後,你可以相當流暢地在不同模態之間切換。
總結來說:你更理解這個世界;你能在數位世界中完成更多端到端任務;而且你甚至可以搭起通往實體世界的橋樑,去完成那裡的任務。這就是起點。
例如,自動駕駛,或者一些家務——理論上,這些都是連接實體世界的例子。所以數位世界的突破是確定的,但它也潛藏著通往實體世界的路徑。
Zhang Xiaojun:
Sora 對中國基礎模型公司意味著什麼?正確的應對是什麼?
Yang Zhilin:
其實沒什麼變化。這一直都是一個確定的方向。
Zhang Xiaojun:
中國的基礎模型還沒有追上 GPT-4,現在 Sora 又來了。你怎麼看?這兩個世界似乎越來越遠了——你會感到焦慮嗎?
Yang Zhilin:
這只是客觀事實。不過實際差距可能仍在縮小——這就是技術發展的規律。
Zhang Xiaojun:
你的意思是什麼?技術曲線一開始很陡,之後才逐漸趨平?
Yang Zhilin:
對。我其實不太意外——OpenAI 一直在做下一代模型。客觀上,差距會持續一段時間,中國不同公司之間的差距也會持續一段時間——這是一個技術爆發期。
但再過兩三年,中國的頭部公司有可能在這裡把更多基礎工作做好——包括技術基礎設施、人才儲備,以及組織文化的沉澱。經過這樣的打磨,它們在某些方面就更有可能領先——但這需要一些耐心。
Zhang Xiaojun:
中國和美國最後會走出完全不同的 AI 技術生態嗎?
Yang Zhilin:
如果從產品和商業化角度看,生態可能會不同。但如果從技術角度看,通用能力不會走向完全不同的技術路線——基礎的通用能力肯定會是相似的。因為 AGI 的空間很大,所以更有可能是在通用能力之上出現分化。
Zhang Xiaojun:
矽谷有一個長期爭論:「一個模型通吃」和「多個專用(更小)的模型」——是用一個通用模型處理各種任務,還是用許多專用的小模型處理特定任務。你的看法是什麼?
Yang Zhilin:
我傾向於第一種看法。
Zhang Xiaojun:
在這一點上,中美會有很大分歧嗎?
Yang Zhilin:
我認為最終不會。
第 7 部分
我接受失敗是有可能的
「它已經改變了我的生活」
Zhang Xiaojun:
基礎模型創業在中國是一種相當奇特的生物:你融了這麼多錢,但看起來其中很大一部分都花在科學實驗上。在這種情況下,你怎麼說服投資人掏錢?
Yang Zhilin:
和在美國沒什麼不同。
我們今天融到的錢其實甚至不算多。
所以我們還有很多要向 OpenAI 學習的地方。
Zhang Xiaojun:
我想知道:要達到 GPT-4 還需要多少錢?要達到 Sora 呢?
Yang Zhilin:
GPT-4 和 Sora 都不需要那麼多錢。現在的錢更多是為下一代——或者再下一代——模型預留的,用於前沿探索。
Zhang Xiaojun:
中國的基礎模型初創公司拿了巨頭的錢,但巨頭也在訓練自己的模型。你怎麼看基礎模型初創公司和巨頭之間的關係?
Yang Zhilin:
既有競爭,也有合作。巨頭和初創公司的首要任務不同。看今天任何一家大型科技公司:它的首要任務都和一家 AGI 公司的首要任務不同。你的首要任務會塑造你的行動和結果,最終也決定了生態中的不同關係。
Zhang Xiaojun:
為什麼巨頭會把小額投資分散到多家基礎模型公司,而不是重注一家?
Yang Zhilin:
這是階段問題。
未來會有更多整合——公司也會更少。
Zhang Xiaojun:
有人說基礎模型公司的終局是被巨頭收購。你同意嗎?
Yang Zhilin:
我覺得不一定。但它們很可能會有非常深入的合作。
Zhang Xiaojun:
例如,可能會怎麼合作?
Yang Zhilin:
OpenAI 和 Microsoft 是經典的合作模式。其中很多地方都可以參考,也有一些地方可以做得更好。
Zhang Xiaojun:
過去一年,創業的曲折主要體現在什麼地方?
Yang Zhilin:
有很多外部變量——資本、人才、GPU、產品、研發、技術。既有高光時刻,也有需要克服的困難。就拿 GPU 來說。
中間有很多反覆拉鋸:供應緊張了一陣子,之後又改善了。
最極端的那段時間,價格是按天變的——一台機器今天可能是 260,明天是 340,兩天後又跌回去。這是一個持續變動的局面,你得盯得很緊。
價格一直在變,所以策略也一直在變:用哪個渠道、是買還是租——選項很多。
Zhang Xiaojun:
這些波動是由什麼驅動的?
Yang Zhilin:
出於地緣政治原因;生產本身也是分批次進行;而且市場情緒也會發揮作用。我們觀察到很多公司開始退回 GPU,意識到自己其實不一定需要訓練這個模型。隨著市場情緒和人們的決策變化,供需也隨之變化。好消息是,整體供應最近已經大幅改善。
我個人的判斷是,至少在未來一到兩年內,GPU 不會成為主要瓶頸。
Zhang Xiaojun:
你似乎一直在思考組織問題。你是怎麼進行團隊建設的?
Yang Zhilin:
我們的招聘方法是逐步演變的。AGI 人才在全球範圍內都極其稀缺,而且具備相關經驗的人也很少。我們最早的招聘標準,是去找那些在直接相關技能上很出色的天才。這一點非常成功。那些以前曾經對模型「動過手術」的人,親自訓練過超大規模模型,做事速度非常快。Kimi 的推出就包括在內——資本效率和組織效率其實都很高。
Zhang Xiaojun:
花了多少錢?
Yang Zhilin:
相當小的一個數字——和很多其他支出相比,算是用小錢辦大事。很長一段時間我們都只有 30–40 人。現在是 80 人。我們追求人才密度。
後來的人才結構發生了變化。最早的時候我們招的是天才,因為我們相信他們的上限很高——一家公司的上限由它的人才上限決定。後來我們又補充了更多維度的人才:產品運營側的人、領導型的人、能把事情做到極致的人。現在這是一支更完整、更有韌性、能打仗的團隊。
Zhang Xiaojun:
在中國做了一年基礎模型創業之後,你怎麼評價目前的里程碑成果?
Yang Zhilin:
我們已經造出了火箭原型,現在正在做點火測試。我們組建了團隊,弄清楚了一些燃料配方,也算是大致看到了 PMF 的雛形。可以說,我們已經邁出了登月計劃的第一步。
Zhang Xiaojun:
你怎麼看 Yann LeCun 的觀點?他對目前的技術路線並不樂觀——他認為自監督語言模型無法真正獲得對世界的知識,而隨著模型規模擴大,出錯的概率——機器幻覺——只會增加。他提出了「world model」的概念。
Yang Zhilin:
沒有根本瓶頸。當 token 空間足夠大時,它就會變成一種新的電腦,用來解決通用問題——而這就是一個通用世界模型。
他這個說法背後有一個很重要的點:大家都能看到當前的侷限。但解決方案未必需要一個全新的框架。在 AI 裡真正有效的,只有 next-token prediction 加上 scaling law。只要 token 足夠完整,什麼都可以做。當然,他指出的問題今天確實存在——但你可以通過把 token 空間做得非常通用來解決。就這麼簡單。
Zhang Xiaojun:
所以他是在放大這些侷限。
Yang Zhilin:
我覺得是這樣。底層第一性原理是對的——只是還有一些小的技術問題沒解決。
Zhang Xiaojun:
你怎麼看深度學習之父 Geoffrey Hinton 一再強調 AI 安全?
Yang Zhilin:
他對安全的重視,其實說明他對未來技術能力的提升有極大的信心。這兩者是相反的。
Zhang Xiaojun:
你怎麼解決幻覺問題?
Yang Zhilin:
還是 scaling law——只是你擴展的是不同的東西。
Zhang Xiaojun:
最後 scaling law 會不會被證明是一條死路?這種可能性有多大?
Yang Zhilin:
概率大約是零。
Zhang Xiaojun:
你怎麼看你的 CMU 校友 Qi Lu 的觀點:OpenAI 一定會比 Google 更大——只是不知道是大一倍、五倍還是十倍?
Yang Zhilin:
未來最成功的 AGI 公司一定會比今天所有公司都更大——這一點毫無疑問。
最終,這可能會相當於 GDP 的兩倍或三倍。未必是 OpenAI,也可能是另一家公司。但一定會有這樣一家公司。
Zhang Xiaojun:
如果你恰好成了這個 AI 帝國的 CEO,你會怎麼保護人類?
Yang Zhilin:
現在去想這個問題,還缺少一些前提條件。但我們當然願意與社會中的不同力量合作、向他們學習,包括在模型裡加入更多安全措施。
Zhang Xiaojun:
你對 2024 年的目標是什麼?
Yang Zhilin:
第一,技術突破——我們現在應該能夠做出一個比 2023 年好得多的模型。第二,用戶和產品——我希望能有更多大規模用戶,以及更強的留存。
Zhang Xiaojun:
你對 2024 年全球基礎模型產業有什麼預測?
Yang Zhilin:
今年會出現更多能力,但格局不會和今天有太大不同——頭部幾家仍然會領先。在能力上,年下半年應該會有一些相當大的突破,很多會來自 OpenAI;它肯定有下一代模型——可能是 4.5,也可能是 5。這感覺是一個高概率事件。視頻生成模型肯定還能繼續擴展。
Zhang Xiaojun:
那你對中國基礎模型產業在 2024 年的預測呢?
Yang Zhilin:
第一,你會看到新的、差異化的能力出現。中國模型——由於更早的投入以及擁有合適的團隊——會在某些維度上達到世界領先的能力。第二,會出現用戶規模大得多的產品——這是高度概率事件。第三,路線選擇會進一步整合與分化。
Zhang Xiaojun:
在創辦這家公司的過程中,你最害怕的一件事是什麼?
Yang Zhilin:
其實沒什麼——就是要無所畏懼地往前衝。
Zhang Xiaojun:
你有什麼想對同業說的嗎?
Yang Zhilin:
讓我們一起繼續努力。
Zhang Xiaojun:
請說出一個你對基礎模型產業還不知道答案、但最想知道的問題。
Yang Zhilin:
我不知道 AGI 的天花板會是什麼樣子——它會造就怎樣的公司,以及那家公司又會創造出什麼樣的產品。這是我現在最想知道的。
Zhang Xiaojun:
隨著 AGI 這樣持續發展,你最不想看到的是什麼?
Yang Zhilin:
我對它相當樂觀。它能把人類文明帶到下一個階段。
Zhang Xiaojun:
有人說過你太理想主義了嗎?
Yang Zhilin:
我們也非常腳踏實地。我們其實已經做出了一些真正的東西——我們不只是空談。
Zhang Xiaojun:
如果你今天募到的錢,是你這輩子最後拿到的資金,你會怎麼花?
Yang Zhilin:
我希望那永遠不會發生,因為我們未來還需要更多很多的錢。
Zhang Xiaojun:
如果你沒有成功,你會把自己視為失敗嗎?
Yang Zhilin:
那其實沒那麼重要——我接受失敗是有可能的。
這段旅程已經徹底改變了我的人生,我心懷感激。
(完)
內容僅供參考,不構成投資、法律、稅務或財務建議。