與 Kimi 創辦人楊植麟對談:走向綿延而未知的雪山
Moonshot AI 創辦人楊植麟暢談 AGI、Scaling Law、Kimi、商業化、Sora,以及為何通用人工智慧需要一種組織形態……

編輯註:本文是 Zhang Xiaojun 於 2024 年 3 月 1 日發表的對 Yang Zhilin 訪談之英文譯文;譯文由 Kimi K3 生成,並由作者於 2026 年 7 月在 X 上轉載。正文內容保持英文原文不變。

這是我與 Yang Zhilin 的第一次訪談,於 2024 年初進行,並在 2024 年 3 月 1 日發表——正好是 Kimi 成立一週年。當時,Kimi 只有 80 人,在他們的第一間辦公室裡工作;那間辦公室相當破舊。入口處沒有 logo。門旁只有一架白色鋼琴守著。
這篇文章當時在中國科技圈引起了相當大的轟動。
那時候,我還是一名紙媒記者,所以這次訪談只以文字稿和音頻播客的形式存在。
正如我們所看到的,這篇文章中提出的許多觀點,後來都得到了印證。
只要重讀兩年前的這些句子,你真的會不禁驚嘆於世界在如此短的時間內竟發生了多麼劇烈的變化!
(本譯文由 Kimi K3 生成。)
Yang Zhilin: “如果人人都認為你是普通人——如果你的夢想是一個任何人都可能擁有的夢想——那它就不會為人類的夢想總量增加任何東西。”
By Zhang Xiaojun
僅僅一年前,AI 科學家 Yang Zhilin 在矽谷做了一次精確計算。他意識到,如果決定啟動一家面向 AGI 的 foundation-model 創業公司,那麼他需要在未來幾個月內募到超過 1 億美元。
但那僅僅只是拿到入場券。又過了一年,這個數字已經增加了十三倍。
對於 foundation-model 公司而言,競爭與其說是一場科學競賽,不如說首先是一場殘酷的金錢戰爭。當投資人捂緊錢包時,你就必須在融資、購買更多 GPU、以及爭取更多人才方面跑得比對手更快。
“它要求人才的集中,也要求資本的集中,” Yang Zhilin,Moonshot AI 的創辦人兼 CEO 說。Moonshot AI 是一家 foundation-model 公司,成立於 2023 年 3 月 1 日。
在過去的一年裡,中國的 foundation-model 公司似乎一直處在一條緊繃而受壓的生存線上。表面上看,每家公司手裡都握有可觀的現金。但一方面,他們必須立刻把新融到的錢投入極其昂貴的研究,以追趕 OpenAI——先是追平 GPT-3.5,還沒來得及觸及 GPT-4,Sora 又出現了。另一方面,他們又必須不斷奔跑,去尋找可行的真實應用場景,以證明自己是公司而不是只會燒錢的研究院。即便如此,這還不夠:對於每一個這樣的項目,無論退出路徑是 IPO 還是 M&A,離場之路仍然完全不清晰。
在中國的 foundation-model 創辦人中,Yang Zhilin 是最年輕的一位,生於 1992 年。這個行業把他描述為一位堅定相信 AGI 的人,也是一位罕見具有技術魅力的創辦人。他的大部分學術與職業履歷都與通用 AI 相關,而且他的論文已被引用超過 22,000 次。
2023 年中,中國科技圈對 foundation models 的態度突然從亢奮轉為冷淡,而加速落地應用則成為主流的務實旋律。這不可避免地把 foundation-model CEO 們撕扯在理想與現實之間。
在中國 AI 生態中,人人都在高喊 PMF(product/market fit),人人也都在高喊商業化,這位經過嚴格訓練的 AI 研究者型創辦人卻並不著急。
Moonshot AI 只有 80 人,是中國頭部 foundation-model 公司中人數最少的之一。與競爭對手不同,Yang 沒有選擇更安全的 B2B 模式,也沒有試圖切入醫療或遊戲等垂直領域。他打造的是一款——且只有一款——消費級產品:AI 助手 Kimi,支持輸入最多 200,000 個中文字符。Kimi 也是 Yang Zhilin 的英文名。
Yang 喜歡把自己的公司看作一個結合科學、工程與商業的系統。你可以這樣想像:在人的世界之上,他正在搭建一個 AI 實驗台——一隻手做實驗,另一隻手把先進技術帶入現實世界,通過與人的互動去發現應用,並把這些應用交到消費者手中。理想情況下,前者會燒掉數十億到數百億美元的資本;後者則把那筆錢賺回來,賺上百倍甚至千倍。怎麼聽都好,這都像是在鋼絲上行走,既令人興奮又危險。
“AI 不是我在一兩年內能找到什麼 PMF;而是十年到二十年後如何改變世界,”他說。
這種抽象而理想化的思維方式,讓人不由得替他捏一把汗:一位年輕的 AI 科學家,真的能在一個務實的中國開闢出生存空間嗎?
2024 年 2 月,Moonshot AI 頂著市場逆風完成了一輪大額融資。據悉,公司完成了超過 10 億美元的 B 輪融資,投前估值超過 15 億美元,由 Alibaba 領投,Monolith Management、Xiaohongshu 等跟投。交易完成後,Moonshot AI 的投後估值約為 25 億美元——使該公司在當時成為中國 foundation-model 競賽中估值最高的獨角獸。(公司拒絕就此事回應或置評。)
在這第三輪融資中,我們與 Yang Zhilin 坐下來談了他創業的第一年——這也是中國 foundation-model 公司從起跑線上疾速衝出的那一年的一個縮影。
Công ty của ông không đặt văn phòng tại Sohu Network Plaza ở Bắc Kinh, nơi tập trung các công ty foundation-model. Đối với một công ty có tổng vốn huy động khoảng 9 tỷ RMB, văn phòng này trong tòa nhà Liangzi Xinzuo trông thô sơ và xuống cấp. Thậm chí ở lối vào cũng không có logo công ty—chỉ có một cây đàn piano màu trắng đứng gác cạnh cửa.
Phòng họp nằm ở một góc; với những ô cửa sổ nhỏ, bên trong khá tối, và máy sưởi rì rầm khi thổi luồng khí ấm chống lại cái lạnh mùa đông.
Trong ánh sáng lờ mờ, Yang mô tả năm vừa qua đã cảm nhận thế nào với anh: “Nó hơi giống như đang lái xe trên một con đường mà phía trước là dãy núi tuyết trải dài. Bạn không biết bên trong đó có gì. Bạn chỉ có thể cứ thế đi về phía trước, từng bước một.”
Dưới đây là toàn bộ cuộc phỏng vấn với Yang Zhilin. (Để dễ đọc, tác giả đã chỉnh sửa một số chỗ trong văn bản.)
Bức ảnh này được chụp vào đầu năm 2024 tại văn phòng đầu tiên của Kimi ở Bắc Kinh. Giờ họ đã chuyển khỏi địa điểm này. Không có logo nào dọc lối vào — chỉ có một cây đàn piano màu trắng lặng lẽ đứng cạnh cửa.
Phần 1
站在起點
“你必須乘上這股浪潮”
Zhang Xiaojun:
Dạo này bạn thế nào?
Yang Zhilin:
Bận—có rất nhiều việc đang diễn ra. Nhưng tôi vẫn rất háo hức. Chúng tôi đang đứng ở ngay điểm khởi đầu của một ngành, và còn vô cùng nhiều không gian để tưởng tượng.
Zhang Xiaojun:
Lúc nãy khi tôi bước vào, tôi thấy một cây đàn piano trắng tinh ở lối vào công ty bạn.
Yang Zhilin:
Trên đó còn có một album của Pink Floyd nữa. Tôi cũng không biết ai đặt chúng ở đó—mấy ngày trước tôi mới bất ngờ nhìn thấy và chưa kịp hỏi. (Pink Floyd là ban nhạc rock Anh đã phát hành album
The Dark Side of the Moon
.)
Zhang Xiaojun:
Vào ngày ChatGPT được phát hành vào tháng 11 năm 2022, bạn đang làm gì?
Yang Zhilin:
Tôi đã chuẩn bị cho việc này từ trước rồi—tuyển người, xây dựng đội ngũ, trao đổi những ý tưởng mới. Khi nhìn thấy ChatGPT, tôi vô cùng phấn khích. Ba đến năm năm trước—thậm chí là vào năm 2021—điều đó gần như là không thể tưởng tượng được. Kiểu suy luận bậc cao như vậy trước đó rất khó đạt được.
Tôi cảm nhận rằng nhiều biến số của thị trường sắp thay đổi: vốn ở một phía, nhân tài ở phía còn lại—những yếu tố sản xuất cốt lõi cho AI.
Nếu những biến số đó vào đúng vị trí, thì sẽ có thể xây dựng một công ty tử tế để làm việc này—một tổ chức được tạo ra cho AGI có thể đi từ 0 đến 1.
Đó là một sự ngộ ra lớn. Một công ty độc lập nghe có lý hơn, nhưng đó không phải là thứ bạn có thể làm ngay khi bạn muốn; ChatGPT đã làm các biến số rung chuyển và đưa các yếu tố sản xuất lại gần nhau. Bạn phải cưỡi lên làn sóng.
Zhang Xiaojun:
Sau khi bạn quyết định thành lập một công ty AGI, bạn đã chuẩn bị những gì? Bạn đã tập hợp hai yếu tố sản xuất—vốn và nhân tài—như thế nào?
Yang Zhilin:
Đó là một quá trình quanh co. ChatGPT cần thời gian để lan tỏa. Có người biết sớm, có người biết muộn; có người ban đầu hoài nghi, rồi sốc, rồi trở thành người tin tưởng. Việc tìm người và tìm tiền đều gắn chặt với thời điểm.
Chúng tôi bắt đầu tập trung vào vòng gọi vốn đầu tiên vào tháng 2 năm 2023. Nếu trì hoãn đến tháng 4, về cơ bản chúng tôi sẽ không còn cơ hội. Nhưng làm vào tháng 12 năm 2022 hoặc tháng 1 năm 2023 cũng không ổn—đại dịch khi đó vẫn còn, và mọi người vẫn chưa kịp tiêu hóa nó.
Vì vậy, cửa sổ thực sự chỉ có một tháng.
Một đêm ở Hoa Kỳ, tôi đã làm một phép tính rất chính xác. Khi tính xong, tôi kết luận rằng chúng tôi cần huy động ít nhất 100 million 美元 trong vòng vài tháng. Nhiều người trên thị trường khi đó vẫn chưa bắt đầu gọi vốn, và nhiều người không tin rằng bạn có thể huy động được con số đó. Nhưng cuối cùng lại làm được—thậm chí còn hơn thế.
Thị trường nhân tài cũng bắt đầu chuyển động. Được ChatGPT truyền cảm hứng, nhiều người trong tháng 3 hoặc tháng 4 năm 2023 đã có nhận thức này: đây là điều duy nhất đáng làm trong mười năm tới. Bạn phải tiếp cận đúng người vào đúng thời điểm. Một hoặc hai năm trước đó, nhân tài sẽ không tụ lại đến mức này. Khi ấy, nhiều người hơn đang làm AI truyền thống hoặc các mảng liên quan đến AI—không phải AI mục đích tổng quát.
Zhang Xiaojun:
Tóm lại: tháng 2 là cửa sổ cho gọi vốn, còn tháng 3 và tháng 4 là cửa sổ cho tuyển dụng?
Yang Zhilin:
Đại khái là vậy.
Zhang Xiaojun:
Đêm đó ở Mỹ—bạn ở đâu khi làm phép tính này? Bạn đã tính cụ thể như thế nào?
Yang Zhilin:
Từ cuối năm 2022 sang đầu năm 2023, tôi đã ở Mỹ khoảng một, hai tháng, nói chuyện với mọi người. Tôi làm nó ở nơi mình đang sống. Bạn tính xem cần bao nhiêu FLOPs, chi phí huấn luyện, suy luận, và số lượng người dùng.
Zhang Xiaojun:
Vào thời điểm đó, bầu không khí chủ đạo ở Thung lũng Silicon là gì?
Yang Zhilin:
Sản phẩm bắt đầu thu hút nhiều người dùng sớm, tập trung trong vòng tròn công nghệ. Chúng tôi cũng ở trong vòng tròn đó, nên cảm nhận rất rõ. Ở các công ty lớn tại Thung lũng Silicon, mọi người cứ sáu tháng lại phải viết đánh giá hiệu suất, và nhiều người đã bắt đầu viết chúng bằng ChatGPT. Có những người trước đây viết lách không mấy chuyên nghiệp lại nộp các bản đánh giá được viết bằng ChatGPT, và ai trông cũng hết sức nghiêm túc.
Những dòng chảy ngầm đang nổi lên. Nhiều người đang nghĩ về công việc tiếp theo của mình hoặc về việc khởi nghiệp. Khá nhiều người bạn từng nói chuyện với chúng tôi sau đó đã đi lập startup. Và có một nỗi FOMO rất mạnh—sợ bỏ lỡ cơ hội. Không ai ngủ được. Bất kể là nửa đêm, 1 giờ sáng hay 2 giờ sáng, nếu bạn liên hệ, họ luôn ở đó. Hơi lo lắng, hơi FOMO, và rất phấn khích.
Zhang Xiaojun:
Đêm bạn tính ra cần huy động 100 triệu đô la—bạn thức đến mấy giờ?
Yang Zhilin:
Cũng ổn—bản thân phép tính không mất nhiều thời gian. Nhưng sau đó, tôi không thể nói cho quá nhiều người biết. Nếu tôi nói ra, sẽ chẳng ai tin là có thể làm được.
Phần 2
技術譜系
“把自己從無止境的雕琢中解放出來”
Zhang Xiaojun:
當風險投資人談到你時,他們會說:「創辦人非常出色,很有技術氣質,而且整個團隊都是技術明星。」所以在談你的 foundation-model 公司之前,我想先從你的學術背景談起。你大學時在清華大學學電腦科學,之後又在 Carnegie Mellon 的 School of Computer Science 取得博士學位。AI 一直都是你的重心嗎?
Yang Zhilin:
我生於 1992 年,2011 年開始讀大學。從大二到現在——超過十年——我一直都在這個領域。最初我探索得相當分散,四處看看;我曾做過一些與圖相關和多模態的工作。到了 2017 年,我開始聚焦於語言模型。那時我覺得語言模型是一個相對重要的問題;後來我逐漸認為,那是唯一重要的問題。
Zhang Xiaojun:
2017 年時,AI 領域一般如何看待語言模型?這種認知後來又是怎麼變化的?
Yang Zhilin:
那時它只是一個用來對語音辨識結果排序的模型。(笑。)一段音訊被辨識之後,你會得到很多候選結果,然後用語言模型來看哪個結果的機率最高,並輸出最可能發生的那個結果。它的應用非常有限。
但後來你會發現這其實是一個基礎性問題,因為你在建模世界的機率。語言是有限的,但它是世界的一個投影;從理論上說,如果你把 token 空間——所有可能 token 的空間——做得足夠大,你就可以建立一個通用的世界模型。這個世界中的一切如何形成與演化,都可以被賦予一個機率。所有問題都可以歸結為機率估計。
Zhang Xiaojun:
你的學術導師都非常有名:你的 PhD 指導老師是 Apple 的 AI 負責人 Ruslan Salakhutdinov,以及 Google AI 的首席科學家 William W. Cohen。兩人都站在產業與學術的交界。
Yang Zhilin:
在前些年,產業與學術的聯繫更緊密,但現在的趨勢正在轉變:
更有價值的突破會發生在產業中。
這是必然的發展規律。它從探索性研究開始,並逐漸轉向更成熟的工業化流程。這並不意味著在工業化階段研究就不再必要——只是純研究會更難產生有價值的突破。
Zhang Xiaojun:
你從這些知名導師身上學到了什麼?
Yang Zhilin:
我在 Google 學到最多,那裡我實習了很長一段時間。我在 2018 年底開始做基於 Transformer 的語言模型。
我學到最多的是,讓自己從無止境的「雕琢」中解放出來——也就是對表面細節過度精修的執念。這一點非常重要。
你應該看大方向是什麼,看大的 gradient 是什麼。當你面前有十條路時,普通人會去擔心怎麼在這條路上為前方行人煞車——那些短期細節。但更重要的是,這十條路裡到底該選哪一條。
這個領域以前確實有這樣的問題。比如,在只有一兩百萬 token 的資料集上,你會去看怎麼把 perplexity 壓得更低、怎麼把 loss 拉得更低、怎麼提高準確率——然後就會陷入無止境的雕琢。人們發明了很多奇怪的架構;那些都是雕琢式技巧。雕琢之後,你確實能在那類資料集上表現更好,但你也會錯過問題的本質。
本質在於分析這個領域缺少什麼。第一性原理是什麼?為什麼 scaling law 可以成為第一性原理?你只需要找到一個同時滿足兩個條件的結構:第一,它足夠通用;第二,它可以擴展規模。通用意味著你能在這個框架下建模所有問題;可擴展意味著只要你投入足夠的 compute,它就會持續變好。
這就是我在 Google 學到的思維:如果某件事可以用更基礎的東西解釋,你就不應該在上層做過度雕琢。有一句我非常認同的話非常重要:如果一個問題可以靠規模解決,那就不要用新算法去解決。新算法最大的價值在於,它能讓你如何更好地擴展規模。當你擺脫雕琢之後,你就能看到更多很多。
Zhang Xiaojun:
Google 當時也是 scaling law 的追隨者嗎?他們是如何實踐第一性原理思維的?
Yang Zhilin:
那裡確實存在許多這樣的想法,但 Google 並沒有把它們執行得特別好。他們有那種思維,但沒能把它組織成一次真正的 moonshot。情況就像:這邊有五個人追求我的第一性原理,那邊有五個人追求他們的。並沒有自上而下的指揮。
Zhang Xiaojun:
在讀博期間,你曾與圖靈獎得主 Yann LeCun 和 Yoshua Bengio 合作發表論文——而且你是那些論文的第一作者。這些合作是怎麼促成的?我的意思是:他們是圖靈獎得主,而且也不是你的導師——你憑什麼吸引到他們?
Yang Zhilin:
學術界非常開放。只要你有一個好想法和一個有意義的問題就行。兩個大腦——或者 n 個大腦——產生的東西通常比單一大腦更多。這在發展 AGI 時也同樣成立。AI 中有一個重要策略叫做「ensembling」——使用多個不同的模型或方法,並結合它們的預測,以獲得更好的效能。其實本質上做的是同一件事:當你有很多多元視角時,你可以激發出很多新東西。合作帶來的收益非常大。
Zhang Xiaojun:
你會先有想法,然後再去問他們有沒有興趣嗎?
Yang Zhilin:
大致上是這樣。
Zhang Xiaojun:
Cái nào khó hơn: thuyết phục các cây đại thụ học thuật trong nghiên cứu, hay thuyết phục các cây đại thụ về vốn trong gọi vốn? Có điểm tương đồng gì?
Yang Zhilin:
“Thuyết phục” không phải là một cách nói hay—bản chất đằng sau nó là hợp tác. Hợp tác có nghĩa là đôi bên cùng thắng, vì lợi ích tương hỗ là tiền đề cho hợp tác. Nên thực ra không có khác biệt gì: bạn cần mang lại giá trị độc đáo cho người khác.
Zhang Xiaojun:
Làm sao để bạn giành được niềm tin của họ? Bạn nghĩ món quà của mình là gì?
Yang Zhilin:
Không có món quà đặc biệt nào cả—chỉ là làm việc chăm chỉ.
Phần 3
Hệ thống cũ không còn hoạt động nữa
“AGI cần một loại tổ chức mới”
Zhang Xiaojun:
Bạn vừa nói “những đột phá có giá trị hơn sẽ xảy ra trong công nghiệp”—điều đó có bao gồm các startup và các phòng thí nghiệm AI của những gã khổng lồ không?
Yang Zhilin:
Labs là lịch sử. Google Brain từng là phòng thí nghiệm AI lớn nhất trong ngành, nhưng nó là một tổ chức nghiên cứu nằm bên trong một công ty lớn. Loại tổ chức đó có thể khám phá ý tưởng mới, nhưng rất khó để tạo ra một hệ thống tuyệt vời—nó có thể tạo ra Transformer, nhưng không thể tạo ra ChatGPT.
Cách phát triển hiện nay tiến hóa là bạn đang xây dựng một hệ thống khổng lồ, điều này đòi hỏi những thuật toán mới, kỹ thuật vững chắc, và thậm chí cả rất nhiều công việc về sản phẩm và thương mại hóa.
Nó giống như đầu những năm 2000: bạn không thể nghiên cứu truy hồi thông tin trong một phòng lab; nó phải tồn tại trong thế giới thực, như một hệ thống khổng lồ, một sản phẩm có người dùng—như Google.
Vì vậy, các hệ thống nghiên cứu và giáo dục sẽ chuyển chức năng của mình sang chủ yếu là nuôi dưỡng nhân tài.
Zhang Xiaojun:
Anh sẽ mô tả hình thức hệ thống mới này như thế nào? OpenAI có phải là nguyên mẫu của nó không?
Yang Zhilin:
Đó là tổ chức trưởng thành nhất thuộc loại này hiện nay, và nó vẫn đang tiến hóa dần dần.
Zhang Xiaojun:
Vậy có thể hiểu nó là một tổ chức được thành lập cho những mục tiêu khoa học vĩ đại của nhân loại?
Yang Zhilin:
Tôi muốn nhấn mạnh: nó không phải khoa học thuần túy—mà là sự kết hợp giữa khoa học, kỹ thuật và kinh doanh. Nó phải là một tổ chức thương mại, một công ty, chứ không phải một viện nghiên cứu. Nhưng công ty này được xây dựng từ zero đến one, vì AGI cần một loại tổ chức mới. Thứ nhất, phương thức sản xuất khác với kỷ nguyên internet; thứ hai, nó chuyển từ nghiên cứu thuần túy sang sự kết hợp giữa nghiên cứu, kỹ thuật, sản phẩm và kinh doanh.
Cốt lõi của nó nên là một chương trình moonshot, với rất nhiều quy hoạch từ trên xuống—nhưng trong khuôn khổ đó vẫn có chỗ cho đổi mới, vì không phải toàn bộ công nghệ đều được xác định sẵn.
Các yếu tố từ dưới lên tồn tại trong một khung từ trên xuống.
Một tổ chức như vậy trước đây chưa từng tồn tại, nhưng tổ chức đó phải thích ứng với công nghệ, vì công nghệ quyết định phương thức sản xuất; nếu chúng không khớp, bạn không thể sản xuất hiệu quả. Chúng tôi tin rằng rất có thể nó cần được thiết kế lại từ đầu.
Zhang Xiaojun:
Trong cuộc đảo chính tại phòng họp hội đồng quản trị của OpenAI năm ngoái, một lựa chọn cho Sam Altman là gia nhập Microsoft và lãnh đạo một đội AI mới của Microsoft. Sự khác biệt cốt lõi giữa điều đó và việc làm CEO của OpenAI là gì?
Yang Zhilin:
Bạn sẽ phải nuôi dưỡng một tổ chức mới bên trong một nền văn hóa cũ—và điều đó cực kỳ khó.
Zhang Xiaojun:
Anh muốn xây dựng “OpenAI của Trung Quốc”—chúng ta có thể nói như vậy không?
Yang Zhilin:
Không hoàn toàn chính xác. Chúng tôi không muốn là bất cứ thứ gì của Trung Quốc, và cũng không nhất thiết muốn là OpenAI.
Thứ nhất, AGI thực sự chắc chắn sẽ mang tính toàn cầu. Ít nhất là về lâu dài, không có chuyện một công ty AGI bị giới hạn trong một thị trường khu vực nào đó vì các cơ chế bảo hộ thị trường.
Toàn cầu hóa, AGI, và có một sản phẩm với lượng người dùng rất lớn: ba điều này cuối cùng đều là những điều kiện cần thiết.
Thứ hai, có nên là OpenAI không? Nếu nhìn vào giai đoạn 2017–2018, OpenAI có danh tiếng rất tệ. Khi mọi người trong vòng của chúng tôi tìm việc, họ thường xem xét những nơi như Google. Rất nhiều người từng nói chuyện với Ilya Sutskever, nhà khoa học trưởng của OpenAI, sau đó đều nghĩ rằng người này điên và quá tự cao—OpenAI hoặc là lũ điên hoặc là kẻ lừa đảo. Nhưng họ đã cam kết từ rất sớm, tìm ra điều phi đồng thuận, và tìm ra thứ hiện nay là nguyên lý đầu tiên duy nhất hoạt động trong AI: scaling thông qua dự đoán token tiếp theo.
Tôi tin rằng sẽ có một công ty lớn hơn OpenAI. Một công ty thực sự vĩ đại có thể kết hợp lý tưởng công nghệ với một sản phẩm tuyệt vời, đồng sáng tạo cùng người dùng—AGI cuối cùng sẽ là thứ được tạo ra bằng cách làm việc chung với tất cả người dùng của nó. Vì vậy, nó không chỉ là vấn đề công nghệ; nó còn đòi hỏi tính thực dụng và những theo đuổi trong thế giới thực—cuối cùng là sự kết hợp hoàn hảo giữa cả hai.
Dù vậy, chúng ta nên học hỏi từ chủ nghĩa lý tưởng công nghệ của OpenAI.
Nếu mọi người đều nghĩ bạn bình thường—nếu giấc mơ của bạn là thứ bất kỳ ai cũng có thể mơ—thì nó sẽ không đóng góp gì vào tổng thể những giấc mơ của nhân loại.
Phần 4
Moonshot 的第一步是“long context”——那第二步是什麼?
“Hai cột mốc lớn tiếp theo sắp đến”
Zhang Xiaojun:
Quay lại thời điểm anh quyết định thành lập công ty—anh đã khởi động vòng gọi vốn đầu tiên ngay sau khi trở về Trung Quốc sao?
Yang Zhilin:
Nó bắt đầu ở Mỹ vào tháng 2 (năm ngoái), một phần được thực hiện từ xa. Cuối cùng, các nhà đầu tư trong nước chiếm đa số.
Zhang Xiaojun:
Vòng đầu tiên đã huy động 100 triệu USD phải không?
Yang Zhilin:
Vòng đầu tiên không nhiều đến vậy; các vòng sau thì vượt con số đó. Chúng tôi đã hoàn thành hai vòng trong năm 2023, tổng cộng gần 2 tỷ RMB.
Hiện tại đây là vòng thứ ba. Chúng tôi chưa công bố chính thức khoản tài trợ, nên tôi chưa thể bình luận lúc này.
Zhang Xiaojun:
Có người nói rằng từ nửa sau năm 2023, không còn ai muốn đầu tư vào các công ty mô hình nền tảng nữa. Họ sai à?
Yang Zhilin:
仍然有。確實可以看到情緒上的變化,但並不是沒有人投資——至少目前,市場上仍然有相當多的投資關注。
Zhang Xiaojun:
除了資本和人員之外,您在 2023 年還做了哪些關鍵決策?
Yang Zhilin:
決定要做什麼。這就是像我們這樣公司的優勢——有技術視野,能在最高層級做決策。
我們做 long context。這要求對未來作出判斷:你需要知道什麼是基礎,接下來一切會走向何方。再一次,這是第一性原理——「de-carving」的過程。如果你專注於 carving,你只能看 OpenAI 做了什麼,然後想辦法把它重現出來。
你會看到,Kimi 中的無損長文本壓縮為產品帶來了獨特的體驗。當你閱讀英文文章時,它能驚人地幫助你理解它們。今天使用 Claude 或 GPT-4,你未必能做得這麼好;這需要事先打好基礎。我們已經為此工作了半年多。這與今天看到 long-context 趨勢後,立刻把兩個團隊湊在一起、以最快速度開發是非常不同的。
當然,馬拉松才剛剛開始;未來還會有更多差異化,而這要求你提前預判什麼才算是「一個與眾不同但仍然正確的判斷。」
Zhang Xiaojun:
這個決定是在幾月做出的?
Yang Zhilin:
二月或三月——公司一成立,這個決定就已經定下來了。
Zhang Xiaojun:
為什麼長上下文是 moonshot 的第一步?
Yang Zhilin:
因為它是基礎性的。它是新電腦的記憶體。
舊電腦的記憶體在過去幾十年裡提升了好幾個數量級,而新電腦也會發生同樣的事情。它可以解決今天的很多問題。例如,當前的多模態架構仍然需要 tokenizer,但如果有無損壓縮的長上下文,你就不需要它了——你可以直接把原始輸入送進去。更進一步,它是讓新的計算模型變得更通用的基礎。
舊電腦可以用 0 和 1 表達一切;一切都可以被數位化。但今天的新電腦還做不到——上下文還不夠,所以還不夠通用。要成為一個通用的 world model,你就需要長上下文。
第二,它使個人化成為可能。AI 的核心價值是個人化交互;最終價值會落到個人化,而 AGI 會比上一代推薦系統更具個人化。
但個人化不是通過 fine-tuning 實現的——而是通過支持非常長的上下文。你和機器之間的全部歷史就是上下文,而這些上下文決定了個人化的過程。它無法被複製,並且會產生更直接的對話——一場能產生資訊的對話。
Zhang Xiaojun:
把這件事再往上擴展,還有多少空間?
Yang Zhilin:
非常大。一方面,單是擴大窗口本身就還有很多空間——很多個數量級。
另一方面,你不能只擴大窗口,也不能只看數字;現在窗口是幾百萬 token 還是幾十億 token,這本身沒有太大意義。你必須看它在這個窗口內帶來的推理能力、忠實度——也就是對原始資訊的貼合程度——以及遵循指令的能力。你不應該追逐單一指標;必須把指標和能力結合起來。
如果這兩個維度持續改進,你就能做很多事情。它可以遵循一條長達數萬字的指令,而這條指令本身又可以定義出很多 agents——非常個人化。
Zhang Xiaojun:
long context 背後的技術,和追趕 GPT-4 是可以互相復用的嗎?它們是一回事嗎?
Yang Zhilin:
我不這麼認為。這更像是增加了一個新的維度——一個 GPT-4 沒有的維度。
Zhang Xiaojun:
很多人說,中國的頭部基礎模型公司現在都在大致做同一件事——2023 年追 GPT-3.5,2024 年追 GPT-4。您同意嗎?
Yang Zhilin:
提升通用能力當然有一些關鍵里程碑,所以這個說法在某種程度上是對的——作為後來者,你必然要經歷追趕的過程。但它也有局限。除了通用能力之外,還有很多空間去發展特定能力,並在某些方向上做到 state-of-the-art。Long context 就是一個例子。DALL-E 3 的影像生成能力被 Midjourney V6 完全拉開了差距。所以你必須兩方面都做。
Zhang Xiaojun:
投入通用能力和新維度的時間與資源比例大概是多少?
Yang Zhilin:
它們必須結合起來。新維度不可能脫離通用能力單獨存在,所以很難直接給出一個比例。但仍然需要足夠大的投入,才能把新維度做好。
Zhang Xiaojun:
所有這些新維度都會由 Kimi 承擔嗎?
Yang Zhilin:
Kimi 肯定是我們非常重要的一個產品,我們也會有一些其他嘗試。
Zhang Xiaojun:
您怎麼看 Shixiang 創辦人 Li Guangmi 的評價——中國基礎模型公司的技術特色目前還不是很高?
Yang Zhilin:
我覺得也還好——現在我們已經做出了相當多的差異化。主要還是時間問題;今年你會看到更多維度。去年,大家還只是先把腳手架搭起來,讓一切先跑起來。
Zhang Xiaojun:
如果 moonshot 的第一步是 long context,那第二步是什麼?
Yang Zhilin:
前面會有兩個大里程碑。第一,一個真正統一的 world model——一個統一所有不同模態的模型,一個真正可擴展、且具有通用性的架構。
第二,讓 AI 在不需要人類輸入資料的情況下繼續進化。
Zhang Xiaojun:
要多久才能達到這兩個里程碑?
Yang Zhilin:
兩到三年——可能還更快。
Zhang Xiaojun:
那麼三年後,我們看到的世界就會和現在完全不同了。
Yang Zhilin:
以目前的發展速度來看,是的。技術現在正處於萌芽階段,增長非常快。
Zhang Xiaojun:
你能想像三年後會出現什麼嗎?
Yang Zhilin:
會出現某種程度的 AGI。今天我們做的很多事情,AI 也會做得到——甚至做得比我們更好。但關鍵在於,我們如何使用它。
Zhang Xiaojun:
那對你來說——對 Moonshot AI 作為一家公司來說——第二步是什麼?
Yang Zhilin:
我們會去做那兩件事。其餘所有問題都源自這兩個因素。今天大家在談的推理和 agents,都是解決這兩個問題的副產品。還需要一點打磨,但沒有根本性的障礙。
Zhang Xiaojun:
你會全力去追趕 GPT-4 嗎?
Yang Zhilin:
GPT-4 是通往 AGI 之路上一個必要的停靠點。關鍵不在於滿足於只是做到和 GPT-4 一樣。
第一,你必須問現在真正的非共識是什麼:除了 GPT-4 之外,下一步是什麼?GPT-5 和 GPT-6 應該是什麼樣子?第二,你必須看看自己在其中有哪些獨特能力——而這更重要。
Zhang Xiaojun:
其他基礎模型公司都會公布自己的模型能力和排行榜。看起來你還沒有這麼做?
Yang Zhilin:
追逐排行榜上的名次沒有太大意義。最好的排行榜是用戶——你應該讓用戶來投票。很多排行榜都有問題。
Zhang Xiaojun:
成為中國第一家達到 GPT-4 的基礎模型公司,這是你的目標嗎?快或慢會有差別嗎?
Yang Zhilin:
當然有。在足夠長的時間尺度下,最後大家都會達到。但問題在於,你是領先還是落後了多久。六個月或更長的差距是有意義的——而且這也取決於你能把那段時間用來做什麼。
Zhang Xiaojun:
你預計什麼時候能達到 GPT-4?
Yang Zhilin:
應該會相當快,但我不能向公眾公布具體時間。
Zhang Xiaojun:
你會是最快的嗎?
Yang Zhilin:
這要靈活看待——但我們確實有真正的機會。
Zhang Xiaojun:
在推出 Kimi 之後,你的 North Star 指標是什麼?
Yang Zhilin:
目前是讓產品更好,並增加更多維度。比如說,我們不應該只為了一個搜尋場景而拼得你死我活——未來搜尋只會是這個產品價值中很小的一部分;產品必須有大得多的增長。
比傳統搜尋工具好 10% 或 20% 算不了什麼——只有真正具有突破性的東西才配得上 "AGI" 這三個字。
你的獨特價值是你的增量智慧。你必須守住這一點:智慧始終是核心增值。如果產品核心價值只有 10%–20% 來自 AI,那它就站不住腳。
第 5 部分
我完全不擔心商業化
“用戶規模和模型規模需要同步發生”
Zhang Xiaojun:
2023 年年中是一個非常大的轉折點——市場從狂熱迅速轉冷。你怎麼看這件事?
Yang Zhilin:
我並不完全同意這種描述——我們在下半年還完成了一輪融資。而且新的東西還在不斷出現。如今的模型能力,在去年底是無法想像的。越來越多 AI 公司的用戶數和收入仍在持續增長。它一直在證明自己的價值。
Zhang Xiaojun:
對你來說,年初和年中之後有什麼不同?
Yang Zhilin:
沒有太大變化。當然會有一些變量,但最終你還是會回到第一性原理——如何給用戶帶來一個好產品。歸根到底,我們必須滿足用戶需求,而不是去贏一場競賽。
我們不是一家為競爭而建立的公司。
Zhang Xiaojun:
這個行業認為,2023 年上半年和下半年之間最顯著的差異,是重心的轉移:上半年更偏向 AGI;下半年則轉向如何把應用落地和商業化。你有做這種轉移嗎?
Yang Zhilin:
當然,我會做 AGI——這是未來十年裡唯一有意義的事情。但這不代表我們不做應用。或者更準確地說,它不應該被定義為一個“應用”。
“應用”聽起來像是你先有了一項技術,然後去找地方使用它,並且商業閉環已經形成。但“應用”不是精確的說法。它和 AGI 是互補的。它既是通往 AGI 的手段,也是抵達 AGI 的目的。
“應用”聽起來更像一個目的:我想讓它變得有用。你必須結合東方和西方的哲學——你必須賺錢,也必須有理想。
今天,用戶幫我們發現了我們從未想到過的場景。有人用它來篩選 résumé——這是我們在設計產品時從未想到過的,但它自然就運作起來了。反過來,用戶輸入也讓模型變得更好。為什麼 Midjourney 會那麼好?它是在用戶側擴張起來的——用戶規模和模型規模必須同步發生。反過來,如果你只專注於應用,而忽略了持續迭代模型能力——忽略 AGI——那麼你的貢獻就會非常有限。
Zhang Xiaojun:
GSR Ventures 的管理合夥人 Zhu Xiaohu,只投資基礎模型應用。他的一個觀點是:最難的核心問題是 AIGC 的 PMF——如果十個人找不到 PMF,那一百個人也一樣;這跟人數或成本沒什麼關係,所以不要把錢燒在上面。他說,「在 LLaMA 上訓練兩三個月,你至少可以達到 top 30 人員的水準——它可以立刻取代人。」你怎麼看這個觀點?
Yang Zhilin:
AI 不是我在一兩年內能找到什麼 PMF;而是如何在十到二十年內改變世界——這是兩種不同的思維方式。
我們是堅定的長期主義者。當 AGI 或更強的東西被實現時,今天的一切都會被改寫。PMF 當然重要,但如果你急著去找 PMF,很可能會再遭到一次「降維打擊」——被更高維度的技術碾壓。這種事已經發生過太多次了。過去,很多人做客服和對話系統、做 slot filling——有些公司規模也還不錯。但最後都被更高維度的一擊掃平了。很痛苦。
這不是說這種做法從來沒有效。假設今天你找到一個場景,現有技術已經足夠,在那裡 0-to-1 的增量價值極大,而 1-to-n 的空間又不算太大——那樣的場景就很好。Midjourney 就是這樣,或者廣告內容生成——相對簡單的任務,0-to-1 效應非常明顯。那是只做應用一方的機會。但最大的機會不在那裡。如果你的前提是商業化,你不能把它和 AGI 分開來看。如果我現在只是做應用——可以,但一年內你可能就會被碾壓。
Zhang Xiaojun:
你可以在下面悄悄升級基礎模型,對吧?
Yang Zhilin:
但那樣做永遠不可能比模型本身更大。技術是這個時代唯一的新變量;其他變量都沒有變。回到第一性原理,AGI 是一切的核心。由此我們推導出:一個超級應用必然需要最強的技術能力。
Zhang Xiaojun:
可以用開源模型嗎?(最新消息是 Google 公布了開源模型 Gemma。)
Yang Zhilin:
開源正在落後於閉源——這也是一個事實。
Zhang Xiaojun:
這種落後有可能只是暫時的嗎?
Yang Zhilin:
至少到目前為止,看起來不像。
Zhang Xiaojun:
為什麼開源追不上閉源?
Yang Zhilin:
因為現在開源的發展方式已經不同了。以前,任何人都可以為開源做貢獻;今天,開源本身仍然是中心化的。
很多對開源的貢獻可能還沒有經過算力驗證。閉源受益於人才和資本的集中,因此最後閉源一定會更好——這是一個中心化的過程。
如果今天我有一個領先模型,把它開源很可能是不合理的。也許只有落後的人才會這麼做,或者開源一個小模型——用來攪動市場;畢竟,如果你不開源,它也沒有什麼價值。
Zhang Xiaojun:
怎麼應對中國的焦慮?大家都說,如果一個基礎模型公司不能儘快做出商業化場景和滿足投資人預期的產品,就很難拿到下一輪融資。
Yang Zhilin:
需要在長期和短期之間取得平衡。
完全沒有用戶、沒有收入,當然不行。
正如我們所看到的,從 GPT-3.5 到 GPT-4 解鎖了很多應用;從 GPT-4 到 GPT-4.5 再到 GPT-5,很可能還會解鎖更多——甚至是指數級地更多。所謂「場景的摩爾定律」就是可用場景的數量會隨時間指數增長。我們需要一邊提升模型能力,一邊尋找更多場景——這樣一種平衡。
這是一個飛輪。它取決於你的投資有多少比例放在短期上,又有多少比例放在長期上。你之所以追求長期,是建立在能夠活下來的前提之上。長期絕對不能忽視,否則你就會錯過整個時代。現在下結論其實還為時過早。
Zhang Xiaojun:
您同意由 Meituan 聯合創辦人、Light Year 創始人 Wang Huiwen 提出的「雙輪驅動」想法嗎?
Yang Zhilin:
這是一個好問題。在某種程度上,那個邏輯是成立的。但真正拉開差距的是你的執行方式。你真的能否執行那些「具有優勢概率的非共識賭注」?
Zhang Xiaojun:
據我理解,他們的雙輪驅動也要求快速找到新的應用場景;否則技術就沒有辦法落地。
Yang Zhilin:
歸根結底,還是模型擴展與用戶擴展之間的差別。
Zhang Xiaojun:
在中國,除了您之外還有誰走模型擴展這條路?
Yang Zhilin:
這不是我能評價的事情。
Zhang Xiaojun:
也許大多數人都走用戶擴展路線。或者換個說法:這是不是學術派和商業化派之間的差別?
Yang Zhilin:
我們不是學術派。學術派肯定不行。
Zhang Xiaojun:
很多基礎模型公司通過 B2B 實現商業化——畢竟 B2B 的確定性更高。那你們呢?
Yang Zhilin:
我們不是。從第一天起,我們就決定走 B2C。
這取決於你想要什麼。如果你知道有些東西不是你想要的,你就不會有 FOMO——因為即便得到了,也沒什麼意義。
Zhang Xiaojun:
在過去一年裡,您有感到焦慮嗎?
Yang Zhilin:
更多的是亢奮和興奮。因為這件事我已經想了很久了。也許我們是最早想去探索月球背面的人之一。今天,你會意識到自己其實是在造一枚火箭,而且每天都在討論該加哪種燃料讓它跑得更快——以及怎麼避免它爆炸。
Zhang Xiaojun:
總結一下您做過那些「不合群但有利可圖」的押注——除了 B2C 和 long context 之外,還有什麼嗎?
Yang Zhilin:
還有很多正在推進;我希望能很快和大家分享。
Zhang Xiaojun:
中國上一代創業者已經在應用和場景裡嘗到了成功,所以他們更聚焦於產品、用戶和數據飛輪。您所代表的新一代 AI 創業者,能否創造一個新的未來?
Yang Zhilin:
我們也非常關注用戶。用戶是我們的最終目標,但這也是一個共同創造的過程。
最大的不同在於,這一次會更多由技術驅動。
還是那個馬車和汽車的問題:我們正處在從馬車到汽車的躍遷中,應該把全部精力放在如何為用戶造出一輛汽車上。
Zhang Xiaojun:
您會感到孤獨嗎?
Yang Zhilin:
哈哈哈……這個問題挺有意思的。我覺得還好,因為我身邊還有幾十個——接近上百個——人在一起戰鬥。
第 6 部分
在我們趕上 GPT-4 之前,Sora 已經出現了
「目前就像是 GPT-3.5 之於影片生成的時刻」
Zhang Xiaojun:
Sora 今年突然出現——有多少在您的預料之中,又有多少是不在預料之中的?
Yang Zhilin:
生成式 AI 能達到這種效果,是在預料之中的;意外的是時間點——它比我們估計得更早到來了。
這也反映出 AI 目前發展得有多快:很多規模化帶來的收益,還遠遠沒有被充分收穫。
Zhang Xiaojun:
去年,業界認為 2024 年的基礎模型肯定會在多模態故事上激烈競爭,而且影片生成品質的提升會像 2023 年的 text-to-image 那樣快。Sora 的技術能力超出、達到,還是低於您的預期?
Yang Zhilin:
它解決了很多以前非常難的問題。比如,在相對較長的時間內保持生成過程的一致性——這是關鍵點,也是非常大的改進。
Zhang Xiaojun:
這對全球產業格局意味著什麼?在 2024 年,基礎模型會出現哪些新的敘事?
Yang Zhilin:
第一,短期應用價值:它可以持續提升生產流程效率,當然我們也期待在現有能力之上構建出更多擴展。第二,與其他方式結合。它本身就是一個世界模型;有了這種知識,它對現有文字能力是絕佳的補充。在此基礎上,無論是在 agent 還是在與物理世界連接方面,都還有相當多的空間和機會。
Zhang Xiaojun:
總體來看,您如何評價 Sora?
Yang Zhilin:
我們也曾經規劃過一個類似方向,而且已經在上面工作了一段時間。就方向而言,這並不算太意外——主要是技術細節上。
Zhang Xiaojun:
有哪些技術細節值得借鑒?
Yang Zhilin:
OpenAI 也沒有把其中很多點解釋得很完整。他們只描述了大方向;而那些關鍵細節,你得從它的輸出或已有資訊,再結合我們之前的實驗去反推。至少對我們來說,這為研發過程提供了更多數據點——增加了數據輸入。
Zhang Xiaojun:
相比文字生成,影片生成的核心瓶頸是什麼?這一次您認為 OpenAI 找到了什麼解法?
Yang Zhilin:
最大的瓶頸——核心仍然是數據:如何在大規模下對齊數據?這在之前沒有被驗證過,尤其是在動作複雜、生成結果又像照片一樣逼真的情況下。
在這種條件下,能夠擴大規模——這就是這次它解決的問題。
尚未解決的部分包括,例如,對統一架構的需求。DiT 還不是一個足夠通用的架構。
對純視覺訊號的邊際概率建模可以做得很好,但如何把它泛化成一台新的、通用的計算機?這仍然需要更統一的架構——那裡還有空間。
Zhang Xiaojun:
您讀過 OpenAI 的 Sora 報告《Video generation models as world simulators》嗎?其中哪些點值得強調?
Yang Zhilin:
我讀過。以目前的競爭情況來看,他們肯定不會把最重要的點寫出來。不過它仍然非常值得學習。基本上這是已經付費的內容——那些如果不是這樣,你可能得花很多實驗成本才能學到的東西。現在你不用為那些實驗付錢,就能先知道其中一部分,並形成初步理解。
Zhang Xiaojun:
您從中提煉出的關鍵信號是什麼?
Yang Zhilin:
這個東西可以擴展到一定程度。另外,它也相當具體地描述了架構是如何搭建的。但也有可能,不同架構對這個問題並不會造成那樣本質性的差異。
Zhang Xiaojun:
您同意他們的這句話嗎——「將影片生成模型擴展規模,是構建物理世界通用模擬器的一條很有前景的路徑」?
Yang Zhilin:
我完全同意。這兩件事優化的是同一個目標函數——這幾乎沒有什麼可懷疑的。
Zhang Xiaojun:
Ông nghĩ gì về việc Yann LeCun một lần nữa lên tiếng phản đối AI sinh? Quan điểm của ông ấy: 「Mô hình hóa thế giới bằng cách sinh pixel là lãng phí và chắc chắn sẽ thất bại. Sinh ra vốn dĩ hoạt động với văn bản vì văn bản là rời rạc, với số lượng ký hiệu hữu hạn. Trong trường hợp đó, xử lý bất định trong dự đoán là dễ; còn xử lý bất định dự đoán trong các đầu vào cảm giác liên tục nhiều chiều là không thể giải quyết được.」
Yang Zhilin: Giờ tôi nghĩ rằng khi bạn mô hình hóa xác suất biên của video, bản chất là nén không mất mát — không có khác biệt bản chất nào so với dự đoán token tiếp theo trong các mô hình ngôn ngữ. Chỉ cần bạn nén đủ tốt, bạn có thể giải thích bất cứ điều gì trong thế giới này vốn có thể được giải thích.
Nhưng vẫn còn những công việc quan trọng chưa hoàn thành: nó kết hợp với những năng lực đã được nén như thế nào? Bạn có thể xem đó là hai loại nén khác nhau. Một loại nén thế giới thô nguyên bản — đó là việc các mô hình video làm. Loại còn lại nén những hành vi mà con người tạo ra, bởi vì hành vi của con người đã đi qua bộ não người — thứ duy nhất trong thế giới tạo ra trí tuệ.
Bạn có thể xem mô hình video là làm loại thứ nhất và mô hình văn bản là loại thứ hai, dù mô hình video cũng chứa một phần của loại thứ hai: một số video do con người tạo ra chứa đựng trí tuệ của người tạo ra chúng. Cuối cùng, có lẽ sẽ là sự pha trộn — bạn cần học từ nhiều góc độ thông qua cả hai cách tiếp cận, và cả hai đều góp phần vào sự tăng trưởng của trí tuệ.
Vì vậy, sinh ra có lẽ không phải là mục tiêu; nó chỉ đơn thuần là hàm nén. Nếu bạn nén đủ tốt, việc sinh ra cuối cùng sẽ rất tốt. Ngược lại, nếu bản thân một mô hình không thể sinh ra, liệu nó còn có thể nén cực kỳ tốt không? Điều đó đáng nghi ngờ. Có thể sinh ra rất tốt là điều kiện cần để nén rất tốt.
Zhang Xiaojun:
Sora và ChatGPT của năm ngoái là hai cột mốc khác nhau. Cái nào lớn hơn?
Yang Zhilin:
Cả hai đều rất quan trọng.
Hiện tại nó khá giống thời điểm GPT-3.5 đối với sinh video — một bước nhảy bậc thang.
Mô hình vẫn còn tương đối nhỏ, và có thể thấy trước rằng sẽ có những mô hình lớn hơn, điều này đồng nghĩa với cải thiện năng lực là chắc chắn.
Zhang Xiaojun:
Một số người cũng cho rằng, xét về đa phương thức, đột phá của Google Gemini còn quan trọng hơn.
Yang Zhilin:
Gemini đi theo hướng GPT-4V và cũng bao gồm cả hiểu biết đó. Cả hai đều quan trọng; bước cuối cùng là đưa tất cả những thứ này vào cùng một mô hình, và điều đó vẫn chưa được giải quyết.
Zhang Xiaojun:
Vì sao việc đưa chúng vào cùng một mô hình lại khó đến vậy?
Yang Zhilin:
Hiện chưa ai biết cách cả. Vẫn chưa có kiến trúc nào được kiểm chứng.
Zhang Xiaojun:
Sora + GPT sẽ tạo ra gì?
Yang Zhilin:
Sora có thể được áp dụng ngay vào sản xuất video, nhưng nếu kết hợp với các mô hình ngôn ngữ, nó có thể nối kết thế giới số và thế giới vật lý. Bạn cũng có thể hoàn thành nhiệm vụ theo cách end-to-end hơn, vì mô hình hóa thế giới của bạn giờ đã tốt hơn trước—nó thậm chí có thể được dùng để cải thiện khả năng hiểu đầu vào đa phương thức. Vì vậy, cuối cùng bạn có thể chuyển đổi khá linh hoạt giữa các phương thức.
Tóm lại: bạn hiểu thế giới tốt hơn; bạn có thể làm nhiều nhiệm vụ end-to-end hơn trong thế giới số; và bạn thậm chí có thể xây một cây cầu sang thế giới vật lý để hoàn thành nhiệm vụ ở đó. Đây là điểm khởi đầu.
Ví dụ như lái xe tự động, hoặc một số việc nhà—về lý thuyết, tất cả đều là những trường hợp kết nối với thế giới vật lý. Vì vậy, đột phá trong thế giới số là chắc chắn, nhưng nó cũng hàm chứa tiềm năng trở thành một con đường tiến tới thế giới vật lý.
Zhang Xiaojun:
Sora có ý nghĩa gì đối với các công ty mô hình nền tảng của Trung Quốc? Đáp lại như thế nào là đúng?
Yang Zhilin:
Nó không thay đổi nhiều. Đây vốn dĩ luôn là một hướng đi chắc chắn.
Zhang Xiaojun:
Các mô hình nền tảng của Trung Quốc vẫn chưa bắt kịp GPT-4, và giờ Sora đã xuất hiện. Anh nghĩ sao? Hai thế giới dường như đang ngày càng tách xa nhau—anh có thấy lo lắng không?
Yang Zhilin:
Đó chỉ là một факт khách quan. Nhưng khoảng cách thực tế có lẽ vẫn đang thu hẹp dần—đó là quy luật phát triển của công nghệ.
Zhang Xiaojun:
Ý anh là gì? Rằng đường cong công nghệ lúc đầu dốc rồi dần dần phẳng ra?
Yang Zhilin:
Đúng vậy. Tôi cũng không quá ngạc nhiên—OpenAI vẫn luôn phát triển các mô hình thế hệ tiếp theo. Về mặt khách quan, khoảng cách đó sẽ còn tồn tại một thời gian, và khoảng cách giữa các công ty Trung Quốc khác nhau cũng sẽ còn tồn tại một thời gian—đây là giai đoạn bùng nổ công nghệ.
Nhưng thêm hai hoặc ba năm nữa, rất có thể các công ty hàng đầu của Trung Quốc sẽ làm tốt hơn phần việc nền tảng ở đây—including hạ tầng kỹ thuật, dự trữ nhân tài và sự lắng đọng của văn hóa tổ chức. Với quá trình mài giũa đó, họ sẽ có nhiều khả năng dẫn đầu ở một số khía cạnh nhất định hơn—but cần có chút kiên nhẫn.
Zhang Xiaojun:
Trung Quốc và Mỹ có thể cuối cùng sẽ hình thành những hệ sinh thái công nghệ AI hoàn toàn khác nhau không?
Yang Zhilin:
Các hệ sinh thái có thể khác nhau, nếu nhìn từ góc độ sản phẩm và thương mại hóa. Nhưng từ góc độ công nghệ, các năng lực tổng quát sẽ không đi theo những lộ trình kỹ thuật hoàn toàn khác nhau—những năng lực tổng quát cơ bản chắc chắn sẽ tương tự nhau. Bởi vì không gian của AGI rất rộng, nên sự khác biệt hóa trên nền tảng các năng lực tổng quát nhiều khả năng sẽ xảy ra hơn.
Zhang Xiaojun:
Ở Silicon Valley có một cuộc tranh luận kéo dài: 「một mô hình thống trị tất cả」 hay 「nhiều (mô hình nhỏ) chuyên biệt」—một mô hình tổng quát cho mọi loại nhiệm vụ, hay nhiều mô hình nhỏ chuyên biệt cho các nhiệm vụ cụ thể. Quan điểm của anh thế nào?
Yang Zhilin:
Tôi đứng về quan điểm thứ nhất.
Zhang Xiaojun:
Về điểm này, Trung Quốc và Mỹ có sẽ phân hóa rất lớn không?
Yang Zhilin:
Tôi không nghĩ vậy, về lâu dài.
Phần 7
Tôi Chấp Nhận Rằng Thất Bại Là Một Khả Năng
「Nó Đã Thay Đổi Cuộc Đời Tôi」
Zhang Xiaojun:
在中國做平台模型創業,是一種相當特別的生物:你已經募了很多錢,但看起來大部分都拿去做科學實驗了。你是怎麼在這種情況下說服投資人掏錢的?
Yang Zhilin:
跟在美國沒什麼不同。
截至目前,我們募到的資金也還沒那麼多。
所以我們仍然有很多要向 OpenAI 學習的地方。
Zhang Xiaojun:
我想知道:要多少錢才能達到 GPT-4?要多少才能達到 Sora?
Yang Zhilin:
GPT-4 和 Sora 都不需要那麼多。現在的資金主要是為了下一代——或者再下一代——的模型,以及探索前沿。
Zhang Xiaojun:
中國的平台模型新創從大公司那裡拿到了錢,但大公司也在自己訓練模型。你怎麼看平台模型新創與大公司之間的關係?
Yang Zhilin:
既有競爭,也有合作。大公司和新創的第一優先事項不同。看看今天任何一家大型科技公司:它們的第一優先事項和一家 AGI 公司的第一優先事項不同。你的第一優先事項會塑造你的行動與結果,並最終決定生態系統中不同的關係。
Zhang Xiaojun:
為什麼大公司會把小額投資分散到很多平台模型公司,而不是重押一家?
Yang Zhilin:
這是階段性的問題。
之後還會有更多整合——公司數量也會更少。
Zhang Xiaojun:
有些人說,平台模型公司的最終結局是被大公司收購。你同意嗎?
Yang Zhilin:
我不認為一定是這樣。但他們很可能會建立非常深度的合作關係。
Zhang Xiaojun:
例如,他們可以如何合作?
Yang Zhilin:
OpenAI 和 Microsoft 就是經典的合作模式。大多可以借鑑,一部分可以改進。
Zhang Xiaojun:
過去一年,創業的轉折點在哪裡顯現出來?
Yang Zhilin:
外部變數很多——資本、人才、GPU、產品、R&D、技術。有些時刻特別突出,也有一些困難需要跨越。以 GPU 為例。
起伏很多:供應曾經緊張了一段時間,之後又改善了。
最極端的階段是價格按天變動——今天一台可能是 260,明天 340,兩天後又降下來。那是一種持續變動的情況。你必須緊跟著它。
價格持續變化,所以策略也持續變化:用哪個管道、買還是租——有很多不同選項。
Zhang Xiaojun:
是什麼推動了這些波動?
Yang Zhilin:
地緣政治原因;生產本身是分批進行的;市場情緒也起作用。我們觀察到很多公司開始歸還 GPU,意識到他們不一定需要用它們來訓練這個模型。當市場情緒和大家的決策改變時,供需也會跟著變化。好消息是,整體來看,最近供應已經改善很多。
我的個人判斷是,至少在未來一到兩年內,GPU 不會是大瓶頸。
Zhang Xiaojun:
你似乎總是在思考組織。你是怎麼建立團隊的?
Yang Zhilin:
我們的招募方式一直在隨時間變化。全球 AGI 人才極其稀缺,而且具備相關經驗的人非常少。我們最初的招聘輪廓,是聚焦尋找那些擁有直接相關技能的天才。這已被證明非常成功。那些曾經「動過手術」模型、並且有超大模型實戰訓練經驗的人,可以非常快地把事情做完。包括 Kimi 的發布——資本效率和組織效率都真的很高。
Zhang Xiaojun:
花了多少?
Yang Zhilin:
一個相當小的數字——和很多其他支出相比,這是用很少的錢辦大事。很長一段時間裡我們只有 30–40 個人。現在是 80。我們追求人才密度。
後來,人才配置也發生了變化。一開始,我們招的是天才,認為他們的能力上限很高——一家公司的能力上限,由其中人的能力上限所決定。之後,我們加入了更多維度的人才——產品-運營方向的人、領導型的人、那些能把事情推到極限的人。現在這是一支更完整、更有韌性、也能打仗的團隊。
Zhang Xiaojun:
在中國做了一年平台模型創業後,你怎麼評價目前這個里程碑的結果?
Yang Zhilin:
我們已經建出了一個火箭原型,現在正在試射。我們已經把團隊組起來了,找到了一些燃料配方,基本上也能看到一個雛形的 PMF。可以說我們已經邁出了登月任務的第一步。
Zhang Xiaojun:
你怎麼看 Yann LeCun 的觀點?他對當前的技術路線並不樂觀——他相信自監督語言模型無法獲得真實的世界知識,而且隨著模型擴大,錯誤——機器幻覺——的機率只會上升。他提出了「world model」的想法。
Yang Zhilin:
不存在根本性的瓶頸。當 token 空間足夠大時,它會變成一種新的計算機,用來解決通用問題——那本身就是一種通用 world model。
他這番話背後有一個很重要的點:每個人都看得到當前的限制。但解法不一定需要一個全新的框架。AI 裡唯一有效的是 next token prediction 加上 scaling law。只要 token 足夠完整,一切都可以做到。當然,他現在提出的那些問題確實存在——但你是透過把 token 空間做得真正通用來解決它們。就這樣而已。
Zhang Xiaojun:
所以他是在誇大這些限制。
Yang Zhilin:
我認為是這樣。基本原理是對的——只是還有一些小的技術問題尚未解決。
Zhang Xiaojun:
你怎麼看 Geoffrey Hinton,deep learning 的教父,一直呼籲關注 AI 安全?
Yang Zhilin:
他專注於安全,其實說明他非常相信技術能力即將提升。這兩件事是對立的。
Zhang Xiaojun:
要怎麼解決幻覺問題?
Yang Zhilin:
還是 scaling law——只是被 scale 的東西換成了別的。
Zhang Xiaojun:
最終,scaling law 其實是死路一條的可能性有多大?
Yang Zhilin:
概率幾乎為零。
Zhang Xiaojun:
你怎麼看 CMU 校友 Qi Lu 的觀點:OpenAI 一定會比 Google 更大——只是大一倍、五倍還是十倍?
Yang Zhilin:
未來最成功的 AGI 公司肯定會比今天所有公司都大——這一點毫無疑問。
最後,規模可能相當於 GDP 的兩倍或三倍。可能不是 OpenAI;也可能是另一家公司。但一定會有這樣一家公司。
Zhang Xiaojun:
如果你碰巧成了這個 AI 帝國的 CEO,你會怎麼做來保護人類?
Yang Zhilin:
現在思考這個問題,還缺少一些前提條件。但我們肯定願意與社會中的各種行動者合作並向他們學習,包括把更多安全措施加入模型中。
Zhang Xiaojun:
你對 2024 年的目標是什麼?
Yang Zhilin:
第一,技術突破——現在我們理應已經能做出比 2023 年好得多的模型。第二,用戶和產品——我希望在大規模用戶和更強留存方面有更多進展。
Zhang Xiaojun:
你對 2024 年全球基礎模型行業的預測是什麼?
Yang Zhilin:
今年會出現更多能力,但格局不會和現在有太大不同——少數領先者仍然會保持領先。就能力而言,下半年可能會有一些相當大的突破,很多突破會來自 OpenAI;它肯定有一個下一代模型——可能是 4.5,也可能是 5。這感覺像是一個高概率事件。影片生成模型肯定還能繼續擴展。
Zhang Xiaojun:
那麼你對 2024 年中國基礎模型行業的預測呢?
Yang Zhilin:
第一,你會看到新的、差異化的能力出現。中國模型——由於更早投入且擁有合適的團隊——會在某些維度上達到世界領先的能力。第二,會出現擁有大得多用戶基礎的產品——這個可能性很高。第三,在路線選擇上會有更多整合與分化。
Zhang Xiaojun:
當你創辦這家公司時,最害怕的是什麼?
Yang Zhilin:
其實也沒什麼——只管無所畏懼地往前衝就行。
Zhang Xiaojun:
你想對你的同事們說些什麼嗎?
Yang Zhilin:
讓我們一起繼續努力。
Zhang Xiaojun:
請提出一個關於基礎模型行業、你至今仍不知道答案但最想知道的問題。
Yang Zhilin:
我不知道 AGI 的極限會是什麼樣子——它會創造出什麼樣的公司,而那家公司又會創造出什麼樣的產品。這是我現在最想知道的。
Zhang Xiaojun:
當 AGI 繼續這樣發展下去,你最不想看到的是什麼?
Yang Zhilin:
我對此相當樂觀。它或許能把人類文明帶到下一個階段。
Zhang Xiaojun:
有人說過你太理想主義嗎?
Yang Zhilin:
我們也很務實。其實我們已經做出了一些真正有成果的東西——我們不是只會空談。
Zhang Xiaojun:
如果你今天募到的錢是你此生最後的一筆資金,你會怎麼花?
Yang Zhilin:
我希望那永遠不會發生,因為未來我們還會需要更多資金。
Zhang Xiaojun:
如果你不成功,你會把自己看作失敗者嗎?
Yang Zhilin:
那也沒那麼重要——我接受失敗是一種可能。
這段旅程已經完全改變了我的人生,我無比感激。
(結束)
內容僅供參考,不構成投資、法律、稅務或財務建議。