Trò chuyện với nhà sáng lập Kimi Yang Zhilin: Tiến về phía ngọn núi tuyết kéo dài và chưa biết trước
Nhà sáng lập Moonshot AI Yang Zhilin bàn về AGI, Scaling Law, Kimi, thương mại hóa, Sora, và vì sao trí tuệ nhân tạo tổng quát cần một kiểu tổ chức m…

Ghi chú của biên tập viên: Bài viết này là bản dịch tiếng Anh của cuộc phỏng vấn với Yang Zhilin do Zhang Xiaojun công bố vào ngày 1 tháng 3 năm 2024; bản dịch được Kimi K3 tạo ra, và được tác giả đăng lại trên X vào tháng 7 năm 2026. Phần nội dung chính giữ nguyên bản tiếng Anh.
Nguồn: tài khoản X của Zhang Xiaojun

Đây là cuộc phỏng vấn đầu tiên của tôi với Yang Zhilin, được thực hiện vào đầu năm 2024 và đăng vào ngày 1 tháng 3 năm 2024—đúng kỷ niệm một năm thành lập Kimi. Khi đó, Kimi chỉ có 80 người, làm việc trong văn phòng đầu tiên của họ, khá xuống cấp. Ở lối vào không có logo. Chỉ có một cây đàn piano màu trắng đứng gác cạnh cửa.
Bài viết này đã tạo nên khá nhiều xôn xao trong cộng đồng công nghệ Trung Quốc vào thời điểm đó.
Khi ấy, tôi vẫn là một nhà báo in ấn, nên cuộc phỏng vấn này chỉ tồn tại dưới dạng văn bản và một podcast âm thanh.
Như chúng ta có thể thấy, nhiều quan điểm được nêu trong bài viết này sau đó đã được chứng thực.
Chỉ cần đọc lại những dòng này từ hai năm trước, bạn thực sự không khỏi kinh ngạc trước mức độ thế giới đã thay đổi dữ dội đến thế nào!
(Bản dịch này được tạo bởi Kimi K3.)
Yang Zhilin: “Nếu ai cũng nghĩ bạn là người bình thường—nếu giấc mơ của bạn là một giấc mơ mà bất kỳ ai cũng có thể có—thì nó không thêm gì vào tổng số những giấc mơ của nhân loại.”
Bởi Zhang Xiaojun
Chỉ một năm trước, nhà khoa học AI Yang Zhilin đã thực hiện một phép tính chính xác ở Silicon Valley. Ông nhận ra rằng nếu quyết định khởi động một startup foundation-model hướng tới AGI, ông sẽ cần huy động hơn 100 triệu đô la Mỹ trong vòng vài tháng tới.
Nhưng đó mới chỉ là tấm vé để bước vào cuộc chơi. Một năm sau, con số đó đã tăng gấp mười ba lần.
Đối với các công ty foundation-model, cạnh tranh ít là một cuộc thi khoa học hơn mà, trước hết và trên hết, là một cuộc chiến tiền bạc khốc liệt. Khi các nhà đầu tư giữ chặt hầu bao, bạn phải chạy trước các đối thủ trong việc huy động thêm tiền, mua thêm GPU, và giành lấy thêm nhân tài.
“Nó đòi hỏi sự tập trung của nhân tài và sự tập trung của vốn,” Yang Zhilin, nhà sáng lập kiêm CEO của Moonshot AI, công ty foundation-model được thành lập vào ngày 1 tháng 3 năm 2023, nói.
Trong suốt năm qua, các công ty foundation-model của Trung Quốc dường như sống trên một lằn ranh sinh tồn căng thẳng và bị siết chặt. Bề ngoài, mỗi công ty đều nắm trong tay những khoản tiền mặt đáng kể. Nhưng một mặt, họ phải lập tức đổ tiền mới huy động vào nghiên cứu cực kỳ đắt đỏ để đuổi theo OpenAI—trước là bắt kịp GPT-3.5, rồi chưa kịp chạm tới GPT-4 thì Sora đã xuất hiện. Mặt khác, họ phải không ngừng chạy đua để tìm những trường hợp sử dụng thực tế khả thi, để tự chứng minh rằng mình là công ty chứ không phải viện nghiên cứu chỉ biết đốt vốn. Và như thế vẫn chưa đủ: với mỗi dự án như vậy, dù lối ra là IPO hay M&A, con đường thoát thân vẫn hoàn toàn chưa rõ ràng.
Trong số các nhà sáng lập của những công ty foundation-model ở Trung Quốc, Yang Zhilin là người trẻ nhất, sinh năm 1992. Ngành này mô tả ông là một người kiên định tin vào AGI và là một nhà sáng lập có sức hút kỹ thuật hiếm có. Phần lớn hồ sơ học thuật và nghề nghiệp của ông đều gắn với AI đa dụng, và các bài báo của ông đã được trích dẫn hơn 22.000 lần.
Vào giữa năm 2023, cộng đồng công nghệ Trung Quốc đột ngột chuyển từ phấn khích sang lạnh nhạt đối với foundation models, và việc tăng tốc ứng dụng thực tế trở thành giai điệu chủ lưu mang tính thực dụng. Điều này tất yếu khiến các CEO foundation-model bị xé toạc dữ dội giữa lý tưởng và thực tế.
Trong hệ sinh thái AI Trung Quốc, nơi ai cũng hô vang PMF (product/market fit) và ai cũng hô vang thương mại hóa, vị nhà sáng lập này—một nhà nghiên cứu AI được đào tạo bài bản—không hề vội vã.
Với 80 người, Moonshot AI có quy mô nhân sự nhỏ nhất trong số các công ty foundation-model hàng đầu Trung Quốc. Không giống các đối thủ, Yang không chọn mô hình B2B an toàn hơn hay tìm cách triển khai trong các lĩnh vực dọc như y tế hoặc game. Ông xây dựng một—and chỉ một—sản phẩm tiêu dùng: trợ lý AI Kimi, cho phép nhập tối đa 200.000 ký tự tiếng Trung. Kimi cũng là tên tiếng Anh của Yang Zhilin.
Yang thích nhìn công ty của mình như một hệ thống kết hợp khoa học, kỹ thuật và kinh doanh. Bạn có thể hình dung thế này: phía trên thế giới con người, ông đang dựng lên một bàn thí nghiệm AI—một tay ông chạy các thí nghiệm, tay kia ông đưa công nghệ tiên tiến xuống thế giới thực, khám phá ứng dụng thông qua tương tác với con người và đưa những ứng dụng đó vào tay người tiêu dùng. Lý tưởng nhất, phần trước đốt cháy hàng tỷ đến hàng chục tỷ đô la vốn; phần sau kiếm lại số tiền đó gấp hàng trăm hoặc hàng nghìn lần. Nghe thế nào đi nữa, nó cũng vừa hồi hộp vừa nguy hiểm như đi trên dây.
“AI không phải là việc trong một hai năm tới tôi có thể tìm thấy PMF gì; mà là làm thế nào để thay đổi thế giới trong mười đến hai mươi năm tới,” ông nói.
Cách suy nghĩ trừu tượng, lý tưởng như vậy khiến người ta toát mồ hôi lo lắng thay cho ông: liệu một nhà khoa học AI trẻ có thể mở ra không gian sống sót trong một Trung Quốc thực dụng hay không?
Vào tháng 2 năm 2024, Moonshot AI đã khép lại một vòng gọi vốn lớn bất chấp xu hướng thị trường. Được biết công ty đã huy động vòng Series B hơn 1 tỷ đô la Mỹ với định giá trước tiền hơn 1,5 tỷ đô la Mỹ, do Alibaba dẫn đầu và có sự tham gia tiếp nối của Monolith Management, Xiaohongshu, và những bên khác. Khi thương vụ hoàn tất, định giá sau tiền của Moonshot AI vào khoảng 2,5 tỷ đô la Mỹ—khiến công ty này, ở giai đoạn đó, trở thành kỳ lân có giá trị cao nhất trong cuộc đua foundation-model ở Trung Quốc. (Công ty từ chối phản hồi hoặc bình luận về vấn đề này.)
Trong vòng gọi vốn thứ ba này, chúng tôi đã ngồi lại với Yang Zhilin để nói về năm đầu tiên khởi nghiệp của ông—một lát cắt thu nhỏ của một năm mà các công ty foundation-model Trung Quốc đã lao nhanh từ vạch xuất phát.
Công ty của ông không đặt văn phòng tại Sohu Network Plaza ở Bắc Kinh, nơi tập trung các công ty foundation-model. Đối với một công ty có tổng vốn huy động khoảng 9 tỷ RMB, văn phòng này trong tòa nhà Liangzi Xinzuo trông thô sơ và xuống cấp. Thậm chí ở lối vào cũng không có logo công ty—chỉ có một cây đàn piano màu trắng đứng gác cạnh cửa.
Phòng họp nằm ở một góc; với những ô cửa sổ nhỏ, bên trong khá tối, và máy sưởi rì rầm khi thổi luồng khí ấm chống lại cái lạnh mùa đông.
Trong ánh sáng lờ mờ, Yang mô tả năm vừa qua đã cảm nhận thế nào với anh: “Nó hơi giống như đang lái xe trên một con đường mà phía trước là dãy núi tuyết trải dài. Bạn không biết bên trong đó có gì. Bạn chỉ có thể cứ thế đi về phía trước, từng bước một.”
Dưới đây là toàn bộ cuộc phỏng vấn với Yang Zhilin. (Để dễ đọc, tác giả đã chỉnh sửa một số chỗ trong văn bản.)
Bức ảnh này được chụp vào đầu năm 2024 tại văn phòng đầu tiên của Kimi ở Bắc Kinh. Giờ họ đã chuyển khỏi địa điểm này. Không có logo nào dọc lối vào — chỉ có một cây đàn piano màu trắng lặng lẽ đứng cạnh cửa.
Phần 1
Đứng ở điểm khởi đầu
“Bạn phải cưỡi lên làn sóng”
Zhang Xiaojun:
Dạo này bạn thế nào?
Yang Zhilin:
Bận—có rất nhiều việc đang diễn ra. Nhưng tôi vẫn rất háo hức. Chúng tôi đang đứng ở ngay điểm khởi đầu của một ngành, và còn vô cùng nhiều không gian để tưởng tượng.
Zhang Xiaojun:
Lúc nãy khi tôi bước vào, tôi thấy một cây đàn piano trắng tinh ở lối vào công ty bạn.
Yang Zhilin:
Trên đó còn có một album của Pink Floyd nữa. Tôi cũng không biết ai đặt chúng ở đó—mấy ngày trước tôi mới bất ngờ nhìn thấy và chưa kịp hỏi. (Pink Floyd là ban nhạc rock Anh đã phát hành album
The Dark Side of the Moon
.)
Zhang Xiaojun:
Vào ngày ChatGPT được phát hành vào tháng 11 năm 2022, bạn đang làm gì?
Yang Zhilin:
Tôi đã chuẩn bị cho việc này từ trước rồi—tuyển người, xây dựng đội ngũ, trao đổi những ý tưởng mới. Khi nhìn thấy ChatGPT, tôi vô cùng phấn khích. Ba đến năm năm trước—thậm chí là vào năm 2021—điều đó gần như là không thể tưởng tượng được. Kiểu suy luận bậc cao như vậy trước đó rất khó đạt được.
Tôi cảm nhận rằng nhiều biến số của thị trường sắp thay đổi: vốn ở một phía, nhân tài ở phía còn lại—những yếu tố sản xuất cốt lõi cho AI.
Nếu những biến số đó vào đúng vị trí, thì sẽ có thể xây dựng một công ty tử tế để làm việc này—một tổ chức được tạo ra cho AGI có thể đi từ 0 đến 1.
Đó là một sự ngộ ra lớn. Một công ty độc lập nghe có lý hơn, nhưng đó không phải là thứ bạn có thể làm ngay khi bạn muốn; ChatGPT đã làm các biến số rung chuyển và đưa các yếu tố sản xuất lại gần nhau. Bạn phải cưỡi lên làn sóng.
Zhang Xiaojun:
Sau khi bạn quyết định thành lập một công ty AGI, bạn đã chuẩn bị những gì? Bạn đã tập hợp hai yếu tố sản xuất—vốn và nhân tài—như thế nào?
Yang Zhilin:
Đó là một quá trình quanh co. ChatGPT cần thời gian để lan tỏa. Có người biết sớm, có người biết muộn; có người ban đầu hoài nghi, rồi sốc, rồi trở thành người tin tưởng. Việc tìm người và tìm tiền đều gắn chặt với thời điểm.
Chúng tôi bắt đầu tập trung vào vòng gọi vốn đầu tiên vào tháng 2 năm 2023. Nếu trì hoãn đến tháng 4, về cơ bản chúng tôi sẽ không còn cơ hội. Nhưng làm vào tháng 12 năm 2022 hoặc tháng 1 năm 2023 cũng không ổn—đại dịch khi đó vẫn còn, và mọi người vẫn chưa kịp tiêu hóa nó.
Vì vậy, cửa sổ thực sự chỉ có một tháng.
Một đêm ở Hoa Kỳ, tôi đã làm một phép tính rất chính xác. Khi tính xong, tôi kết luận rằng chúng tôi cần huy động ít nhất 100 triệu đô la trong vòng vài tháng. Nhiều người trên thị trường khi đó vẫn chưa bắt đầu gọi vốn, và nhiều người không tin rằng bạn có thể huy động được con số đó. Nhưng cuối cùng lại làm được—thậm chí còn hơn thế.
Thị trường nhân tài cũng bắt đầu chuyển động. Được ChatGPT truyền cảm hứng, nhiều người trong tháng 3 hoặc tháng 4 năm 2023 đã có nhận thức này: đây là điều duy nhất đáng làm trong mười năm tới. Bạn phải tiếp cận đúng người vào đúng thời điểm. Một hoặc hai năm trước đó, nhân tài sẽ không tụ lại đến mức này. Khi ấy, nhiều người hơn đang làm AI truyền thống hoặc các mảng liên quan đến AI—không phải AI mục đích tổng quát.
Zhang Xiaojun:
Tóm lại: tháng 2 là cửa sổ cho gọi vốn, còn tháng 3 và tháng 4 là cửa sổ cho tuyển dụng?
Yang Zhilin:
Đại khái là vậy.
Zhang Xiaojun:
Đêm đó ở Mỹ—bạn ở đâu khi làm phép tính này? Bạn đã tính cụ thể như thế nào?
Yang Zhilin:
Từ cuối năm 2022 sang đầu năm 2023, tôi đã ở Mỹ khoảng một, hai tháng, nói chuyện với mọi người. Tôi làm nó ở nơi mình đang sống. Bạn tính xem cần bao nhiêu FLOPs, chi phí huấn luyện, suy luận, và số lượng người dùng.
Zhang Xiaojun:
Vào thời điểm đó, bầu không khí chủ đạo ở Thung lũng Silicon là gì?
Yang Zhilin:
Sản phẩm bắt đầu thu hút nhiều người dùng sớm, tập trung trong vòng tròn công nghệ. Chúng tôi cũng ở trong vòng tròn đó, nên cảm nhận rất rõ. Ở các công ty lớn tại Thung lũng Silicon, mọi người cứ sáu tháng lại phải viết đánh giá hiệu suất, và nhiều người đã bắt đầu viết chúng bằng ChatGPT. Có những người trước đây viết lách không mấy chuyên nghiệp lại nộp các bản đánh giá được viết bằng ChatGPT, và ai trông cũng hết sức nghiêm túc.
Những dòng chảy ngầm đang nổi lên. Nhiều người đang nghĩ về công việc tiếp theo của mình hoặc về việc khởi nghiệp. Khá nhiều người bạn từng nói chuyện với chúng tôi sau đó đã đi lập startup. Và có một nỗi FOMO rất mạnh—sợ bỏ lỡ cơ hội. Không ai ngủ được. Bất kể là nửa đêm, 1 giờ sáng hay 2 giờ sáng, nếu bạn liên hệ, họ luôn ở đó. Hơi lo lắng, hơi FOMO, và rất phấn khích.
Zhang Xiaojun:
Đêm bạn tính ra cần huy động 100 triệu đô la—bạn thức đến mấy giờ?
Yang Zhilin:
Cũng ổn—bản thân phép tính không mất nhiều thời gian. Nhưng sau đó, tôi không thể nói cho quá nhiều người biết. Nếu tôi nói ra, sẽ chẳng ai tin là có thể làm được.
Phần 2
Dòng dõi kỹ thuật
“Giải phóng mình khỏi việc chạm khắc vô tận”
Zhang Xiaojun:
Khi giới đầu tư mạo hiểm nói về bạn, họ nói: “Nhà sáng lập rất xuất sắc, có khí chất kỹ thuật, và cả đội ngũ đều là những ngôi sao kỹ thuật.” Vì vậy trước khi nói về công ty foundation-model của bạn, tôi muốn bắt đầu từ nền tảng học thuật của bạn. Bạn học khoa học máy tính ở Thanh Hoa thời đại học và lấy bằng tiến sĩ tại School of Computer Science của Carnegie Mellon. AI có phải luôn là trọng tâm của bạn không?
Yang Zhilin:
Tôi sinh năm 1992 và bắt đầu học đại học vào năm 2011. Từ năm hai cho đến bây giờ—hơn một thập kỷ—tôi đã ở trong lĩnh vực này. Ban đầu tôi khám phá theo hướng khá phân tán, nhìn quanh khắp nơi; tôi từng làm một số công việc liên quan đến đồ thị và đa mô thức. Đến năm 2017, tôi hội tụ vào các mô hình ngôn ngữ. Khi đó tôi cảm thấy mô hình ngôn ngữ là một vấn đề tương đối quan trọng; về sau tôi dần cho rằng đó là vấn đề duy nhất quan trọng.
Zhang Xiaojun:
Năm 2017, ngành AI nhìn nhận mô hình ngôn ngữ nói chung như thế nào, và nhận thức đó đã thay đổi ra sao?
Yang Zhilin:
Hồi đó nó chỉ là một mô hình dùng để xếp hạng kết quả nhận dạng giọng nói. (Cười.) Sau khi một đoạn âm thanh được nhận dạng, bạn sẽ có nhiều kết quả ứng viên, rồi dùng mô hình ngôn ngữ để xem kết quả nào có xác suất cao nhất và xuất ra kết quả có khả năng xảy ra nhất. Ứng dụng của nó rất hạn chế.
Nhưng rồi bạn sẽ nhận ra đây là một vấn đề nền tảng, vì bạn đang mô hình hóa xác suất của thế giới. Ngôn ngữ là hữu hạn, nhưng nó là một phép chiếu của thế giới; về mặt lý thuyết, nếu bạn làm không gian token—không gian của mọi token có thể có—đủ lớn, bạn có thể xây dựng một mô hình thế giới tổng quát. Mọi thứ trong thế giới này hình thành và phát triển như thế nào đều có thể được gán một xác suất. Mọi vấn đề đều có thể quy về việc ước lượng xác suất.
Zhang Xiaojun:
Những người hướng dẫn học thuật của bạn đều rất nổi tiếng: các cố vấn PhD của bạn là Ruslan Salakhutdinov, trưởng bộ phận AI tại Apple, và William W. Cohen, nhà khoa học trưởng của Google AI. Cả hai đều đứng giữa công nghiệp và học thuật.
Yang Zhilin:
Trong những năm trước, công nghiệp và học thuật gắn kết với nhau nhiều hơn, nhưng xu hướng hiện nay đang dịch chuyển:
những đột phá có giá trị hơn sẽ xảy ra trong công nghiệp.
Đó là một quy luật phát triển tất yếu. Nó bắt đầu bằng nghiên cứu thăm dò và dần chuyển sang một quá trình công nghiệp hóa trưởng thành hơn. Điều đó không có nghĩa là nghiên cứu là không cần thiết trong giai đoạn công nghiệp hóa—chỉ là nghiên cứu thuần túy sẽ khó tạo ra những đột phá có giá trị.
Zhang Xiaojun:
Bạn học được gì từ những người hướng dẫn nổi tiếng này?
Yang Zhilin:
Tôi học được nhiều nhất ở Google, nơi tôi thực tập trong một thời gian dài. Tôi bắt đầu làm việc về các mô hình ngôn ngữ dựa trên Transformer vào cuối năm 2018.
Điều tôi học được nhiều nhất là giải phóng bản thân khỏi việc “chạm khắc” bất tận—sự ám ảnh tinh chỉnh quá mức các chi tiết bề mặt. Điều đó rất quan trọng.
Bạn nên nhìn vào hướng đi lớn là gì, vào gradient lớn là gì. Khi trước mặt bạn có mười con đường, người bình thường sẽ lo làm sao phanh cho người đi bộ phía trước trên con đường này—những chi tiết ngắn hạn. Nhưng nên chọn con đường nào trong mười con đường đó mới là điều quan trọng nhất.
Lĩnh vực này trước đây đúng là có vấn đề như vậy. Ví dụ, trên một bộ dữ liệu chỉ có một hoặc hai triệu token, bạn sẽ nhìn cách đẩy perplexity xuống thấp hơn, cách kéo loss xuống thấp hơn, cách cải thiện độ chính xác—và bạn sẽ rơi vào việc chạm khắc bất tận. Người ta đã phát minh ra rất nhiều kiến trúc kỳ quặc; đó đều là các thủ thuật chạm khắc. Sau khi chạm khắc, bạn có thể làm tốt hơn trên loại bộ dữ liệu đó, nhưng bạn lại bỏ lỡ bản chất của vấn đề.
Bản chất là phân tích xem lĩnh vực đang thiếu điều gì. Nguyên lý đầu tiên là gì? Vì sao scaling law có thể đóng vai trò là một nguyên lý đầu tiên? Bạn chỉ cần tìm một cấu trúc thỏa mãn hai điều kiện: thứ nhất, nó đủ tổng quát; thứ hai, nó có thể mở rộng quy mô. Tổng quát nghĩa là bạn có thể mô hình hóa mọi vấn đề trong khuôn khổ này; có thể mở rộng quy mô nghĩa là miễn là bạn đổ đủ compute vào, nó sẽ tiếp tục tốt lên.
Đây là tư duy tôi học được ở Google: nếu một thứ có thể được giải thích bằng một thứ cơ bản hơn, bạn không nên chạm khắc quá mức ở các lớp phía trên. Có một câu rất quan trọng mà tôi đặc biệt đồng ý: nếu có thể giải quyết một vấn đề bằng quy mô, thì đừng giải nó bằng một thuật toán mới. Giá trị lớn nhất của một thuật toán mới nằm ở chỗ nó giúp bạn mở rộng quy mô tốt hơn như thế nào. Khi bạn thoát khỏi việc chạm khắc, bạn có thể nhìn thấy nhiều hơn rất nhiều.
Zhang Xiaojun:
Google khi đó cũng là người đi theo scaling law sao? Họ đã thực hiện tư duy nguyên lý đầu tiên như thế nào?
Yang Zhilin:
Nhiều ý tưởng như vậy đã tồn tại ở đó, nhưng Google không triển khai chúng đặc biệt tốt. Họ có kiểu tư duy đó, nhưng không thể tổ chức thành một moonshot thực sự. Nó giống như: ở đây có năm người theo đuổi nguyên lý đầu tiên của tôi, và ở kia có năm người theo đuổi của họ. Không có gì mang tính chỉ huy từ trên xuống.
Zhang Xiaojun:
Trong thời gian làm PhD, bạn đã công bố các bài báo hợp tác với những người đoạt giải Turing là Yann LeCun và Yoshua Bengio—và bạn là tác giả chính của những bài báo đó. Những hợp tác đó đến với nhau như thế nào? Ý tôi là: họ là các laureate của giải Turing và họ không phải là cố vấn của bạn—bạn đã dựa vào đâu để thu hút họ?
Yang Zhilin:
Giới học thuật rất cởi mở. Chỉ cần bạn có một ý tưởng tốt và một vấn đề có ý nghĩa là được. Hai bộ não—or n bộ não—tạo ra thường nhiều hơn một bộ não đơn lẻ. Điều này cũng đúng khi phát triển AGI. Một chiến lược quan trọng trong AI gọi là “ensembling”—dùng nhiều mô hình hoặc phương pháp khác nhau và kết hợp dự đoán của chúng để đạt hiệu năng tốt hơn. Thực chất cũng là làm cùng một việc: khi có nhiều góc nhìn đa dạng, bạn có thể khơi lên rất nhiều điều mới. Hợp tác mang lại lợi ích cực lớn.
Zhang Xiaojun:
Bạn sẽ nảy ra ý tưởng trước rồi mới hỏi họ xem họ có hứng thú không?
Yang Zhilin:
Đại khái là như vậy.
Zhang Xiaojun:
Cái nào khó hơn: thuyết phục các cây đại thụ học thuật trong nghiên cứu, hay thuyết phục các cây đại thụ về vốn trong gọi vốn? Có điểm tương đồng gì?
Yang Zhilin:
“Thuyết phục” không phải là một cách nói hay—bản chất đằng sau nó là hợp tác. Hợp tác có nghĩa là đôi bên cùng thắng, vì lợi ích tương hỗ là tiền đề cho hợp tác. Nên thực ra không có khác biệt gì: bạn cần mang lại giá trị độc đáo cho người khác.
Zhang Xiaojun:
Làm sao để bạn giành được niềm tin của họ? Bạn nghĩ món quà của mình là gì?
Yang Zhilin:
Không có món quà đặc biệt nào cả—chỉ là làm việc chăm chỉ.
Phần 3
Hệ thống cũ không còn hoạt động nữa
“AGI cần một loại tổ chức mới”
Zhang Xiaojun:
Bạn vừa nói “những đột phá có giá trị hơn sẽ xảy ra trong công nghiệp”—điều đó có bao gồm các startup và các phòng thí nghiệm AI của những gã khổng lồ không?
Yang Zhilin:
Labs là lịch sử. Google Brain từng là phòng thí nghiệm AI lớn nhất trong ngành, nhưng nó là một tổ chức nghiên cứu nằm bên trong một công ty lớn. Loại tổ chức đó có thể khám phá ý tưởng mới, nhưng rất khó để tạo ra một hệ thống tuyệt vời—nó có thể tạo ra Transformer, nhưng không thể tạo ra ChatGPT.
Cách phát triển hiện nay tiến hóa là bạn đang xây dựng một hệ thống khổng lồ, điều này đòi hỏi những thuật toán mới, kỹ thuật vững chắc, và thậm chí cả rất nhiều công việc về sản phẩm và thương mại hóa.
Nó giống như đầu những năm 2000: bạn không thể nghiên cứu truy hồi thông tin trong một phòng lab; nó phải tồn tại trong thế giới thực, như một hệ thống khổng lồ, một sản phẩm có người dùng—như Google.
Vì vậy, các hệ thống nghiên cứu và giáo dục sẽ chuyển chức năng của mình sang chủ yếu là nuôi dưỡng nhân tài.
Zhang Xiaojun:
Anh sẽ mô tả hình thức hệ thống mới này như thế nào? OpenAI có phải là nguyên mẫu của nó không?
Yang Zhilin:
Đó là tổ chức trưởng thành nhất thuộc loại này hiện nay, và nó vẫn đang tiến hóa dần dần.
Zhang Xiaojun:
Vậy có thể hiểu nó là một tổ chức được thành lập cho những mục tiêu khoa học vĩ đại của nhân loại?
Yang Zhilin:
Tôi muốn nhấn mạnh: nó không phải khoa học thuần túy—mà là sự kết hợp giữa khoa học, kỹ thuật và kinh doanh. Nó phải là một tổ chức thương mại, một công ty, chứ không phải một viện nghiên cứu. Nhưng công ty này được xây dựng từ zero đến one, vì AGI cần một loại tổ chức mới. Thứ nhất, phương thức sản xuất khác với kỷ nguyên internet; thứ hai, nó chuyển từ nghiên cứu thuần túy sang sự kết hợp giữa nghiên cứu, kỹ thuật, sản phẩm và kinh doanh.
Cốt lõi của nó nên là một chương trình moonshot, với rất nhiều quy hoạch từ trên xuống—nhưng trong khuôn khổ đó vẫn có chỗ cho đổi mới, vì không phải toàn bộ công nghệ đều được xác định sẵn.
Các yếu tố từ dưới lên tồn tại trong một khung từ trên xuống.
Một tổ chức như vậy trước đây chưa từng tồn tại, nhưng tổ chức đó phải thích ứng với công nghệ, vì công nghệ quyết định phương thức sản xuất; nếu chúng không khớp, bạn không thể sản xuất hiệu quả. Chúng tôi tin rằng rất có thể nó cần được thiết kế lại từ đầu.
Zhang Xiaojun:
Trong cuộc đảo chính tại phòng họp hội đồng quản trị của OpenAI năm ngoái, một lựa chọn cho Sam Altman là gia nhập Microsoft và lãnh đạo một đội AI mới của Microsoft. Sự khác biệt cốt lõi giữa điều đó và việc làm CEO của OpenAI là gì?
Yang Zhilin:
Bạn sẽ phải nuôi dưỡng một tổ chức mới bên trong một nền văn hóa cũ—và điều đó cực kỳ khó.
Zhang Xiaojun:
Anh muốn xây dựng “OpenAI của Trung Quốc”—chúng ta có thể nói như vậy không?
Yang Zhilin:
Không hoàn toàn chính xác. Chúng tôi không muốn là bất cứ thứ gì của Trung Quốc, và cũng không nhất thiết muốn là OpenAI.
Thứ nhất, AGI thực sự chắc chắn sẽ mang tính toàn cầu. Ít nhất là về lâu dài, không có chuyện một công ty AGI bị giới hạn trong một thị trường khu vực nào đó vì các cơ chế bảo hộ thị trường.
Toàn cầu hóa, AGI, và có một sản phẩm với lượng người dùng rất lớn: ba điều này cuối cùng đều là những điều kiện cần thiết.
Thứ hai, có nên là OpenAI không? Nếu nhìn vào giai đoạn 2017–2018, OpenAI có danh tiếng rất tệ. Khi mọi người trong vòng của chúng tôi tìm việc, họ thường xem xét những nơi như Google. Rất nhiều người từng nói chuyện với Ilya Sutskever, nhà khoa học trưởng của OpenAI, sau đó đều nghĩ rằng người này điên và quá tự cao—OpenAI hoặc là lũ điên hoặc là kẻ lừa đảo. Nhưng họ đã cam kết từ rất sớm, tìm ra điều phi đồng thuận, và tìm ra thứ hiện nay là nguyên lý đầu tiên duy nhất hoạt động trong AI: scaling thông qua dự đoán token tiếp theo.
Tôi tin rằng sẽ có một công ty lớn hơn OpenAI. Một công ty thực sự vĩ đại có thể kết hợp lý tưởng công nghệ với một sản phẩm tuyệt vời, đồng sáng tạo cùng người dùng—AGI cuối cùng sẽ là thứ được tạo ra bằng cách làm việc chung với tất cả người dùng của nó. Vì vậy, nó không chỉ là vấn đề công nghệ; nó còn đòi hỏi tính thực dụng và những theo đuổi trong thế giới thực—cuối cùng là sự kết hợp hoàn hảo giữa cả hai.
Dù vậy, chúng ta nên học hỏi từ chủ nghĩa lý tưởng công nghệ của OpenAI.
Nếu mọi người đều nghĩ bạn bình thường—nếu giấc mơ của bạn là thứ bất kỳ ai cũng có thể mơ—thì nó sẽ không đóng góp gì vào tổng thể những giấc mơ của nhân loại.
Phần 4
Bước đầu tiên của Moonshot là “long context”—vậy bước thứ hai là gì?
“Hai cột mốc lớn tiếp theo sắp đến”
Zhang Xiaojun:
Quay lại thời điểm anh quyết định thành lập công ty—anh đã khởi động vòng gọi vốn đầu tiên ngay sau khi trở về Trung Quốc sao?
Yang Zhilin:
Nó bắt đầu ở Mỹ vào tháng 2 (năm ngoái), một phần được thực hiện từ xa. Cuối cùng, các nhà đầu tư trong nước chiếm đa số.
Zhang Xiaojun:
Vòng đầu tiên đã huy động 100 triệu USD phải không?
Yang Zhilin:
Vòng đầu tiên không nhiều đến vậy; các vòng sau thì vượt con số đó. Chúng tôi đã hoàn thành hai vòng trong năm 2023, tổng cộng gần 2 tỷ RMB.
Hiện tại đây là vòng thứ ba. Chúng tôi chưa công bố chính thức khoản tài trợ, nên tôi chưa thể bình luận lúc này.
Zhang Xiaojun:
Có người nói rằng từ nửa sau năm 2023, không còn ai muốn đầu tư vào các công ty mô hình nền tảng nữa. Họ sai à?
Yang Zhilin:
Vẫn có. Quả thật có thể thấy sự thay đổi trong tâm lý, nhưng không phải là không ai đầu tư—ít nhất là hiện tại, thị trường vẫn có khá nhiều sự quan tâm đầu tư.
Zhang Xiaojun:
Ngoài vốn và nhân sự, còn những quyết định then chốt nào khác mà anh đã đưa ra trong năm 2023?
Yang Zhilin:
Quyết định sẽ làm gì. Đó là lợi thế của những công ty như chúng tôi—có tầm nhìn kỹ thuật để ra quyết định ở cấp cao nhất.
Chúng tôi làm long context. Điều đó đòi hỏi phán đoán về tương lai: bạn cần biết điều gì là nền tảng và mọi thứ sẽ đi về đâu tiếp theo. Một lần nữa, đó là nguyên lý đầu tiên—quá trình “de-carving”. Nếu bạn tập trung vào carving, bạn chỉ có thể nhìn vào những gì OpenAI đã làm và tìm cách tái tạo lại nó.
Bạn sẽ thấy rằng việc nén lossless long-text compression trong Kimi mang lại cho sản phẩm một trải nghiệm độc đáo. Khi bạn đọc các bài báo tiếng Anh, nó giúp bạn hiểu chúng một cách đáng kinh ngạc. Dùng Claude hoặc GPT-4 ngày nay, bạn chưa chắc đã làm tốt như vậy; điều này đòi hỏi phải đặt nền móng từ trước. Chúng tôi đã làm việc về nó hơn nửa năm. Điều đó rất khác với việc hôm nay thấy xu hướng long-context, vội vàng gom hai đội lại và phát triển với tốc độ tối đa.
Dĩ nhiên, cuộc chạy marathon mới chỉ bắt đầu; sẽ còn nhiều khác biệt hóa hơn nữa, và điều đó đòi hỏi bạn phải dự đoán trước điều gì được coi là “một nhận định khác với số đông nhưng vẫn đúng.”
Zhang Xiaojun:
Quyết định này được đưa ra vào tháng nào?
Yang Zhilin:
Tháng Hai hoặc tháng Ba—quyết định này được chốt ngay khi công ty được thành lập.
Zhang Xiaojun:
Vì sao ngữ cảnh dài là bước đầu tiên của moonshot?
Yang Zhilin:
Bởi vì nó mang tính nền tảng. Nó là bộ nhớ của chiếc máy tính mới.
Bộ nhớ của chiếc máy tính cũ đã tăng lên vài bậc độ lớn trong vài thập kỷ qua, và điều tương tự cũng sẽ xảy ra với chiếc máy tính mới. Nó có thể giải quyết nhiều vấn đề của ngày nay. Ví dụ, các kiến trúc đa phương thức hiện tại vẫn cần một tokenizer, nhưng với ngữ cảnh dài được nén không mất dữ liệu, bạn không cần nó nữa—bạn có thể đưa trực tiếp đầu vào thô vào. Đi xa hơn nữa, đó là nền tảng để khiến mô hình tính toán mới trở nên tổng quát hơn.
Máy tính cũ có thể biểu diễn mọi thứ bằng 0 và 1; mọi thứ đều có thể được số hóa. Nhưng chiếc máy tính mới ngày nay vẫn chưa làm được—chưa có đủ ngữ cảnh, nên nó chưa đủ tổng quát. Để trở thành một world model tổng quát, bạn cần ngữ cảnh dài.
Thứ hai, nó cho phép cá nhân hóa. Giá trị cốt lõi của AI là tương tác cá nhân hóa; giá trị cuối cùng rơi vào cá nhân hóa, và AGI sẽ được cá nhân hóa hơn thế hệ hệ thống gợi ý trước đây.
Nhưng cá nhân hóa không đạt được thông qua fine-tuning—mà là bằng cách hỗ trợ ngữ cảnh rất dài. Toàn bộ lịch sử của bạn với máy là ngữ cảnh, và ngữ cảnh đó quyết định quá trình cá nhân hóa. Nó không thể bị sao chép, và nó tạo ra đối thoại trực tiếp hơn—một cuộc đối thoại sinh ra thông tin.
Zhang Xiaojun:
Có bao nhiêu dư địa để mở rộng điều này lên nữa?
Yang Zhilin:
Rất lớn. Một mặt, việc mở rộng chính cửa sổ vẫn còn rất nhiều dư địa—nhiều bậc độ lớn.
Mặt khác, bạn không thể chỉ mở rộng cửa sổ, và cũng không thể chỉ nhìn vào con số; việc cửa sổ hiện nay là vài triệu token hay vài tỷ token tự nó không có nhiều ý nghĩa. Bạn phải nhìn vào khả năng suy luận mà nó mang lại bên trong cửa sổ đó, độ trung thực—tức mức độ bám sát thông tin gốc—và khả năng làm theo chỉ dẫn. Bạn không nên chạy theo một chỉ số đơn lẻ; phải kết hợp chỉ số với năng lực.
Nếu hai chiều đó tiếp tục được cải thiện, bạn có thể làm được rất nhiều việc. Nó có thể làm theo một chỉ dẫn dài hàng chục nghìn từ, và bản thân chỉ dẫn đó có thể định nghĩa ra rất nhiều agents—rất cá nhân hóa.
Zhang Xiaojun:
Công nghệ phía sau long context và việc đuổi kịp GPT-4 có thể dùng lại cho nhau không? Chúng có phải là một thứ không?
Yang Zhilin:
Tôi không nghĩ vậy. Nó giống như việc bổ sung một chiều mới—một chiều mà GPT-4 không có.
Zhang Xiaojun:
Nhiều người nói các công ty mô hình nền tảng hàng đầu của Trung Quốc đều đang làm đại khái cùng một việc—đuổi theo GPT-3.5 trong năm 2023, đuổi theo GPT-4 trong năm 2024. Bạn có đồng ý không?
Yang Zhilin:
Nâng cao năng lực tổng quát chắc chắn có những cột mốc then chốt, nên nhận xét đó đúng ở một mức độ nào đó—với tư cách là kẻ đến sau, bạn tất yếu phải trải qua quá trình đuổi kịp. Nhưng nó cũng phiến diện. Ngoài năng lực tổng quát, còn rất nhiều không gian để phát triển năng lực đặc thù và đạt state-of-the-art ở một số hướng nhất định. Long context là một ví dụ. Khả năng tạo ảnh của DALL-E 3 bị Midjourney V6 vượt xa hoàn toàn. Vì vậy bạn phải làm trên cả hai mặt.
Zhang Xiaojun:
Tỷ lệ thời gian và nguồn lực dành cho năng lực tổng quát so với các chiều mới là bao nhiêu?
Yang Zhilin:
Chúng phải được kết hợp với nhau. Một chiều mới không thể tồn tại tách rời khỏi các năng lực tổng quát, nên rất khó đưa ra một tỷ lệ trực tiếp. Nhưng vẫn cần đầu tư đủ lớn để làm tốt chiều mới.
Zhang Xiaojun:
Tất cả những chiều mới này sẽ do Kimi gánh vác sao?
Yang Zhilin:
Kimi chắc chắn là một sản phẩm rất quan trọng đối với chúng tôi, và chúng tôi cũng sẽ có một số thử nghiệm khác.
Zhang Xiaojun:
Bạn nghĩ gì về nhận xét của Li Guangmi, nhà sáng lập Shixiang, rằng tính đặc sắc công nghệ của các công ty mô hình nền tảng Trung Quốc hiện nay vẫn chưa cao lắm?
Yang Zhilin:
Tôi thấy cũng ổn—hiện tại chúng tôi đã tạo ra khá nhiều khác biệt hóa rồi. Chủ yếu là vấn đề thời gian; năm nay bạn sẽ thấy thêm nhiều chiều hướng hơn. Năm ngoái, mọi người mới chỉ dựng giàn giáo và làm cho mọi thứ chạy trước đã.
Zhang Xiaojun:
Nếu bước đầu tiên của moonshot là long context, thì bước thứ hai là gì?
Yang Zhilin:
Sẽ có hai cột mốc lớn phía trước. Thứ nhất, một world model thực sự thống nhất—một mô hình thống nhất tất cả các phương thức khác nhau, một kiến trúc thực sự có khả năng mở rộng và mang tính tổng quát.
Thứ hai, giúp AI tiếp tục tiến hóa mà không cần dữ liệu đầu vào từ con người.
Zhang Xiaojun:
Mất bao lâu để đạt được hai cột mốc này?
Yang Zhilin:
Hai đến ba năm—có thể còn nhanh hơn.
Zhang Xiaojun:
Vậy thì ba năm nữa, chúng ta sẽ nhìn thấy một thế giới đã hoàn toàn khác so với hiện tại rồi.
Yang Zhilin:
Với tốc độ phát triển hiện tại, đúng vậy. Công nghệ hiện đang ở giai đoạn nảy mầm, tăng trưởng rất nhanh.
Zhang Xiaojun:
Bạn có hình dung được ba năm nữa sẽ có những gì không?
Yang Zhilin:
Sẽ có một mức độ AGI nhất định. Nhiều việc chúng ta làm hôm nay, AI cũng sẽ làm được—thậm chí tốt hơn chúng ta. Nhưng mấu chốt là chúng ta sử dụng nó như thế nào.
Zhang Xiaojun:
Còn với bạn—với Moonshot AI như một công ty—bước thứ hai là gì?
Yang Zhilin:
Chúng tôi sẽ đi làm hai việc đó. Tất cả những vấn đề còn lại đều bắt nguồn từ hai yếu tố này. Suy luận và agents mà mọi người đang nói đến hôm nay là sản phẩm phụ của việc giải quyết hai vấn đề này. Cần thêm một chút tinh chỉnh, nhưng không có rào cản cơ bản nào.
Zhang Xiaojun:
Bạn sẽ dốc toàn lực để đuổi kịp GPT-4 chứ?
Yang Zhilin:
GPT-4 là một điểm dừng cần thiết trên con đường đi đến AGI. Mấu chốt không phải là hài lòng với việc chỉ bằng được GPT-4.
Thứ nhất, bạn phải hỏi đâu mới là điều phi đồng thuận thực sự lúc này: ngoài GPT-4, tiếp theo là gì? GPT-5 và GPT-6 nên trông như thế nào? Thứ hai, bạn phải xem trong đó mình có những năng lực đặc thù nào—và điều đó quan trọng hơn.
Zhang Xiaojun:
Các công ty mô hình nền tảng khác công bố năng lực và bảng xếp hạng mô hình của họ. Dường như bạn chưa làm vậy?
Yang Zhilin:
Chạy theo thứ hạng trên bảng xếp hạng chẳng có nhiều ý nghĩa. Bảng xếp hạng tốt nhất là người dùng—bạn nên để người dùng bỏ phiếu. Nhiều bảng xếp hạng có vấn đề.
Zhang Xiaojun:
Việc trở thành công ty mô hình nền tảng đầu tiên ở Trung Quốc đạt tới GPT-4 có phải là mục tiêu của bạn không? Nhanh hay chậm có tạo ra khác biệt không?
Yang Zhilin:
Chắc chắn là có. Trong một khung thời gian đủ dài, rồi ai cũng sẽ đạt tới. Nhưng vấn đề là bạn dẫn trước hay tụt lại bao lâu. Chênh lệch sáu tháng hoặc hơn là có ý nghĩa—và nó cũng phụ thuộc vào việc bạn có thể làm gì với khoảng thời gian đó.
Zhang Xiaojun:
Khi nào bạn dự kiến sẽ đạt tới GPT-4?
Yang Zhilin:
Chắc là khá sớm, nhưng tôi không thể công bố thời điểm cụ thể ra công chúng.
Zhang Xiaojun:
Bạn sẽ là người nhanh nhất chứ?
Yang Zhilin:
Điều đó phải được đánh giá linh hoạt—nhưng chúng tôi có cơ hội thực sự.
Zhang Xiaojun:
Sau khi ra mắt Kimi, chỉ số North Star của bạn là gì?
Yang Zhilin:
Hiện tại là làm cho sản phẩm tốt hơn và bổ sung thêm nhiều chiều hơn. Ví dụ, chúng ta không nên chỉ đánh nhau sống mái vì một kịch bản tìm kiếm—về sau tìm kiếm sẽ chỉ là một phần rất nhỏ trong giá trị của sản phẩm này; sản phẩm phải có mức tăng trưởng lớn hơn nhiều.
Tốt hơn 10% hay 20% so với một công cụ tìm kiếm truyền thống thì chẳng đáng là bao—chỉ điều gì thực sự mang tính đột phá mới xứng với ba chữ "AGI".
Giá trị độc nhất của bạn là trí tuệ gia tăng của bạn. Bạn phải giữ vững điểm này: trí tuệ luôn là giá trị gia tăng cốt lõi. Nếu chỉ 10%–20% giá trị cốt lõi của sản phẩm đến từ AI, thì nó không đứng vững.
Phần 5
Tôi Hoàn Toàn Không Lo Lắng Về Thương Mại Hóa
“Quy mô người dùng và quy mô mô hình cần diễn ra cùng lúc”
Zhang Xiaojun:
Giữa năm 2023 là một bước ngoặt rất lớn—thị trường chuyển từ cuồng nhiệt sang lạnh nhanh chóng. Bạn nhìn nhận điều đó như thế nào?
Yang Zhilin:
Tôi không hoàn toàn đồng ý với cách mô tả đó—chúng tôi vẫn hoàn tất một vòng gọi vốn vào nửa sau của năm. Và những điều mới vẫn tiếp tục xuất hiện. Năng lực mô hình ngày nay là điều không thể tưởng tượng được vào cuối năm ngoái. Số lượng người dùng và doanh thu của ngày càng nhiều công ty AI vẫn tiếp tục tăng. Nó liên tục chứng minh giá trị của mình.
Zhang Xiaojun:
Với bạn, điều gì khác đi giữa nửa đầu và nửa sau của năm?
Yang Zhilin:
Không có nhiều thay đổi. Dĩ nhiên là có các biến số, nhưng cuối cùng bạn quay về với những nguyên lý đầu tiên—làm thế nào để mang đến cho người dùng một sản phẩm tốt. Sau cùng, chúng ta phải đáp ứng nhu cầu người dùng, chứ không phải thắng một cuộc đua.
Chúng tôi không phải là một công ty được xây dựng để cạnh tranh.
Zhang Xiaojun:
Ngành này cho rằng sự khác biệt đáng chú ý giữa nửa đầu và nửa sau của năm 2023 là sự chuyển dịch trọng tâm: nửa đầu thiên về AGI hơn; nửa sau chuyển sang cách đưa ứng dụng vào thực tế và thương mại hóa. Bạn có thực hiện sự chuyển dịch đó không?
Yang Zhilin:
Tất nhiên tôi sẽ làm AGI—đó là việc duy nhất có ý nghĩa trong mười năm tới. Nhưng điều đó không có nghĩa là chúng tôi không xây dựng ứng dụng. Hay đúng hơn, nó không nên được định nghĩa là một “ứng dụng”.
“Ứng dụng” nghe như thể bạn có một công nghệ rồi đi tìm chỗ để dùng nó, với một vòng lặp thương mại đã khép kín. Nhưng “ứng dụng” không phải là từ chính xác. Nó và AGI bổ trợ cho nhau. Nó vừa là phương tiện để đạt tới AGI, vừa là mục đích của việc đạt tới nó.
“Ứng dụng” nghe giống như một mục đích hơn: tôi muốn làm cho nó hữu ích. Bạn phải kết hợp triết lý phương Đông và phương Tây—bạn phải kiếm tiền, và bạn phải có lý tưởng.
Ngày nay, người dùng giúp chúng tôi phát hiện những kịch bản mà chúng tôi chưa từng nghĩ tới. Có người dùng nó để sàng lọc résumé—một việc mà chúng tôi chưa từng nghĩ đến khi thiết kế sản phẩm, nhưng nó tự nhiên hoạt động. Ngược lại, đầu vào từ người dùng lại làm mô hình tốt hơn. Vì sao Midjourney lại tốt như vậy? Nó đã mở rộng ở phía người dùng—quy mô người dùng và quy mô mô hình phải diễn ra cùng lúc. Ngược lại, nếu bạn chỉ tập trung vào ứng dụng mà bỏ qua việc lặp lại cải tiến năng lực mô hình—bỏ qua AGI—thì đóng góp của bạn sẽ rất hạn chế.
Zhang Xiaojun:
Hợp danh quản lý của GSR Ventures, Zhu Xiaohu, chỉ đầu tư vào các ứng dụng mô hình nền tảng. Một trong những quan điểm của ông ấy là: vấn đề cốt lõi khó nhất là PMF của AIGC—nếu mười người không tìm ra PMF thì một trăm người cũng vậy thôi; chuyện đó chẳng liên quan gì đến số lượng nhân sự hay chi phí, nên đừng đốt tiền vào nó. Ông ấy nói, “Huấn luyện trên LLaMA trong hai hoặc ba tháng và bạn ít nhất có thể đạt tới trình độ của top 30 người—nó có thể thay thế người ngay lập tức.” Bạn nghĩ gì về quan điểm này?
Yang Zhilin:
AI không phải là chuyện trong một hay hai năm tới tôi có thể tìm thấy PMF gì; mà là chuyện làm thế nào để thay đổi thế giới trong mười đến hai mươi năm tới—đây là hai kiểu tư duy khác nhau.
Chúng tôi là những người theo chủ nghĩa dài hạn kiên định. Khi AGI hoặc thứ còn mạnh hơn được đạt tới, mọi thứ ngày hôm nay sẽ bị viết lại. PMF chắc chắn quan trọng, nhưng nếu bạn vội vàng đi tìm PMF, rất có thể bạn sẽ bị đánh trúng thêm một “đòn tấn công giảm chiều” khác—bị một công nghệ có chiều cao hơn nghiền nát. Điều đó đã xảy ra quá nhiều lần. Trong quá khứ, nhiều người xây dựng các hệ thống chăm sóc khách hàng và đối thoại, làm điền slot—có những công ty quy mô cũng khá ổn. Nhưng tất cả đều bị quét sạch bởi một cú đánh ở chiều cao hơn. Rất đau đớn.
Không phải nói rằng cách làm đó chưa bao giờ hiệu quả. Giả sử hôm nay bạn tìm được một kịch bản mà công nghệ hiện tại là đủ, nơi giá trị gia tăng 0-to-1 là cực lớn và không gian 1-to-n lại không quá lớn—kịch bản đó thì ổn. Midjourney là như vậy, hoặc tạo nội dung quảng cáo—những nhiệm vụ tương đối đơn giản với hiệu ứng 0-to-1 rất rõ ràng. Đó là cơ hội cho phe chỉ làm ứng dụng. Nhưng cơ hội lớn nhất không nằm ở đó. Nếu tiền đề của bạn là thương mại hóa, bạn không thể nghĩ về nó tách rời AGI. Nếu bây giờ tôi chỉ xây dựng ứng dụng—được thôi, nhưng trong một năm bạn có thể bị nghiền nát.
Zhang Xiaojun:
Bạn có thể âm thầm nâng cấp mô hình nền tảng bên dưới mà, đúng không?
Yang Zhilin:
Nhưng cách làm đó không bao giờ có thể lớn hơn chính mô hình. Công nghệ là biến số mới duy nhất của thời đại này; các biến số khác không thay đổi. Quay về nguyên lý đầu tiên, AGI là cốt lõi của mọi thứ. Từ đó, chúng tôi suy ra: một siêu ứng dụng chắc chắn đòi hỏi năng lực kỹ thuật mạnh nhất.
Zhang Xiaojun:
Có thể dùng các mô hình mã nguồn mở không? (Tin mới nhất là Google đã công bố mô hình mã nguồn mở Gemma.)
Yang Zhilin:
Mã nguồn mở đang tụt hậu so với mã nguồn đóng—đó cũng là một sự thật.
Zhang Xiaojun:
Sự tụt hậu đó có thể chỉ là tạm thời không?
Yang Zhilin:
Ít nhất cho đến hiện tại, không có vẻ như vậy.
Zhang Xiaojun:
Vì sao mã nguồn mở không thể bắt kịp mã nguồn đóng?
Yang Zhilin:
Bởi vì hiện nay cách phát triển mã nguồn mở đã khác. Trước đây, ai cũng có thể đóng góp cho mã nguồn mở; ngày nay, chính mã nguồn mở vẫn còn mang tính tập trung.
Rất nhiều đóng góp cho mã nguồn mở có lẽ chưa được kiểm chứng bằng sức mạnh tính toán. Mã nguồn đóng hưởng lợi từ sự tập trung của nhân tài và vốn, nên cuối cùng mã nguồn đóng chắc chắn sẽ tốt hơn—đó là một quá trình tập trung hóa.
Nếu hôm nay tôi có một mô hình dẫn đầu, việc mở mã nguồn của nó rất có thể là phi lý. Có lẽ chỉ những người đang ở phía sau mới làm vậy, hoặc mở mã nguồn một mô hình nhỏ—to để khuấy động thị trường; xét cho cùng, nếu bạn không mở mã nguồn, thì nó cũng chẳng có giá trị gì.
Zhang Xiaojun:
Làm thế nào để đối phó với nỗi lo ở Trung Quốc? Mọi người nói rằng một công ty mô hình nền tảng nếu không nhanh chóng tạo ra các kịch bản thương mại và sản phẩm đáp ứng kỳ vọng của nhà đầu tư thì sẽ khó gọi được vòng tiếp theo.
Yang Zhilin:
Cần có sự cân bằng giữa dài hạn và ngắn hạn.
Hoàn toàn không có người dùng và không có doanh thu thì chắc chắn không được.
Như chúng ta đã thấy, từ GPT-3.5 lên GPT-4 đã mở khóa rất nhiều ứng dụng; từ GPT-4 lên GPT-4.5 rồi đến GPT-5, rất có thể sẽ tiếp tục mở khóa nhiều hơn nữa—thậm chí nhiều hơn theo cấp số nhân. Cái gọi là “định luật Moore của các kịch bản” nghĩa là số lượng kịch bản có thể sử dụng sẽ tăng theo cấp số nhân theo thời gian. Chúng ta cần cải thiện năng lực mô hình đồng thời tìm thêm kịch bản—một sự cân bằng như vậy.
Đó là một vòng xoáy. Nó phụ thuộc vào bao nhiêu phần đầu tư của bạn dành cho ngắn hạn và bao nhiêu phần cho dài hạn. Bạn theo đuổi dài hạn trên điều kiện là có thể sống sót. Dài hạn tuyệt đối không thể bị bỏ qua, nếu không bạn sẽ bỏ lỡ cả một thời đại. Đưa ra kết luận vào lúc này thực sự vẫn còn quá sớm.
Zhang Xiaojun:
Ông có đồng ý với ý tưởng “hai bánh xe cùng dẫn dắt” do Wang Huiwen, đồng sáng lập Meituan và nhà sáng lập Light Year, đưa ra không?
Yang Zhilin:
Đó là một câu hỏi hay. Ở một mức độ nào đó, logic đó có lý. Nhưng cách bạn thực thi mới là yếu tố tạo ra khác biệt rất lớn. Bạn có thực sự có thể thực hiện những “kèo cược phi đồng thuận với xác suất có lợi” hay không?
Zhang Xiaojun:
Theo tôi hiểu, hai bánh xe cùng dẫn dắt của họ cũng đòi hỏi phải nhanh chóng tìm ra các kịch bản ứng dụng mới; nếu không, công nghệ sẽ không có cách nào hạ cánh.
Yang Zhilin:
Rốt cuộc vẫn là sự khác biệt giữa mở rộng quy mô mô hình và mở rộng quy mô người dùng.
Zhang Xiaojun:
Ở Trung Quốc, ngoài ông ra còn ai theo con đường mở rộng quy mô mô hình?
Yang Zhilin:
Điều đó không phải việc tôi có thể đánh giá.
Zhang Xiaojun:
Có lẽ đa số mọi người theo con đường mở rộng quy mô người dùng. Hay có thể nói theo cách khác: đây có phải là sự khác biệt giữa phe học thuật và phe thương mại hóa không?
Yang Zhilin:
Chúng tôi không phải phe học thuật. Phe học thuật chắc chắn không hiệu quả.
Zhang Xiaojun:
Nhiều công ty mô hình nền tảng thương mại hóa thông qua B2B—suy cho cùng, B2B mang lại sự chắc chắn cao hơn. Còn các ông thì sao?
Yang Zhilin:
Chúng tôi thì không. Ngay từ ngày đầu, chúng tôi đã quyết định đi theo B2C.
Điều đó phụ thuộc vào việc bạn muốn gì. Nếu bạn biết một thứ không phải điều mình muốn, bạn sẽ không mắc FOMO—vì cho dù có đạt được nó, cũng chẳng có ý nghĩa gì nhiều.
Zhang Xiaojun:
Trong năm qua ông có thấy lo lắng không?
Yang Zhilin:
Nhiều hơn là hưng phấn và phấn khích. Vì tôi đã nghĩ về chuyện này từ rất lâu rồi. Có lẽ chúng tôi là một trong những người sớm nhất muốn khám phá mặt tối của Mặt Trăng. Hôm nay, bạn nhận ra rằng mình thực sự đang chế tạo một tên lửa, và mỗi ngày đều bàn luận xem nên thêm loại nhiên liệu nào để nó chạy nhanh hơn—và làm sao để nó không nổ tung.
Zhang Xiaojun:
Tóm lại những “kèo cược phi đồng thuận với xác suất có lợi” mà ông đã thực hiện—ngoài B2C và long context, còn có gì nữa không?
Yang Zhilin:
Còn nhiều cái đang được triển khai; tôi hy vọng sớm chia sẻ với mọi người.
Zhang Xiaojun:
Thế hệ doanh nhân trước đây ở Trung Quốc đã nếm trải thành công với ứng dụng và kịch bản, nên họ tập trung nhiều hơn vào sản phẩm, người dùng và bánh đà dữ liệu. Thế hệ doanh nhân AI mới mà ông đại diện có thể tạo nên một tương lai mới không?
Yang Zhilin:
Chúng tôi cũng rất quan tâm đến người dùng. Người dùng là mục tiêu cuối cùng của chúng tôi, nhưng đó cũng là một quá trình đồng sáng tạo.
Khác biệt lớn nhất là lần này sẽ mang tính dẫn dắt bởi công nghệ nhiều hơn.
Vẫn là câu hỏi xe ngựa so với ô tô: chúng ta đang ở trong bước nhảy từ xe ngựa sang ô tô, và nên tập trung tối đa vào việc làm sao để mang đến cho người dùng một chiếc ô tô.
Zhang Xiaojun:
Ông có thấy cô đơn không?
Yang Zhilin:
Ha ha ha… Câu hỏi khá thú vị. Tôi nghĩ mình ổn, vì tôi vẫn có hàng chục—gần cả trăm—người đang chiến đấu bên cạnh tôi.
Phần 6
Trước khi chúng ta kịp bắt kịp GPT-4, Sora đã xuất hiện
“Hiện tại giống như thời điểm GPT-3.5 đối với việc tạo video”
Zhang Xiaojun:
Sora bất ngờ xuất hiện trong năm nay—bao nhiêu phần là nằm trong dự tính của ông và bao nhiêu phần là không?
Yang Zhilin:
Việc AI tạo sinh có thể đạt được hiệu ứng này là nằm trong dự tính; điều bất ngờ là thời điểm—nó đến sớm hơn mức chúng tôi ước tính.
Điều đó cũng phản ánh AI hiện đang phát triển nhanh đến mức nào: rất nhiều lợi tức từ quy mô hóa vẫn chưa được thu hoạch đầy đủ.
Zhang Xiaojun:
Năm ngoái, ngành công nghiệp cho rằng các mô hình nền tảng trong năm 2024 chắc chắn sẽ cạnh tranh gay gắt về câu chuyện đa phương thức, và chất lượng tạo video sẽ cải thiện nhanh như text-to-image trong năm 2023. Năng lực kỹ thuật của Sora vượt quá, đáp ứng hay thấp hơn kỳ vọng của ông?
Yang Zhilin:
Nó đã giải quyết được nhiều vấn đề trước đây rất khó. Ví dụ, duy trì tính nhất quán của quá trình sinh trong một khoảng thời gian tương đối dài — đó là điểm then chốt, và là một cải tiến rất lớn.
Zhang Xiaojun:
Điều đó có ý nghĩa gì đối với cục diện ngành toàn cầu? Trong năm 2024, các mô hình nền tảng sẽ xuất hiện những câu chuyện mới nào?
Yang Zhilin:
Thứ nhất, giá trị ứng dụng trong ngắn hạn: nó có thể tiếp tục nâng cao hiệu quả trong các quy trình sản xuất, và tất nhiên chúng tôi cũng kỳ vọng có thêm nhiều mở rộng được xây dựng trên các năng lực hiện tại. Thứ hai, kết hợp với các phương thức khác. Bản thân nó là một mô hình về thế giới; với tri thức đó, nó là sự bổ trợ tuyệt vời cho văn bản hiện có. Trên cơ sở đó, còn khá nhiều không gian và cơ hội, dù là trong agent hay trong việc kết nối với thế giới vật lý.
Zhang Xiaojun:
Nhìn chung, ông đánh giá Sora như thế nào?
Yang Zhilin:
Chúng tôi cũng đã từng lên kế hoạch cho một hướng tương tự và đã làm việc trên đó một thời gian. Xét về hướng đi thì nó không có gì quá bất ngờ — chủ yếu là ở các chi tiết kỹ thuật.
Zhang Xiaojun:
Những chi tiết kỹ thuật nào đáng để học hỏi?
Yang Zhilin:
OpenAI cũng chưa giải thích đầy đủ nhiều điểm trong số đó. Họ chỉ mô tả những nét lớn; còn những chi tiết then chốt thì bạn phải suy ra từ đầu ra của nó hoặc từ những thông tin sẵn có, kết hợp với các thí nghiệm trước đây của chúng tôi. Ít nhất đối với chúng tôi, nó cung cấp thêm các điểm dữ liệu cho quá trình phát triển — thêm đầu vào dữ liệu.
Zhang Xiaojun:
So với sinh văn bản, những nút thắt chính trong sinh video là gì? Lần này bạn thấy OpenAI đã tìm ra giải pháp nào?
Yang Zhilin:
Nút thắt lớn nhất — cốt lõi vẫn là dữ liệu: làm sao khớp được dữ liệu ở quy mô lớn? Điều đó trước đây chưa được kiểm chứng, đặc biệt khi chuyển động phức tạp và kết quả sinh ra lại chân thực như ảnh chụp.
Trong điều kiện đó, có thể mở rộng quy mô — đó là điều lần này nó đã giải quyết được.
Những gì vẫn chưa được giải quyết bao gồm, chẳng hạn, nhu cầu về một kiến trúc thống nhất. DiT vẫn chưa phải là một kiến trúc đủ phổ quát.
Mô hình hóa xác suất biên của các tín hiệu thuần thị giác có thể làm rất tốt, nhưng làm sao để khái quát nó thành một chiếc máy tính mới mang tính phổ quát? Vẫn cần một kiến trúc thống nhất hơn — ở đó vẫn còn dư địa.
Zhang Xiaojun:
Ông đã đọc báo cáo Sora của OpenAI, “Video generation models as world simulators” chưa? Những điểm nào trong đó đáng được nhấn mạnh?
Yang Zhilin:
Tôi đã đọc. Với tình hình cạnh tranh hiện tại, họ chắc chắn sẽ không viết ra những điểm quan trọng nhất. Nhưng nó vẫn rất đáng để học hỏi. Về cơ bản đây là nội dung đã được trả phí — những thứ mà nếu không thì bạn có thể phải tốn tiền cho rất nhiều thí nghiệm mới học được. Giờ bạn có thể biết một phần trong số đó mà không phải trả tiền cho các thí nghiệm, và hình thành một hiểu biết sơ bộ.
Zhang Xiaojun:
Ông rút ra những tín hiệu then chốt nào từ đó?
Yang Zhilin:
Rằng thứ này có thể mở rộng đến một mức độ nhất định. Ngoài ra, nó cũng đưa ra một mô tả khá cụ thể về cách kiến trúc được xây dựng. Nhưng cũng có khả năng các kiến trúc khác nhau không tạo ra khác biệt mang tính bản chất như vậy đối với bài toán này.
Zhang Xiaojun:
Ông có đồng ý với câu của họ — “Mở rộng quy mô các mô hình sinh video là một hướng đi đầy hứa hẹn để xây dựng các bộ mô phỏng đa dụng của thế giới vật lý” không?
Yang Zhilin:
Tôi hoàn toàn đồng ý. Hai thứ này tối ưu cùng một hàm mục tiêu — điều đó hầu như không có gì phải nghi ngờ.
Zhang Xiaojun:
Ông nghĩ gì về việc Yann LeCun một lần nữa lên tiếng phản đối AI sinh? Quan điểm của ông ấy: “Mô hình hóa thế giới bằng cách sinh pixel là lãng phí và chắc chắn sẽ thất bại. Sinh ra vốn dĩ hoạt động với văn bản vì văn bản là rời rạc, với số lượng ký hiệu hữu hạn. Trong trường hợp đó, xử lý bất định trong dự đoán là dễ; còn xử lý bất định dự đoán trong các đầu vào cảm giác liên tục nhiều chiều là không thể giải quyết được.”
Yang Zhilin: Giờ tôi nghĩ rằng khi bạn mô hình hóa xác suất biên của video, bản chất là nén không mất mát — không có khác biệt bản chất nào so với dự đoán token tiếp theo trong các mô hình ngôn ngữ. Chỉ cần bạn nén đủ tốt, bạn có thể giải thích bất cứ điều gì trong thế giới này vốn có thể được giải thích.
Nhưng vẫn còn những công việc quan trọng chưa hoàn thành: nó kết hợp với những năng lực đã được nén như thế nào? Bạn có thể xem đó là hai loại nén khác nhau. Một loại nén thế giới thô nguyên bản — đó là việc các mô hình video làm. Loại còn lại nén những hành vi mà con người tạo ra, bởi vì hành vi của con người đã đi qua bộ não người — thứ duy nhất trong thế giới tạo ra trí tuệ.
Bạn có thể xem mô hình video là làm loại thứ nhất và mô hình văn bản là loại thứ hai, dù mô hình video cũng chứa một phần của loại thứ hai: một số video do con người tạo ra chứa đựng trí tuệ của người tạo ra chúng. Cuối cùng, có lẽ sẽ là sự pha trộn — bạn cần học từ nhiều góc độ thông qua cả hai cách tiếp cận, và cả hai đều góp phần vào sự tăng trưởng của trí tuệ.
Vì vậy, sinh ra có lẽ không phải là mục tiêu; nó chỉ đơn thuần là hàm nén. Nếu bạn nén đủ tốt, việc sinh ra cuối cùng sẽ rất tốt. Ngược lại, nếu bản thân một mô hình không thể sinh ra, liệu nó còn có thể nén cực kỳ tốt không? Điều đó đáng nghi ngờ. Có thể sinh ra rất tốt là điều kiện cần để nén rất tốt.
Zhang Xiaojun:
Sora và ChatGPT của năm ngoái là hai cột mốc khác nhau. Cái nào lớn hơn?
Yang Zhilin:
Cả hai đều rất quan trọng.
Hiện tại nó khá giống thời điểm GPT-3.5 đối với sinh video — một bước nhảy bậc thang.
Mô hình vẫn còn tương đối nhỏ, và có thể thấy trước rằng sẽ có những mô hình lớn hơn, điều này đồng nghĩa với cải thiện năng lực là chắc chắn.
Zhang Xiaojun:
Một số người cũng cho rằng, xét về đa phương thức, đột phá của Google Gemini còn quan trọng hơn.
Yang Zhilin:
Gemini đi theo hướng GPT-4V và cũng bao gồm cả hiểu biết đó. Cả hai đều quan trọng; bước cuối cùng là đưa tất cả những thứ này vào cùng một mô hình, và điều đó vẫn chưa được giải quyết.
Zhang Xiaojun:
Vì sao việc đưa chúng vào cùng một mô hình lại khó đến vậy?
Yang Zhilin:
Hiện chưa ai biết cách cả. Vẫn chưa có kiến trúc nào được kiểm chứng.
Zhang Xiaojun:
Sora + GPT sẽ tạo ra gì?
Yang Zhilin:
Sora có thể được áp dụng ngay vào sản xuất video, nhưng nếu kết hợp với các mô hình ngôn ngữ, nó có thể nối kết thế giới số và thế giới vật lý. Bạn cũng có thể hoàn thành nhiệm vụ theo cách end-to-end hơn, vì mô hình hóa thế giới của bạn giờ đã tốt hơn trước—nó thậm chí có thể được dùng để cải thiện khả năng hiểu đầu vào đa phương thức. Vì vậy, cuối cùng bạn có thể chuyển đổi khá linh hoạt giữa các phương thức.
Tóm lại: bạn hiểu thế giới tốt hơn; bạn có thể làm nhiều nhiệm vụ end-to-end hơn trong thế giới số; và bạn thậm chí có thể xây một cây cầu sang thế giới vật lý để hoàn thành nhiệm vụ ở đó. Đây là điểm khởi đầu.
Ví dụ như lái xe tự động, hoặc một số việc nhà—về lý thuyết, tất cả đều là những trường hợp kết nối với thế giới vật lý. Vì vậy, đột phá trong thế giới số là chắc chắn, nhưng nó cũng hàm chứa tiềm năng trở thành một con đường tiến tới thế giới vật lý.
Zhang Xiaojun:
Sora có ý nghĩa gì đối với các công ty mô hình nền tảng của Trung Quốc? Đáp lại như thế nào là đúng?
Yang Zhilin:
Nó không thay đổi nhiều. Đây vốn dĩ luôn là một hướng đi chắc chắn.
Zhang Xiaojun:
Các mô hình nền tảng của Trung Quốc vẫn chưa bắt kịp GPT-4, và giờ Sora đã xuất hiện. Anh nghĩ sao? Hai thế giới dường như đang ngày càng tách xa nhau—anh có thấy lo lắng không?
Yang Zhilin:
Đó պարզապես là một факт khách quan. Nhưng khoảng cách thực tế có lẽ vẫn đang thu hẹp dần—đó là quy luật phát triển của công nghệ.
Zhang Xiaojun:
Ý anh là gì? Rằng đường cong công nghệ lúc đầu dốc rồi dần dần phẳng ra?
Yang Zhilin:
Đúng vậy. Tôi cũng không quá ngạc nhiên—OpenAI vẫn luôn phát triển các mô hình thế hệ tiếp theo. Về mặt khách quan, khoảng cách đó sẽ còn tồn tại một thời gian, và khoảng cách giữa các công ty Trung Quốc khác nhau cũng sẽ còn tồn tại một thời gian—đây là giai đoạn bùng nổ công nghệ.
Nhưng thêm hai hoặc ba năm nữa, rất có thể các công ty hàng đầu của Trung Quốc sẽ làm tốt hơn phần việc nền tảng ở đây—including hạ tầng kỹ thuật, dự trữ nhân tài và sự lắng đọng của văn hóa tổ chức. Với quá trình mài giũa đó, họ sẽ có nhiều khả năng dẫn đầu ở một số khía cạnh nhất định hơn—but cần có chút kiên nhẫn.
Zhang Xiaojun:
Trung Quốc và Mỹ có thể cuối cùng sẽ hình thành những hệ sinh thái công nghệ AI hoàn toàn khác nhau không?
Yang Zhilin:
Các hệ sinh thái có thể khác nhau, nếu nhìn từ góc độ sản phẩm và thương mại hóa. Nhưng từ góc độ công nghệ, các năng lực tổng quát sẽ không đi theo những lộ trình kỹ thuật hoàn toàn khác nhau—những năng lực tổng quát cơ bản chắc chắn sẽ tương tự nhau. Bởi vì không gian của AGI rất rộng, nên sự khác biệt hóa trên nền tảng các năng lực tổng quát nhiều khả năng sẽ xảy ra hơn.
Zhang Xiaojun:
Ở Silicon Valley có một cuộc tranh luận kéo dài: “một mô hình thống trị tất cả” hay “nhiều (mô hình nhỏ) chuyên biệt”—một mô hình tổng quát cho mọi loại nhiệm vụ, hay nhiều mô hình nhỏ chuyên biệt cho các nhiệm vụ cụ thể. Quan điểm của anh thế nào?
Yang Zhilin:
Tôi đứng về quan điểm thứ nhất.
Zhang Xiaojun:
Về điểm này, Trung Quốc và Mỹ có sẽ phân hóa rất lớn không?
Yang Zhilin:
Tôi không nghĩ vậy, về lâu dài.
Phần 7
Tôi Chấp Nhận Rằng Thất Bại Là Một Khả Năng
“Nó Đã Thay Đổi Cuộc Đời Tôi”
Zhang Xiaojun:
Khởi nghiệp về mô hình nền tảng ở Trung Quốc là một kiểu sinh vật khá đặc biệt: anh đã huy động rất nhiều tiền, nhưng dường như phần lớn lại được dùng cho các thí nghiệm khoa học. Anh thuyết phục nhà đầu tư mở hầu bao trong hoàn cảnh như vậy bằng cách nào?
Yang Zhilin:
Không khác gì ở Mỹ.
Số tiền chúng tôi huy động được đến nay cũng chưa nhiều đến thế.
Vì vậy chúng tôi vẫn còn rất nhiều điều phải học từ OpenAI.
Zhang Xiaojun:
Tôi muốn biết: cần thêm bao nhiêu tiền để đạt tới GPT-4? Bao nhiêu để đạt tới Sora?
Yang Zhilin:
Cả GPT-4 lẫn Sora đều không cần nhiều đến vậy. Số tiền bây giờ chủ yếu là để dành cho thế hệ kế tiếp—hoặc thế hệ sau nữa—của các mô hình, cho việc khám phá tuyến đầu.
Zhang Xiaojun:
Các startup mô hình nền tảng của Trung Quốc đã nhận tiền từ các ông lớn, nhưng các ông lớn cũng đang tự huấn luyện mô hình của họ. Anh nhìn nhận mối quan hệ giữa các startup mô hình nền tảng và các ông lớn như thế nào?
Yang Zhilin:
Vừa có cạnh tranh vừa có hợp tác. Các ông lớn và các startup có những ưu tiên số một khác nhau. Hãy nhìn bất kỳ công ty công nghệ lớn nào hôm nay: ưu tiên số một của họ khác với ưu tiên số một của một công ty AGI. Ưu tiên số một của bạn định hình hành động và kết quả của bạn, và cuối cùng xác định những mối quan hệ khác nhau trong hệ sinh thái.
Zhang Xiaojun:
Vì sao các ông lớn lại rải những khoản đầu tư nhỏ vào nhiều công ty mô hình nền tảng thay vì đặt cược mạnh vào một công ty?
Yang Zhilin:
Đó là vấn đề của giai đoạn.
Về sau sẽ còn nhiều hợp nhất hơn—và số công ty sẽ ít hơn.
Zhang Xiaojun:
Một số người nói kết cục của các công ty mô hình nền tảng là bị một ông lớn thâu tóm. Anh có đồng ý không?
Yang Zhilin:
Tôi không nghĩ là nhất thiết như vậy. Nhưng họ rất có thể sẽ có những quan hệ đối tác rất sâu.
Zhang Xiaojun:
Ví dụ, họ có thể hợp tác như thế nào?
Yang Zhilin:
OpenAI và Microsoft là mô hình hợp tác kinh điển. Phần lớn có thể tham khảo, và một phần có thể cải thiện.
Zhang Xiaojun:
Trong năm qua, những khúc quanh của khởi nghiệp đã hiện lên với anh ở đâu?
Yang Zhilin:
Có rất nhiều biến số bên ngoài—vốn, nhân tài, GPU, sản phẩm, R&D, công nghệ. Có những thời điểm nổi bật, và cũng có những khó khăn phải vượt qua. Lấy GPU làm ví dụ.
Đã có rất nhiều lên xuống: nguồn cung có lúc căng thẳng một thời gian, rồi lại cải thiện.
Giai đoạn cực đoan nhất là giá thay đổi từng ngày—một máy hôm nay có thể giá 260, ngày mai 340, rồi hai ngày sau lại giảm xuống. Đó là một tình huống luôn biến động. Bạn phải theo sát nó.
Giá liên tục thay đổi, nên chiến lược cũng liên tục thay đổi: dùng kênh nào, mua hay thuê—có rất nhiều lựa chọn khác nhau.
Zhang Xiaojun:
Điều gì đã thúc đẩy những biến động này?
Yang Zhilin:
Lý do địa chính trị; bản thân quá trình sản xuất diễn ra theo từng đợt; và tâm lý thị trường cũng đóng vai trò. Chúng tôi quan sát thấy nhiều công ty bắt đầu trả lại GPU, nhận ra rằng họ không nhất thiết cần dùng chúng để huấn luyện mô hình này. Khi tâm lý thị trường và quyết định của mọi người thay đổi, cung và cầu cũng thay đổi theo. Tin tốt là nhìn chung nguồn cung gần đây đã được cải thiện rất nhiều.
Đánh giá cá nhân của tôi là, ít nhất trong một đến hai năm tới, GPU sẽ không phải là nút thắt lớn.
Zhang Xiaojun:
Anh dường như luôn suy nghĩ về tổ chức. Anh đã xây dựng đội ngũ như thế nào?
Yang Zhilin:
Cách tuyển dụng của chúng tôi đã thay đổi theo thời gian. Nhân tài AGI trên toàn thế giới vô cùng hiếm, và những người có kinh nghiệm liên quan thì rất ít. Hồ sơ tuyển dụng ban đầu của chúng tôi tập trung vào việc tìm kiếm những thiên tài có kỹ năng trực tiếp liên quan. Điều đó đã chứng minh là rất thành công. Những người từng “phẫu thuật” mô hình và có kinh nghiệm thực chiến huấn luyện mô hình siêu lớn có thể làm mọi thứ rất nhanh. Bao gồm cả lần ra mắt Kimi—hiệu quả về vốn và hiệu quả tổ chức thực sự rất cao.
Zhang Xiaojun:
Tốn bao nhiêu?
Yang Zhilin:
Một con số khá nhỏ—so với nhiều khoản chi khác, đó là làm việc lớn với ít tiền. Trong một thời gian dài chúng tôi chỉ có 30–40 người. Bây giờ là 80. Chúng tôi theo đuổi mật độ nhân tài.
Sau này, cấu hình nhân tài đã thay đổi. Thuở ban đầu, chúng tôi tuyển những thiên tài, tin rằng trần năng lực của họ rất cao—trần năng lực của một công ty được quyết định bởi trần năng lực của con người trong đó. Sau đó, chúng tôi bổ sung đội ngũ với nhiều chiều năng lực hơn—những người ở phía sản phẩm-vận hành, kiểu người lãnh đạo, những người có thể đẩy mọi thứ đến cực hạn. Bây giờ đây là một đội ngũ đầy đủ hơn, có sức bền hơn và có thể chiến đấu.
Zhang Xiaojun:
Sau một năm khởi nghiệp mô hình nền tảng ở Trung Quốc, anh đánh giá kết quả cột mốc hiện tại như thế nào?
Yang Zhilin:
Chúng tôi đã xây dựng được một nguyên mẫu tên lửa và hiện đang thử bắn. Chúng tôi đã tập hợp được đội ngũ, tìm ra một số công thức nhiên liệu, và về cơ bản có thể nhìn thấy một PMF phôi thai. Có thể nói chúng tôi đã bước ra bước đầu tiên của sứ mệnh lên Mặt Trăng.
Zhang Xiaojun:
Anh nghĩ gì về quan điểm của Yann LeCun? Ông ấy không lạc quan về lộ trình kỹ thuật hiện tại—ông tin rằng các mô hình ngôn ngữ tự giám sát không thể có được tri thức thật sự về thế giới, và khi mô hình mở rộng, xác suất sai sót—ảo giác máy—sẽ chỉ tăng lên. Ông ấy đã đưa ra ý tưởng về một “world model”.
Yang Zhilin:
Không có nút thắt mang tính căn bản nào cả. Khi không gian token đủ lớn, nó sẽ trở thành một loại máy tính mới để giải quyết các vấn đề tổng quát—và đó chính là một world model tổng quát.
Một điểm quan trọng đằng sau phát biểu của ông ấy: ai cũng có thể thấy các hạn chế hiện tại. Nhưng giải pháp không nhất thiết đòi hỏi một khuôn khổ hoàn toàn mới. Thứ duy nhất hiệu quả trong AI là dự đoán token tiếp theo cộng với scaling law. Miễn là các token đủ đầy đủ, mọi thứ đều có thể làm được. Tất nhiên, những vấn đề ông ấy nêu ra hiện nay đúng là có tồn tại—nhưng bạn giải quyết chúng bằng cách làm cho không gian token trở nên thật sự tổng quát. Chỉ vậy thôi.
Zhang Xiaojun:
Vậy ông ấy đang phóng đại các hạn chế.
Yang Zhilin:
Tôi nghĩ là vậy. Nguyên lý nền tảng là đúng—chỉ là vẫn còn một số vấn đề kỹ thuật nhỏ chưa được giải quyết.
Zhang Xiaojun:
Anh nghĩ gì về Geoffrey Hinton, cha đỡ đầu của deep learning, khi liên tục kêu gọi chú ý đến an toàn AI?
Yang Zhilin:
Việc ông ấy tập trung vào an toàn thực ra cho thấy ông ấy có niềm tin rất lớn vào sự cải thiện sắp tới của năng lực kỹ thuật. Hai điều này là đối nghịch nhau.
Zhang Xiaojun:
Làm sao để giải quyết vấn đề ảo giác?
Yang Zhilin:
Vẫn là scaling law—chỉ là thứ được scale lên là một thứ khác.
Zhang Xiaojun:
Cuối cùng, khả năng scaling law hóa ra là ngõ cụt là bao nhiêu?
Yang Zhilin:
Xác suất xấp xỉ bằng không.
Zhang Xiaojun:
Anh nghĩ gì về quan điểm của cựu sinh viên CMU Qi Lu: OpenAI chắc chắn sẽ lớn hơn Google—chỉ là lớn hơn gấp một, năm hay mười lần?
Yang Zhilin:
Công ty AGI thành công nhất trong tương lai chắc chắn sẽ lớn hơn mọi công ty ngày nay—điều đó thì không còn nghi ngờ gì nữa.
Cuối cùng, nó có thể là vấn đề gấp đôi hoặc gấp ba GDP. Có thể không phải là OpenAI; có thể là một công ty khác. Nhưng chắc chắn sẽ có một công ty như vậy.
Zhang Xiaojun:
Nếu anh tình cờ trở thành CEO của đế chế AI này, anh sẽ làm gì để bảo vệ nhân loại?
Yang Zhilin:
Nghĩ về câu hỏi đó lúc này vẫn còn thiếu một số điều kiện tiên quyết. Nhưng chúng tôi chắc chắn sẵn sàng hợp tác với và học hỏi từ các tác nhân khác nhau trong xã hội, bao gồm việc đưa thêm nhiều biện pháp an toàn vào trong mô hình.
Zhang Xiaojun:
Mục tiêu của anh cho năm 2024 là gì?
Yang Zhilin:
Thứ nhất, đột phá kỹ thuật—hiện giờ chúng tôi hẳn đã có thể xây dựng một mô hình tốt hơn rất nhiều so với năm 2023. Thứ hai, người dùng và sản phẩm—tôi hy vọng có nhiều người dùng hơn ở quy mô lớn và khả năng giữ chân mạnh hơn.
Zhang Xiaojun:
Dự đoán của anh về ngành mô hình nền tảng toàn cầu trong năm 2024 là gì?
Yang Zhilin:
Năm nay sẽ xuất hiện nhiều năng lực hơn, nhưng cục diện sẽ không khác nhiều so với hiện tại—vài người dẫn đầu vẫn sẽ dẫn đầu. Về năng lực, nửa cuối năm có thể sẽ có một số đột phá khá lớn, nhiều đột phá đến từ OpenAI; chắc chắn nó có một mô hình thế hệ tiếp theo—có thể là 4.5, có thể là 5. Đó có cảm giác là một sự kiện có xác suất cao. Các mô hình tạo video chắc chắn vẫn có thể tiếp tục mở rộng.
Zhang Xiaojun:
Còn dự đoán của anh về ngành mô hình nền tảng của Trung Quốc trong năm 2024 thì sao?
Yang Zhilin:
Thứ nhất, bạn sẽ thấy những năng lực mới, khác biệt xuất hiện. Các mô hình Trung Quốc—nhờ đầu tư sớm hơn và có đúng đội ngũ—sẽ đạt được năng lực dẫn đầu thế giới ở một số chiều nhất định. Thứ hai, sẽ xuất hiện các sản phẩm có cơ sở người dùng lớn hơn nhiều—khả năng này rất cao. Thứ ba, sẽ có thêm sự hợp nhất và phân hóa trong các lựa chọn lộ trình.
Zhang Xiaojun:
Khi khởi nghiệp công ty này, điều anh sợ nhất là gì?
Yang Zhilin:
Thật ra cũng chẳng có gì nhiều—chỉ cần lao về phía trước một cách không sợ hãi thôi.
Zhang Xiaojun:
Bạn có muốn nói gì với các đồng nghiệp của mình không?
Yang Zhilin:
Hãy cùng nhau tiếp tục cố gắng.
Zhang Xiaojun:
Hãy nêu ra một câu hỏi về ngành mô hình nền tảng mà bạn هنوز chưa biết câu trả lời nhưng lại muốn biết nhất.
Yang Zhilin:
Tôi không biết giới hạn của AGI trông sẽ như thế nào — nó sẽ tạo ra một kiểu công ty gì, và công ty đó sẽ tạo ra những sản phẩm gì. Đó là điều tôi muốn biết nhất lúc này.
Zhang Xiaojun:
Khi AGI tiếp tục phát triển như thế này, điều gì là thứ duy nhất mà bạn ít muốn nhìn thấy nhất?
Yang Zhilin:
Tôi khá lạc quan về điều đó. Nó có thể đưa nền văn minh nhân loại lên giai đoạn tiếp theo.
Zhang Xiaojun:
Có ai từng nói bạn quá lý tưởng chủ nghĩa chưa?
Yang Zhilin:
Chúng tôi cũng rất thực tế. Thực ra chúng tôi đã làm ra được vài thứ thật sự — chúng tôi không chỉ nói suông.
Zhang Xiaojun:
Nếu số tiền bạn đã huy động hôm nay là số tiền cuối cùng bạn từng có, bạn sẽ chi tiêu nó như thế nào?
Yang Zhilin:
Tôi hy vọng điều đó sẽ không bao giờ xảy ra, vì trong tương lai chúng tôi sẽ cần nhiều tiền hơn nữa.
Zhang Xiaojun:
Nếu bạn không thành công, bạn có coi mình là kẻ thất bại không?
Yang Zhilin:
Điều đó cũng không quá quan trọng — tôi chấp nhận rằng thất bại là một khả năng.
Hành trình này đã hoàn toàn thay đổi cuộc đời tôi, và tôi vô cùng biết ơn.
(Kết thúc)
Chỉ nhằm mục đích cung cấp thông tin; không phải tư vấn đầu tư, pháp lý, thuế hoặc tài chính.