商汤 công bố SenseNova U1 Pro: Cạnh tranh mô hình đa phương thức chuyển sang việc bàn giao các tác vụ phức tạp
商汤 đã giới thiệu SenseNova U1 Pro tại Hội nghị Trí tuệ nhân tạo thế giới 2026, định vị đây là nền tảng tác nhân đa phương thức bản địa cho các tác vụ…
一、Điều gì đã xảy ra
Ngày 18 tháng 7, tại Hội nghị Trí tuệ nhân tạo thế giới 2026 (WAIC), 商汤科技 đã chính thức ra mắt sản phẩm chủ lực của dòng mô hình lớn SenseNova U1 Pro. 商汤 định vị đây là nền tảng tác nhân đa phương thức bản địa “cấp bàn giao” cho các tác vụ dài hạn, với mục tiêu để mô hình tiến xa hơn việc chỉ tạo nội dung một lần, mà tham gia vào quá trình hiểu, lập kế hoạch, thực thi, kiểm tra và sửa đổi trong các tác vụ phức tạp.
SenseNova U1 Pro thuộc phiên bản chủ lực của dòng “日日新 SenseNova U”, tập trung bao phủ các kịch bản như thiết kế hình ảnh, infographic, tài liệu thuyết trình, storyboard video và minh họa khoa học. Theo 商汤, bản xem trước của sản phẩm đã bắt đầu thử nghiệm theo hình thức mời tham gia, còn bản chính thức dự kiến phát hành rộng rãi vào tháng 8 năm 2026, đồng thời cung cấp bảng giá và dịch vụ API.
二、Vì sao đáng chú ý
Từ tạo nội dung sang bàn giao đầu ra
Các mô hình sinh nội dung truyền thống thường xoay quanh việc tạo ảnh hoặc nội dung khác chỉ với một lần prompt, nhưng 商汤 muốn dùng U1 Pro để xử lý các tác vụ có quy trình dài hơn. Mô hình cần hiểu mục tiêu phức tạp, liên tục thực hiện nhiều vòng sáng tạo và chỉnh sửa, và cuối cùng bàn giao một đầu ra hình ảnh có độ hoàn thiện tương đối cao.
商汤 tóm lược hướng đi này là sự chuyển dịch từ “Generation” sang “Delivery”, và so sánh với sự tiến hóa từ Copilot, Vibe Coding sang Agentic Coding trong lĩnh vực mã nguồn. Nếu hướng sản phẩm này được triển khai ổn định, trục cạnh tranh của mô hình hình ảnh sẽ không chỉ dừng ở chất lượng ảnh đơn lẻ, mà còn mở rộng sang sắp xếp thông tin, tính nhất quán phong cách, chỉnh sửa chi tiết và khả năng hoàn thành tác vụ.
Mô hình hình ảnh bắt đầu đi vào quy trình sản xuất
U1 Pro không chỉ nhắm tới việc tạo ảnh giải trí, mà còn hướng vào các workflow như infographic doanh nghiệp, PPT, poster thương mại, hình ảnh sản phẩm cho thương mại điện tử, minh họa khoa học, thiết kế concept phim ảnh và storyboard anime. Định vị sản phẩm này cho thấy 商汤 đang tìm cách tích hợp mô hình đa phương thức sâu hơn vào quy trình văn phòng, thiết kế thương mại và sản xuất nội dung.
Tuy nhiên, các thông tin hiện được công bố chủ yếu dựa trên tài liệu ra mắt của 商汤 và các báo cáo truyền thông, vẫn chưa đủ để độc lập chứng minh tính ổn định và hiệu quả trong các workflow thực tế khác nhau.
三、Thông tin công khai và năng lực sản phẩm
Theo 商汤, SenseNova U1 Pro chủ yếu có các năng lực sau.
- Thiết kế hình ảnh chuyên nghiệp: chú trọng bố cục, màu sắc và hiệu ứng trình bày, nhằm giảm “cảm giác AI” thường thấy ở ảnh do mô hình sinh ra.
- Đầu ra native 8K: hỗ trợ độ phân giải gốc lên tới 8K, hướng tới sản xuất nội dung hình ảnh siêu dài, siêu dung lượng và mật độ thông tin cao.
- Kiểm soát giữa hình ảnh và văn bản, chi tiết: tăng cường xử lý quan hệ giữa văn bản, hình ảnh, bố cục và chi tiết, áp dụng cho infographic, tài liệu thuyết trình và các sơ đồ tri thức phức tạp.
- Vòng lặp Agentic dài hạn: với các mục tiêu phức tạp, mô hình có thể chạy hàng chục vòng sinh tác nhân, đồng thời chỉnh sửa phong cách tổng thể và văn bản cục bộ.
Các ví dụ do 商汤 đưa ra bao gồm việc trước tiên thiết kế thế giới quan của câu chuyện video, thiết lập nhân vật, trang phục và vũ khí, cũng như tông màu môi trường, sau đó tạo ra tối đa 22 khung storyboard liên tục có tính logic nhất quán. Ngoài ra còn có ví dụ tích hợp đường thăng hạng trong trận đấu thể thao, quan hệ đối đầu của vận động viên, hệ thống chiến thuật, mạng lưới chuyền bóng và bản đồ nhiệt chạm bóng, rồi xuất ra thành báo cáo biểu đồ độ phân giải cao.
Ngoài ra, công ty cũng trình bày tác phẩm màn hình siêu rộng tỷ lệ 4:1 có chứa các địa danh đô thị và lượng lớn thông tin văn bản, qua đó thể hiện năng lực của mô hình trong việc xử lý canvas dài, bố cục phức tạp và sự hòa trộn giữa hình ảnh và văn bản.
四、Lộ trình kỹ thuật và giới hạn của bằng chứng
商汤 cho biết họ sử dụng kiến trúc lõi NEO-unify cho nền tảng của U1 Pro, và trong hệ thống đa phương thức bản địa, họ hợp nhất biểu đạt ngôn ngữ và biểu đạt thị giác để giảm sự đứt gãy giữa hiểu và sinh.
商汤 cũng nói rằng mô hình thị giác lớn thống nhất mã nguồn mở SenseNova-Vision đã đưa các tác vụ thị giác truyền thống như phân tách đối tượng theo instance và phát hiện vật thể vào năng lực của mô hình lớn đa dụng, qua đó muốn tăng cường khả năng hiểu thế giới thị giác của tác nhân đa phương thức.
Hiện tại, các tài liệu công khai chưa tiết lộ quy mô tham số, dữ liệu huấn luyện, chi phí suy luận, độ dài ngữ cảnh hay báo cáo kỹ thuật hoàn chỉnh của U1 Pro. Những năng lực như native 8K, tỷ lệ lỗi văn bản thấp và hàng chục vòng lặp tác nhân chủ yếu dựa trên thông tin công bố của 商汤 và cách diễn đạt lại từ truyền thông, và vẫn cần được kiểm chứng thêm bằng các mẫu công khai, benchmark của bên thứ ba và phản hồi thực tế từ người dùng.
五、Những điểm cần theo dõi tiếp theo
- Bản chính thức có ra mắt đúng kế hoạch hay không: bản xem trước đã bắt đầu thử nghiệm theo hình thức mời tham gia, bản chính thức dự kiến phát hành vào tháng 8 năm 2026. Sắp tới cần xác nhận thời điểm và phạm vi phát hành thực tế.
- API và chính sách giá: 商汤 dự kiến cung cấp dịch vụ API tương ứng, và phương thức tính phí, giới hạn gọi, tốc độ suy luận, chi phí đầu ra 8K sẽ ảnh hưởng trực tiếp đến việc doanh nghiệp triển khai.
- Kết quả đánh giá của bên thứ ba: độ chính xác văn bản, bố cục phức tạp, mức độ hoàn thành tác vụ dài hạn, tính nhất quán phong cách và hiệu năng độc lập trong nhiều vòng chỉnh sửa vẫn còn chờ được kiểm chứng.
- Khác biệt với các sản phẩm cùng dòng: sự khác nhau về năng lực, tốc độ, giá và kịch bản áp dụng giữa U1 Pro với SenseNova U1 và U1-Fast có thể ảnh hưởng đến lựa chọn của người dùng.
- Tiến triển thương mại hóa: 商汤 cho biết các năng lực liên quan đã được kiểm chứng trong các sản phẩm như “小浣熊” và “Seko”, nhưng hiện chưa công bố quy mô gọi cụ thể, tỷ lệ giữ chân khách hàng hay mức đóng góp doanh thu.
Kết luận
Việc công bố SenseNova U1 Pro cho thấy cạnh tranh mô hình đa phương thức đang mở rộng từ chất lượng tạo ảnh đơn lẻ sang lập kế hoạch, lặp lại và bàn giao đầu ra của các tác vụ phức tạp. Thông qua native 8K, kiểm soát hình ảnh và văn bản, cùng vòng lặp tác nhân dài hạn, 商汤 đang cố gắng nâng mô hình hình ảnh từ công cụ sáng tạo lên thành một hệ thống năng suất hoàn thiện hơn.
Việc định vị này có thành công hay không, cuối cùng sẽ phụ thuộc vào tình hình ra mắt bản chính thức, giá API, đánh giá của bên thứ ba và phản hồi thực tế của người dùng.
Nguồn gốc
Nội dung chỉ cung cấp thông tin, không cấu thành tư vấn đầu tư, pháp lý, thuế hoặc tài chính.