Kimi K3: Bong bóng 2,8 nghìn tỷ tham số hay đòn bẩy cho ngành phần cứng?
Từng lớp mã nguồn mở hé lộ bóng tối bên trong. Một mô hình ngôn ngữ lớn với 2,8 nghìn tỷ tham số, nhưng chưa ai nhìn thấy một benchmark nào. Điều đó đáng sợ hơn bất kỳ lỗi smart contract nào.
Tôi nhận được một bản phân tích từ SemiAnalysis về K3 – mô hình mới nhất của Moonshot AI (công ty mẹ của Kimi). Con số 2,8 nghìn tỷ tham số ngay lập tức kích hoạt bản năng điều tra. Nếu đúng, đây là mô hình lớn nhất từng được công bố – vượt qua cả GPT-4 (ước tính 1,8 nghìn tỷ). Nhưng tham số lớn không đồng nghĩa với thông minh. Hãy nhìn vào EOS năm 2017: whitepaper hoành tráng, tokenomics rỗng tuếch. K3 có thể là một phiên bản AI của EOS.
SemiAnalysis cho rằng K3 sử dụng cơ chế linear attention – một cải tiến kiến trúc giúp giảm độ phức tạp tính toán từ O(n²) xuống O(n). Điều này nghe có vẻ sẽ làm giảm nhu cầu GPU. Nhưng đó là cái bẫy. Tôi đã phân tích tokenomics của hàng trăm dự án DeFi, và một quy tắc luôn đúng: khi ai đó nói với bạn rằng họ có thể làm mọi thứ với ít tài nguyên hơn, hãy kiểm tra xem họ đang ẩn giấu điều gì. Với K3, thứ bị ẩn giấu là dung lượng HBM.
Mô hình 2,8 nghìn tỷ tham số cần hơn 1,5TB HBM chỉ để lưu trọng số. KV cache vẫn phải được offload xuống CPU DDR5 và NVMe. Điều này có nghĩa là linear attention không loại bỏ được nhu cầu về bộ nhớ tốc độ cao – nó chỉ dịch chuyển bottleneck từ compute sang memory bandwidth. Bạn vẫn cần một đống GPU, nhưng giờ đây chúng sẽ bị nghẽn ở khâu đọc/ghi thay vì tính toán. Đây chính là điểm mà SemiAnalysis đã đúng: nhu cầu phần cứng không hề giảm.
Họ tiết lộ thêm rằng K3 yêu cầu ít nhất 64 chip trong một kiến trúc大规模扩展域 (large-scale expanded domain architecture). Điều này khớp hoàn hảo với thiết kế GB300 NVL72 của NVIDIA – 72 GPU B300 kết nối qua NVLink 5.0 trong một domain duy nhất. Nếu Moonshot AI thực sự triển khai K3 trên GB300, họ sẽ phải mua cả rack hệ thống, không chỉ GPU rời. Và mỗi rack như vậy có giá hàng triệu đô la. Đây là tin tốt cho NVIDIA, SK Hynix, và Micron – những nhà cung cấp HBM và bộ nhớ băng thông cao.
Nhưng hãy đi ngược chiều: liệu K3 có thực sự mang lại hiệu suất vượt trội? Tôi đã từng mua một BAYC với giá 1.2 ETH chỉ để phát hiện ra 80% giao dịch trên OpenSea là wash trading. Với K3, tôi nghi ngờ có một lớp "wash trading" về mặt kỹ thuật: các thông số có thể được inflate bằng cách sử dụng MoE (Mixture of Experts) mà không tiết lộ số lượng expert thực tế. Một mô hình 2,8 nghìn tỷ tham số dạng MoE chỉ kích hoạt một phần nhỏ trong mỗi forward pass, và con số 2,8 nghìn tỷ có thể là tổng tham số của tất cả expert, không phải tham số kích hoạt. Nếu chỉ 10% được kích hoạt, thì một mô hình 280 tỷ tham số hiệu dụng sẽ không còn ấn tượng nữa.
Vấn đề thứ hai: linear attention có thể làm giảm chất lượng suy luận trên các tác vụ ngữ cảnh dài. Tôi đã nghiên cứu Mamba và RWKV – hai kiến trúc linear attention phổ biến – và phát hiện ra rằng chúng gặp khó khăn với các tác vụ yêu cầu truy xuất thông tin chính xác từ đầu vào rất dài (ví dụ: LegalQA, NarrativeQA). Nếu K3 được quảng bá là "siêu mô hình cho xử lý văn bản dài" (như Kimi vốn nổi tiếng), thì việc hy sinh độ chính xác để đổi lấy tốc độ có thể là một canh bạc.
Bây giờ đến phần contrarian – điều mà phe bò không nói với bạn: K3 có thể là chất xúc tác cho Jevons Paradox trong AI. Khi chi phí suy luận giảm nhờ linear attention, các ứng dụng mới sẽ xuất hiện, tiêu thụ nhiều tài nguyên hơn tổng thể. Tôi đã thấy điều này xảy ra với L2 trên Ethereum: phí thấp kích thích hoạt động on-chain, cuối cùng làm tăng tổng phí tuyệt đối. Tương tự, K3 có thể giúp Moonshot AI cung cấp API rẻ hơn 10 lần so với GPT-4, từ đó thu hút hàng nghìn startup AI – và họ sẽ mua nhiều GPU hơn, không ít hơn.
Từ bài học DeFi 2017, tôi rút ra một takeaway: đừng bao giờ đặt cược chống lại phần cứng khi một cải tiến kiến trúc được công bố. Hãy mua GPU, hãy mua HBM, hãy mua NVLink. Còn K3? Tôi sẽ chờ benchmark công khai. Nếu nó đạt top 5 trên LMSYS Chatbot Arena, tôi mới tin. Nếu không, đây chỉ là một đống tham số được bơm căng bởi hype và quỹ VC.
Câu hỏi cuối cùng: Bạn có dám khai thác on-chain của K3 không? Hay bạn sẽ mua token của một dự án AI phi tập trung nào đó? Tôi chọn cách theo dõi dòng tiền đi vào NVIDIA. Đó là tín hiệu rõ ràng nhất.