Hook: Một Con Số Biết Nói
80 tỷ tham số, nhưng chỉ kích hoạt 3 tỷ. 617 tỷ tham số, nhưng chỉ kích hoạt 23 tỷ. Đây không phải là một giao thức Layer 2 mới hay một sharding solution. Đây là WeLM – bộ đôi mô hình ngôn ngữ lớn của WeChat, vừa được tiết lộ trong một báo cáo ngành đầu tháng 8/2025. Và nếu bạn nghĩ rằng nó chỉ liên quan đến AI, thì bạn đã bỏ lỡ bức tranh toàn cảnh. Trong thế giới blockchain, nơi mà chi phí tính toán và khả năng mở rộng là vấn đề sống còn, chiến lược của WeChat đang gửi một tín hiệu rõ ràng: mô hình AI trung tâm, với chi phí cực thấp, có thể tái tạo những gì DePIN và các dự án phi tập trung đang cố gắng làm.
Context: Bản Đồ Thanh Khoản AI
Trước khi đi sâu, hãy đặt WeLM vào bối cảnh. WeChat, siêu ứng dụng của Tencent, đã triển khai AI Agent "Tiểu Vi" (Xiao Wei) dựa trên WeLM-80B. Mô hình 80B này chịu trách nhiệm cho các tác vụ thời gian thực: chat, tìm kiếm, gọi chức năng WeChat, và tương tác với mini-program. Trong khi đó, WeLM-617B với kiến trúc MoE (Mixture of Experts) đang được phát triển để tạo ra các mini-program thông minh – một bước tiến có thể biến WeChat thành nền tảng phân phối ứng dụng AI-native.

Điều đáng chú ý là tỷ lệ tham số kích hoạt trên tổng tham số của cả hai mô hình đều xấp xỉ 3.7%. Đây không phải ngẫu nhiên. Đó là một thiết kế có chủ ý để kiểm soát chi phí suy luận (inference cost) – giống như cách các blockchain layer 2 tối ưu hóa gas fee bằng cách nén dữ liệu hoặc sử dụng sharding.
Core: Bài Học Từ Kiến Trúc Sparse Cho Blockchain
1. Tối ưu hóa chi phí giống như Rollup
Trong blockchain, Ethereum layer 2 như Optimism hay Arbitrum sử dụng "tổng tham số" là dữ liệu trên Ethereum mainnet, nhưng chỉ "kích hoạt" một phần khi thực hiện giao dịch. WeLM-80B với 3B kích hoạt tương đương với một optimistic rollup: nó giữ toàn bộ trạng thái (80B tham số) nhưng chỉ tính toán trên một tập con nhỏ. Điều này cho phép WeChat xử lý hàng triệu yêu cầu mỗi giây với chi phí cực thấp, tương tự như cách Arbitrum xử lý hàng ngàn TPS với phí gas thấp.

2. MoE như một cơ chế đồng thuận
WeLM-617B sử dụng MoE, nơi các "expert" khác nhau được kích hoạt cho các tác vụ khác nhau. Trong blockchain, điều này tương tự như sharding: mỗi shard (expert) xử lý một phần giao dịch, giảm tải cho toàn mạng. Nhưng có một khác biệt lớn: MoE trung tâm có một bộ định tuyến (router) duy nhất, trong khi sharding phi tập trung cần cơ chế đồng thuận xuyên shard. WeChat đã chọn con đường tập trung hóa để đạt hiệu suất cực cao – một lựa chọn mà các dự án blockchain không thể có, nhưng lại cho thấy khoảng cách về hiệu suất so với phi tập trung.
3. Hidden Decoding: Bí mật tối ưu hóa
Báo cáo đề cập đến bài báo "Hidden Decoding" của nhóm WeChat, nhưng không tiết lộ chi tiết. Trong bối cảnh blockchain, điều này gợi nhớ đến các kỹ thuật tối ưu hóa như zk-SNARKs hay zk-rollups: một quá trình tính toán nặng được thực hiện off-chain, và chỉ kết quả được xác thực on-chain. Hidden Decoding có thể là một phương pháp tương tự: giải mã một phần mô hình ở biên (edge) và chỉ gửi kết quả cuối cùng về trung tâm. Nếu đúng, điều này sẽ làm giảm đáng kể băng thông và độ trễ – một thách thức mà các mạng DePIN (mạng lưới cơ sở hạ tầng vật lý phi tập trung) như Helium hay Filecoin đang phải đối mặt.
Contrarian: Góc Nhìn Nghịch Lý – Liệu Phi Tập Trung Có Còn Cần Thiết?
Câu chuyện về WeLM là một lời cảnh tỉnh cho cộng đồng blockchain. Trong khi chúng ta đang xây dựng các mạng lưới AI phi tập trung như Bittensor, Render Network hay Gensyn, với lời hứa về quyền sở hữu dữ liệu và chống kiểm duyệt, thì WeChat đang chứng minh rằng: với một công ty đủ lớn, AI trung tâm có thể đạt hiệu quả vượt trội với chi phí thấp đến mức phi tập trung trở nên khó cạnh tranh về mặt kinh tế.
Hãy nhìn vào con số: WeLM-80B với 3B tham số kích hoạt, nếu được triển khai trên một mạng lưới phi tập trung, sẽ cần hàng nghìn node để chạy mô hình, với chi phí đồng thuận và truyền thông khổng lồ. WeChat làm điều đó với một cụm máy chủ tập trung. Kết quả là: thời gian phản hồi dưới 100ms, chi phí gần như bằng 0 cho người dùng cuối. Trong khi đó, một dự án như Bittensor vẫn đang vật lộn với độ trễ vài giây và phí token không ổn định.
Tuy nhiên, đó là một nghịch lý: chính sự hiệu quả của trung tâm hóa lại tạo ra động lực cho sự phát triển của blockchain. Nếu WeChat thành công in việc tạo ra một "AI-native app store" thông qua WeLM-617B, nó sẽ trở thành một "walled garden" khổng lồ. Điều này sẽ thúc đẩy nhu cầu về các giải pháp phi tập trung có thể cung cấp quyền tự do tương tự nhưng không bị kiểm soát bởi một công ty. Blockchain sẽ đóng vai trò như một lớp đảm bảo tính minh bạch và khả năng chuyển đổi, ngay cả khi hiệu suất không bằng.
Takeaway: Định Vị Chu Kỳ
Chúng ta đang ở giai đoạn đầu của cuộc đua AI. WeLM của WeChat là một đối thủ nặng ký không chỉ trong lĩnh vực AI, mà còn trong việc định hình lại cách chúng ta nghĩ về tính toán phi tập trung. Nếu các dự án blockchain không nhanh chóng cải thiện hiệu suất và giảm chi phí, họ sẽ bị bỏ lại phía sau bởi các gã khổng lồ công nghệ. Nhưng nếu họ thành công, họ sẽ tạo ra một hệ sinh thái mà WeChat không thể chiếm lĩnh: một hệ sinh thái mở, không cần cấp phép, nơi AI thực sự thuộc về người dùng.
Câu hỏi dành cho bạn: Liệu chúng ta có chấp nhận đánh đổi quyền riêng tư và tính phi tập trung để lấy hiệu suất và giá rẻ, hay chúng ta sẽ xây dựng một tương lai nơi cả hai điều này có thể cùng tồn tại?
