Mọi người đều nói tương lai AI là phi tập trung, nhưng Morgan Stanley vừa vẽ ra một viễn cảnh mà tôi thấy… lỗi không ở code, lỗi ở lòng tham. Báo cáo của họ về robot cluster distributed inference cloud kết hợp Starlink và SpaceX khiến tôi nhớ lại những ngày ICO 2017: câu chuyện quá đẹp, con số quá lớn, nhưng kỹ thuật thì… thiếu trách nhiệm.
Context
Báo cáo Morgan Stanley (được cho là công bố năm 2025) mô tả một tương lai nơi 22 tỷ robot – từ xe tự hành đến drone, robot công nghiệp – tạo thành một distributed inference cloud ngang hàng, kết nối qua Starlink. Tổng công suất tính toán lên tới 1.1 terawatt (TW), đủ để chạy các mô hình như Grok mà không cần data center truyền thống. Nghe có vẻ là bước đột phá về hạ tầng AI, nhưng thực chất là sự pha trộn giữa edge computing, federated learning và low-earth orbit satellite – một tổ hợp đã có từ lâu, chỉ khác là họ gắn thêm logo Tesla và SpaceX.
Core
Đọc whitepaper trước, mua sau. Khi tôi mổ xẻ báo cáo này, ba lỗi cơ bản lộ ra ngay lập tức.

Thứ nhất: nhầm lẫn giữa công suất điện và sức mạnh tính toán. “Mỗi robot 500 watt” và “1.1 TW computing power” là một sai lầm vật lý cơ bản. Watt là đơn vị đo công suất điện, không phải FLOPS hay TOPS. Một robot tiêu thụ 500 watt không có nghĩa là nó cung cấp 500 watt tính toán – thực tế, hiệu suất năng lượng của AI accelerator hiện nay khoảng 1-2 TFLOPS/Watt (FP16), tức là 500 watt chỉ cho khoảng 500-1000 TFLOPS. Nhưng con số 1.1 TW là tổng công suất điện, không phải tổng sức mạnh tính toán. Đây là kiểu đánh lận con số quen thuộc trong crypto: dùng tổng TVL để nói về thanh khoản thực tế.
Thứ hai: quy mô phi thực tế. 22 tỷ robot vào năm 2040? Ngành công nghiệp robot hiện tại chỉ có khoảng 4 triệu robot công nghiệp (2023). Thêm xe tự hành và drone, con số có thể lên vài trăm triệu. Nhưng để đạt 22 tỷ, cần sản xuất 1.5 tỷ robot mỗi năm – gấp 10 lần sản lượng ô tô toàn cầu. Không có chuỗi cung ứng, năng lượng hay nhu cầu thị trường nào hỗ trợ điều đó. Đây là câu chuyện giống như “Mass Adoption of Blockchain” – ai cũng nói nhưng không ai tính toán chi phí.
Thứ ba: băng thông Starlink là nút cổ chai. Starlink hiện tại mỗi vệ tinh chỉ có 10-20 Gbps backhaul, tổng dung lượng mạng khoảng 100-200 Tbps. Để phục vụ 22 tỷ node, dù mỗi node chỉ gửi 1 kbps, bạn cũng cần 22 Tbps. Nhưng inference yêu cầu hai chiều, độ trễ thấp. Starlink latency khoảng 40-80 ms một chiều, cộng thêm routing mặt đất, tổng latency >200 ms – không thể dùng cho real-time inference. Và chi phí băng thông? Mỗi robot cần module Starlink mini, tiêu thụ thêm điện, làm giảm công suất tính toán khả dụng.
Nhưng điểm mù lớn nhất là hiệu suất sử dụng thực tế. Một robot di động phải dành phần lớn năng lượng cho di chuyển, cảm biến, xử lý chính. Nếu chỉ có 10% thời gian rảnh để làm inference cho cloud, thì 1.1 TW lý thuyết chỉ còn 110 GW. Với hiệu suất năng lượng hiện tại, đó là khoảng 110 exaFLOPS – một con số ấn tượng, nhưng thua xa một siêu cluster GPU tập trung như của Google hay Meta (vài trăm exaFLOPS). Và đừng quên, training vẫn cần đồng bộ, không thể phân tán trên robot.
Contrarian
Góc nhìn phản trực giác của tôi: báo cáo này không phải để mô tả công nghệ, mà để tạo ra một narrative định giá. Morgan Stanley đang cố gắng gán giá trị tương lai cho Tesla, SpaceX và xAI dựa trên một “siêu mạng lưới tính toán” mà họ kiểm soát. Nó giống như cách các dự án DeFi từng khoe “total value locked” để kêu gọi đầu tư, nhưng thực tế thanh khoản chỉ là vài token bơm nhau. Lỗi không ở code, lỗi ở lòng tham – và lòng tham ở đây là của các nhà đầu tư tổ chức muốn một câu chuyện đủ lớn để biện minh cho định giá của Tesla ở mức 1.5 nghìn tỷ USD.
Thực tế, các mạng tính toán phi tập trung thực sự – như Render Network, Akash Network, hay io.net – đang đối mặt với những thách thức kỹ thuật rất thực tế: node discovery, task scheduling, network interruption, và SLA. Chưa có dự án nào đạt được quy mô trên 100.000 GPU. Một robot cluster với 22 tỷ node là giấc mơ xa vời, và bất kỳ ai từng phân tích hợp đồng thông minh đều biết rằng: “Đọc whitepaper trước, mua sau” là cách duy nhất để tránh bẫy.
Takeaway
Tôi không nói rằng distributed inference là vô ích. Các mô hình như Grok 5 cần inference ở biên, và việc tận dụng robot là một hướng đi đáng nghiên cứu. Nhưng đừng để câu chuyện đẹp đánh lừa bạn. Câu hỏi thực sự là: khi nào thì một robot cluster có thể đạt được hiệu suất ngang bằng một data center nhỏ? Câu trả lời: khi ai đó giải quyết được bài toán đồng bộ, độ trễ và chi phí – và tôi chưa thấy dấu hiệu nào trong báo cáo này. Còn lúc đó, hãy cứ giữ stablecoin, và nhớ: lỗi không ở code, lỗi ở lòng tham.