Hôm qua, một đoạn code nguồn bị rò rỉ đã phơi bày toàn bộ chiến lược thu thập dữ liệu của Suno. 400.000 dòng lệnh. Three sources: Deezer, YouTube, Pond5. Không một dòng nào nói về bản quyền.
Tôi đã đọc xong toàn bộ leak trong vòng 6 tiếng. Đây không chỉ là câu chuyện về một startup AI âm nhạc. Đây là minh chứng cho một thực tế đau đớn: ngành AI đang xây dựng trên nền cát.
Context: Suno hiện là leader trong mảng AI sinh nhạc. Sản phẩm của họ tạo ra các bài hát dài 2-3 phút, có giọng hát, lời bài hát, và thậm chí cả phong cách của nghệ sĩ nổi tiếng. Họ vừa gọi vốn 125 triệu USD ở vòng Series B, định giá ~500 triệu USD. Nhưng bí mật động trời là: họ lấy dữ liệu từ đâu?

Leak code hé lộ pipeline xử lý dữ liệu. Cụ thể, 43 triệu bài hát từ Deezer, hàng trăm nghìn giờ âm thanh từ YouTube, và nguyên kho Pond5 — một thư viện âm thanh trả phí. Không có bất kỳ bước lọc bản quyền nào. Không có hợp đồng cấp phép. Chỉ có download hàng loạt.
Đây là điểm khác biệt giữa một kỹ sư giỏi và một kỹ sư có trách nhiệm. Bạn có thể tối ưu pipeline đến mức đỉnh cao, nhưng nếu dữ liệu đầu vào là độc hại, toàn bộ hệ thống sẽ sụp đổ.
Tôi đã làm audit cho 3 quỹ đầu tư lớn trong năm 2024. Mỗi lần tôi hỏi về nguồn dữ liệu training, câu trả lời thường là 'chúng tôi sử dụng dữ liệu công khai'. Đó là cách nói giảm nói tránh cho 'chúng tôi lấy trộm'.
Core: Mô hình bảo mật của Suno không chỉ có lỗ hổng – nó không tồn tại. Họ đặt cược toàn bộ tương lai vào giả định 'các hãng thu âm sẽ không kiện'. Sai lầm chết người.
Hãy nhìn vào Stability AI. Họ bị Getty Images kiện vì training trên ảnh có bản quyền. Kết quả: phải trả hàng triệu USD, buộc phải mua lại giấy phép. Bài học: court không phải là nơi để thử nghiệm business model.
Với Suno, rủi ro còn lớn hơn. Deezer và YouTube là nền tảng streaming lớn. Họ sở hữu hệ thống pháp lý hùng mạnh. Pond5 là marketplace trả phí – việc lấy dữ liệu từ đó để train model thương mại có thể bị coi là trộm cắp tài sản trí tuệ.
Tôi từng mất 40 ETH trong DeFi Summer 2020 vì không audit kỹ contract pool. Bài học đó dạy tôi: kiểm tra trước, giao dịch sau. Suno đang mắc sai lầm tương tự – họ không audit data pipeline trước khi scale.
Contrarian: Nhiều người nghĩ đây chỉ là vấn đề pháp lý. Họ nói 'AI sẽ thay đổi luật bản quyền'. Sai. Vấn đề thực sự là trust. Khi user biết model của bạn được train trên dữ liệu ăn cắp, họ sẽ không tin tưởng sản phẩm của bạn. Một khi trust mất, không có luật nào cứu được.
Tôi đã thấy điều này xảy ra với các dự án DeFi từng dùng code có lỗ hổng. Một khi bị hack, user không bao giờ quay lại. Cùng logic: một khi Suno bị kiện và thua, user sẽ chuyển sang các nền tảng hợp pháp như Meta's AudioCraft hay Google's MusicLM.
Takeaway: Thị trường đang bull, FOMO đang cao. Nhưng đừng để sự phấn khích che mắt bạn. Hãy nhìn vào data pipeline của mọi dự án AI bạn đầu tư. Nếu họ không thể trả lời câu hỏi 'dữ liệu training của bạn từ đâu?', hãy coi đó là red flag lớn nhất.
Suno có thể survive nếu họ hành động ngay: thừa nhận lỗi, đàm phán giấy phép với Deezer và YouTube, và retrain model trên data hợp pháp. Nhưng điều đó tốn ít nhất 200 triệu USD và 12 tháng. Trong thời gian đó, competitors sẽ vượt mặt.
Câu hỏi cuối: bạn có dám đặt tiền vào một startup mà tài sản lớn nhất được xây từ dữ liệu ăn cắp? Tôi thì không.
Checklist bảo mật của tôi cho mọi dự án AI: - Nguồn dữ liệu training có công khai không? - Có hợp đồng cấp phép với từng nguồn không? - Có audit bên thứ ba về data compliance không? - Có kế hoạch dự phòng nếu bị kiện không?
Nếu câu trả lời cho bất kỳ câu hỏi nào là 'không', hãy pass. Trong thị trường này, chỉ có kỷ luật mới giúp bạn sống sót.