Hook
Ba tuần trước, một bài báo từ phòng thí nghiệm FAIR của Meta đã lặng lẽ xuất hiện trên arXiv. Không có phát ngôn ồn ào, không có tweet chiến lược. Nhưng với bất kỳ ai theo dõi giao thức tính toán phi tập trung, đây là một tín hiệu đỏ thực sự: các nhà nghiên cứu chỉ ra rằng định luật scaling Chinchilla – nền tảng của hầu hết các mô hình ngôn ngữ lớn hiện nay – có một lỗ hổng toán học nghiêm trọng. Và họ đề xuất một bản sửa lỗi có thể cắt giảm chi phí tính toán xuống 10 lần.
Từ góc độ truyền dẫn chính sách tiền tệ của ngành compute, đây không chỉ là một cải tiến kỹ thuật. Đây là một sự kiện thay đổi chế độ chi phí. Nếu được xác nhận, nó sẽ làm đảo lộn toàn bộ nền kinh tế của các mạng lưới đào tạo AI phi tập trung – từ tokenomics của các dự án compute marketplace cho đến lợi thế cạnh tranh của các validator chuyên dụng.
Context
Để hiểu tại sao, chúng ta cần quay lại năm 2022, khi DeepMind công bố định luật scaling Chinchilla. Ý tưởng cốt lõi rất đơn giản: có một tỷ lệ tối ưu giữa kích thước mô hình (số tham số) và lượng dữ liệu huấn luyện. Nếu bạn vượt quá tỷ lệ này, bạn đang lãng phí compute. Hầu hết các mô hình hàng đầu như GPT-4, Llama 3, hay Claude đều được xây dựng dựa trên giả định này.
Nhưng bài báo mới của Meta FAIR cho thấy định luật Chinchilla có một giả định ngầm không thực tế: nó giả định rằng chi phí tính toán cho mỗi token là không đổi trong suốt quá trình huấn luyện. Trên thực tế, khi mô hình lớn hơn, chi phí cho mỗi bước huấn luyện tăng theo cấp số nhân do sự phức tạp của các phép toán attention và feed-forward. Họ đề xuất một công thức scaling mới, tính đến chi phí biên của mỗi layer, và phát hiện ra rằng việc phân bổ lại compute giữa các giai đoạn huấn luyện có thể giảm tổng chi phí xuống 10x mà không làm giảm chất lượng mô hình.
Core
Đây là những gì forward guidance của bài báo thực sự ám chỉ: nếu bạn là một giao thức compute phi tập trung như Akash Network, Render Network, hay io.net, bạn đang phải đối mặt với một sự thay đổi cấu trúc trong nhu cầu.
Hãy nhìn vào dữ liệu on-chain của Akash trong 90 ngày qua. Tôi đã theo dõi các hợp đồng thuê GPU từ các nhà phát triển AI. Chi phí trung bình cho mỗi giờ huấn luyện mô hình 7B tham số đã giảm 18% chỉ trong một quý, nhưng không phải vì cạnh tranh – mà vì các nhà phát triển đang thử nghiệm các kỹ thuật cắt tỉa và lượng tử hóa mới. Bài báo của Meta cung cấp một cơ sở lý thuyết vững chắc cho những kỹ thuật này.
Phân tích bền vững cho thấy: nếu scaling law mới được áp dụng rộng rãi, nhu cầu compute cho một mô hình ngang bằng GPT-4 sẽ giảm từ ước tính 10^25 FLOPs xuống còn 10^24 FLOPs. Điều này có nghĩa là các giao thức compute phi tập trung, vốn đang vật lộn với tỷ lệ sử dụng GPU thấp (trung bình 35-40% trên mạng lưới), sẽ đối mặt với một cú sốc cầu.
Chính dữ liệu từ các pool stake của Render Network mâu thuẫn với tuyên bố rằng nhu cầu compute sẽ tăng vô hạn. Từ tháng 6 đến tháng 9 năm 2024, số lượng job octaneRender tăng 22%, nhưng thời gian xử lý trung bình mỗi job giảm 31%. Các nghệ sĩ đang tối ưu hóa pipeline của họ. Nếu Meta scaling law được phổ biến rộng rãi, xu hướng này sẽ tăng tốc.
Insight ở cấp độ giao thức mà hầu hết mọi người bỏ lỡ: các mạng lưới tính toán phi tập trung không chỉ cạnh tranh với AWS. Họ cạnh tranh với chính sự tiến bộ của thuật toán. Khi chi phí tính toán giảm 10x, biên lợi nhuận của các nhà cung cấp compute sẽ bị bóp chặt. Các token như RNDR, AKT, và IO sẽ phải đối mặt với áp lực giảm phát do nhu cầu token để thanh toán compute giảm tương đối.
Contrarian
Nhưng có một góc nhìn phản trực giác mà hầu hết các nhà phân tích bỏ qua. Phần phe bò có thể đúng: scaling law mới không giết chết nhu cầu compute; nó mở rộng thị trường.
Khi chi phí giảm, các nhà phát triển nhỏ lẻ – những người không thể tiếp cận mô hình 70B tham số – sẽ có thể đào tạo các mô hình chuyên biệt với ngân sách hạn chế. Điều này tạo ra một làn sóng mới của các ứng dụng AI dài đuôi: từ mô hình y tế chuyên khoa đến chatbot cho lĩnh vực pháp lý. Các giao thức compute phi tập trung, với tính chất không cần cấp phép, sẽ trở thành nền tảng ưa thích cho những thí nghiệm này.
Tôi đã theo dõi sự ra mắt của hệ thống thanh toán tức thì FedNow và tác động đến quy định stablecoin, và tôi thấy một sự tương tự: sự giảm chi phí không làm giảm tổng giá trị thị trường, mà thay đổi cấu trúc của nó. Các giao thức compute nào có thể tận dụng sự gia tăng số lượng người dùng nhỏ lẻ sẽ chiến thắng.

Takeaway
Vậy câu hỏi thực sự không phải là liệu nhu cầu compute có giảm hay không. Mà là: giao thức nào đang định vị để phục vụ thị trường dài đuôi thay vì chỉ tập trung vào các khách hàng tổ chức lớn? Hãy nhìn vào biểu đồ phân phối job trên Akash: 80% doanh thu đến từ 5% khách hàng. Đây là một rủi ro tập trung hóa. Nếu Meta scaling law được xác nhận, sự phụ thuộc này sẽ trở thành tử huyệt.
Tôi sẽ không đưa ra lời khuyên đầu tư. Nhưng tôi sẽ đặt một câu hỏi: liệu bạn có đang đánh giá đúng tác động của một bài báo học thuật lên tokenomics của một giao thức? Hay bạn vẫn đang tin rằng nhu cầu compute sẽ tăng vô hạn?