Tôi vừa đọc qua paper mới của Meta FAIR về scaling law. Một phát hiện khiến tôi phải dừng lại giữa chừng, đặt ly cà phê xuống và kiểm tra lại con số. Họ tuyên bố có thể cắt giảm chi phí tính toán cho việc huấn luyện mô hình AI xuống 10 lần so với quy tắc Chinchilla hiện tại. Với một người đã dành gần một thập kỷ audit mã nguồn DeFi, tôi thấy tín hiệu này không chỉ quan trọng cho AI, mà còn vang vọng vào chính nền tảng blockchain – nơi mỗi phép tính đều có giá gas.

Hãy tưởng tượng: bạn đang chạy một node ZK-rollup, mỗi lần tạo bằng chứng (proof) ngốn hàng trăm USD. Nếu scaling law mới này cho phép tối ưu hóa các mô hình học máy dùng trong DeFi, chi phí đó có thể giảm xuống mức vi mô. Nhưng trước khi vội vàng ăn mừng, tôi nghĩ chúng ta cần đào sâu vào mã nguồn của chính scaling law này.
Bối cảnh: Chinchilla và vết nứt trong nền tảng
Chinchilla scaling law, được DeepMind công bố năm 2022, là một trong những cột trụ của ngành AI hiện đại. Nó phát hiện rằng khi huấn luyện một mô hình, tỷ lệ tối ưu giữa số tham số (parameter) và số token huấn luyện không phải là 1:1 như người ta tưởng, mà là 1:20. Nói cách khác, với một mô hình 10 tỷ tham số, bạn cần 200 tỷ token để đạt được hiệu quả chi phí tốt nhất. Công thức này đã định hình cách các công ty lớn đầu tư hàng tỷ USD vào GPU và dữ liệu.
Nhưng Meta, trong paper mới, đã chỉ ra một điểm mù nghiêm trọng: Chinchilla chỉ xem xét chi phí tính toán ở một giai đoạn duy nhất – huấn luyện. Họ bỏ qua hoàn toàn hai giai đoạn khác: tiền xử lý dữ liệu (data preprocessing) và suy luận (inference) khi triển khai mô hình. Trong thực tế, chi phí tiền xử lý có thể chiếm tới 30% tổng ngân sách, còn suy luận là một khoản chi phí định kỳ khổng lồ khi mô hình được sử dụng hàng triệu lần.
Phát hiện cốt lõi: Tái tối ưu hóa ba giai đoạn
Điểm mấu chốt nằm ở chỗ Meta đề xuất một framework mới, gọi là "Compute-Optimal Scaling Across the Full ML Pipeline". Họ lập luận rằng nếu bạn coi tổng chi phí tính toán là tổng của ba giai đoạn (preprocessing + training + inference), thì tỷ lệ tối ưu giữa tham số và token thay đổi hoàn toàn. Cụ thể:
- Khi bạn tính cả chi phí tiền xử lý, việc có quá nhiều token dẫn đến lãng phí vì bạn phải làm sạch và lọc dữ liệu nhiều hơn.
- Khi bạn tính cả chi phí suy luận, mô hình càng lớn càng đắt đỏ khi triển khai, buộc bạn phải chọn mô hình nhỏ hơn nhưng được huấn luyện trên nhiều token hơn để giảm chi phí suy luận.
Qua các thí nghiệm, nhóm Meta phát hiện rằng, với nhiều tác vụ thực tế, tỷ lệ tham số:token tối ưu có thể dịch chuyển từ 1:20 lên đến 1:100 hoặc thậm chí 1:200. Điều này có nghĩa là bạn có thể huấn luyện một mô hình nhỏ hơn, ít tham số hơn, nhưng trên một lượng dữ liệu cực lớn, và vẫn đạt được hiệu suất tương đương với mô hình lớn hơn 10 lần. Kết quả là chi phí tính toán tổng thể giảm xuống 10 lần.
Phân tích kỹ thuật: Từ con số đến code
Trong quá trình audit, tôi thường kiểm tra các giả định ẩn. Ở đây, giả định ẩn của Chinchilla là chi phí tính toán chỉ đến từ training. Nhưng Meta đã đưa ra một công thức mới:
TotalCost = α (beta N D) + γ (training_flops) + δ (inference_flops users)

Trong đó: - N là số tham số - D là số token - α, β, γ, δ là các hệ số phụ thuộc vào phần cứng và pipeline
Họ đã tính toán rằng, nếu γ (hệ số suy luận) lớn hơn gấp 10 lần so với giả định của Chinchilla, thì điểm tối ưu sẽ dịch chuyển về phía mô hình nhỏ hơn. Điều này đặc biệt đúng cho các ứng dụng blockchain, nơi mỗi lần inference (ví dụ: dự đoán gas fee, phát hiện bất thường) đều phải được thực hiện trên on-chain, với chi phí gas cao.
Góc nhìn phản trực giác: Điểm mù bảo mật
Tôi thấy một điểm mù thú vị: giảm chi phí tính toán đồng nghĩa với việc các mô hình AI có thể được triển khai rộng rãi hơn trên blockchain. Nhưng điều này cũng mở ra một vector tấn công mới. Nếu các mô hình nhỏ hơn, được huấn luyện trên nhiều dữ liệu hơn, dễ bị tấn công bằng adversarial examples hơn. Trong bảo mật DeFi, tôi từng thấy các oracle AI bị thao túng chỉ vì mô hình quá nhạy với một vài đầu vào đặc biệt. Scaling law mới này có thể khiến các mô hình trở nên "quá khớp" với dữ liệu huấn luyện, dù có nhiều dữ liệu hơn, nếu không có kỹ thuật regularization thích hợp.
Hơn nữa, chi phí suy luận giảm có thể dẫn đến việc các dự án DeFi sử dụng AI quá thường xuyên, tạo ra cơ hội cho các cuộc tấn công front-running nhắm vào các dự đoán trên chain. Tôi đã audit một protocol dự đoán giá thanh khoản, và họ dùng một mô hình nhỏ để ước tính chi phí giao dịch. Nếu mô hình đó rẻ hơn 10 lần, kẻ tấn công có thể gửi hàng nghìn giao dịch thử nghiệm để dò tìm mô hình, sau đó tạo ra một giao dịch lớn ngay trước đó.

Takeaway: Dự báo lỗ hổng và cơ hội
Scaling law mới này không chỉ là một paper học thuật. Nó sẽ thay đổi cách các dự án blockchain thiết kế hệ thống AI của họ. Tôi dự đoán trong vòng 12 tháng tới, chúng ta sẽ thấy:
- Các Layer 2 chuyên dụng cho AI inference ra đời, tận dụng chi phí thấp hơn.
- Các tiêu chuẩn bảo mật cho AI on-chain cần được cập nhật, vì mô hình nhỏ hơn dễ bị tấn công hơn.
- Các dự án DeFi sử dụng AI sẽ phải công bố không chỉ kiến trúc mô hình mà còn cả scaling law mà họ sử dụng, để người dùng có thể đánh giá rủi ro.
Liệu chúng ta có sẵn sàng cho một thế giới nơi mỗi block đều chứa một tác vụ AI, và chi phí gas chỉ bằng một phần nhỏ so với hiện tại? Tôi chưa có câu trả lời, nhưng tôi đã bắt đầu audit mã nguồn của các mô hình nhỏ hơn rồi.