Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

Meta(META) công bố quy luật scaling mới, mức giảm 10 lần chỉ tính chi phí thử nghiệm

Tài liệu nghiên cứu scaling cầm trên tay cùng biểu đồ vẽ tay / TokenPost.ai

Nhóm nghiên cứu FAIR thuộc Meta(META) vừa chỉ ra những hạn chế của quy luật scaling Chinchilla vốn được dùng để dự đoán quy mô huấn luyện mô hình ngôn ngữ lớn (LLM), đồng thời đề xuất một mô hình hiệu chỉnh mới. Tuy nhiên, con số “giảm 10 lần khối lượng tính toán” mà bài báo nhắc tới không phải là mức tiết kiệm cho toàn bộ quá trình huấn luyện, mà chỉ áp dụng cho chi phí thử nghiệm nhằm ước lượng quy luật scaling.

Theo bài báo mang tên “Skaling: Chinchilla’s Exponents Meet Kaplan’s Coupling”, nhóm tác giả gồm Mathurin Videau, Badr Youbi-Idrissi, David Lopez-Paz và Kartik Ahuja cho biết giả định trước đây - rằng kích thước mô hình và lượng dữ liệu huấn luyện tác động độc lập lên giá trị loss - tạo ra sai số ở một số vùng nhất định. Trang arXiv ghi ngày nộp bài là 7 tháng 8 năm 2026, trong khi phần metadata của file PDF lại thể hiện ngày 10 tháng 8 năm 2026.

Quy luật Chinchilla từ trước tới nay được xem là tiêu chuẩn: với một ngân sách tính toán cố định, cần tăng đồng thời kích thước mô hình và số lượng token huấn luyện để đạt hiệu quả tối ưu. Trong bài báo Chinchilla công bố năm 2022, Google DeepMind cho biết mô hình 70 tỷ tham số cho kết quả tốt hơn mô hình Gopher 280 tỷ tham số, dù dùng cùng mức tính toán.

Sau đó, giới công nghệ thường nhắc tới quy tắc kinh nghiệm “khoảng 20 token cho mỗi tham số”. Logic ở đây là thay vì chỉ tăng kích thước mô hình, việc cân bằng giữa quy mô mô hình và lượng dữ liệu mới giúp sử dụng ngân sách tính toán hiệu quả hơn.

Bài báo mới cho rằng cấu trúc này có thể ước tính thiếu hoặc thừa giá trị loss ở những vùng dữ liệu khan hiếm hoặc bị huấn luyện quá mức. Nhóm nghiên cứu đề xuất quy luật “Skaling”, bổ sung một số mũ kết hợp k vào cấu trúc cộng độc lập vốn có của Chinchilla.

Skaling không còn xem kích thước mô hình N và số token huấn luyện D là hai biến vận động tách rời. Thay vào đó, mô hình này phản ánh cách hai biến số cùng tác động lên bề mặt loss, qua đó giảm sai số dự đoán.

Nhóm tác giả cũng đưa ra con số cải thiện cụ thể. Theo họ, Skaling cho kết quả chính xác hơn Chinchilla ở 76% cấu hình được thử nghiệm, với mức cải thiện sai số theo trung vị đạt 2,2 lần.

Sai số phần trăm tuyệt đối trung bình (MAPE) giảm từ 1,5 đến 3 lần tùy điều kiện thử nghiệm. Tuy nhiên, đây là kết quả thu được từ một lưới thử nghiệm và phương pháp đánh giá cụ thể, nên chưa thể khẳng định áp dụng nguyên vẹn cho các mô hình, dữ liệu hay công thức huấn luyện khác.

Chi tiết đáng chú ý nhất chính là con số “10 lần”. Theo bài báo, nếu dùng lưới khảo sát dạng chữ L - chỉ tập trung vào vùng chi phí thấp - thay vì quét đều toàn bộ lưới, có thể đạt độ chính xác dự đoán tương đương với lượng tính toán ít hơn khoảng 10 lần.

Điều này không đồng nghĩa với việc tổng chi phí huấn luyện chính của các mô hình quy mô lớn giảm còn một phần mười. Con số 10 lần chỉ áp dụng cho các thử nghiệm quy mô nhỏ và công đoạn khảo sát nhằm xác định quy luật scaling trước khi bước vào huấn luyện chính thức.

Trước đó, trong bài viết công bố Llama 3, Meta cũng từng thể hiện quan điểm không xem tiêu chuẩn Chinchilla là quy tắc tuyệt đối. Meta cho biết vào năm 2024, mô hình 8 tỷ tham số vẫn tiếp tục cải thiện hiệu năng dù được huấn luyện với tối đa 15.000 tỷ token, vượt xa mốc khoảng 200 tỷ token thường được nhắc tới như điểm tối ưu theo Chinchilla.

Trong nghiên cứu “Compute Optimal Tokenization” công bố tháng 5 năm 2026, Meta FAIR cũng lập luận rằng kích thước dữ liệu nên tính theo byte thay vì token, và tỷ lệ thuận với quy mô tham số. So với hướng tiếp cận đó, Skaling đi sâu hơn vào cấu trúc kết hợp của bề mặt loss, thay vì chỉ dừng ở tỷ lệ đơn giản giữa số token và kích thước mô hình.

Xu hướng này gắn liền với câu chuyện chi phí phát triển AI nói chung. Việc huấn luyện mô hình lớn có liên hệ mật thiết với trung tâm dữ liệu, chất bán dẫn và chi phí điện năng. Tokenpost từng đưa tin rằng cuộc đua đầu tư hạ tầng AI của các hãng công nghệ lớn tại Mỹ đang gây áp lực lên dòng tiền của chính các doanh nghiệp này.

Skaling không phải là công nghệ giải quyết trực tiếp áp lực chi phí nói trên, mà gần hơn với một khung nghiên cứu giúp phân bổ ngân sách chính xác hơn trước khi bước vào huấn luyện quy mô lớn. Nếu giảm được chi phí thử nghiệm trước khi huấn luyện, phần lãng phí trong quá trình xác định kích thước mô hình và lượng dữ liệu có thể được thu hẹp phần nào.

Cần lưu ý đây là bản preprint đăng trên arXiv, chưa qua bình duyệt (peer review) trên tạp chí khoa học. Bài báo cũng không đề cập trực tiếp tới thị trường tiền mã hóa hay blockchain. Vì vậy, ở thời điểm hiện tại, nên nhìn nhận đây là tranh luận về hiệu quả huấn luyện AI và việc hiệu chỉnh quy luật scaling, hơn là một yếu tố có thể làm thay đổi cục diện ngành.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1