Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

GLM-5.3 nâng thông lượng suy luận lên 3,2 lần

Màn hình kiểm tra biểu đồ hiệu suất suy luận / TokenPost.ai

Hạ tầng agent dựa trên GLM-5.3 đã giúp hệ thống suy luận của GLM-5.3-Flash nâng thông lượng đầu cuối lên 3,2 lần so với ban đầu. Thời gian từ lần chạy đầu tiên đến khi đảm nhiệm toàn bộ lưu lượng vận hành chưa đến hai tuần.

Zhipu cho biết agent hạ tầng dựa trên GLM-5.3 đã tham gia cải thiện hệ thống suy luận GLM-5.3-Flash. BlockBeats đưa tin dựa trên giải thích của Zhipu rằng agent đã lặp lại các nhiệm vụ chỉnh sửa mã, kiểm tra hiệu suất và phân tích nguyên nhân.

Điểm đáng chú ý của trường hợp này là agent AI không chỉ viết mã mà còn đo lường kết quả thực thi và xác định hướng chỉnh sửa tiếp theo. Theo Zhipu, một phần công việc cải thiện hiệu suất đã được tự động hóa và áp dụng trong môi trường vận hành thực tế.

Tang Jie, đồng sáng lập kiêm nhà khoa học trưởng của Zhipu, cho biết điểm khiến agent dễ bị đình trệ nhất không nằm ở việc viết mã mà ở việc tìm ra nguyên nhân của vấn đề. Việc xác nhận thông lượng giảm 20% sau một lần chỉnh sửa là chưa đủ, vì vẫn cần phân tích để xác định vấn đề phát sinh ở tầng nào và cần kiểm tra gì tiếp theo.

Zhipu đã chuyển phương pháp truy vết vấn đề hiệu suất của các kỹ sư giàu kinh nghiệm thành những công cụ mà agent có thể sử dụng. Sau khi thay đổi mã, agent kiểm tra kết quả có bình thường hay không và phân tích thời gian thực thi phát sinh ở đâu.

Sau đó, agent so sánh nhiều phương án để tìm cách nhanh hơn rồi tiếp tục chỉnh sửa mã. Đây là một vòng lặp trong đó agent xây dựng giả thuyết, tiến hành thử nghiệm và đưa kết quả vào công việc tiếp theo, thay vì chỉ xem xét kết quả của một lần chỉnh sửa.

Agent đã phát hiện lỗi tính toán trong quá trình xử lý ngữ cảnh dài, điểm nghẽn trong truyền KV và vấn đề tính toán trùng lặp ở kernel giải mã. Sau khi viết lại một kernel, tốc độ xử lý đã tăng 1,71 lần.

Kernel là đơn vị mã cấp thấp thực hiện các phép tính của mô hình AI. Ngay cả với cùng một mô hình, tốc độ suy luận và mức sử dụng tài nguyên vẫn có thể thay đổi tùy theo cách kernel được thực thi và cấu trúc di chuyển dữ liệu.

Truyền KV là quá trình chuyển thông tin trạng thái trung gian được tạo ra trong quá trình suy luận tới một giai đoạn tính toán hoặc thiết bị khác. Nếu xuất hiện điểm nghẽn ở đây, thông lượng xử lý phản hồi tổng thể có thể giảm unabhängig với hiệu suất của chính mô hình.

Trước đó, Zhipu đã công bố thông tin về hiệu suất suy luận và chi phí của GLM-5.3-Flash. Lần này, điểm được nhấn mạnh là agent đã tối ưu hóa hệ thống suy luận cung cấp dịch vụ cho mô hình, thay vì chỉ tập trung vào các chỉ số hiệu suất của bản thân mô hình.

Trong dạng công việc này, con người đặt ra mục tiêu và giới hạn, đồng thời xem xét những thay đổi có rủi ro cao. Agent đảm nhiệm việc truy tìm nguyên nhân khiến hiệu suất suy giảm, thay đổi mã theo giả thuyết và tiến hành thử nghiệm.

Tang Jie nhận định vai trò của kỹ sư sẽ ngày càng gần với 'người thiết kế phản hồi'. Đây là cách kết hợp giữa sự kiểm tra của con người và các thử nghiệm lặp lại của agent nhằm rút ngắn chu kỳ cải thiện hiệu suất.

Tuy nhiên, trường hợp này khó được xem là tự cải thiện đệ quy hoàn chỉnh (RSI). Tang Jie cho biết đã xuất hiện 'vòng lặp khép kín tối thiểu', trong đó mô hình tối ưu hóa hệ thống và hệ thống đó lại phục vụ mô hình, nhưng vẫn còn cách xa RSI hoàn chỉnh.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1