24 giờ, 1.000 tool call: case study tối ưu kernel chứng minh điều gì?
Benchmark đo cú nước rút của một agent. Nghiên cứu tối ưu kernel của Meta đo cuộc marathon — và đó mới là con số thú vị hơn.
Bối cảnh thí nghiệm
Meta đã kiểm tra khả năng của Muse Spark 1.2 trong việc tối ưu GPU kernel một cách lặp đi lặp lại qua hơn 1.000 tool call, với những phiên chạy kéo dài tới 24 giờ. Bên trong môi trường agentic của Muse Code, model viết một kernel, biên dịch, profile nó so với baseline được cung cấp, rồi dùng dữ liệu profiling để thử lại — một vòng lặp viết-biên dịch-profile-cải thiện khép kín, duy trì suốt một ngày trọn vẹn. Mục tiêu benchmark là các attention kernel KDA và MLA trên GPU NVIDIA Hopper.
Một luật chơi khiến bài test trở nên sòng phẳng: model bị cấm import các thư viện kernel bên thứ ba như FLA. Không có chuyện bọc một implementation nhanh sẵn có rồi nhận công — agent phải vận dụng kiến thức tối ưu kernel thực thụ và tự cài đặt thuật toán bằng Triton.
Agent đã thực sự xây được gì
Các lời giải không hề chung chung. Với KDA — benchmark so với implementation Triton của FLA — Muse Spark 1.2 ghép một kernel chuẩn bị chạy song song theo chunk với một phép quét tuần tự giữa các chunk, kết hợp fusion và tiling tiêu chuẩn với những nước đi đặc thù cho KDA như re-center giá trị gated cumulative decay tại điểm giữa chunk. Với MLA — so với reference PyTorch ở batch size 1, 64 head, độ dài chuỗi 8192, chiều latent 512 — nó thiết kế một pipeline Triton hai kernel, tái sử dụng KV latent dùng chung làm cả K lẫn V.
Đó là loại tối ưu mà một chuyên gia chỉ viết ra sau khi đã hiểu cấu trúc thuật toán, chứ không phải mấy cú tinh chỉnh vòng lặp hời hợt. Và agent tiếp tục tìm ra những cải thiện đáng kể so với baseline trong suốt phiên chạy — tiến bộ tích lũy qua hàng trăm vòng lặp thay vì chững lại sau đợt bùng nổ đầu tiên.
Vì sao 24 giờ mới là tiêu đề thật sự
Khối model có thể cải thiện một kernel trong hai mươi phút. Nhưng duy trì tiến bộ có định hướng suốt một ngày đòi hỏi hạ tầng mà phần lớn agent không có. Ba mảnh ghép gánh tải chính. Goal conditioning giữ cho vòng lặp thứ 700 vẫn nhắm đúng mục tiêu như vòng lặp thứ nhất — model được huấn luyện cho đúng việc này. Context compaction giữ lại kiến thức quan trọng (chiến lược nào đã thất bại, profiler nói gì) mà không chết chìm trong lịch sử của cả một ngày. Và event log khiến runtime an toàn trước restart — trong 24 giờ, kiểu gì cũng sẽ có trục trặc, và một cú crash xóa sạch giờ thứ 23 sẽ khiến toàn bộ thí nghiệm trở nên vô nghĩa.
Nó báo hiệu gì cho công việc thường ngày
Chẳng mấy team tối ưu kernel Hopper. Nhưng hình dáng của bài toán — lặp đi lặp lại theo một mục tiêu đo đếm được, học từ mỗi lần thử, không lạc mất mạch — trùng khớp với rất nhiều việc kỹ thuật kém hào nhoáng: săn lùng một test suite chập chờn, mài bundle size xuống từng chút, migrate một API qua cả trăm điểm gọi. Case study này là bằng chứng Meta đưa ra rằng “bấm nút chạy rồi mai kiểm tra” giờ đã là một workflow có thật. Phương pháp đánh giá được công bố trên trang nghiên cứu của Meta; còn phía sản phẩm cho công việc long-horizon thì bắt đầu từ docs.