字节跳动 Seed 团队与清华大学智能产业研究院(AIR)近日正式发布 CUDA Agent 系统。该系统是一套面向高性能 GPU 内核生成的智能体强化学习框架,核心目标是帮助大型语言模型获得硬件级优化能力,进一步推动 AI 在底层系统编程与 CUDA 代码优化领域实现关键突破。
长期以来,主流大模型在通用编程与代码生成任务中表现优异,但在 CUDA 代码生成和 GPU 内核优化方面仍存在明显短板。虽然模型通常可以生成语法正确的内核代码,但普遍缺乏对内存访问模式、线程调度策略、共享内存布局等 GPU 微架构特性的深层理解,因此实际性能往往不及 torch.compile 等成熟编译器优化方案。根据 KernelBench 测试结果,原始模型 Seed1.6 的任务通过率为74.0%,但仅有27.2%的生成内核在运行速度上超过 torch.compile,整体几何均速也低于编译器基准水平。
为解决这一行业难题,CUDA Agent 构建了一个高度逼真的 CUDA 开发沙盒环境。该环境集成自动编译验证、多维性能剖析工具(如 Nsight Compute)以及细粒度正确性检查等关键能力,同时通过严格的文件权限隔离与执行约束机制,彻底阻断“作弊路径”。系统基于近端策略优化(PPO)算法,完成了长达150步的端到端强化训练。在涵盖250个多样化任务的基准测试中,CUDA Agent 最终实现了98.8%的整体功能通过率,其中96.8%的生成内核在实测性能上超过了 torch.compile。
在生态建设与开源布局方面,研究团队已经开源 CUDA-Agent-Ops-6K 数据集(包含6000条高质量融合算子样本)、SKILL.md 技能规范文档,以及完整的奖励设计与热身训练方案。尽管目前尚未公开完整模型权重,但这一技术路线已经展现出在 AI 基础设施优化、大模型低延迟推理、自动驾驶实时计算、高频量化交易等高要求场景中的广阔应用前景与落地潜力。
