核心观点 - 阿里千问最新发布的Qwen3.8预览版模型在英伟达SOL-ExecBench基准评测的FlashInfer-Bench子集中登顶,其SOL得分超过腾讯混元、人类开发者及Cursor等竞争对手,表明其在GPU算子自动生成与优化能力上接近硬件理论极限 [1][2] 榜单与评测体系 - 英伟达SOL-ExecBench是面向Blackwell B200架构的GPU CUDA Kernel内核优化基准评测套件,包含从124个商用及前沿AI模型中提取的235项CUDA内核优化任务,覆盖大语言模型、扩散模型、计算机视觉等多种模型类型及BF16、FP8、NVFP4精度 [2][3] - 该榜单通过“Speed-of-Light(SOL)”界限评估内核性能,SOL得分越接近1,代表生成和优化GPU算子的能力越接近由GPU峰值算力与HBM带宽决定的理论性能极限,评分为0.5表示与基准值相当 [1][4] 1. FlashInfer-Bench子集专门用于测试和优化大语言模型推理系统中的GPU算子,包含26个来源于Llama-3.1-8B、Qwen3-30B-A3B等模型的问题,覆盖BF16与FP8精度,每个问题提供7-48个动态形状输入配置,测试在真实NVIDIA B200 GPU上执行 [2][5] 模型表现与排名 - 在SOL-ExecBench FlashInfer-Bench子集榜单中,阿里千问Qwen3.8排名第一,腾讯混元Hyra排名第二,人类开发者Amir M. Mir排名第四,美国AI创企doubleAI的全自动GPU内核生成智能体系统排名第六,AI编程独角兽Cursor排名第十 [1] 技术能力与意义 - 在SOL-ExecBench上表现靠前,意味着模型具备在无需人类标注的情况下,通过与真实硬件环境交互,自主产生训练信号、评估输出质量并持续改进算子的能力,即具备在客观物理约束下进行闭环自我改进的潜力 [1][6] 1. Kernel优化任务能提供运行时间、吞吐量等清晰、客观、可量化的反馈信号,模型在评测中完成了平均29354轮工具调用的持续迭代,在数万轮迭代中保持方向一致性并持续产出有效优化,体现了长程持续优化能力 [6][9] 2. 模型登顶意味着其有能力承担底层算力优化的复杂工程任务,进一步压缩人工介入算子开发的环节,形成从算子生成到性能调优的自动化闭环 [9] 训练与推理优化方法 - 在训练侧,为让模型真正具备kernel优化能力,公司构建了一套基于真实GPU环境的大规模强化学习体系,包括搭建基于沙盒的真实GPU训练环境、使用真实Kernel仓库作为训练数据,并对强化学习基础设施进行专项优化以支持超长多轮工具调用的训练 [6][8] 1. 在推理侧,公司使用阿里巴巴Atrex Kernel Agent框架来承载算子优化的完整分析迭代流程与经验沉淀机制 [8] 2. 模型需要具备长程因果推理、工具使用与环境交互中的策略规划、稀疏反馈下的探索能力,以及系统级抽象与具体实现之间的双向翻译等能力 [7] 行业影响与未来展望 - 自动化GPU算子生成赛道的长期竞争,未来可能取决于大模型理解硬件架构、推演访存瓶颈、自主迭代调参的综合智能水平 [10] 1. 伴随大模型能力升级,模型侧与编译层在算力优化方面将形成持续双向反馈,硬件规格、算子实现、模型架构三者协同演进可能会成为常态 [10]
Qwen3.8,登顶英伟达榜单!