刚刚,腾讯姚顺雨再交卷,开源Hy4 preview

核心观点 - 腾讯混元发布并开源新一代大语言模型Hy4 preview,定位为“为生产力而生”,在软件工程、办公、游戏和科学研究等场景重点升级,模型性能进入开源模型第一梯队[1][6][12] 模型技术参数与架构 - Hy4 preview总参数达770B,单次推理激活49B,支持1M上下文,采用混合专家架构,主干共78层,其中77层为MoE层,每层包含256个路由专家和1个共享专家,每个token调用8个路由专家及共享专家[1][7] - 与上一代Hy3 preview的295B总参数、21B激活参数和256K上下文相比,Hy4 preview在模型容量和上下文窗口上大幅提升[1] - 模型内置一层原生MTP用于推测解码,注意力模块采用Gated DSA并通过IndexCache复用跨层稀疏索引,残差通路引入iHC扩展层间信息流,分别指向长上下文计算、解码效率和深层网络信息传递[7] - 模型权重及FP8版本已开放,采用Apache 2.0许可[1] 性能评测与排名 - 相较Hy3,Hy4 preview在软件工程和Agent任务上提升明显:Terminal-Bench 2.1从70.8升至85.4,DeepSWE从28.0升至64.3,Toolathlon-Verified从56.2升至74.1;科学与推理方面,BioMysteryBench从54.9升至71.3,GPQA Diamond从90.9升至92.3[7] - 在大模型竞技场平台Arena.ai的Code Arena: WebDev榜单中,Hy4 preview以1633分暂列约第5名(AutoEval),相比Hy3的总榜第31名提升115分;在开源模型中约排第3,而Hy3此前为第7[9] - 腾讯组织163名内部专家对203个工程任务进行盲测,Hy4 preview平均分2.99分(满分4分),略高于GLM 5.3的2.92分和Kimi K3的2.94分[19] 应用场景与产品集成 - 软件工程场景升级重点在长程任务,模型需理解需求、规划改动、调试代码并完成验证,同时改善前端页面视觉与交互质量[13] - 复杂办公环境加强理解能力,可从多个文件中提取和交叉核对信息,执行数据分析与金融分析,产出文档、表格或演示文稿[14] - 游戏开发场景从一句需求生成可玩原型,能在配套工具环境中使用Unity、Unreal等游戏引擎,并在多轮交互中补充玩法、资产和工程细节[15] - 科学研究场景覆盖AI研发、分子动力学模拟、凝聚态物理和基础数学等任务[16] - 用户可在WorkBuddy、CodeBuddy国内版及国际版、元宝和ima中体验,并通过腾讯云TokenHub、OpenRouter调用API[1] 训练与反馈机制 - 训练引入软件工程、游戏、金融和安全等领域的腾讯内部专家,专家参与高质量数据共建,CodeBuddy、WorkBuddy等产品将真实使用问题和反馈带回模型研发,形成更短的反馈链[12] API价格与体验 - API价格为输入每百万tokens 6元,输出每百万tokens 18元,缓存命中输入每百万tokens 0.3元[3] - WorkBuddy和CodeBuddy将开启为期两周的限时免费体验[3] 基础设施优化 - 在一轮推理基础设施优化中,模型分析系统瓶颈并围绕算子融合、通信优化持续迭代,最终将端到端吞吐较基线提升31.8%[1]

刚刚,腾讯姚顺雨再交卷,开源Hy4 preview - Reportify