大模型benchmark - 财报，业绩电话会，研报，新闻

大模型benchmark

搜索文档

量子位· 2025-06-16 12:50

经典小游戏成为新Benchmark - o3-pro突破推箱子第六关上限并通关所有关卡表现远超benchmark原有标准[2][8] - 俄罗斯方块测试中o3-pro得分无上限成绩较前SOTA模型o3直接翻倍[3][14] - 测试采用迭代交互循环模式结合智能体框架的感知/记忆/推理模块提升稳定性[18][20] Lmgame基准测试体系 - 包含6款游戏：推箱子(1989版)、俄罗斯方块、2048、糖果传奇、马里奥兄弟、逆转裁判[6][18] - 各游戏评估标准差异化：推箱子计算通关关卡数俄罗斯方块按方块数+10倍消行数计分[7][13][24] - 测试框架开源支持动态更新游戏关卡(如推箱子从4关扩展至50关)[9][23] 模型性能对比 - 推箱子历史排名：o3-pro > o3 > o4-mini > DeepSeek-R1(0528版)[10] - 俄罗斯方块历史排名：o3-pro > o3 > R1 > o4-mini 与推箱子排名存在差异[14] - o3-pro操作耗时显著单步决策需数分钟[17] 研究团队背景 - 项目来自UCSD Hao AI Lab 负责人张昊(卡内基梅隆博士)曾参与创立LMSYS[28][29][30] - 实验室获谷歌/英伟达资助 2024年4月接收DGX B200捐赠[34] - 开源项目FastVideo获GitHub 1 5k星标团队同时开发大模型竞技场等知名框架[32][31] 行业应用延伸 - Gemini模型2024年5月成功通关宝可梦·蓝谷歌CEO公开宣布成果[26][27] - 测试方法受业界认可网友认为比大模型竞技场更适合评估模型能力[5]

o3-pro通关“推箱子”，人类怀旧小游戏成了大模型新Benchmark

量子位· 2025-06-16 12:49

经典小游戏成为大模型Benchmark - 核心观点：经典小游戏如推箱子和俄罗斯方块被用作测试大模型性能的新基准，o3-pro模型在该基准上表现优异，突破了原有上限 [1][2][6] - o3-pro在推箱子游戏中通关所有关卡，远超之前仅能完成第六关的benchmark上限 [3][7][8] - 在俄罗斯方块中o3-pro表现持续强劲，游戏需强行终止，其得分计算方式为放置方块数量与清除行数10倍之和 [13][14] - 与前SOTA模型o3相比，o3-pro成绩直接翻倍 [3] Lmgame Benchmark框架设计 - 测试框架包含六款游戏：推箱子、俄罗斯方块、2048、糖果传奇、马里奥兄弟和逆转裁判 [18] - 采用迭代交互循环模式：游戏状态持续反馈给模型，模型生成动作后获得奖励并更新状态 [18] - 引入智能体框架辅助，包含感知、记忆、推理模块，并通过提示标准化确保评估稳定性 [20] - 各游戏评价标准差异化：马里奥兄弟按移动距离、2048按合并方块值对数、糖果传奇按消除数量、逆转裁判按正确动作计数 [24] 模型性能对比与开源生态 - 推箱子历史排名：o3-pro > o3 > o4-mini > DeepSeek-R1(0528) [10] - 俄罗斯方块历史排名：o3-pro > o3 > R1 > o4-mini（与推箱子排名部分倒置） [14] - 测试基准动态更新，GitHub仓库半月前仅四关，原版推箱子含50+关卡 [9] - 项目完全开源，可自行下载测试模型性能 [23] 研究团队背景 - Lmgame由UCSD Hao AI Lab开发，负责人张昊为卡内基梅隆博士、伯克利博士后，曾参与创立LMSYS（大模型竞技场开发方） [28][29][30] - 实验室获谷歌/英伟达资助，2024年4月获赠英伟达DGX B200服务器 [34] - 其他开源项目FastVideo（视频生成加速框架）获GitHub 1.5k星 [32]