o3-pro通关“推箱子”，人类怀旧小游戏成了大模型新Benchmark

经典小游戏成为大模型Benchmark - 核心观点：经典小游戏如推箱子和俄罗斯方块被用作测试大模型性能的新基准，o3-pro模型在该基准上表现优异，突破了原有上限 [1][2][6] - o3-pro在推箱子游戏中通关所有关卡，远超之前仅能完成第六关的benchmark上限 [3][7][8] - 在俄罗斯方块中o3-pro表现持续强劲，游戏需强行终止，其得分计算方式为放置方块数量与清除行数10倍之和 [13][14] - 与前SOTA模型o3相比，o3-pro成绩直接翻倍 [3] Lmgame Benchmark框架设计 - 测试框架包含六款游戏：推箱子、俄罗斯方块、2048、糖果传奇、马里奥兄弟和逆转裁判 [18] - 采用迭代交互循环模式：游戏状态持续反馈给模型，模型生成动作后获得奖励并更新状态 [18] - 引入智能体框架辅助，包含感知、记忆、推理模块，并通过提示标准化确保评估稳定性 [20] - 各游戏评价标准差异化：马里奥兄弟按移动距离、2048按合并方块值对数、糖果传奇按消除数量、逆转裁判按正确动作计数 [24] 模型性能对比与开源生态 - 推箱子历史排名：o3-pro > o3 > o4-mini > DeepSeek-R1(0528) [10] - 俄罗斯方块历史排名：o3-pro > o3 > R1 > o4-mini（与推箱子排名部分倒置） [14] - 测试基准动态更新，GitHub仓库半月前仅四关，原版推箱子含50+关卡 [9] - 项目完全开源，可自行下载测试模型性能 [23] 研究团队背景 - Lmgame由UCSD Hao AI Lab开发，负责人张昊为卡内基梅隆博士、伯克利博士后，曾参与创立LMSYS（大模型竞技场开发方） [28][29][30] - 实验室获谷歌/英伟达资助，2024年4月获赠英伟达DGX B200服务器 [34] - 其他开源项目FastVideo（视频生成加速框架）获GitHub 1.5k星 [32]