机器之心
搜索文档
Agent版Hugging Face来了,openJiuwen发布首个开源智能体资产平台
机器之心· 2026-09-22 14:16
核心观点 - openJiuwen将Agent能力拆解为技能、连接器、插件、专家和专家团五类可管理、可复用、可共享的能力资产,构建从创建到发布的完整生命周期,推动Agent能力从一次性使用走向可流通的资源生态[1][47] 平台定位与生态 - openJiuwen是由华为2012实验室、华为云、终端、计算、算力先遣队等团队联合高校、企业开发者共同构建的开源AI Agent平台[2] - 五类资产已上线至蜂群智能体WorkSwarm和Agentic Hub中,支持上传、下载、分享各类经验资产,共建共享Agent生态[2] - 当前已有客户及伙伴参与共建,如openJiuwen × FAB智慧金融专区升级金融智能体加速器FAB 2.0,推动工程工艺资产沉淀复用,发布金融元枢Token全生命周期运营方案[47] 五类资源详解 技能:沉淀方法为可复用资源 - 技能以SKILL.md为入口,可附带参考资料、脚本、模板和多模态资源,告诉Agent在什么场景下采用什么方法及具体步骤[9] - WorkSwarm可识别三类技能:团队技能(Swarm Skill)固化多Agent协作方式,多模态技能(Skill-Omni)携带图片、音频、视频等资源,普通技能(Skill)固化单个Agent任务流程[10] - 创建技能通过统一入口skill-creator,根据目标类型选择创建方式,生成可安装的技能资源[10] - 团队技能由swarmskill-creator生成角色分工、协作流程和依赖关系,可补充SwarmFlow脚本[11] - 多模态技能由skill-omni-creation从URL、网页或视频抽取正文、图片或视频帧并打包[11] - 普通技能由skill-creator-normal沉淀单个Agent的流程、SOP、脚本和参考资料[11] - 提供本地技能自动演进能力,Agent使用技能后根据执行过程、失败信号或用户反馈生成经验记录,沉淀到本地经验文件和技能索引中[12] - 技能可从Hub或技能广场安装,也可通过本地上传、本地路径或资源包导入[12] 连接器:接入外部真实系统 - 连接器统一承载集成方式、认证信息和连接状态,让Agent访问代码仓库、企业文档、数据库、内部服务或本地开发工具[14] - 获取方式包括从Hub获取成熟连接器,或在WorkSwarm客户端配置企业内部系统、本地CLI或自定义MCP服务[14] - 覆盖四种集成形态:stdio-mcp启动本地MCP服务进程,remote-mcp连接远程MCP服务,cli通过CLI安装认证使用外部能力,skill-only通过技能和凭证提供接入[15] 插件:打包一组能力给Agent - 插件将提示词、工具、Rail、技能和MCP能力组织在一起,让Agent获得一整套增强能力[17] - 插件可包含prompt sections、tools、rails、skills、connector等组成[19] - 创建方式包括通过聊天描述需求,WorkSwarm自动使用plugin-creator整理成可加载的plugin插件包[19] - 可从openJiuwen Agentic Hub安装成熟插件,或通过本地上传导入企业内部插件[19] 专家:带角色的能力包 - 专家是可安装的Agent模板,将角色身份、职责边界、工作方式和可调用能力打包,让Agent加载一套稳定的角色能力[21] - 专家可包含persona、skills、tools、rails、connector、subagents等组成[23] - 创建方式包括在专家管理页面通过聊天描述需求,WorkSwarm使用agent-creator转成Agent模板包,或通过文件上传专家资源包[23] - 专家不是已运行的Agent,而是可被会话加载的角色模板,会话选择后运行中的Agent才获得相应角色、规则和能力配置[25] - 对其他业界平台(如WorkBuddy、千问办公等)已沉淀的专家资产,可转换为openJiuwen的专家资源,WorkSwarm可复用[26] 专家团队:多专家协同完成复杂任务 - 专家团队将协作本身做成资源,由Leader负责目标理解、任务拆解和结果汇总,成员专家分别承担专业工作[28] - 专家团队可包含Leader、Members、instruction、Swarm Skills、member templates等组成[29] - 组建方式包括将已有专家拉到同一团队,或通过自然语言描述任务目标,WorkSwarm通过内置agent-group-creator技能自动生成完整专家团包[29] - 专家团队保存的是可复用的初始协作配置,而非固定不可变的工作流步骤图[32] 资源发布与生命周期 - 资源经历创建、安装、使用、发布和再次获取的完整生命周期[2] - 发布入口有两种方式:从WorkSwarm客户端直接发布本地验证过的资源,或在Agentic Hub网站面向社区发布已整理好的资源包[35][36][37][38][39] 应用案例 - 案例一:鸿蒙应用开发专家完成"吞噬黑洞"应用开发,用户选择已发布到SkillHub的专家,通过自然语言提出需求,专家结合人设、开发Skill和连接器能力完成鸿蒙App开发、真机部署、后端部署和二次调试优化[42][43] - 案例二:将本地已沉淀的多个专家组合成"智囊天团",每个成员保留角色、人设、Skill和连接器能力,由Leader拆解任务、分派问题、汇总结论[44][45]
用GPT-6 Astra就能直接控制机器人?可具身真机没那么简单
机器之心· 2026-09-22 14:16
核心观点 - GPT-6 Astra的发布标志着AGI加速到来,其强大的基础通用模型能力在具身智能领域引发巨大浪潮,但基模能力的突破仅是起点,系统级能力构建才是长期竞争力的关键 [1][9][52] - 穹彻智能发布的RoboRSI框架,通过多智能体自进化机制,解决了基模在具身智能中持续执行、诊断、修订和复用的系统级难题,为具身智能公司提供了不可替代的价值 [10][11][53] GPT-6 Astra对具身智能的冲击 - GPT-6 Astra在机器人控制任务中成功率达到95%,远高于Fable 5.1的40%,输出Token用量仅为后者的约1/6.2,成本约为后者的1/2.3 [3] - 用GPT-6基模控制机器人执行复杂操作的案例迅速增多,行业出现“GPT-6横扫具身”的趋势,具身智能可能成为通用模型的一个子领域 [3][9] - 知名具身智能企业创始人指出,当前具身智能没有真正护城河,通用模型公司在人才、算力和资金上占优,未来一两年是关键窗口 [9] - Robocurve预测,如果趋势持续,大语言模型最早在2024年底、最晚在2029年实现对机械臂的实时控制 [9] - 基模在真实环境中存在安全问题,RoboDojo团队评测显示,Astra在真机测试中反复发出物理上不合理或不安全的动作,部分事故造成硬件损坏,团队提前停止测试,未能完成原定18项任务的RoboDojo-Real评测 [9] 具身智能面临的核心系统难题 - 执行过程中的异常处理难题:机器人报错停止、抓取失败、位置偏移后,需要结果检查、异常恢复和安全决策,过去全靠工程师手动跟进,大模型无法负责现场恢复 [15] - 历史经验沉淀复用难题:每次让Agent参考完整执行记录会导致Token消耗持续增长,每次局部失败就重写整套流程则系统难以收敛 [15] - Context管理成为新时代的代码管理:机器人系统核心挑战从写出正确控制代码,转变为管理Agent持续运行产生的海量上下文(轨迹、日志、视频、代码版本、失败记录) [15] 穹彻智能RoboRSI框架设计 - 设计哲学:给人和Agent各自提供合适的接口,对人提供高层引导,对Agent提供清晰结构 [16][17][18] - 对人:无需深入底层实现,专注于目标设定、专业判断和安全边界,将日常执行交给多智能体 [17] - 对Agent:通过层级化技能树,明确修改范围、成功标准和失败反馈路径,让局部修订始终围绕全局目标展开 [18] - 采用Manager、Planner、Engineer、Reviewer四类智能体协作架构,将规划、执行、诊断和修订拆分到不同上下文中 [22] - Manager作为调度中枢,负责任务队列管理、并发worker调度、断点恢复和技能版本管理,将高层目标分解为可执行任务序列 [31] - Planner根据环境观察和技能库生成具体执行计划 [31] - Engineer调用底层工具执行动作并生成候选能力 [31] - Reviewer复盘执行结果,定位失败原因,将修订建议返回Manager推动下一轮迭代 [31] - 四个角色围绕同一任务和执行证据接力运行,形成“执行→诊断→修订→再执行”闭环,人类保留对目标、价值判断和安全边界的控制权 [25] - 工程师角色从逐行编写任务代码、跟进底层执行,转向设定目标、审核结果和提供方向性指导 [26] TSR技能树机制 - 提出TSR(Top-down Skill Refinement,自顶向下技能细化)机制,用四层技能树组织机器人全部能力 [28] - 任务族:定义总体目标与约束,如“家庭地面清理” [32] - 复合技能:组合多步能力,如“搜索目标→移动→抓取→放置” [32] - 原子任务:边界明确、结果可验证的最小任务单元,如“抓取地面上的黄色包装袋” [32] - 基础技能:与机器人直接交互的底层能力,包括视觉感知、移动控制、抓取、放置等 [32] - 技能树为Coding Agent提供结构性约束,每次修改限制在清晰技能边界内,Agent专注局部实现但不会偏离全局目标 [28] - 历史经验从对话记录和日志,变成下一轮真正可调用的能力 [29] 三阶段演进机制 - 从成功的调用链中提取稳定结构,将物体类别、目标区域和空间关系参数化,将可复用流程固化为代码技能 [33] - 类似任务再次出现时,Agent只需选择、监控和必要时修订整条技能,重复工具调用步骤由代码承担 [33] - 在LIBERO基准测试中,启用代码固化相比未启用版本,回合通过率从21.5%提升到29.0%,中位Token消耗下降29.4%,中位VLM调用次数下降27.2%,中位执行时间下降17.0% [36] - Agent的推理资源只留给真正变化和不确定的部分 [37] 实验验证结果 - 零样本任务适配:经过约一天并行执行,LIBERO基准累计任务通过率从32/120提升到95/120,RoboTwin从初始的9/50提升至36/50 [39] - 完整多智能体配置(Planner+Engineer+Reviewer)在RoboTwin上将通过率提升4倍,相比仅使用Engineer单角色的基线 [39] - 代码固化效果:在LIBERO的120个任务、5组初始布局、共600个episode实验中,回合通过率从21.5%提升到29.0%,中位Token消耗下降29.4%,中位VLM调用次数下降27.2%,中位执行时间下降17.0% [40] - 扰动鲁棒性:在LIBERO-Plus的840个扰动实例中(涵盖视觉纹理、相机视角、语言指令、光照条件、物体布局、机器人初始状态、传感器噪声七个维度),RoboRSI通过自适应修订将通过率从31.1%提升至47.4%,额外恢复137个原本失败的实例 [42] 商业价值与场景适配 - 2024年完成类似家庭地面清理Demo需两名工程师连续投入约一个月,编写约2,000至3,000行任务代码,RoboRSI框架下一天内走完完整闭环 [45] - 新场景适配成本被大幅压缩,核心成本从“工程师驻场数周”变为“设定目标+系统自主迭代+人工审核和安全把关” [46] - 为家庭等高度个性化场景打开新商业空间:每个家庭户型、家具布局和物品摆放不同,若每次部署需工程师驻场数周则服务成本难以支撑大规模推广 [47] - RoboRSI在通用能力基础上,通过现场反馈自主迭代,逐步学会适合家庭的清理路径和操作技能,家具移动、物品更换后也可沿用同一套机制完成适配 [47] - 类似需求存在于布局各异的门店、办公室和小型仓储空间,缩短适配周期意味着过去因定制成本过高而难以覆盖的分散场景都有机会成为可服务的市场 [47] 具身智能公司的未来方向 - 仅在语义基座上做微调改造得到的具身模型,容易遭遇GPT-6的降维冲击 [50] - 基模解决了“理解”问题,但从理解到持续稳定执行,中间还有系统级能力需要构建,这是具身智能公司不可替代的价值 [52] - 具身智能公司下一阶段机会,是把不断增长的模型能力变成用户在真实世界中用得起来、用得长久的机器人能力 [53] - 穹彻智能将探索RoboRSI和Noe-0世界动作模型协同,突破机器人能力边界、走向真实应用 [53] - 三个关键系统能力:经验的结构化管理与复用、行为边界与安全约束、部署后的持续迭代能力 [54]
迎接生成范式革命!复旦和Wan团队发布首篇Agentic视觉生成综述
机器之心· 2026-09-22 11:01
让 AI 生成一张海报已经不难。更难的是,让它围绕同一个设计目标持续工作:理解品牌与产品要求,生成初稿;发现标题、产品位置或整体风格存在问题 后,知道应该修改哪里、怎样修改;同时保留已经确认的内容。等到下一次活动,它还能延续此前确定的设计偏好和有效经验。 这里需要做的决定,从曾经的"输入什么提示词",扩展到了选什么工具、检查结果、局部修改,以及积累经验。 这些决定由谁来做,做到哪一步,正是 Agentic Visual Generation(智能体式视觉生成) 要研究的问题。 来自 复旦、Wan、港中文mmlab 的研究团队 在综述《Agentic Visual Generation: From Generative Models to Agentic Control》中,为这个快速 发展的方向建立了一套围绕控制器决策范围的分类框架。 论文梳理了覆盖图像生成、编辑、视频、幻灯片、用户界面、3D 与世界模型 的系统,并将不同技术路线放到同一组问题下考察:系统在生成前能决定什 么?执行时能选择什么?看到结果后能改变什么?任务结束后又能留下什么? 这其中一个非常值得关注的地方是:目前的工作中,根据结果修正当前任务的 ...
红杉、云启领投,华超神控完成2亿元Pre-A轮融资,押注「非侵入式AI脑机接口」
机器之心· 2026-09-22 11:01
编辑|Clio 科幻小说《仿生人会梦见电子羊吗》中有一个有趣的设定:人类可以使用一种叫「情绪调节器」的设备,通过拨号或设置参数,让机器自动调节心情。 AI 生成 对应到当下技术,最接近的可能是脑机接口与神经调控。提到脑机接口,很多人首先想到的可能是 Neuralink 带入公众视野的植入式电极,或者实验室里 戴在头上、布满电极和导线的脑电设备。 在我们和李昕的交流里,他把华超定义为一家「 非侵入 AI 脑机接口公司 」。 这背后包含几项同时推进的技术:以低强度经颅聚焦超声作为主要的「写脑」手段,以脑电、功能超声等多模态方式读取大脑状态,再由 AI 参与神经解 码、靶点判断和参数优化。公司把这套体系概括为「读脑—解码—写脑」。 简单说,它希望完成这样一个循环: 读取大脑状态,理解正在发生什么,实施调控,再根据反馈继续调整。 要完成这个循环,需要同时解决两个问题:一是如何在不开颅的情况下,更精准地读取和作用于大脑;二是面对复杂且存在个体差异的神经信号,系统如何 判断当前状态,以及下一步该怎样调控。 华超给出的答案,是「非侵入式 + AI」。 李昕产生脑机接口创业的念头,比华超神控成立早了三年。 2022 年,在经 ...
全球唯一非侵入穿颅读脑突破!这家中国公司想成为脑科学的“英伟达”
机器之心· 2026-09-22 10:33
文章核心观点 - 鲲为通过声学空间智能理论,实现了全球唯一的非侵入式超声穿颅读脑技术,突破了传统超声无法穿透颅骨进行高分辨率成像的行业瓶颈[2][9] - 该技术通过“低频+计算”的范式,用算力替代物理聚焦,解决了低频超声分辨率低的问题,并有望成为脑科学AGI时代的关键基础设施[14][18] 行业背景与痛点 - 侵入式脑机接口(如Neuralink)需开颅钻孔,仅适用于极少数患者[2] - 非侵入式EEG脑电帽信号分辨率低,无法穿透头皮和颅骨读取大脑[2] - 传统超声行业遵循“频率越高分辨率越高”的范式,但高频超声遇颅骨几乎完全反射和吸收,低频超声穿透后分辨率退化至无临床价值[13][14] - 全球超声学术界长期无法实现非侵入全脑超声成像,行业认知为“要么开颅,要么无解”[14] - 现有脑科学数据采集工具各有缺陷:植入电极需开颅且仅局部信号;EEG信噪比低;fMRI设备巨大昂贵且无法日常使用;功能超声穿不透颅骨[22] 技术突破与核心创新 - 鲲为选择正面穿透颅骨,而非绕开颅骨(如Arbor、Merge Labs采用开颅或植入透声材料)[9] - 核心技术为“声学空间智能”理论,将波束合成难题大规模留给算法,用GPU算力在物理重建层面“计算”出图像[14] - 成像算法计算量是传统超声的千倍以上,依赖高性能GPU实时物理重建,鲲为因此成为英伟达全球超声领域前沿客户[15] - 成像性能从初代原型机0.25帧/秒提升至5000帧/秒,五年提升万倍,性能提升由算力+算法驱动的“摩尔定律”支撑[15] - 公司目标为每一代产品性能至少提升两倍以上[15] 商业化进展与市场机会 - 颅脑超声产品已在中国和海外多家顶级医院完成系统性临床验证和商业化落地[18] - 2025年底商业化以来进入陡峭的指数增长[18] - 全球超声市场为百亿美元级成熟市场,长期由GE、飞利浦主导,颅脑超声是巨头未解决的难题,鲲为视其为“技术降维”式机会[18] 脑科学基础设施愿景 - 超声可走向可穿戴,探头可做成贴合皮肤的轻薄阵列或集成到头戴装置中,实现长期持续观察大脑[19] - 2025年《Science Advances》研究已展示功能超声跟随人活动、长期反复使用的可能(虽仍需开颅植入透声材料)[19] - 设备进一步小型化可进入日常生活,监测睡眠、运动、情绪、专注状态等,Enable脑科学领域Oura Ring级别产品[20] - 可穿戴超声可产生亿小时级别数据量,远超目前最大fMRI数据集(万小时级别)[20] - 超声天然具备读写闭环能力:同一探头可交替完成成像和神经调控,实现“观察—干预—再观察”[21] - 2026年6月UCSF团队预印本报告已在大鼠实验中用同一探头完成刺激和成像闭环[21] - 鲲为希望成为脑科学AI公司、脑机接口公司获取AGI级别突破的“数据铲子”[23][24] 创始人背景与公司基因 - 创始人刘家家本硕就读于西安交通大学生物医学工程专业,2003年接触神经网络,2008年入行超声行业[4][26] - 2009年起从第一性原理出发研究“低频率实现高分辨率”问题,持续十年[27] - 2019年创立鲲为,2021年初代原型机问世,2024年将声学空间智能理论延伸至颅脑超声应用[27] - 公司定位为“有商业化能力的声学空间智能Neo Lab”,将蝙蝠用声波感知空间的能力做成可计算、可规模化的产品[28] - 公司从不发论文,核心技术作为商业秘密保护,学术界尚在基础理论阶段时,鲲为已完成理论-技术-产品-量产闭环[3] 行业影响与外部验证 - 全球超声学术界对鲲为成果的反应是试图复现“低频之下高分辨如何实现”[12] - 脑科学数据需求已写入前沿AI团队计划:OpenAI与Merge Labs合作开发脑科学基础模型;Meta支持“数字大脑计划”采集1.5万小时脑记录;Flourish获5亿美金融资探索大脑学习机制[23] - Neuralink创始科学家Philip Sabes提出脑机接口需重新设计数据获取方式,不可能让6万人接受脑植入[19]
假如有一万张卡,RL训练该怎么扩大规模?十万张呢?
机器之心· 2026-09-22 10:33
核心观点 - 强化学习在LLM开发中占比增大,训练效率成为关键变量,Batch Size是影响效率的核心参数 [2][3][4] - 腾讯混元团队提出通过先建立Batch Size Invariance(样本效率)再优化吞吐(系统效率)的两步法,可缩短训练时间29% [60][62] 强化学习规模化与效率 - 预训练将大模型带到新起点,强化学习通过持续探索与反馈决定模型能走多远 [2] - RL在模型开发中占比越大,训练效率对算力预算影响越直接 [3] - 以1万张GPU连续运行30天为例,每卡每小时3美元,总费用2160万美元,缩短10%训练时间可节省72万GPU小时约216万美元 [3] Batch Size的两类决策 - 适度增大Batch并同步调整学习率可提高吞吐,但Batch过大时额外样本代价会压过吞吐收益 [5] - 腾讯混元团队将Batch Size放回训练动力学与硬件执行共同约束中,从第一性原理重新审视规模化规律 [8] - Batch Size Tuning:模型变大或GPU卡型变化时,需找到稳定学习且高效使用硬件的Batch与配套超参数 [9] - Batch Size Scaling:更多GPU时同步扩大Batch,或利用闲置能力通过更大Batch提高利用率 [9] 经典Batch Scaling到LLM强化学习 - 2017年Facebook团队通过线性放大学习率和gradual warmup,将ResNet-50训练从8张GPU Batch 256约29小时扩展到256张GPU Batch 8192时1小时 [11] - 2018年OpenAI团队研究扩大Batch收益递减转折点,与梯度噪声尺度联系起来 [12] - LLM强化学习特殊之处:模型既是生产训练数据的推理系统,也是消费数据的学习系统 [13][14] - 生成阶段是自回归推理,训练阶段在整批token上执行前向反向传播,扩大Batch对两者影响不同 [15] 衡量标准:Time-to-target - 最终目标不是把Batch开到最大,而是让模型尽早达到要求能力水平,用Time-to-target衡量 [17] - 达标速度由样本效率(每条回答带来多少学习进展)和系统效率(每秒生成并处理多少回答)共同决定 [18][26] - 公式:达标时间 = 达标所需回答数 / 端到端吞吐 [19] - 只有当吞吐收益超过达标样本数增幅时,更大Batch才会缩短训练时间 [27] 发现一:GRPO在16倍prompt batch范围内近似不变 - 在Qwen3-30B-A3B-Instruct-2507上,G=8时,P=64至P=1024呈现相似样本级学习曲线,P=2048和P=4096偏离 [29] - 近似不变范围内actor梯度范数大致按特定规律下降,偏离时下降变缓 [30] 发现二:PPO中actor和critic尺度不同 - PPO实验采用内部混元策略模型和价值模型,均为3B激活参数 [33] - Batch 256-2048样本级学习曲线近似对齐,Batch 4096偏离 [33] - actor梯度范数随Batch增大持续下降,critic梯度范数相对平坦波动更大,两者有效Batch尺度可能不同 [33] 发现三:GRPO的Batch更应看总回答数 - 总回答数相同的配置呈现大致相似学习轨迹,如(P,G)=(128,8)与(64,16)都使用1024条回答 [36] - 总回答Batch相同时actor梯度范数相近,2048条回答的gradient norm始终比1024条更小 [36] - 支持用总回答数作为GRPO的Batch单位,但不能认为prompt数和group size在任意设定下可互换 [36] 发现四:保持学习率不变会破坏近似不变性 - 以P=128为参考,P=256调整学习率后大Batch跟随参考曲线,固定学习率运行明显落后 [40] - 累计约12万条回答时,固定学习率配置约74%,参考和调整后约77% [40] - 学习率调整后达标更新数为参考的0.50-0.67倍,固定学习率需0.75-0.83倍更新,对应1.50-1.67倍样本消耗 [40] - 训练稳定不代表Batch Size Invariance成立 [38][41] 发现五:固定硬件上生成耗时呈次线性增长 - PPO中训练Batch从256增加到1024,回答数增长4倍,收集时间从39秒增加到68秒,生成吞吐提高2.29倍 [47] - GRPO中P从128增加到256时生成吞吐提高1.31倍,增加到512时提高1.36倍,收益趋于饱和 [47] - 生成阶段受权重读取和内存带宽限制,更大Batch让更多token分摊权重读取开销 [50][51] - 训练阶段耗时近似随Batch线性增长,如GRPO中prompt batch从128翻倍到256,actor更新时间从101.3秒增长到208.6秒 [50] 两个Critical Batch - Critical generation batch:生成吞吐接近平台的位置,标记系统效率边界 [49] - Critical training batch:近似Batch Size Invariance的上界,标记样本效率边界 [52] - 两个边界回答不同问题:生成侧还有多少硬件吞吐可挖掘,训练侧还能否保持每条回答学习效果 [53] - 最终目标是最小化time-to-target,不是机械选择某一个critical batch [54] 实测结果 - 学习率调整后,P从128增加到512和1024,归一化time-to-target分别降至0.74倍和0.71倍 [60] - P=1024时,模型用122.88K条保留回答达到目标,端到端吞吐提高41%,训练时间从11.90小时下降到8.42小时,缩短29% [60] - P=2048和P=4096时,达标回答数增加约60%,超过30%和36%的吞吐收益,训练时间升至1.23倍和1.18倍 [61] - P=256保持学习率不变,吞吐只提高17%,达标回答数增加67%,训练时间变为1.42倍 [61] 调优框架 - 先调整学习率并估计达标样本代价,再寻找生成并发带来的端到端吞吐收益,最后按达标时间选择配置 [63] - 对每个候选训练Batch调整学习率,比较相同累计回答数下的学习曲线 [68] - 在显存允许范围内调整生成Batch或解码并发,测量端到端吞吐 [68] - 最终按达标时间选择配置,确认它能更早达到目标 [68] 意义和边界 - 理论认识:把Batch能变大和不能一直变大的问题拆开,学习率Scaling可在一定范围内维持近似不变性但最终失效 [65] - 训练实践:先确认学得好再想办法跑得快,换模型任务或硬件后复用调优顺序但不能照搬Batch数值 [66] - 系统设计:生成Batch与训练Batch不一定要同步扩大,解耦并合理安排GPU分工可能进一步释放吞吐 [67] - 评估方式:不同Batch必须放在同一起跑线上比较,先对齐学习效果再比较系统收益 [68][69] - 当模型、奖励、任务分布、训练阶段、推理引擎或执行策略变化时,已测有效Batch范围不能直接照搬 [69] - PPO实验提示actor和critic可能需要不同Batch尺度 [69]
刚刚,OpenAI成立独立数学顾问团!100+「已攻克」开放问题待审
机器之心· 2026-09-22 10:29
在一道千禧年大奖难题的解答还在接受数学界审视的同时,超过 100 道长期开放问题也已经被内部模型解决。OpenAI 最新公布的信息描绘了这样的局面。 今天早上,OpenAI 宣布与一个独立数学顾问组合作。 该组织名为「数学与人工智能顾问组」(Advisory Group on Mathematics and Artificial Intelligence, AGMAI) ,由普林斯顿高等研究院托管。它眼下的一项任务,是针对 OpenAI 内部模型产生的大量数学结果,就评估、审查和发布方式提出建议。 OpenAI 此举回答了一个更棘手的问题:当 AI 生成数学成果的速度超过同行评议和学术传播能够承受的速度,数学界该怎样接住这些结果? 百道难题,突然变成了发布难题 机器之心编辑部 OpenAI 称,公司从 8 月 28 日开始训练一款新的内部模型。除了此前公布的纳维 — 斯托克斯方程千禧年大奖难题解答, 这款模型已经解决了横跨数学多个领域的 100 多道长期开放问题。其进展速度甚至令 OpenAI 内部的数学家感到意外 。 9 月 8 日,OpenAI 公开了纳维 — 斯托克斯问题的论文和 Lean 形式化证明。 ...
刚刚,SpaceXAI最强Grok 4.7发布!价格杀疯,跑分令人失望
机器之心· 2026-09-22 10:29
机器之心编辑部 今天一早,SpaceXAI 最强模型 Grok 4.7 来了。 发布页开头只有一句极具「攻击性」的定位:面向编程与知识工作的最强模型,速度达到可比模型的两倍,价格只有一半。 这次升级没有停留在跑分表上。Grok 4.7 换用了更大的基础模型,强化了长时间任务、自我检查和长上下文管理能力,并把文档、演示文稿、法律、医疗和工程等 专业工作纳入重点测试。它瞄准的场景很明确:让模型在持续数小时的任务里少走弯路,交出可以直接使用的结果。 | | Grok 4.7 xHigh | Grok 4.6 High | GPT-5.6 Sol Max | Fable 5.1 Max | | --- | --- | --- | --- | --- | | Input token price $ per million | $2 | $2 | 24 | $10 | | Output token price $ per million | $6 | $6 | $20 | $50 | | Software engineering CursorBench 4.0 | 46.3% | 40.4% | 41.7% | 51.8 ...