Workflow
Agent集群
icon
搜索文档
腾讯研究院AI速递 20260811
腾讯研究院· 2026-08-11 00:03
核心观点 - 全球AI大模型竞争进入新一轮军备竞赛,OpenAI、Anthropic、Meta、英伟达等巨头密集发布或泄露下一代模型,参数规模、上下文长度、多模态能力及Agent化成为核心竞争维度 [1][2][3] - 存储器市场因AI需求挤压消费级产能,价格飙升传导至终端设备,苹果测试长鑫存储DRAM成为市场紧张信号 [4] - 开发者角色正从编码转向调度Agent集群,AI放大意图的能力催生小团队获得高杠杆的新范式 [5] 一、OpenAI下一代模型与预训练突破 - OpenAI被爆料将于8月发布代号Astra的GPT-6,参数或达10万亿,是GPT-4的五倍以上,预训练规模空前 [1] - 年底还将推出代号Doug的迄今最大规模预训练模型,或采用英伟达下一代Vera Rubin芯片,被指让Fable相形见绌 [1] - OpenAI两年来首次突破预训练瓶颈,Anthropic拟以Fable 5.1对标截击,御三家现仅剩OpenAI与Anthropic角逐 [1] 二、Meta重回开源发布Muse Spark及Agent模型 - Meta重回开源,宣布开源发布Muse Spark 1.2,扎克伯格主张超级智能应赋能每个人而非集中于少数机构 [2] - 同时开源300亿参数Agent模型Muse Glimmer,采用Apache 2.0协议、权重已上Hugging Face,经4bit量化仅需24GB显存即可运行且能力不打折 [2] - 模型专为Agent场景设计,具备端到端任务、工具调用、多步推理、失败恢复与多模态理解能力,支持100多种语言及主流部署框架 [2] 三、Anthropic新一代Sonnet 5.5泄露 - Anthropic新一代Sonnet 5.5遭泄露,内部代号「Fennec」,据称已进入最后阶段,最早或于下月发布,直接对标DeepSeek V4 Flash [3] - 核心升级包括200万token上下文(翻倍)、更快推理与更低延迟、长上下文与多步规划增强、浏览器与终端等工具调用大幅改善,综合能力逼近Fable 5 [3] - 定价维持Sonnet档位,业界推测Anthropic或让Sonnet接管Haiku定位,以接近Fable的能力和更低成本争夺性价比之王 [3] 四、疑似OpenAI新图像模型现身Arena - Arena平台出现神秘图像模型「mona-lisa-1」,经SynthID水印验证、命名风格及模型自曝,普遍判断来自OpenAI,或为GPT Image 2的后续版本或测试分支 [3] - 相比GPT Image 2,其在细节丰富度与真实感上有所提升,皮肤「塑料感」减轻,更能压低「AI味」,但仍存在噪声、块状伪影及爱加文字等问题 [3] - 测试显示模型训练数据或停留在2025年5月前后,不具备联网搜索,OpenAI尚未官方表态,业界认为官宣只是时间问题 [3] 五、马斯克推新生图模型Imagine Image 2.0 - 马斯克在X力推的新生图模型Imagine Image 2.0凭借做表情包出圈,在大模型竞技场文本转图像与图像编辑两类均列世界第二 [4] - 核心亮点是可交互精准编辑,上传图片自动分层,可选区修改、一键导出透明背景、魔棒工具及最多5图参考融合,交互比GPT-Image 2更友好,但审核护栏严格、版权限制多 [4] - 同期OpenAI在Arena测试代号mona-lisa-1的新生图模型,真实感提升、AI感减弱,训练数据截至2025年5月,或为GPT-Image 2.5或2.0 Mini [4] 六、英伟达开源全双工语音模型VoiceChat 11B - 英伟达开源全双工语音模型VoiceChat 11B,端到端语音到语音架构整合ASR、LLM与TTS,平滑轮换延迟约448毫秒,训练使用约55万小时音频 [4] - 核心亮点是独立工具调用通道,用TOOLCALL脚本配合预设「保持」话术,在API运行期间填补空档,把等待外部工具的时间纳入对话设计 [4] - 但工具调用可靠性不足(参数准确率仅44%),部署门槛高(单卡80GB显存起步、仅供研究),工具执行期间无法打断,Agent状态管理成下一挑战 [5] 七、苹果测试长鑫存储DRAM与存储器市场紧张 - 苹果启动对中国长鑫存储(CXMT)DRAM芯片的测试,拟用于iPhone和MacBook,测试不等于采购,却意味存储器市场紧张已达新节点 [5] - 因AI数据中心大量吸收产能,三大厂将先进制程转向HBM与服务器DRAM,消费级DRAM供应收紧,一季度合约价环比涨逾九成,库克称当前定价为「百年一遇的洪水」并呼吁引入第四家供应商 [5] - 涨价已从手机、PC传导至游戏主机与汽车,微软Xbox、比亚迪均因存储成本提价,苹果的测试被视为衡量市场紧张度的压力表与前置信号 [5] 八、斯坦福经济学家:下一代开发者要学会调度Agent集群 - 斯坦福AI经济学家Erik Brynjolfsson将AI重新定义为「放大意图」,AI能放大行动能力,但方向仍取决于使用者,开发者要从「接工单」转向主动发现并定义问题 [6] - 资深开发者正开始同时调度「一群Agent」并行工作,价值不在编码速度,而在如何拆分任务、汇总结果、处理冲突与撤回错误改动 [6] - 更大的机会是把少数十倍、二十倍高手的判断顺序、故障手册、决策记录沉淀为Agent可调用的上下文并复制给团队,小团队借AI获得过去买不起的杠杆 [6]