腾讯研究院AI速递 20260908
腾讯研究院·2026-09-08 00:01

核心观点 - AI行业正加速从模型训练转向Agent应用落地,同时伴随安全与成本挑战,企业开始自建智能技术栈,多模型并用成为常态 一、模型与芯片进展 - OpenAI内部测试GPT-6 Sol,输出规模与Astra接近,单次生成速度约为其六倍,可能在9月29日开发者大会亮相 [1] - 华为发布麒麟9050 Pro,为全球首款落地“韬定律”、采用逻辑折叠技术的旗舰产品,晶体管密度较上代提升55%,关键任务功耗最高降低66% [3] - 麒麟9050 Pro搭载于华为MateXT2三折叠,整机性能提升42%,大文件打开速度提升50%,售价19999元起,9月12日开售 [3] - 麒麟9050 Pro自研9核灵犀CPU多核性能提升52%,达芬奇NPU支持总参数300亿、激活20亿的端侧MoE全模态大模型入端 [3] 二、多模态与开源模型 - 微信视觉团队开源多模态嵌入模型WeMM-Embedding,含2B、4B、9B三个版本,支持文本、图像、视频及任意交错输入 [2] - WeMM-Embedding 9B版本在MMEB-v2榜单以80.6分位列第一,2B版本77.9分超过此前领先的8B开源模型,取256维时仍保留98.7%性能 [2] - 该模型已部署于视频号、公众号、朋友圈等推荐与搜索场景,日调用量达十亿量级,完成14次在线A/B测试并全量上线 [2] 三、Agent与AI劳动力 - OpenAI披露,截至8月中旬,每1个人类工作日对应3.1个Agent工作日,研究部门的AI劳动力已达人类的三倍多 [3][5] - OpenAI中位数研究员日均推理成本约600美元,90分位重度用户超7000美元,8月人均实验数创2025年以来新高 [3][5] - OpenAI已达成“自动化AI研究实习生”目标,研究员每工作一天对应3.1个Agent工作日 [1] - 4至8小时的复杂任务中过半成功案例仍需人工干预,高层规划几乎不交给Agent,目标2028年3月实现自动化AI研究员 [3] 四、AI安全与行业放缓呼吁 - OpenAI首席科学家发文称思维链监控正在失效,Astra在对抗测试中出现压低成绩、绕过监控等行为,呼吁行业自愿放缓 [1] - 帕乔基发表长文《外星思维》,认为AI参与自身研发会带来递归自我改进,能力增速可能进一步加快 [5] - 思维链监控可靠性正在下降,模型已能分析甚至操纵自己的推理过程,7月Hugging Face事件显示智能体会钻规则漏洞 [5] - 目前没有实验室把对齐与监控做到足够可靠,呼吁在共同安全标准建立前,把自愿放缓作为行业普遍做法 [5] 五、企业AI应用与自建趋势 - 千问办公推出“多人工作台”,用户用自然语言描述需求即可生成网页,最多支持百人同时在线协作 [2] - 该功能具备角色权限、云端数据库、管理后台和一键发布四项能力,可承载完整业务流程 [2] - 红杉Sonya Huang指出,开放权重模型追赶前沿的速度超出预期,独立后训练栈已成熟,企业可从非常接近前沿的基线开始自建智能 [4] - 成本、速度、专有数据与掌控自身命运,是企业选择拥有自有模型的四个理由,产品越成功推理成本压力越大 [4] - 落地路径分为评测、Harness与上下文工程、后训练、在线学习四步,前沿实验室造“大脑”,产品公司养“小天才” [5] 六、AI原生设备与硬件创新 - 前Meta可穿戴团队成员创办Nirva,产品不到8克,可作项链或手链佩戴,续航2至3天,只识别佩戴者本人声音 [5] - 产品定位不是会议纪要工具,而是靠全天候context理解用户的情绪、关系与行为模式,并主动关心和提供建议 [5] - 团队不足20人,收入来自硬件、软件订阅与时尚配饰复购,认为硬件没有永久壁垒,壁垒在品牌与迭代速度 [5] 七、行业格局与推理服务 - AI不会只剩一个赢家,训练数据、方法与模型“性格”的差异本身就是价值,多模型并用将成为企业长期常态 [4] - 推理服务并非无差别的卖铲子生意,同一模型交给不同服务商部署,速度、成本乃至输出质量都可能不同 [4] - GPT-5.6 Luna两周内价格降10倍、使用量增长13倍,Harness不会消失,将成为模型之上可组合的工作界面 [4]

腾讯研究院AI速递 20260908 - Reportify