Workflow
Agent
icon
搜索文档
解读丨苹果为何「死磕」自研 AI ?
雷峰网· 2026-08-17 08:34
苹果AI战略:自研与合作的博弈 - 苹果在生成式AI自研上进展缓慢,不得不依靠Gemini、阿里千问和百度文心等外部模型补足功能[2] - 苹果与阿里巴巴合作,专门为中国市场训练大语言模型,被视为AI策略从单纯依赖第三方转向“自研+合作”双轨并行[2][3] - 2025年,阿里通义千问与百度文心被确定为主要合作对象,通义千问负责通用知识与内容生成,百度侧重搜索及部分视觉能力[3][4] - 苹果官网曾短暂上线《在Mac上配合Apple智能使用千问》的支持文档,但仅一天便被删除,显示苹果对合作模式仍未下定最后决心[4] 自研基础模型的必要性 - 苹果自研模型的核心动机是掌控系统级Agent的意图理解、任务拆解与权限护栏,避免外部模型主导核心决策带来的数据安全与隐私风险[6][7] - 行业趋势显示,大模型工程体系快速成熟,开源生态降低门槛,混合专家(MoE)等高效架构让硬件厂商能以可控成本搭建自研基础模型[8] - 小米自研MiMo系列模型快速迭代:2025年11月罗福莉加入,12月开源MiMo-V2-Flash(总参数309B、激活15B),2026年3月发布MiMo-V2-Pro,4月推出MiMo-V2.5系列[8][9] - 美团从2025年9月开源LongCat-Flash(总参数560B)到2026年6月发布LongCat-2.0(总参数1.6T、平均激活约48B),用时约九个月完成从百亿级到万亿级跨越[9] - 小红书从2025年中陆续开源dots.llm1(142B MoE)、dots.vlm1,到2026年8月开源dots3-note(总参数280B、激活16B),该系列在数学奥林匹克竞赛中获满分[9] 商业模式与入口争夺 - 缺少自己Agent的硬件厂商,只能在别人的智能入口下做硬件承载方,无法参与用户与服务之间的价值分配[1][13] - Agent时代,用户直接向AI下达任务,传统入口(应用商店、浏览器、广告分发)面临被压缩或绕过的风险,硬件厂商议价能力将大幅下降[12] - 未来将出现Agent to Agent的跨平台协作,模型之间的协作背后是公司之间的利益分配,掌握用户入口、关键数据与服务履约能力的一方拥有更高话语权[12][13] 竞争格局与紧迫性 - 2026年上半年,华为在中国智能手机市场以约20%份额登顶,苹果以17.5%紧随其后,华为等本土品牌在AI功能上已形成先发优势[14][15] - 国内手机厂商在AI领域进入新一轮探索:小米澎湃OS4 Beta发布,引入专家级小爱同学Pro;荣耀发布Robot Phone;OPPO以AI一键闪记等功能成为卖点[17] - 大模型公司也盯上市场:阶跃星辰推出STEPX Neo智能体手机;字节跳动与努比亚合作豆包手机;阿里与荣耀深度共创终端大模型[18] - 海外市场,OpenAI与前苹果设计主管乔纳森·艾维合作布局无屏幕AI伴侣设备,并大规模挖角硬件人才推进自研AI Agent手机[18]
说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低。
数字生命卡兹克· 2026-08-17 08:11
核心观点 - 当前大模型在Coding等标准化任务上表现优异,但在真实世界工作任务中成功率极低,存在显著的“评测-体验鸿沟”[5][55] - 真实工作任务评测集稀缺,现有模型在电商、生活服务等领域的任务通过率普遍不及格,与Coding领域的体感完全不同[5][20][21] 真实工作任务评测现状 - 作者认为模型在真实工作中的实际完成效果评测最为稀缺,如金融、法律、电商、生活等领域,直接给模型一份真实工作从头干到尾,更符合用户日常工作和生活[5] - 作者翻遍几乎所有评测集,发现真实场景下的评测集寥寥无几,绝大多数模型在这些任务上的成功率低得可怜[5] - 现有评测集更偏向研究,更新不够及时,新模型发布后需很久才能更新,无法放入AIHOT排行榜[53] RealReplicaBench电商评测 - 该评测集由阿里国际站团队开源,基于其电商Agent产品Accio Work的真实数据[6] - 从约160万条完整对话中整理出20万条工作流,归纳出约2000条商业价值高的,最终按可复现性和结果可判定性整理出107个任务[6] - 覆盖电商领域全部工作场景:供应商采购、商品发布、店铺经营、订单对账、国际物流、售后争议等[9] - 任务分为四大类:API/MCP(10项)、Browser(28项)、CLI(53项)、File(16项)[7] - 任务示例包括:上线定制瑜伽垫(需从多家供应商报价和实拍图片中选品发布)[11][12]、规划东莞到达拉斯电子产品运输路线(计算保险、清关、海关担保和平台费)[12][13]、处理电商退货争议(综合订单记录、物流扫描、质检、客户对话等逐单决策)[15]、跨平台月度对账(清洗天猫、京东、拼多多三套格式不同的订单)[16] 模型表现 - 在PI开源Harness框架下测试,排名第一的Claude Opus 5通过率60.75%,完成65/107个任务,每任务成本$1.79,耗时7分48秒[17][18] - Qwen 3.8 Max和DeepSeek V4 Pro以49.53%通过率并列第三,均完成53/107个任务[19] - 大部分模型任务通过率连50%都过不去,107个任务中有一半全失败[20] - 使用Accio框架后通过率整体提升,50%以上通过率的模型从2个增加到6个,Claude Opus 5提升至61.68%[37][38] 评测方法 - 评测程序直接检查邮箱、草稿、日历和JSON文件的最终状态,共23组、42项结果检查[35] - 23组全部通过才算答对得1分,有一项检验错误即0分,没有过程分[37] - 以供应商采购题为例:模型需从约300封邮件中还原项目需求,从20家供应商中找出合格且成本最低的,进行标签、标记可疑邮件、保存草稿、创建会议、交付JSON总结等操作[24][25][26][27] - 项目需求散落在10封邮件中,中途多次更改数量和要求,供应商需综合工厂地址、电话、银行收款人和出口许可证等多个信号交叉核对[29][30] E-Bench评测 - 由腾讯混元联合清华大学和东南大学发布,模拟王者荣耀、QQ音乐和腾讯会议3个产品场景[43] - 共设置323个需要模型真实操作的任务,如整理好友、搜索歌曲、筛选参会人员等[44] - 共测试11个模型,成绩最好的Kimi-K3的Avg@3为73.79%[45] - 同一道题独立运行3次全部做对的稳定性指标,表现最好的Kimi-K3仅58.82%[46] - 11个模型在稳定性指标上均未过60%[47] VibeLifeBench生活评测 - 由小红书dots团队发布,包含200个持续时间数周的生活任务,覆盖职业、健身、租房、购物和差旅等10个领域[49][50] - 指出现有benchmark建立在三个与真实世界不符的假设上:用户会把需求说清楚、一次交互就能结束、世界是静止的[49] - 成绩最好的Claude Opus 5的avg@3仅32.5%[51] 行业对比与展望 - 在Coding任务上,DeepSWE评测基准(113个任务)中,排名靠前的模型通过率均超70%,Claude Opus 5达74%[41][42] - 真实工作任务与Coding任务表现差距巨大,模型在大量真实工作场景中还有极大进步空间[55] - 纯靠模型公司不够,需要所有厂商一起努力,如Accio将持续提炼真实工作任务并滚动更新开放评测集[52] - 作者计划收集RealReplicaBench、E-Bench、VibeLifeBench等真实世界工作评测集,自建环境自费跑分,保持更新并放入AIHOT排行榜[53]