Workflow
软件工程新范式
icon
搜索文档
AI应用进入软件工程新范式
2026-08-24 10:25
电话会议纪要关键要点总结 一、涉及行业与公司 * **行业**:AI Agent(人工智能代理)、AI编程工具、软件工程自动化、AI应用框架(Harness)[1] * **海外公司**:Anthropic、OpenAI、微软(M365 Copilot)、Meta、SpaceX、Cursor、Cognition、GitHub Copilot、DeepSeek、Google(Gemini)[1][2][3][4][5][6][7][8][9][10][11][12][13][14][15][16][17][18][19][20][21][22][23][24] * **国内公司**:智谱(Z Code)、字节跳动(Trea、豆包)、阿里(Qwen-Agent、千问)、腾讯(Workbody、Codebody、元宝)、Kimi、Minimax、DeepSeek、Manners(蝴蝶效应公司)[7][8][9][18][19][20][21][22] * **其他机构**:发改委、中国商务部、美国财政部、Gartner、JetBrains、QuestMobile[8][9][10][19][20] 二、核心观点与论据 1. AI Agent范式转移:从“同步结对”到“异步委派” * 行业核心范式已从用户实时监督AI逐行编写代码的“同步结对”,转变为用户下达任务后处理其他事务、稍后直接验收结果的“异步委派”[1][7] * 该范式转变正在重塑定价逻辑,传统的按席位SaaS收费模式不再适用,转向按AI Credit用量或任务SLA收费[1][7] * 代表产品包括Z Code的Go模式、Codex的Go模式、Cursor的云端Agent、Codex的云端异步任务以及腾讯Workbody的三层智能体[7] 2. Harness成为AI竞争新高地 * Harness(驾驭工程)是继提示词工程和上下文工程之后的新概念,在“Agent = 模型 + Harness”框架中,模型负责生成计划,Harness决定何时暂停、将哪些工具交还给模型,避免模型在错误路径上无限推理[2] * Harness包含七个层次:上下文工程、工具层、执行环境、循环控制、记忆与压缩、编排与子代理、可观测性与治理[2][3] * Harness对模型性能的增益可量化,部分场景效果甚至超过更换一代模型[1][5] * 第三方测试显示,将同一个DeepSeek V3 Flash模型置于八种不同Harness中运行三十个复杂工作流,完成率和成本差异非常显著[5] * 学术研究证实,在深度研究类任务的消融实验中,仅为模型增加一个委派子代理的工具,性能提升约两个百分点;配以完整Harness设计原则,性能提升可达十分[5] 3. Cursor创造SaaS增长纪录 * Cursor的ARR从2025年1月的1亿美元增长至2026年5、6月份的约40亿美元[6] * 从100万美元增长至40亿美元ARR,仅用时约30个月[1][6] * 从0到1亿美元ARR的里程碑,Cursor仅用时12个月,相比之下Dropbox用了4年,Slack用了2.5年[6] * 2026年6月16日,SpaceX宣布以600亿美元全股票收购Cursor,估值约为其ARR的15倍[7][12] * Cursor企业用户收入占比为60%至65%,付费客户超过100万[12] 4. Anthropic增长迅猛,企业端收入占比高 * Anthropic 2026年7月ARR突破650亿美元,Q2单季收入达到115亿美元,同比增长14倍[1][10] * 公司H轮融资后估值为9,650亿美元,已于2026年6月1日秘密提交IPO申请[10] * 投行对其2028年的收入预测在1,900亿至2,000亿美元之间[10] * 企业客户超过30万家,企业端收入占总收入的80%[1][10] * 根据JetBrains 2026年1月调研,Cloud Code在企业AI编程市场份额约为54%,职场采用率从2025年4月的3%增至2026年1月的18%[10] * 46%的开发者称Cloud Code为最喜爱的工具,相比之下Cursor为19%,Copilot为9%[11] 5. OpenAI用户增长放缓,企业收入首次超过消费端 * ChatGPT周活跃用户数约10亿,月活跃用户数超11亿,付费订阅用户超5,000万,企业付费用户超900万[11] * 用户增长呈现放缓趋势,周活从9亿增长到10亿耗时5个月,表明消费端市场已接近饱和[11] * 公司年化收入超过400亿美元,从2026年2月的250亿美元ARR平稳运行约5个月后,于8月跃升至400亿美元[11] * 企业用户在7月单月增长32%,拉动企业收入首次超过消费端收入[11] * 预计2026年公司亏损约为140亿美元[11] * Codex在4月份周活为200万,6月超过500万,其中约20%为知识工作者,该群体增速是开发者的三倍以上[11] 6. 微软M365 Copilot渗透率低,产品力超越渠道力 * 微软M365 Copilot付费席位数从2026年3月底的2,000万增至7月底的3,000万,单季净增1,000万[14] * 相对于M365商业版4.64亿的用户基数,渗透率仅为6.5%[1][14] * 用户留存率低至8%,当用户可同时使用Copilot、ChatGPT和Gemini时,最初有70%的人偏好Copilot,但试用其他工具后仅有8%仍然选择它[1][15] * Copilot在美国付费AI订阅市场的份额从2025年7月的18.8%下降至2026年1月的11.1%[15] * 结论:生态系统内的分发渠道能带来许可证销售,但未必能培养用户使用习惯,产品力相较于渠道力更为关键[15] 7. DeepSeek R1推出Codis微内核架构 * DeepSeek R1基于Codis微内核原框架,核心设计理念是“everything is a plugin”(万物皆插件)[16] * 所有组件均为插件,可在配置层重组而无需修改核心代码,实现时空可组合性[16] * 产品出厂自带四种预设模式:Standard模式、Minimal模式、Code模式[16] * Code模式最具前瞻性,不将工具作为函数调用暴露给模型,而是生成TypeScript SDK让模型直接编写程序编排工具[1][16] * 这种方式能将原本需要五轮工具往返的操作缩减为一次调用完成,结构性降低token成本和延迟[1][17] * DeepSeek Harness支持将Claude Code和Codex作为子代理调用,定位更像一个驾驭于其他Harness之上的框架[18] 8. Manners收购案揭示AI出海监管风险 * Manners团队核心前身是肖鸿团队2022年4月在北京注册的蝴蝶效应公司[7] * 2025年12月30日,Meta宣布收购Manners,为Meta历史上第三大并购案[8] * 2026年4月27日,发改委作出禁止投资的决定,要求撤销交易,这是自2020年《外资投资安全审查办法》实施以来首例被公开披露的禁止决定[8] * 至2026年8月11日,Manners官网移除“已成为Meta一部分”的表述,更改为“即将恢复以独立公司形式运营”[8] * 案例揭示三点关键经验:闭源runtime的稀缺性叙事会被开源社区迅速削弱;Agent的高权限执行能力带来全新法律与安全风险;境内研发、境外注册并寻求外资收购的AI出海路径受到严格监管[9] 9. Cognition定位“软件劳动力的基础设施” * Cognition年化收入接近5亿美元,估值达260亿美元,约为ARR的53倍[13] * 增长路径迅速:从2024年9月的100万美元ARR,增长至2025年6月的7,300万美元,再到2026年5月接近5亿美元[13] * 客户包括奔驰、高盛、桑坦德银行和NASA[13] * 不将自己定位为更快的开发工具,而是“软件劳动力的基础设施”,其CEO称之为“一支Agent军队”[13] * 定价模式将从每月39美元的IDE订阅费,转变为按完成的任务或SLA收费,对标人力成本而非软件预算[13] 10. 国内AI编程工具市场渗透真实发生 * 2025年中国AI编程工具市场规模约为24.5亿人民币,与美国市场存在数量级差距[20] * 蔚来汽车智能座舱团队约400人使用通义灵码,日常AI生成代码占比达到30%至40%[20] * 中华财险约六成研发人员使用相关工具,代码生成占比从28%提升至46%[20] * 字节Trea已注册开发者超600万,月活约160万,核心用户全年使用超200天,付费用户周活达6天,半年内token消耗增长700%[19] * 阿里Qwen-Agent插件下载量超2,000万,累计生成代码约60亿行,是Gartner唯一入选挑战者象限的中国产品[19] 三、其他重要但可能被忽略的内容 1. Harness as a Service将发展为独立收费层 * 以往作为模型公司内部运营成本的Harness,正逐渐转变为可独立调用、托管和计费的利润中心[23] * 预计未来半年到一年内,会出现按Agent运行时间收费的独立云服务商,客户为持续运转、可沉淀经验的Agent进程付费,而非为token付费[23] * 模型的可替换性将变强,而Harness的迁移难度会很高[23] 2. 多智能体协作走向生产环境 * GPT-5.6的多智能体协作V2已能让主智能体自动分配子任务给不同模型[23][24] * Kimi能实现对300至400个子智能体的编排分发[24] 3. 单任务成本成为核心竞争标尺 * 单纯比较token价格的意义减弱,未来竞争关键在于完成一项任务的端到端总成本,包括推理、工具调用、任务重试和人工审批等全部开销[24] * Harness engineering上升到系统级的竞争维度,因为决定复杂任务完成率的不仅是底层模型能力,更是模型被置于何种Harness中运行[24] 4. 闭源Harness领先窗口期缩短 * 在Harness层面,闭源技术的领先窗口期正在缩短至半年到一年左右,对所有Harness初创公司的估值产生直接影响[9] * DSH、OpenCall及PI等开源项目已将闭源能力变为公共品[9] 5. 权限模型和审计能力成为企业采购一票否决项 * Agent处理的不仅是内容,而是用户的数字身份、会话及在第三方平台的授权边界[9] * 权限模型和审计能力正成为企业采购Agent产品时的一票否决项[9] 6. 国内用户规模数据商业价值有限 * 根据QuestMobile 2026年6月数据,国内豆包月活约3.82亿,千问1.67亿,DeepSeek 1.3亿,腾讯元宝不足5,000万[20][21] * 由于多数用户为免费用户,用户规模数据在评估商业价值时参考意义有限,收入数据更为关键[21] 7. Anthropic会计口径可能收紧 * Anthropic对通过AWS、谷歌和Azure转售的收入采用总额法记账,这会抬高其报告的营收数字,IPO前该会计口径可能收紧[11] 8. 国内厂商收入更多沉淀在云端 * 国内AI编程工具厂商的收入更多沉淀在云端,而非应用侧的订阅服务[20]