核心观点 AI正从回答问题的模型演变为能自主规划、调用工具、执行任务的软件系统,软件工程挑战从“构建AI”转向“驾驭AI”,即如何让具备自主能力的AI稳定、可信、可控地运行[2] 模型决定AI能做什么,系统决定AI能否真正创造价值[2] 2026年QCon全球软件开发大会·上海站聚焦此主题,分享AI从能力到系统、从实验到生产的真实路径[3] AI Native时代的工程新实践 - AI不再只是软件中的一个能力,而开始成为软件系统的一部分,团队需要思考如何让具备自主能力的AI稳定、可信、可控地运行[2] - 2026年QCon全球软件开发大会·上海站于10月22日—24日举办,聚焦Harness AI时代的工程实践[3] - 大会围绕AI Native架构、Agent Runtime、AI Infra、Data Systems、Agent安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等前沿技术方向[3] - 大会邀请全球技术社区与产业一线的实践者,系统性分享前沿洞察与实战经验[3] - 大会策划了20个专题论坛,包括Loop Engineering、千行百业Agent创新实践、Agent自主进化、Agent as a Service、Vibe Coding时代的新质量债、理性驾驭AI的SRE可靠性工程、金融AI Native工程实践、AI Infra等[25] - 将有来自不同行业、不同领域、不同企业的100+资深专家在现场带来前沿技术洞察和一线实践经验[25] 蚂蚁集团ARCA执行边界体系实践 - 蚂蚁集团高级技术专家林鑫已确认出席“AI Native架构”专题,发表题为《从沙箱到执行边界:蚂蚁AI Agent的大规模企业级实践》的主题分享[4] - 林鑫是蚂蚁集团高级技术专家,消息中间件负责人、沙箱项目负责人,拥有10余年分布式系统领域工作经验[11] - 林鑫当前主要负责蚂蚁沙箱项目ARCA-Sandbox,致力于打造面向AI Agent自主执行与代码运行时的高效、安全、轻量隔离环境[11] 企业级Agent执行环境面临的挑战 - 隔离难:Agent会执行模型生成代码、访问文件系统和内部网络,既要放开执行能力,又要守住租户、身份、网络和内核边界[4] - 启动慢:安全容器、镜像拉取、依赖初始化和持久化挂载叠加后,冷启动耗时直接影响在线Agent和训练评测体验[4] - 状态重:办公Agent、Coding Agent、长任务Agent需要保留workspace、依赖、会话和执行上下文,但资源不能长期空转[6] - 规模大:Agentic RL和批量评测会带来镜像风暴、缓存击穿、多集群调度、配额竞争和环境一致性问题[6] - 治理散:Harness + Tool Use场景下,高危动作何时进沙箱、进沙箱后如何共享状态、如何注入身份和审计链路,都不能靠业务代码临时判断[6] ARCA执行边界体系架构 - 围绕Sandboxed Agent、Agentic RL、Agent Harness + Tool Use三类典型场景,构建蚂蚁ARCA执行边界体系[5] - ARCA Sandbox提供安全隔离、缓存池、持久化存储、内存快照、镜像预热、网络隔离与成本治理[5] - Piston承担Agent托管、生命周期管理、灰度发布和自助入驻[5] - Tool Gateway与运行时策略负责将高危动作路由到受控沙箱中执行[5] - ARCA在蚂蚁多个重点Agent场景中支撑数万级每日沙箱创建、千万级日请求和万核级资源峰值[5] Sandboxed Agent场景 - Agent从“对话式AI”走向“执行式AI”,代码执行、Tool Use、浏览器操作、桌面操作、文件系统读写成为基础能力[13] - 企业场景下核心变化:模型风险开始外溢到执行层、网络层、身份层和状态层[13] - 蚂蚁Agent场景的共同诉求:既要让Agent充分“动手”,又要让风险、成本和状态可控[13] - ARCA的定位演进:从Agent Sandbox,走向企业Agent执行边界基础设施[13] - 长期Agent不是“跑一个容器”,而是要把计算状态、文件状态、身份状态、网络边界和资源成本分开治理[13] - 典型场景包括内部员工办公Agent、Coding Agent、OpenClaw / Claude Code类长期运行任务[13] - 核心挑战包括长生命周期会话、workspace持久化、依赖安装、内部网络访问、员工身份边界、内核隔离和资源空转[13] - 成本治理实践包括CPU超卖、混部、空闲回收、缓存池容量控制、quota和计量[14] Agentic RL场景 - Agentic RL的瓶颈不只是算力,而是环境供应链,训练环境必须可版本化、可复现、可调度、可观测[17] - 典型场景包括Agentic RL、Reward Server、批量评测、训练任务中的环境批量拉起[17] - 核心挑战包括瞬时创建大量沙箱、镜像大规模拉取、依赖初始化、环境一致性、多集群调度、缓存击穿和训练任务资源竞争[17] - 镜像与快照链路包括镜像中心、分发加速、镜像懒加载、内存快照、模板预热、缓存池复用[17] - 调度设计包括缓存感知调度、多集群路由、租户配额、批量任务优先级、失败重试和资源水位控制[17] - 可观测与准入包括拆解镜像拉取、调度、挂载、启动、ready latency、缓存命中率和失败原因[17] Agent Harness + Tool Use场景 - Harness + Tool Use不是“所有东西都进沙箱”,而是把危险Action路由进受控执行边界[17] - 典型场景:主Agent / Harness跑在常规服务或Serverless中,但代码执行、文件修改、构建测试、外部输入处理和高危系统操作需要进入沙箱[17] - 核心挑战包括哪些动作必须进沙箱、谁来做策略判断、Harness和Tool Use Sandbox如何共享状态、如何注入短期身份、如何保持端到端审计[17] - 运行时策略基于action taxonomy、risk metadata、policy-before-dispatch决定host执行、dry-run、人工审批、sandbox执行或deny[17] - Tool Gateway设计把安全决策收敛到平台层,而不是散落在每个业务tool的代码里[20] - 状态共享机制包括共享workspace、artifact store、trace id、输入输出bundle、session reuse和checkpoint/restore[20] - 身份与审计包括短期delegated identity、最小权限token、出口网关、调用链追踪和操作审计[20] 统一架构与落地方法论 - ARCA系统架构支持大规模业务落地,三类场景背后的统一primitive包括内核隔离、缓存池、镜像预热、内存快照、持久化存储、checkpoint/restore、出口网关、多集群调度、quota、审计和可观测[20] - 三种沙箱角色:Sandboxed Agent中沙箱是Agent的家;Agentic RL中沙箱是环境供应链;Harness + Tool Use中沙箱是危险动作执行器[20] - 从Demo到生产的经验总结:先定义执行边界,再优化启动性能;先拆状态,再谈弹性;先平台化策略,再放开Tool Use[20] 实践痛点 - 长会话保持与资源效率的冲突:办公Agent和Coding Agent希望像云电脑一样长期保存状态,但平台希望空闲即可释放资源,checkpoint/restore、持久化存储和session reuse之间需要持续权衡[20] - 强隔离与低延迟的根本冲突:安全容器、网络隔离和持久化挂载会天然增加启动成本,缓存池、内存快照和镜像懒加载只能缓解,不能消除所有场景的冷启动压力[20] - 真实企业依赖无法简单clone:很多Agent需要访问代码库、构建系统、内部服务、OSS/NAS、办公网络和权限系统,必须设计网络、身份和出口治理[20] - Agentic RL的环境供应链复杂度被低估:批量训练的难点不只是GPU/CPU算力,还包括镜像分发、缓存命中、快照一致性、环境复现、调度公平性和资源隔离[20] - Tool Use沙箱化的边界难定义:哪些动作高危、哪些可以host执行、哪些需要审批,不能完全交给模型判断,也不应由业务tool自己拍板,需要平台化策略和统一审计[20] - Harness与Sandbox的状态共享困难:主Agent在外部服务中运行,高危动作在沙箱中执行,二者之间的workspace、artifact、trace、身份和长任务状态需要显式协议,否则很容易变成不可观测的黑盒[21] 演讲亮点与听众收益 - 用三类真实场景重新定义Agent Sandbox,讲清沙箱分别作为“Agent的家”“环境供应链”“危险动作执行器”时的架构差异[24] - 从产品托管到执行底座的完整实践,呈现一个从Agent生命周期管理到低层执行环境的端到端工程体系[24] - 强调企业Agent的执行边界方法论,给出可复用判断框架:Agent自主性在哪里、风险动作在哪里、状态在哪里、身份在哪里、成本在哪里[24] - 真实规模与踩坑经验基于蚂蚁内部多个重点Agent场景的落地经验,覆盖数万级每日沙箱创建、千万级日请求、万核级资源峰值下的性能、稳定性、安全、成本和可观测问题[24] - 听众可掌握企业级Agent执行环境的完整设计框架,了解如何从三类场景出发设计不同的隔离、状态、调度和治理方案[24] - 获得可复用的Agent Sandbox选型方法论,知道何时应让Agent常驻沙箱、何时应把沙箱作为批量环境供应链、何时应只让高危Tool Use进入沙箱[24] - 了解Agent从Demo到生产的真实工程卡点,包括冷启动、镜像风暴、长会话状态、内部网络访问、身份注入、成本治理、Tool策略路由和端到端审计[24] - 借鉴蚂蚁ARCA的规模化实践经验,帮助正在建设Agent平台、AI Coding平台、Agentic RL训练平台或企业Tool Use治理平台的团队,提前识别执行层风险[24]
从沙箱到执行边界:蚂蚁 AI Agent 的大规模企业级实践|QCon 上海
AI前线·2026-09-16 15:15