Workflow
量子位
icon
搜索文档
至知研究院提出大模型可解释性新路线:直接拆权重,数据成本不到1%
量子位· 2026-08-14 15:47
核心观点 - 提出一种名为稀疏权重分解(SWD)的新方法,直接从预训练权重中“拆”出可干预单元,无需训练独立的替代网络,以更低成本实现大模型机制可解释性 [5][6][48] 方法背景与问题 - 传统机制可解释性研究需先训练新的稀疏表示(如Transcoder、稀疏特征模块)来近似原模型,带来额外训练成本和替换误差 [1] - 训练型替代表示需针对不同模型、层和checkpoint分别拟合,使大规模系统性回路分析困难 [3] - 理想方案应同时保持原模型行为、提供可独立干预单元,并能低成本从已有权重中构造 [4] SWD方法原理 - 将稠密权重矩阵W分解为两个稀疏矩阵A和B,使W≈AB,共享m个中间维度作为瓶颈单元 [6][11] - 每个瓶颈单元是一条固定的rank-one读写路径,可独立评分、选择和消融 [6][12] - 使用少量校准文本优化分解前后输出误差,通过硬阈值维持非零预算并重新拟合保留权重 [12] 与SVD的对比优势 - SVD成分的读方向和写方向通常稠密,即使保留少数成分仍可能连接几乎所有输入输出维度 [17] - SWD对每个单元施加稀疏读写连接,少量单元对应少量活跃连接 [18] - 精确还原原权重的full-rank SVD和Random-B对照,需更多活跃连接才能达到与SWD相同的任务表现 [20][21] 数据效率与保真度 - 在GPT-2 Small第8层mlp.c_proj单矩阵实验中,SWD仅用数千个校准token进入低CE误差区间,而Transcoder等基线需约10⁶量级token [24] - 在达到匹配替换保真度时,SWD使用的数据不到训练型替代表示的1% [7][24] - 该趋势在Qwen2.5-0.5B、1.5B、3B和Qwen3.5-27B上得到验证 [24][26] 任务回路因果测试结果 - 在GPT-2 Small的GreaterThan、IOI、Docstring和Gendered Pronoun四项任务上,SWD达到相同充分性或必要性要求时,通常比Transcoder和VPD-Recon-CI需要更少的单元和活跃连接 [29] - 将平均激活消融替换为零消融后,优势依然保持 [30] - 该结果扩展至Qwen2.5和Qwen3.5-27B [31][34] 模型规模与全模型扩展 - 单矩阵替换和回路抽取流程从GPT-2扩展至Qwen2.5-0.5B、1.5B、3B,最终至Qwen3.5-27B [36] - 在27B模型第31层mlp.down_proj上,SWD以显著更少数据达到低CE delta,并以更少活跃连接达到充分性和必要性目标 [36] - 将GPT-2 Small全部48个注意力和MLP权重矩阵替换为稀疏分解,SWD-FT在连接数不变下将模型CE从3.90降至3.44,略优于稀疏预训练基线的3.45 [36] - SWD-FT总计使用约2,060万个token,而稀疏预训练基线使用28.84亿个token,前者不到后者的1% [37] Zero-data版本 - 完全不使用校准文本,直接最小化原权重与分解权重之间的Frobenius误差 [37] - Zero-data SWD在权重空间中更接近原矩阵,其瓶颈单元仍能抽取出有效任务回路 [38] 语义模式与定向编辑 - 在GreaterThan任务中,GPT-2 Small第6、8、10层六个高排名瓶颈单元中,四个集中响应数字、年份、数量或度量信息,两个对应标点、句法和命名实体 [40][42] - 定向编辑实验:筛选瓶颈单元c205,将读方向诱导的rank-one更新施加到原始稠密GPT-2权重上,在提示词“The opposite of up is”中,正确答案down相对干扰答案left的logit margin提高0.216,七条无关事实提示上平均末token KL仅为4.02×10⁻⁵ [44] - 该单单元方向测得的副作用低于随机单元和rank-4 LoRA对照 [45]
刚刚,GLM-5.3发布:Coding更接近Fable 5!潜伏40年的bug都被揪出来了
量子位· 2026-08-14 15:47
金磊 发自 凹非寺 量子位 | 公众号 QbitAI 太热闹了。 昨儿DeepSeek V4 Pro正式版+Harness、Grok 4.6"你方唱罢",今儿 GLM-5.3 闪亮一记 "我登场" —— 一出手便杀回 开源一哥 、 国模一哥 ,甚至在Coding方面更加 接近Claude Fable 5! 也就是说,唐杰给马斯克"画的饼"(说国产模型超越Fable 5不会太久),往前拱了一大截,也就花了2个月整。 在多项主流基准测试中,GLM-5.3是当前 排名最高的开源模型 ,编程与智能体能力接近Claude Fable 5,编程 体感 超过其他国产模型。 在CyberGym白盒代码审查中,GLM-5.3拿到84.5%,相比5.2的77.2%继续提升,也略高于Mythos 5和GPT-5.6 Sol,一举成为 最强开源安 全模型 。 并且在GLM-5.3发布前两周,智谱就联合清华、南开,以及国内众多企业、实验室,开展了密集的红队测试与安全评估。 据悉,累计发现漏洞2404个(经过初筛、去重),其中1088个为中高危,覆盖系统内核、操作系统、浏览器引擎、开源基础组件、互联网应 用与互联网协议等220个项目。 ...
算力需求两年涨10倍,机器人为了走进真实物理世界,正在疯狂「吃算力」
量子位· 2026-08-14 14:12
核心观点 具身智能行业正经历从本地化、重资产研发模式向云端化、弹性化基础设施的范式转移,阿里云无影灵构等平台通过提供标准化、可复用的云上工作站,旨在解决机器人研发中算力需求暴涨、环境配置复杂、协作效率低等核心痛点,从而加速行业迭代速度 机器人研发的算力与工程挑战 - 具身智能研发对算力需求在过去两年增长了5到10倍,且“有多少卡就能吃掉多少卡”[17] - 机器人研发流程复杂,包括遥操作数据采集、算法调试、仿真训练、真机部署,每个环节都依赖计算资源[11][14] - 传统模式下,工程师搭建一套可用开发环境需耗费四五个小时,通过命令行安装软件、配置依赖、编译程序[32] - 团队扩大后,本地工作站硬件型号不一,导致CUDA、ROS2、Isaac Sim等工具链极易出现版本冲突,难以统一环境[36] - 新人入职或外包人员进场需从零下载、编译、调试全套环境,单人配置耗时长达大半天,构成隐藏成本[37][38] - 外包和跨地域协作带来账号、数据权限、审计和离场回收压力[38] - 机器人研发天然需要大量试错,但真实机器人测试成本高、周期长[94][95] 云端工作站的解决方案与优势 - 无影灵构将高性能工作站搬上云端,GPU、仿真环境、数据盘上云,工程师通过轻量设备网络串流操作[49][50] - 环境交付方面,无影灵构将CUDA、ROS2、Isaac Sim等工具链预制成固定模板镜像,一键复制即可新增开发机器[54][55] - 逐际动力CTO表示,过去团队本地配置Isaac仿真环境常遇报错,而在无影灵构中可直接选现成镜像启动,半小时即可开工,稳定很多[56][57] - 算力弹性方面,企业可根据不同任务灵活选择GPU规格,高峰期分钟级扩出上百台,项目结束即释放[66][67][88] - 算力跟着需求灵活调整,从买设备转变为调用算力[68][69] - 无影灵构通过自研ASP流化协议优化图形渲染、视频编码、网络传输,在Isaac Sim对比测试中,模型文件拖动旋转时,无影帧率约29fps,高出WebRTC方案7fps,帧率提升约32%,达到满帧水平的97%左右[76][78] - 在相同模型旋转操作中,无影ASP平均带宽约1.9Mbps,相比WebRTC等方案降低约50%,单台终端日均流量消耗约7GB[80][81] - 在丢包率10%、带宽限制5Mbps的弱网环境下,无影仍能维持约27fps,相比其他方案帧率提升约29%[83] - 云端工作站解决了环境交付、图形算力、弹性调度、安全治理四件事,前两件是技术门槛,后两件是工程门槛[87][88] 行业趋势与基础设施标准化 - 机器人研发正从单点实验走向复杂工程协作,研发资源从“一台机器”变为一整套持续运行的基础设施[19][22] - 云计算发展经历两次迁移,机器人时代需要“第三朵云”,解决算力、开发环境和3D交互能力进入研发流程的问题[23][26] - 行业走到工程化阶段,环境、算力、数据、仿真等共性需求每家公司都在自己搭一遍,共性越强的部分越应被沉淀为标准件[40][41] - 无影灵构的目标是把基础设施带来的研发摩擦降到最低,让机器人公司专注于本体、模型、数据和真实场景[42] - 逐际动力开源“FluxVLA Engine”,是一个标准化具身智能大模型工程底座,旨在降低VLA全研发周期的工程门槛[100][101] - 无影灵构与FluxVLA Engine从不同角度降低研发门槛,前者提供云上工作空间,后者沉淀机器人研发核心经验[104][106] - 当算力、环境和研发工具逐渐基础设施化,机器人公司的竞争重点将从“谁搭建了更多底层设施”转向“谁能让机器人更快学会新技能并进入真实场景”[111] - 技术本质上没有壁垒,壁垒是迭代速度,技术领先只是时间红利[112][113] - 多家具身智能头部企业已基于无影灵构AI工作站构建云上数据采集工厂和仿真评测,加速研发周期[91]
根治AI音乐通病!这家国产音乐模型正面挑战SUNO
量子位· 2026-08-14 14:12
核心观点 音潮音乐大模型V4.0通过底层技术重构,实现了对用户情绪与碎片化灵感的精准理解,大幅提升指令落地能力,并新增多语种与纯音乐功能,正式挑战全球AI音乐标杆SUNO,标志着国产AI音乐从跟随转向自研突围[5][7][11] 行业痛点与音潮V4.0的突破 - 过去AI音乐产品只能读懂文字指令,无法理解人类细腻情绪和碎片化灵感,导致生成作品千篇一律、缺乏温度[3] - 用户输入画面、情绪、氛围感,AI只能机械抓取关键词,无法抓住创作核心内核,造成反复试错和无效消耗[8][10] - 音潮V4.0精准直击行业核心痛点,大幅提升指令理解与落地能力,尤其在人性化语义解读和音乐场景精准适配两大维度实现跨代升级[11] - 迭代逻辑是让AI音乐从被动“猜你想要”进化为主动“懂你所想”,稳稳接住每一份细碎灵感[13] 模型性能对比测试 - 第一组测试使用海外专业Prompt,V3.5能识别“欢快”基调但无法深度绑定情绪与曲风,V4.0精准锁定“warm、groovy、happy”三大情绪关键词,落地轻快拉丁舞曲曲风,律动感饱满流畅[16][17] - 第二组测试“轻松的蓝调音乐”,V3.5输出大众化流水线风格,V4.0精准还原经典十二小节正统布鲁斯结构,完美适配“慵懒松弛”人声质感[19][21] - 第三组高阶测试“忧郁、感性、温暖的韩国流行歌曲”,V3.5弱化原声吉他、大提琴等核心配器,V4.0精准拿捏每种乐器音色特质,多乐器融合自然和谐[23][24] - 多组实测结论:V4.0在曲风定义、乐器选型、细化奏法、抽象情绪及人声唱法偏好上均能精准响应一步落地,告别反复调试[24] 语种与纯音乐功能升级 - V3.5已支持中、英、日、韩、西五国语言,V4.0新增俄、德、葡、意、法五大语种,实现全球十大主流语种全覆盖[25] - 凭借中文语境积累与东方情绪理解优势,搭配多语言创作能力,打破国产AI“只会做中文歌”的偏见,具备征战全球赛道实力[25] - 专业纯音乐生成能力正式全面开放C端使用,此前仅面向B端商用客户[26][27] - 普通会员用户可自由使用,生成作品可选“带人声/纯音乐”两种模式,覆盖短视频BGM、影视配乐、舞台伴奏等全场景[28] B端API平台与商业化 - 音潮推出API Platform一站式AI音乐开放平台,基于V4.0底层能力搭建稳定、高精度、可量产的智能音乐生成体系[29] - 平台集齐歌词生成、歌曲生成、歌曲仿写、歌曲扩写四大核心能力,一站式解决商业音乐创作、内容批量产出等需求[31] - 对比行业同类产品,音潮API核心优势是兼顾超高生成质感与超低调用成本,商用性价比突出[32] - 目前平台处于限时免费试用阶段,所有意向合作企业与开发者完成对接后即可免费调用全量API接口,无阉割、无权限限制、无隐形门槛[33][34]
3D指标超过Nano Banana Pro!浙大开源方案让AI在平面图像里进行立体编辑 | ACM MM'26
量子位· 2026-08-14 14:12
核心观点 - 浙江大学ReLER团队提出并开源PhyEdit,用显式3D几何preview指导DiT图像编辑,解决AI在物体远近、尺度、遮挡和多物体操作中的三维空间物理常识错误问题,论文已被ACM MM 2026接收[3] PhyEdit技术方案 - 核心流程分四步:用户给定待操作物体和三维操作指令(移动或6DOF);估计场景深度和相机参数,把物体反投影成三维点云;在3D空间中移动点云,再投影成目标preview;将源图、preview和文本一起交给Qwen-Image-Edit backbone生成最终图像[11] - preview不需要像完整照片,只需清楚表达物体位置、大小和遮挡关系,生成模型可从源图恢复纹理和身份[8] - PhyEdit避开两个极端:既不是让大模型完全靠prompt猜三维空间,也不是把点云投影直接当成最终图像[9] - 在基础flow-matching loss之外加入像素级SILog depth loss,从预测velocity恢复编辑图,再比较编辑图和目标图的深度[10] - 消融结果:不使用深度监督DIoU 62.37、Chamfer 24.52;latent-to-depth方案DIoU 64.19、Chamfer 20.87;pixel-level方案DIoU 65.33、Chamfer 18.93[10] 训练数据集RealManip-40K - 团队构建RealManip-40K,包含41154对真实场景图像,提供深度、物体mask和代表性三维坐标[14] - 数据管线利用3D foundation model的camera token进行聚类,筛选相机近似静止的视频片段,再完成目标检测、跟踪、分割、深度估计和三维位移筛选[15] - RealManip-40K重点覆盖三类难题:明显的远近变化、复杂遮挡以及多个对象同时操作[16] 评估基准ManipEval - 团队构建ManipEval,共200对图像、约320个物体,其中一半为单物体操作,另一半为多物体操作[17] - 从五个层面考察模型:2D落点是否准确;深度是否正确;重建后的三维点云是否接近目标;物体身份和画质是否保留;光照、接触与遮挡是否合理[18][27] - PhyEdit主要成绩:DIoU 65.33、Mask IoU 27.20、Chamfer 18.93、RA-DINO 36.91、Phys-VLM 93.72[21] - 与Nano Banana Pro对比,DIoU提升5.36,Chamfer距离降低6.40,RA-DINO提升2.14[22] - 商业模型常见问题包括:物体仍留在源位置、只操作了多物体指令中的一部分、把目标放到错误深度、在遮挡区域改变物体身份,PhyEdit在大幅移动、小尺寸物体以及多人操作场景中更稳定[24] 连续动作与普通编辑能力 - 给出一条三维轨迹后,PhyEdit在轨迹上的多个位置生成关键状态,再由视频模型插值出中间帧[25] - 机械臂未出现在训练分布中,仍能沿曲线把红笔移动到纸张左下方[26] - 测试改变颜色、材质、图案和添加局部元素等任务,PhyEdit需一次生成同时完成外观编辑与三维操作,综合成功率为87.5%;Qwen-Image-Edit单独完成普通编辑时为88.8%[32] - 两者只差1.3个百分点,但PhyEdit三维精度明显更高,说明加入几何控制没有让基础编辑能力大幅退化[33] 开源与定位 - PhyEdit提供交互式前端GUI,用户可上传图片、分割并选择多个物体,在三维点云中调整平移和旋转,再生成最终图片[35] - 团队定位PhyEdit不是完整physics simulator,不会显式计算受力、碰撞和动力学,透明反光物体、极端近景移动以及严重深度或分割错误仍可能导致失败[35] - PhyEdit解决当动作由用户指定时,如何把一个明确的三维操作渲染成几何合理的视觉状态,为机器人视觉规划、交互式内容和图像状态预测提供可复现的开源起点[35]
Token半价!谷歌新模型Gemini 3.7 Flash闪击马斯克Grok
量子位· 2026-08-14 14:12
文章核心观点 - 谷歌在领导层交接后,迅速推出Gemini 3.7 Flash模型,以激进的价格策略和性能提升抢占市场,同时其旗舰Pro系列发布延迟,内部战略方向出现分化 [2][5][36] 产品发布与定价策略 - 谷歌在发布3.6 Flash仅三周后,火速推出Gemini 3.7 Flash,这是哈萨比斯交棒Koray后首款公开亮相的Gemini模型 [1][2] - 模型发布时间由新任负责人Koray Kavukcuoglu拍板决定,其策略是优先推出能迅速上线、降低成本并服务大规模产品的模型 [4][39] - 官方宣布年底前3.7 Flash价格腰斩,每百万token输入0.75美元、输出3.75美元,费用仅为3.6 Flash的一半 [6] - 与竞品Grok 4.6相比,Gemini 3.7 Flash价格明显便宜一大截 [6] - 3.7 Flash的API限时价格比初始价格少一半,同时3.6 Flash也降价50% [31] - 半价活动仅持续到年底,2027年1月起输入价格回升至1.50美元,输出价格回升至7.50美元 [32][33] 性能与基准测试表现 - 3.7 Flash在DeepSWE基准测试中提分18.8%,从3.6 Flash的49.0%升至65.3% [7][18] - 在FrontierCode基准测试中,成绩从3.6 Flash的34.4%升至43.6% [18] - 在WebDev Arena上,Elo分数由1538升至1588 [22] - 面向复杂PDF理解的GDP.pdf基准测试从22.0%升至34.0% [26] - 模拟真实企业工作流的AutomationBench上,从17.0%升至30.4% [26] - 在Terminal-bench 2.1上得分85.8%,高于3.6 Flash的78.0% [8] - 在Terminal-bench 3.0上得分14.9%,高于3.6 Flash的5.4% [8] - 在GDM-MRCR v2长上下文测试中,128k平均得分97.0%,高于3.6 Flash的91.8% [8] - 在Harvey LAB-AA复杂法律工作流测试中得分90.7%,高于3.6 Flash的85.1% [8] - 在BioMysteryBench生物信息学推理中,人类可解部分得分87.1%,高于3.6 Flash的80.6% [8] 产品定位与战略方向 - 谷歌将3.7 Flash定位为迄今为止最智能的编码和Agent主力模型 [12] - 谷歌正将Flash系列推向Agent工作流核心,赋予其更强大的工具使用、调试、多步骤执行能力及更少的迭代次数 [13] - 3.7 Flash突出的Agent性能和编码准确率,使其适用于关键编码和网页开发任务 [14] - 新模型遇到障碍时更会切换路径,在意图不清时先确认,再完成多步规划与工具调用 [27] - 以前的Flash追求效率,现在的Flash重心是把事情做完 [28] - 与Grok 4.6对比,Gemini 3.7 Flash建模质量更好,平均推理时间只有Grok的十分之一,费用大幅降低(11.22美元 vs 1.46美元) [16] 行业竞争与内部动态 - 三个月内谷歌接连推出Gemini 3.5 Flash、3.6 Flash和3.7 Flash,但Pro系列仍停在3.1 [34] - OpenAI、Anthropic已发布自家旗舰模型,DeepSeek-V4-Pro也已发布,谷歌面临尴尬局面 [35] - 谷歌靠猛发Flash刷脸,被视为弃车保帅的无奈之举 [36] - Flash和Pro的定位变得模糊,原本Pro负责复杂推理、Flash强调性价比,现在Flash已覆盖更多功能 [37][38] - 哈萨比斯更看重长期研究和能力上限,被放到幕后;接班人Koray Kavukcuoglu则优先推动能快速上线、降本增效的模型 [39] - 两个领导两种画风,谷歌内部战略拉锯刚刚开始 [40]
ChatGPT一夜提速14倍!新模式GPT-5.6 Sol每秒750 token
量子位· 2026-08-14 08:39
OpenAI推出Ultrafast极速推理模式 - OpenAI官宣了GPT-5.6 Sol的Ultrafast预览版,最高比标准处理快14倍,每秒能吐750个token[1][8][9] - 该模式用于处理慢一步就晚一步的任务,如工程师同步读日志、分析交易记录、购物车实时推荐等场景[10][11][12] - 早期用户评价极高,金融研究AI公司Rogo应用AI负责人形容“感觉像是在跟一个人实时对话”,AI客服平台Podium语音AI产品负责人称通话不用被打断去等模型转圈[14] - 提速不牺牲智能,Ultrafast跑的依然是最高档的GPT-5.6 Sol,而非换小参数模型[17][18][19] - 速度靠Cerebras晶圆级引擎,模型权重直接放入芯片上44GB的SRAM,绕开显存带宽瓶颈[19] - OpenAI与Cerebras年初签署多年协议,计划部署750MW规模的晶圆级系统,协议总值超过100亿美元[19] ChatGPT新增Computer History记忆功能 - ChatGPT桌面版新增Computer History功能,能记住点击、打字、快捷键、应用切换等交互事件[4][20] - 用户可问“我上次做到哪了”,ChatGPT能立马回答[5] - 该功能脱胎于4月上线的研究预览版Chronicle,本次为重构[22] - 不截屏、不录音、不录系统音频,数据处理克制,临时事件文件本地保留最多48小时,服务器不留存原始数据也不用于训练[21][26] - 用户可随时暂停收集,或排除某些应用和网站[26] - 最终记忆文件保存为本地Markdown文本,时间线按天分组,每条记录带摘要和参与应用,可一键查找或删除[24][26] - 重复工作流程可存为skill,如连续整理发布通稿可存成直接调用的技能[24] 行业趋势:推理速度从优势变为标配 - 过去半年,多家头部模型厂将“更快”做成独立产品线,不再只是模型能力参数[27] - Anthropic今年5月上线Fast Mode,在结构清晰提示词下响应时间中位数从2.8秒压到1.2秒[27] - Google为实时交互场景准备Gemini Flash Live,xAI给Grok单独开fast端点[28] - 芯片层竞争激烈,Cerebras在中小模型上每秒跑3000个token,Groq强项是稳定低延迟,SambaNova高并发场景总吞吐量反超前两家[30] - 国内字节跳动豆包系列靠火山引擎推理基础设施主打低延迟,阿里Qwen-Turbo定位超快超长上下文低成本[30] - 小米MiMo-V2.5-Pro-UltraSpeed靠FP4量化加投机解码,在8卡通用GPU上把万亿参数模型生成速度推到每秒1000个token以上[30] - 月之暗面Kimi K3用KDA混合线性注意力架构,解码速度比常规架构快6.3倍[32] - 模型推理速度已卷到没人敢不做的程度[33]
7亿年薪留不住!余家辉离职Meta创业
量子位· 2026-08-14 08:39
核心观点 - 余家辉在Meta任职仅一年零一个多月后宣布离职创业,尽管Meta为其提供了传闻中高达1亿美元年薪的薪酬包以及顶级算力和产品机会[2][12][41] - 这一事件引发市场对Meta AI人才流失问题的关注,数据显示有929名研究者符合“曾在Meta任职、目前已不在Meta”的条件[44] - 行业观察者将Meta的抢人策略比喻为“雇佣兵”模式,而OpenAI CEO奥特曼曾讽刺称“传教士终将战胜雇佣兵”[49][51] 余家辉离职事件 - 余家辉于2025年6月底加入Meta,2026年8月14日宣布离开,任职时间约一年零一个多月[2][11] - 离职前Meta刚推出Muse Spark 1.2,余家辉带领的多模态团队在过去几个月接连交出Muse Spark、Voice Mode、Muse Image和Muse Video等成果[5][6] - 余家辉表示被一个“对人类未来非常重要、但尚未被充分探索”的问题吸引,将投入全部注意力,但未透露新公司名称、研究方向或合伙人信息[7][8][9] Meta的薪酬与人才策略 - 2025年扎克伯格亲自下场挖角余家辉,传出“1亿美元年薪”刷新AI人才市场纪录[12] - 奥特曼曾公开表示Meta向部分OpenAI员工开出1亿美元签约奖金及更高年度薪酬[28] - WIRED报道称Meta为少数顶级AI人才提供的方案最高达四年3亿美元,其中第一年总薪酬可能超过1亿美元[29] - Meta CTO Andrew Bosworth澄清1亿美元并非人人都有,也不是入职即到账的签约奖金,而是包含股票、奖金、任期和绩效条件的整体薪酬包[31] Meta超级智能实验室(MSL)建设 - 扎克伯格正式宣布成立Meta Superintelligence Labs(MSL),由亚历山大王领导[13][14] - Meta向Scale AI投资143亿美元,并从OpenAI、Google DeepMind、Apple等公司密集挖人[14] - TBD Lab是MSL最核心的模型研究团队之一,负责开发下一代前沿模型,余家辉是创始成员兼多模态方向负责人[15] - 2026年4月团队发布Muse Spark,这是MSL成立后首款基础模型,标志着Meta前沿模型从Llama转向Muse系列[16][18] - 随后团队继续推出Voice Mode、Muse Image和Muse Video,覆盖语音、图像和视频生成[19] - Muse Spark 1.2将重点推向编程、长程Agent任务和多模态能力[24] 余家辉的履历与价值 - 余家辉本科就读于中国科学技术大学少年班学院,在UIUC攻读博士,师从计算机视觉学者黄煦涛[35] - 读博期间参与开发DeepFill,让AI擦除照片中不想要的内容并自动补全背景[37] - 加入Google Brain后从计算机视觉做到多模态大模型,参与并共同领导Gemini多模态方向[38] - 其论文Gemini: a family of highly capable multimodal models被引用10564次,Gpt-4o system card被引用6616次[39] - Meta当时急需具备底层视觉研究、大模型开发和多模态产品化经验的人才,Llama 4表现不及预期促使Meta重建前沿模型能力[40] Meta人才流失情况 - 网友检索显示有929名研究者符合“曾在Meta任职、目前已不在Meta”的条件[44] - 离职名单中包括余家辉、转投谷歌的Chenchen Zhu、担任创业公司首席科学家的Ariya Rastrow以及加入隐身创业项目的Chen Guo[44][46] - alphaXiv评论称“Meta AI的未来,也是TBD(To Be Determined)”[47]
DeepSeek的「自进化」蓝图,曝光了
量子位· 2026-08-14 08:39
核心观点 - DeepSeek与北大合作的最新论文《A Programming Paradigm for Spatiotemporal Composability》揭示了Harness版“黑鲸”的核心架构Cordis,这是一个可随意插拔的“乐高底板”,实现“万物皆插件,万物可重组”[1][3][4] - 论文旨在解决自进化AI Agent场景下的“时间可组合性”和“空间可组合性”两大难题,为未来Agent能自主生成、安装、替换工具提供基础[23][25][26] - 该设计已在Koishi聊天机器人框架上运行四年,超过4000个社区插件在生产环境中验证,并非实验室玩具[9][44] 论文核心概念与理论支柱 时空可组合性问题 - 传统插件系统卸载插件后需重启整个宿主进程,导致所有已加载插件陪重启,VSCode是典型案例:截至2026年6月9日,Marketplace排名前100的扩展中87个包含可执行代码,一旦激活无法在运行时单独卸载,禁用或删除后必须重启整个扩展宿主[12][13][14][15] - 几乎所有插件架构都存在此类缺陷,程度不同[16] - Agent场景下问题更严重:Agent马鞍包含工具集、执行环境、权限控制、沙箱、会话状态、记忆系统等复杂工程系统,若每次改一行代码都重启进程,积累的上下文和缓存可能全部崩溃[19][24] - 时间可组合性指模块间依赖靠各自打补丁易引入循环依赖,空间可组合性指模块依赖关系混乱[25][26] 理论支柱:效应与余效应 - 效应刻画“程序对世界的影响”,余效应刻画“世界对程序的约束”,两者是对偶关系:效应系统丰富类型,余效应系统丰富上下文[28] - 经典效应/余效应是静态类型系统工具,不适用于动态加载的自进化AI语境[29][30] - 团队将其适配升级为“可逆效应”和“反应式余效应”[31] 可逆效应(解决时间维度) - 核心定义:每个对上下文的修改都必须配一个显式的逆函数,使副作用可逆[33] - 加载插件时,每次修改状态记录对应逆函数,按顺序叠加成“撤销链”;卸载时反向执行链,系统状态精确恢复到加载前[34][35] - 类比为一摞盘子,最后放上去的先拿走,确保时间顺序不乱[36][37] 反应式余效应(解决空间维度) - 组件可声明所需依赖,实现依赖可解析:如聊天插件声明需要消息适配器和数据库,两个依赖满足才进入ACTIVE,缺一个保持INACTIVE[39] - 提供者出现,依赖者自动激活;提供者撤走,依赖者先停下来,等effect撤回后提供者再完成卸载[40] - 依赖提供方卸载,依赖方自动停用;依赖重新上线,依赖方自动恢复,拓扑编排从声明自动推导[41] 实践验证:Koishi框架 时间维度验证 - 管理员可从控制台禁用一个插件,插件对系统的影响原地撤回,其他插件继续工作[61] - 开发时,插件修改并保存后重新应用被修改的插件,缓存和连接保持不动[62] 空间维度验证 - Koishi生态中,IM适配器提供消息平台接入,数据库驱动提供持久化存储,功能插件声明依赖直接访问[63] - 切换存储后端或重连适配器时,只有依赖发生实际变化的插件被重新激活,依赖没变的插件纹丝不动[64] - 这些插件通常由不同作者独立开发,唯一协调是反应式余效应,证明动态组合规则能在开放插件生态工作[65][66] 局限性 - 团队承认目前只有Koishi单一生态、TypeScript单一语言的验证数据,缺乏与替代架构的受控对比[68] 论文作者与背景 一作:Yifan Shi - 来自北京大学,同时也是DeepSeek成员[73] - 曾出现在DeepSeek V3 Technical Report中[74] - 是Koishi项目的作者,Koishi是四年前的仓库,已有5.7K星星[75][80] - 2023年给Koishi官方文档写了设计文章《可逆的插件系统》,是这篇新论文的“祖宗”[82] 二作:张伟(Wei Zhang) - 北京大学计算机学院软件研究所副教授[84] - 1999年南京航空航天大学工程热物理专业本科毕业,2002年获南航计算机科学硕士,2006年获北大计算机软件与理论博士[87] - 博士毕业后留北大任职,从事软件工程、程序设计语言研究[88] - 2021年ASE与Yifan Shi合作,2024年两人又一起发ICSME论文[89][91] 三作:崔添翼 - DeepSeek Harness团队负责人[93] - 本科毕业于浙江大学计算机系,梁文锋学弟[93] - 因NOIP/信息学竞赛保送浙大,6次获ACM国际大学生程序设计竞赛亚洲区域赛金牌[95] - 毕业后在Jane Street香港和纽约办公室工作9年[96] 论文与项目链接 - 论文链接:https://github.com/cordiverse/paper [98] - Koishi:https://github.com/koishijs/koishi [98]
深度体验DeepSeek Harness,我原谅它涨价了
量子位· 2026-08-14 00:01
文章核心观点 DeepSeek Harness (DSH) 是一款为AI Agent设计的开源框架,采用“一切皆插件”的Cordis架构,旨在打造Agent时代的“安卓”系统,通过开放生态和可定制性推动AI的自进化能力 产品发布与定位 - DSH已正式发布并开源源代码,作者内测近半个月[1] - DSH被描述为“彻头彻尾为自进化和DIY而生的马鞍”[3] - 官方已内置超过100个插件,后续社区将提供更多[13][110] - DSH被视为“Agent时代的安卓”[15][103] 安装与使用 - 提供两种安装方法:快速体验使用npx命令,源码安装通过GitHub仓库[17][18][19][20] - 目前没有Electron APP,需通过浏览器Web UI使用[21] - 首次使用需填写模型API Key,可接入DeepSeek或其他模型[22][23] - 会话前需选择工作目录和Agent预设[26] Agent预设功能 - 官方提供四类预设:标准模式、PTC模式、极简模式、创造模式[28][29] - 标准模式涵盖文件编辑、Shell、文件与网页检索、Skills、计划模式、目标追踪、子代理和工作流等全部能力[29] - PTC模式额外提供Code Mode SDK,允许模型编写TypeScript程序组合多步操作[29] - 创造模式额外提供运行时检查、插件实验和preset创作指导[29] - 支持自定义预设[28] 核心功能特性 - 轨迹功能:可随时监控Agent的回放窗口,查看原始事件级记录[34][36][37][38] - 内置多个Skill,专为开发而生,包括代码审查、简化代码、文档标准、文字品控等[39][40][43] - 主动提问功能:用户指令不明确时主动拉起提问并给出建议选项[44][45] - 支持图片作为附件上传,但需搭配多模态模型使用[55][56] - Token消耗统计表:屏幕下方实时显示Token消耗量和缓存命中率[57][58] 性能表现 - 缓存命中率大多处于99%左右,有几次达到100%[59] - 也出现过缓存命中率掉到60-70%的情况[60] - DSH驾驭下模型长程任务能力显著增强[72] - 猪八戒3D白模测试中,DSH运行20分钟,Codex仅6分钟[73][74] - 社区反馈最长运行时间达10小时[78] - 第一人称射击游戏测试中,一句prompt直出,下蹲、换弹、瞄准、NPC等功能全部自动完成[80] 架构设计 - 采用Cordis协议,可理解为乐高底座板,将整体拆解为独立插件[89][90][91][92] - 一切皆插件的架构,允许用户自定义整个Agent运行时[98] - 与Codex的闭源哲学不同,DSH是彻底开放的操作系统[99][100][101][102][103] - 仓库Doc文件夹中有从零构建插件的完整教程[103] - 内置魔改Cordis的Skill[104][105] 生态与自进化 - 预留了Plugin Store,官方已内置100多个插件[110] - 社区开发者已制作大鲸鱼TUI、上古QQ风皮肤、鲸鱼专属emoji等插件[111] - 团队呼吁全球开发者加入DSH插件生态[111] - Cordis协议下模型可在不打断任务前提下自己写插件并安装[116] - 从成百上千万个Agent实例中筛选魔改较好的插件融回主线,实现自进化[117] - 对普通用户暂时帮助不大,需等高质量插件沉淀[120][121] 定价与成本 - DeepSeek计划17号涨价,尤其是缓存[22] - 定价表显示DeepSeek-V4-Flash空闲时段缓存命中输入0.05元,高峰时段缓存未命中输入3.0元,输出9.0元[23] - DeepSeek-V4-Pro空闲时段缓存命中输入0.15元,高峰时段缓存未命中输入9.0元,输出27.0元[23]