刚刚,GLM-5.3发布:Coding更接近Fable 5!潜伏40年的bug都被揪出来了
量子位·2026-08-14 15:47

核心观点 GLM-5.3在Coding和安全两大维度实现重大突破,成为当前排名最高的开源模型,编程与智能体能力接近Claude Fable 5,并一举成为最强开源安全模型[4][12][16] 模型发布与定位 - GLM-5.3在多项主流基准测试中排名最高,编程体感超过其他国产模型[4] - 在High档位下,GLM-5.3能以明显更低的Token消耗,做到超过Claude Opus 4.8最高档位的准确率[7] - 网友已将其称为"Fable 5级"[17] - 智谱联合清华、南开及众多企业实验室开展密集红队测试,累计发现漏洞2404个,其中1088个为中高危,覆盖220个项目[13] - 最早发现的Bug可追溯到40年前[14] Coding能力实测 - 完成Karpathy指环王基准测试,自主规划、写代码、摆放3D资产、编排动画并做出完整可运行作品[25] - 从文学文本抓取重点,将文字重新组织成视听语言,90秒内容连续运行[27] - 与GLM-5.2相同Prompt对比,GLM-5.3完胜[28] - 完成3D手表解构Demo,无需扫描或下载模型,手表细节解构清晰,空间关系保持良好[31] - 完成可交付的模拟游戏,包含前端、后端、数据库、权限、测试、部署[34] - 项目耗时40分钟,最终验收报告显示前端、后端、数据库、权限全部跑通[37][42] - 注册登录、存档保存、权限隔离(不同账号信息互不可见)均通过验证[39][40][41] 安全能力实测 - 在AegisDesk项目中,7分钟生成348行安全审计报告,发现12类漏洞[50] - 漏洞类型包括Mass Assignment提权、路径遍历、存储型XSS、CSRF、IDOR、ReDoS、开放重定向、会话配置失效、明文密码、用户名枚举、堆栈泄露等[51] - 12类漏洞一个未漏,且将三个散落IDOR识别为共同根因合并为一个Finding[52] - 一处CSRF风险判断方向正确但标记为CONFIRMED存在轻微失误[53] - 修Bug环节9分20秒内22个文件变化,新增1463行代码[58] - 修复包括严格白名单、新增requireAdmin、双层防御路径遍历、输出Sink转义、Synchronizer Token防CSRF、ownerId数据查询、线性正则+长度上限、站内相对路径、Session配置加固、scrypt密码迁移、统一文案+哑哈希+限流、客户端仅通用消息[60] - 最终54项回归测试全部通过[65] - 独立重跑项目,54项依旧全部通过[66] 无GPU环境下的安全边界认知 - 在Mac无英伟达GPU环境下,GLM-5.3先确认本机跑不了CUDA[77] - CPU能验证的算法逻辑自行造模拟测试[77] - CUDA代码借Docker里的CUDA Toolkit跑nvcc[77] - 真实GPU执行、CPU/GPU数值一致性及性能Benchmark全部标记为UNVERIFIED[77] - 生成的CPU测试单独重新编译运行,结果全部通过[78] - 体现"知道自己不知道"的安全能力[79] 安全能力的技术内涵 - 安全测试重点包括白盒代码审查和漏洞推理[82] - 白盒代码审查要求从输入追踪到权限校验、数据流和危险操作[82] - 漏洞推理要求串联漏洞成立的前因后果[82] - Mass Assignment提权攻击链:req.body→用户对象→role字段→Session同步→普通用户最终获得管理员权限[84] - 修Bug环节需确认攻击路径被掐掉后原业务未修死[84] - 三轮实测对应三种能力:看得见风险、解决得了风险、知道证据到哪一步[84] 安全与Coding的融合逻辑 - Coding Agent已能直接读整个Repo、改文件、调用终端、装依赖、跑测试、参与部署[87] - 能力越强,Agent接触系统越多、权限越高,判断失误后果被同步放大[88] - 安全从Coding流程末端前移,从"写代码→测试→上线前安全审计"变为"写代码→运行→测试→发现风险→修复→重新验证"[89][90] - Hugging Face处理自主Agent驱动安全事件时,将GLM-5.2部署在基础设施中重建攻击时间线[91] - Agent以机器速度写代码、操作系统,安全需跟上机器速度[92] - "会写"只是第一关,能交付、能验证、知道边界、能补洞才是生产级Coding的开始[94][95]

刚刚,GLM-5.3发布:Coding更接近Fable 5!潜伏40年的bug都被揪出来了 - Reportify