公司概况与创业历程 - 贾扬清在离开英伟达一个月后,创立了新公司Intent Lab [1][7] - 公司首批展示了三项成果:目前已知最快的GLM 5.2推理引擎、一句话生成的数据库引擎、一套带形式化验证的文件系统 [2] - 公司的核心产品是背后的生成引擎Fleet,定位为“首个将意图转换为生产级软件的自主团队” [5][31] 创始人背景与过往创业 - 贾扬清于2023年3月从阿里巴巴离职,创立了Lepton AI,业务方向是AI基础设施(AI Infra),通过云原生和多云整合调度全球GPU资源,为开发者提供算力租赁和模型部署 [8][9] - Lepton AI创始团队包括ONNX的联合创始人 [10] - 2025年3月至4月,英伟达以约7亿美元(约合人民币48亿元)收购了Lepton AI,并将其更名为DGX Cloud Lepton,并入英伟达DGX Cloud体系 [12] - 被收购后,Lepton AI的产品理念与英伟达的企业体系格格不入,于2025年中期基本停止对外运营 [15][16] - 英伟达收购时承诺在2026年前开源Lepton核心软件平台,但最终被否决,目前GitHub上仅开源了客户端SDK和命令行工具 [18][19] 新产品Fleet的技术成果与性能 - Fleet是一个智能体系统,首批三项成果均由该系统端到端自主完成,无人为介入 [6][32] - GLM-5.2推理引擎优化:起点是改造TensorRT-LLM代码以在Grace Blackwell节点上运行GLM-5.2,Fleet自主识别并实现了四类优化 [33] - 在两台Grace Blackwell节点上,将输出速度从102 tokens/s提升至647 tokens/s,性能提升6.3倍 [35] - 内核层面优化提升24%,通过kernel fusion及由agent直接生成PTX和SASS实现 [36] - 运行时优化提升16%,通过H2D batching将稳态decode步骤的host-to-device元数据拷贝从大约十次降为零 [37] - 通信层面优化提升18%,采用融合的MNNVL all-reduce,将residual add和RMSNorm折进集合通信 [37] - 投机解码(speculative decoding)优化提升400%,配合优化过的DSpark drafter实现 [38] - 数据库引擎:从一行提示(prompt)开始,零文档零代码,Fleet自主完成了从架构到测试的全流程,最终使600万条SQLite兼容性测试全部通过 [39] - 文件系统:Fleet利用形式化验证发现并修复了一个由coding agent引入的瞬态损坏状态bug [43][44] 产品理念与商业模式 - 公司认为,当前从“能跑起来的代码”到“可投入生产并长期维护的软件”之间存在距离,这并非模型能力限制,而是缺乏一个能将模糊意图转化为可靠设计、验证并自主演进的中间层 [51][53] - Intent Lab将这一中间层细化为六个自主环节:理解意图(Understand)、设计(Design)、协调(Coordinate)、构建(Build)、验证(Verify)、演进(Evolve) [54] - 这六个环节模拟了一个可靠工程团队的日常流程,但主体是智能体系统 [55] - 公司计划与外部合作,专注于解决那些因工程量过大而长期搁置的系统项目 [59] - 从历史项目(Caffe, PyTorch, Lepton AI)到Intent Lab,其核心脉络始终是“让别人更容易用上算力” [60]
贾扬清离开英伟达再创业!GLM-5.2速度飙6.3倍,一句话造的推理引擎
量子位·2026-07-29 08:49