Kimi K3:智能的新前沿 | 红杉Family
红杉汇·2026-07-25 08:05

模型概览与核心突破 - 月之暗面推出最新旗舰模型Kimi K3,是全球首个开源的3万亿级别模型,参数规模达2.8万亿 [3][5] - 模型基于全新的KDA混合线性注意力机制与Attention Residuals技术构建,原生支持视觉理解,上下文窗口达100万token [3][5] - 相比上一代K2模型,K3整体扩展效率提升约2.5倍,能更有效地将算力转化为实际能力 [3][9] 架构与技术创新 - Kimi K3基于Kimi Delta Attention和Attention Residuals构建,旨在优化长序列和深模型中的信息流动 [9][38] - 模型采用Stable LatentMoE框架,在896个专家中高效激活16个,结合Quantile Balancing和Per-Head Muon等技术,支持了2.8万亿参数规模下稳定高效的训练 [9][38] - 从SFT阶段开始采用量化感知训练,使用MXFP4权重和MXFP8激活,并引入了完全均衡的专家并行训练方法以提升效率 [39] 长程编程与工程能力 - Kimi K3具备很强的长程编码能力,可在极少人工监督下持续完成长时间工程任务,理解处理大型代码库,并协调使用终端工具 [10] - 在GPU内核优化竞技场测试中,Kimi K3在最大思考强度下的表现接近Fable-5,并明显领先Opus 4.8、GPT-5.6 Sol和GPT 5.5 [12][14] - Kimi K3开发了名为MiniTriton的紧凑类Triton编译器,其性能达到或超越Triton和torch.compile,并能稳定支撑端到端训练nanoGPT,证明其构建了真正可用的编译器栈 [15][17] 多模态与创作能力 - Kimi K3融合强大的3D推理、编程与视觉能力,可将概念、图像和视频转化为完全可玩的交互体验,实现真正的视觉闭环 [18] - 模型展示了多项创作示例,包括3D模拟长征十号火箭发射与回收、3D开放世界游戏、3D GBA模拟器以及黑洞卡冈图雅复刻 [18][19][20] - 在视频剪辑方面,Kimi K3制作了时长4分半的“3Blue1Brown”风格技术讲解视频,并用56段原始素材剪辑出品牌视频,效率可比拟有经验的剪辑师 [35][36] 知识工作与科研能力 - Kimi K3推动了端到端知识工作的进展,在内部评测中展现出稳定提升,在不同生产场景导向的工作流中表现出一致优势 [24] - 在一个科研案例中,Kimi K3用约两小时完成了通常需要一名资深研究人员一到两周的工作:为复现计算天体物理中的I-Love-Q普适关系,它阅读交叉验证了20多篇论文,实现了完整数值流程,评估了300多种状态方程,生成了3000多行Python代码,并产出了交互式HTML仪表盘 [25] - 模型展示了强大的行业研究与分析能力,例如在推理芯片行业研究中,K3经过120多轮递归自我改进,完成了2800多次网页搜索与抓取、1100多次终端数据拉取,处理了87份季报和99份原始PDF(合计超过11000页资料),并生成包含定制图表和交互式叙事的报告 [28] Agent与自主任务执行 - Kimi K3具备高度自主的Agent能力,在芯片设计概念验证中,基于开源EDA工具和Nangate 45nm工艺库,连续48小时自主运行,独立完成了面积4mm²、集成146万个标准单元、0.277 MB SRAM的芯片设计,仿真解码吞吐持续超过每秒8700个token [20] - 在引力波分析任务中,Kimi K3使用20多个并发subagents,一次分析了391个引力波事件,产出7张科学可视化图、2张表格,并综合了10多篇论文的文献内容 [32] - 公司推出了“小组件”和“看板”新功能,让用户与Kimi K3的交互更加可视化且具持续性,支持生成交互式组件并连接本地数据或外部插件 [34]

Kimi K3:智能的新前沿 | 红杉Family - Reportify