核心观点 - AI行业正从追求低延迟的实时对话转向长周期后台Agent,后台推理将成为主导,成本需降低1000倍[4][5][14] - 通过“算力拾荒者战略”利用被低估的芯片、廉价电力和低可用率数据中心,实现极致性价比的Token生产[5][6][68][76] 行业趋势与市场判断 从低延迟到长周期Agent - 行业陷入“延迟陷阱”,GPU被硬逼成交互式聊天机器人,但AI终局是能自主运行数小时甚至数天的后台Agent[2][4][27] - 最好的延迟是零延迟——机器在夜间替人类完成所有工作,人类不应成为交互回路中的瓶颈[5][6][11] - 长周期Agent任务(如深度研究、网络安全)可消耗无限Token,后台负载占比将从50:50变为90:10[14][15][16] - 思考期计算扩展(test-time compute scaling)已验证:给Agent更多时间,它能给出更好答案,当前已能连续运行一小时[12][13] 推理支出无泡沫 - 当前Token消费与2000年互联网泡沫不同,Token被立即使用产生价值,而非投机囤积[64] - 推理支出只会单调递增,不存在投机泡沫,与2023-2024年训练芯片短缺时期的投机性支出完全不同[65] 数据与模型架构 - 互联网是对数据的一次性补贴,高质量文本(约30万亿Token)已被翻遍,普通人类偏好信号已无价值[50] - 下一代智能进化依赖可验证任务沙盒中的强化学习自我博弈,模型已超越普通大众[50][51] - Transformer的“原罪”:将内存受限的注意力层与算力受限的MLP层硬拼在一起,单芯片极难兼顾[6][44] - KV cache存在1-2个数量级的冗余,DeepSeek等研究正以每年一个数量级幅度压缩[82] 公司战略与商业模式 Token工厂定位 - Sail Research是一家“Token工厂”,以市场无可匹敌的价格提供开源大模型推理服务,并托管长周期Agent沙箱[7] - 核心主题是“丰裕”,将智能作为大宗商品,目标是把Token成本降低10倍以催生全新产品品类[7] - 北极星指标是拥有全行业最低的单Token成本,未来将转向“成果”作为度量单位[8] 算力拾荒者战略 - “世界上没有坏芯片,只有糟糕的定价”——愿意在任何时间、任何地点采购任何芯片[6][59] - 市场对非英伟达硬件的偏见是最好套利机会,AMD等芯片因编程难度被低估,可压榨出超额收益[59][60] - 多芯片架构适配能力是核心优势,无历史包袱,能快速为TPU、Trainium等新芯片搭建软件栈[61][62] 数据中心策略 - 传统数据中心为99.99% SLA和发电机付出天价,但长周期Agent可容忍95%可用率[6][71][72] - 分布式1兆瓦小型数据中心比吉瓦级数据中心更具成本优势,可砍掉电力冗余和备用发电机[67][70] - 利用太阳能和风能的间歇性,配合天气模型调度,以极低成本获取他人不敢碰的电力资源[75] 技术实现与效率优化 软件与算子 - 围绕GPU极限效率构建LLM软件栈,从底层算子(Kernels)入手压榨性能,追逐100%“光速极限”[21][24][25] - 从低延迟优化转向吞吐量优化,采用专家并行、流水线并行等策略,而非张量并行[31][32][33] - 算子融合趋势:将矩阵乘法与加法等操作合并,减少数据在DRAM的读写[53] - 算子工程正从手工编写转向AI辅助,人类负责概念设计,模型负责实现代码[54] 硬件利用 - GPU本质是吞吐量机器,追求低延迟与高吞吐量存在根本权衡(“公交车vs私家车”比喻)[27][28][29] - NVLink技术专为低延迟设计,但非必需;其他芯片在“单位美元FLOPS”上可能优于NVIDIA[32][33] - 当前GPU在理想大矩阵乘法时可达峰值利用率70-80%,但实际运行Transformer时大部分时间不在此路径[55][56] - 编程范式正从单GPU转向整个机架(如NVIDIA NVL72)甚至整个集群[56][57] 芯片架构分析 - Cerebras等公司押注片上SRAM,带宽可达21 PB/s(Blackwell HBM约10 TB/s),但KV cache成为巨大痛点[37][38][39][42] - 理想方案是异构融合:Cerebras托管MLP(模型权重),GPU处理注意力机制(KV cache)[43][44] - 专用加速器(如Groq)需与传统GPU协同工作,片外内存提供大容量,片上内存提供极致速度[43] 行业低效环节 算力调度 - 全球算力未有效调度,大量GPU在私有算力池中闲置,NVIDIA仅今年就出货500万张Blackwell芯片[82][83] - 需要将全球算力组织为共享资源,更紧凑高效地进行负载打包[83] 内存与注意力 - KV cache几乎无压缩,每个Token存储数KB数据,存在1-2个数量级冗余[82] - 注意力层是内存受限的瓶颈,在长上下文(如100万Token)下问题尤为突出[43][44]
互联网免费数据已被吃光,普通人反馈早没用了?前英伟达工程师:Transformer的原罪浪费算力,聊天机器人把GPU全糟蹋了