ChatGPT一夜提速14倍!新模式GPT-5.6 Sol每秒750 token
量子位·2026-08-14 08:39

OpenAI推出Ultrafast极速推理模式 - OpenAI官宣了GPT-5.6 Sol的Ultrafast预览版,最高比标准处理快14倍,每秒能吐750个token[1][8][9] - 该模式用于处理慢一步就晚一步的任务,如工程师同步读日志、分析交易记录、购物车实时推荐等场景[10][11][12] - 早期用户评价极高,金融研究AI公司Rogo应用AI负责人形容“感觉像是在跟一个人实时对话”,AI客服平台Podium语音AI产品负责人称通话不用被打断去等模型转圈[14] - 提速不牺牲智能,Ultrafast跑的依然是最高档的GPT-5.6 Sol,而非换小参数模型[17][18][19] - 速度靠Cerebras晶圆级引擎,模型权重直接放入芯片上44GB的SRAM,绕开显存带宽瓶颈[19] - OpenAI与Cerebras年初签署多年协议,计划部署750MW规模的晶圆级系统,协议总值超过100亿美元[19] ChatGPT新增Computer History记忆功能 - ChatGPT桌面版新增Computer History功能,能记住点击、打字、快捷键、应用切换等交互事件[4][20] - 用户可问“我上次做到哪了”,ChatGPT能立马回答[5] - 该功能脱胎于4月上线的研究预览版Chronicle,本次为重构[22] - 不截屏、不录音、不录系统音频,数据处理克制,临时事件文件本地保留最多48小时,服务器不留存原始数据也不用于训练[21][26] - 用户可随时暂停收集,或排除某些应用和网站[26] - 最终记忆文件保存为本地Markdown文本,时间线按天分组,每条记录带摘要和参与应用,可一键查找或删除[24][26] - 重复工作流程可存为skill,如连续整理发布通稿可存成直接调用的技能[24] 行业趋势:推理速度从优势变为标配 - 过去半年,多家头部模型厂将“更快”做成独立产品线,不再只是模型能力参数[27] - Anthropic今年5月上线Fast Mode,在结构清晰提示词下响应时间中位数从2.8秒压到1.2秒[27] - Google为实时交互场景准备Gemini Flash Live,xAI给Grok单独开fast端点[28] - 芯片层竞争激烈,Cerebras在中小模型上每秒跑3000个token,Groq强项是稳定低延迟,SambaNova高并发场景总吞吐量反超前两家[30] - 国内字节跳动豆包系列靠火山引擎推理基础设施主打低延迟,阿里Qwen-Turbo定位超快超长上下文低成本[30] - 小米MiMo-V2.5-Pro-UltraSpeed靠FP4量化加投机解码,在8卡通用GPU上把万亿参数模型生成速度推到每秒1000个token以上[30] - 月之暗面Kimi K3用KDA混合线性注意力架构,解码速度比常规架构快6.3倍[32] - 模型推理速度已卷到没人敢不做的程度[33]

ChatGPT一夜提速14倍!新模式GPT-5.6 Sol每秒750 token - Reportify