核心观点 - 第三方平台OpenRouter的API调用数据显示,中国AI模型在Token调用量上迅速崛起,从2024年10月的1.2%占比增长至2026年4月的超过45%[13] - 匿名模型Ox Alpha突然爆火,登顶OpenRouter Token调用榜,引发市场对其来源的猜测[2][9] - 市场趋势显示,开发者倾向于选择性价比高的模型,便宜且够用的模型正在吃掉大量Token[13][23] OpenRouter平台与Ox Alpha模型 - OpenRouter是一个可接入300+AI模型的平台,每周处理超过几十万亿Token的请求[9] - Ox Alpha是8月20日左右上线的匿名stealth推理模型,ID为stealth/ox-alpha,主打编码、长周期Agent和生产场景[4] - 该模型支持1M Token上下文,支持文/图/视频输入和工具调用,目前免费预览[4] - 早期代码测试表现强劲,社区讨论热烈,但至今无人认领该模型[5] - 该模型在OpenRouter上免费一周,提供1M上下文、多模态、零数据保留,每日有100T Token的处理能力[6] - Olam Labs的Elo评级中,Ox Alpha排名第4,仅次于GPT-5.6 Sol,被认为是第一个真正处于前沿但非OpenAI或Anthropic开发的模型[7] - 在社交策略游戏中,Ox Alpha对大多数智能体和人类占据主导地位[7] Token调用量排行榜(TOP 1-10) - Ox Alpha(Stealth):23.2T tokens,暂居第一,新模型一上线就冲到榜首,调用量非常夸张[16] - DeepSeek V4 Flash 0731(DeepSeek):11.6T tokens,排名第二,环比+3%,凭借低成本、高速度和百万Token上下文成为高频Agent、代码和自动化任务的重要选择[16][17] - MiMo-V2.5(小米):9.92T tokens,环比+82%,增长非常猛,轻量化和低价格使其大量进入Agent自动化流程[16][19] - Hy3(腾讯):7.16T tokens,环比-27%,2950亿参数、单次激活约210亿,针对长文本和Agent场景优化[16][19] - DeepSeek V4 Flash 0423(DeepSeek):5.58T tokens,环比+17%,保持非常高的实际使用量[16][19] - Nemotron 3 Ultra(NVIDIA):5.4T tokens,环比+100%,增长速度仅次于部分新晋模型[16][19] - GPT-5.6 Luna(OpenAI):4.16T tokens,环比-28%[16][19] - GLM 5.2(智谱):3.22T tokens,环比-26%[16][19] - Gemini 3.7 Flash(Google):2.58T tokens,环比暴涨+210%,是榜单中增速最惊人的模型之一[16][19] - DeepSeek V4 Pro 0423(DeepSeek):1.84T tokens,环比-29%[16][19] Token调用量排行榜(TOP 11-20) - MiniMax M3(MiniMax):1.57T tokens,环比-6%,采用MSA稀疏注意力,百万上下文下算力开销大幅降低,支持多模态[20] - Laguna S 2.1(Poolside):1.53T tokens,环比-8%[20][21] - Claude Opus 5(Anthropic):1.52T tokens,环比下降84%,旗舰模型调用量受成本因素影响[20][22] - GPT-5.6 Sol(OpenAI):1.51T tokens,环比+84%,增长非常明显[20][24] - Kimi K3(月之暗面):1.42T tokens,环比+8%,基本持平[20][24] - Claude Sonnet 5(Anthropic):1.12T tokens,环比+3%[20][24] - Nemotron 3.5 Lightning(NVIDIA):1.07T tokens,环比+28%[20][24] - DeepSeek V4 Pro 0813(DeepSeek):1.01T tokens,环比+7%[20][24] - Gemini 3 Flash Preview(Google):830B tokens,环比+1%[20][24] - GLM 5.3(智谱):803B tokens,环比+999%,暴涨,刚出来大家发现智谱5.3不错[20][24] 中国模型崛起趋势 - 2024年10月,中国模型在OpenRouter的Token调用占比约1.2%,几乎可忽略不计[13] - DeepSeek V3发布后,2025年3月占比跨过10%[13] - Kimi K2和MiniMax加入后,2025年Q3占比超过25%[13] - 2026年4月,占比超过45%[13] - 不到两年,从1.2%增长到45%[13] - 主要原因是中国模型是性价比之王,同等能力下价格便宜10-20倍,开发者在生产环境算成本账[13] - 前五大模型Token调用量排名中,Ox Alpha、DeepSeek V4 Flash、小米Mimo、腾讯Hy3占据前四席,TOP 20里国产模型拿下至少10席[9] 市场趋势分析 - 便宜、快速的模型正在吃掉大量Token,DeepSeek V4 Flash、MiMo-V2.5、Nemotron、Gemini Flash等模型大量出现在前列[23] - MiMo-V2.5环比+94%、Nemotron 3 Ultra环比+114%、Gemini 3.7 Flash环比+236%,说明市场越来越倾向于把高频、重复、自动化任务交给成本更低的模型[23] - Claude Opus 5环比下降84%,旗舰模型调用量明显受成本因素影响[22]
看看本周 AI 大模型 token 调用量排行,神秘模型 Ox Alpha 登顶~