Workflow
AI前线
icon
搜索文档
DeepSeek如何实现5000亿估值?外媒曝其API毛利率高达82.9%
AI前线· 2026-08-26 18:30
核心观点 - DeepSeek 凭借极致的基础设施效率实现高毛利率,在营收高速增长和亏损收窄的背景下,正加速推进大规模融资和上市计划,展现出在AI竞赛中“越跑越接近终点”的态势[2][7][15] 财务表现 - 2025年前七个月营收约4.75亿元人民币(约7070万美元),较2025年全年增长近10倍[2] - 同期净亏损收窄至7.15亿元,明显低于2025年全年9.35亿元的亏损规模[2] - 前七个月综合毛利率为44.6%,其中API业务毛利率高达82.9%[3] - 营收体量尚不足两家美国巨头的零头,但盈利效率已经反超[5] 行业对比 - 国内同行智谱2025年综合毛利率为41.0%,其云端模型/API服务毛利率仅18.9%[4] - MiniMax 2025年综合毛利率为25.4%[4] - OpenAI 2025年一季度营收57亿美元,毛利率为39%[9] - Anthropic 2025年二季度营收115亿美元,预计2026年全年毛利率将从2025年的40%升至63%[9] 高毛利率来源 - 通过持续优化AI系统效率,用更少的芯片完成更多任务,大幅压低模型运行成本[10] - 秘诀在于极致的基础设施效率,而非提高售价[8][10] 定价策略 - 本月上调API价格:旗舰模型V4-Pro峰值时段输出费用升至每百万token 3.96美元,非峰值时段1.98美元,较此前的0.87美元显著提升[11] - 涨价后依然是行业“价格洼地”:Kimi K3输出收费为每百万token 15美元,Anthropic的Claude Opus 5高达25美元,DeepSeek定价不及竞品零头[12] - 具体涨价幅度:V4-Flash输出空闲时段涨125%,高峰时段涨350%;V4-Pro输出空闲时段涨125%,高峰时段涨350%[12] 资本运作与扩张 - 正与新旧投资者磋商第二轮融资,目标规模500亿元人民币,对应估值5000亿元[6] - 今年6月刚完成同样规模为500亿元的首轮融资,两轮融资几乎无缝衔接[6] - 已聘请投行协助筹备明年在上海挂牌上市事宜[6] - 前七个月在AI基础设施上豪掷约110亿元人民币,涵盖租用AI芯片服务器及采购计算设备等[13] - 2025年全年基础设施支出仅为约12亿元,一年多时间暴涨近10倍[13] 增长趋势 - The Information上月报道年化营收已达4亿至5亿美元区间,本次最新数据印证了这一增长趋势的延续[14] - 营收增长近10倍、亏损持续收窄、API毛利率领先全球同行、开源模型(尤其是轻量版V4-Flash)在全球开发者中加速渗透[14]
不做手机缩小版:AI 健康记录迁到手腕,要跨过哪些工程鸿沟?
AI前线· 2026-08-26 17:21
核心观点 AI健康管理应用正从手机端向手表端迁移,通过语音交互、传感器和跨端协同,解决传统健康记录流程繁琐、易遗漏的痛点,但产品落地需克服权限、断连、设备差异等工程挑战,并非所有功能都适合穿戴形态[2][3][7] 行业痛点与产品方向 - 传统手机端健康管理记录链路繁琐,用户需先选餐次、再搜索食物、估份量,导致漏记和回忆模糊,健康管理行业虽已卷成红海但发力方向存疑[2] - 小卡健康团队3名00后女生开发者自身经历减脂和体重反复,切身体会记录流程负担,将健康记录入口迁移至手表,抬腕口述即可完成记录[3] - 手表随身属性带来手机无法实现的价值:饮食运动发生当下即可记录,不再依靠夜晚回忆补录,数据完整性更高,用户操作负担大幅降低[7] 产品设计原则 - 手机端复杂食谱、长篇营养报告、大段AI对话不适合手表狭小屏幕,热量缺口、当日步数、饮水、体重等一眼可读指标及语音记录、运动陪练等场景才适配穿戴形态[7] - 手表信息应一眼可读,操作最好一步完成,功能经过多次调整和优化,内容不断被删除,页面层级变浅,按钮更靠近表冠和手势,AI长段分析也必须缩短[7] - 小卡健康团队希望手表在用户运动和生活时给出“刚刚好、不多不少的反馈”,这个尺度仍在调整,但改变的终点永远是为用户服务[25] 技术实现与系统能力 - 小卡健康、开练、凯格尔运动依托四大系统Kit构建完整业务链路:Core Speech Kit、Health Service Kit、Sensor Service Kit、Wear Engine Kit[5] - Core Speech Kit接住声音,开发者创建语音识别引擎通过回调获得实时转写,不必从头搭录音上传与识别服务,系统接口省下基础工作[11] - 小卡健康将录音确认放进“智慧手势”,用户通过拇指和食指快速触碰完成确认,再通过辅助动作切换“确定”或“取消”焦点,减少一次精确触摸[11] - 产品已将录音、AI分析、结果生成和确认连成一条表端流程,可识别饮食、饮水、运动等十余类口述信息[11] - Health Service Kit开放日常活动、心率、睡眠和锻炼记录等数据,应用先申请服务和数据范围再交由用户手动授权[13] - 小卡健康当前仅可读取步数、历史记录实现基础数据同步,距离、热量、体脂、营养、心率、压力、睡眠等多维度数据还在申请流程中[13] - AI营养师想要结合完整身体指标给予个性化建议,但现阶段只能基于已获批数据能力做落地,部分设想体验停留在规划阶段[13] - Wear Engine Kit承担跨端连接,开练针对不同信息类型设计差异化传输策略:实时性强的简短事件采用即时消息通道,完整训练计划与最终结果采用文件传输模式[15] - 当健身者手机断开后,开练将训练计划、当前进度和待发送结果保存在本地文件及Preferences中,已开始的训练可在表端继续,保证离线或断连时暂停参数编辑但用户仍可继续或结束训练[15] - Sensor Service Kit让训练应用进一步读取身体与动作信号,开练监听实时心率,监听失败或无效值时页面显示“--”[17] - 小卡健康后续计划用加速度计、陀螺仪、心率和端侧模型识别更多动作,但需注意手表佩戴松紧、换手、动作幅度等影响波形,采样过勤增加耗电[18] 工程挑战与解决方案 - 接口可用不代表产品可用,项目时间消耗在接口之间,开练早期将智能手表复杂页面直接移到运动手表导致页面无法正常显示,训练流程跑不稳[19] - 团队减少单页元素、拆分复杂页面、降低图片和动画资源占用,调整数据加载、内存和状态保存[19] - 跨设备一致体验不等于相同界面和实现,真正一致是用户在不同设备上都能稳定顺畅完成相同核心任务,智能手表可保留动作图和较完整编辑面板,运动表先做好开始、完成、休息、结束和同步[19] - 圆形屏幕要求另一套操作方式,开练充分利用表冠能力,用户转动表冠即可滚动浏览训练计划、查看详情或调整参数,相比在圆形小屏精准点击操作门槛更低[20] - 后台运行需通过Background Tasks Kit发布休息结束提醒,再用Notification Kit检查通知通道,设备设置、省电策略和系统状态都可能影响触达,训练进度仍要保存在本地[22] - 测试指标需跟着场景走:语音记录观察从开口到结果等了多久、解析后改了几次;跨端训练确认过程消息是否漏掉、整份结果是否回传、断连后能否恢复;设备侧测首屏、页面切换、峰值内存和一段完整训练的耗电[22] - 小卡健康超慢跑功能月度参与人数从不足200增长至10000+,即便数据向好,上线前仍要严格核对统计口径[22] 具体应用场景 - 小卡健康示例语音“早餐吃了一个鸡蛋,喝了两杯水,做了30个深蹲、60个高位下拉,帮我分析一下今天的状态”,整条业务链路需完成声音采集-语音转写-语义解析-数据关联-跨端同步-结果反馈[9] - 开练团队开发者反馈:以前用手机记训练,每完成一组拿起来点一下,休息时容易刷短视频导致超时;手表端完成一组只需抬腕确认,倒计时结束手腕振动,注意力可留在训练本身[15] - 健身人一次包含4个动作、每个动作4组的训练会出现16次组间切换,开练将训练前计划制定和训练后复盘留给手机,手表负责现场流程[15] - 凯格尔运动使用相似通信和振动能力,场景更私密,用户在手机端选好课程,训练开始后手表用不同振动区分收缩、放松、休息和阶段切换,用户跟着手腕提示完成训练[16] - 盆底肌训练可能发生在办公室空隙,一直盯手机奇怪、外放声音不合适,团队没有在表端塞进很多数据,用户需要时看一眼剩余时间和进度[16] 产品现状与未来规划 - 小卡健康语音记录已上线,更多健康数据、运动识别和Agent联动仍要经过测试、权限申请和审核[25] - 小艺调用小卡健康Agent处在沟通与Demo验证阶段[13] - 跳绳、哑铃、开合跳、深蹲等运动识别为后续迭代内容[14] - 开练的实时心率也要等待最终版本[25] - 开发者能调用的系统能力越来越多,未来产品仍要在每一项具体限制里做选择[25]
完全相信 AI 代码的 Uncle Bob,坦诚这条路还没走通
AI前线· 2026-08-26 17:21
AI代码质量管控框架的演进与争议 - Uncle Bob放弃对AI代码逐行人工评审,转而搭建基于指标与约束条件的管控框架,引发工程师群体激烈争论[2] - Grady Booch公开反对,认为测试覆盖率和复杂度指标无法发现安全漏洞、无效死代码或性能逻辑拆分问题,强调“信任,但要核验”[2] - Uncle Bob为AI智能体设置强约束体系:单元测试、Gherkin验收测试、QA测试流程、圈复杂度阈值、模块大小限制、依赖结构分析、变异测试及测试覆盖率要求[3] - 变异测试通过系统性改动源代码检验测试用例能否捕获缺陷,严谨程度超过多数工程团队的人工评审流程,但需前期投入巨大成本建立工程纪律[4] - Uncle Bob透露AI全权负责代码编写,他专注质量管控,模式运行顺利,但架构设计全自动化尚未取得理想效果,架构与模块依赖管控仍需人类主导[4] - 他建议放弃瀑布式重度前置规划,采用敏捷小迭代:做完一小轮迭代后人工复盘重构架构,再进入下一轮,可运行系统与自动化检测标准才是权威需求[4] AI代码质量管控的底层逻辑与调整 - AI智能体短期记忆能力远超人类,能处理更复杂代码逻辑,Uncle Bob将CRAP评分阈值从人类开发的4调整到AI开发的6,后续可能放宽到8[43][44] - 测试驱动开发适配人类开发者,但不适合强行约束AI智能体,AI最终会回归“完成函数开发再补充测试用例”的模式[44] - 人类编程价值理念依然通用,但开发行为规范与操作阈值需针对AI全面调整,不能直接照搬[44] - 自动化检测工具规则固定、执行确定性强,不会被上下文窗口的“中间信息丢失”机制影响,而提示词过长会导致大部分规则被模型无视[29] - 使用AI智能体的核心技巧是精简初始提示词,只保留核心规则,剩余规范约束依靠后置自动化工具落地[29] 多智能体协作体系与效率 - Uncle Bob搭建多智能体协作体系:需求解析智能体将需求转化为Gherkin验收测试用例和QA测试流程,编码智能体开发业务代码,代码清理智能体运行CRAP检测,代码加固智能体执行变异测试,QA测试智能体自动化系统测试[33][34] - 多智能体精细化分工两大核心优势:支持并行工作,普通笔记本电脑可同时运行三个以上编码智能体;精准控制上下文窗口,缓解“中间信息丢失”问题[33] - 采用“即用即毁”模式,智能体完成单次任务后直接销毁,下一轮任务启用全新智能体,保证上下文环境干净无冗余[33] - 多智能体闭环体系约一小时完成原本单个智能体五分钟的工作,但对比人类半天开发时长,效率提升4-5倍,且代码质量远高于人工开发水平[34] - 即便叠加大量检测规则与约束条件,AI开发效率依然是人类的2-4倍,优势明显[30] 架构设计与模块规划 - Uncle Bob人工负责架构设计,让AI开发架构可视化工具实时生成UML结构图,实现全层级架构可视化管控[37] - 搭建确定性检测工具,明确定义模块间依赖规则并写入固定配置文件,AI绝对不能违规,专属检测程序校验架构合规性[38] - 优质模块化结构核心价值:边界清晰、接口规范、分工明确的模块,人类开发者与AI智能体都能轻松理解精准把控[40] - 大模型会重点关注代码结构和接口定义,依托规范模块接口可无需解析底层源码直接完成开发迭代[40] - AI通过读取测试用例理解系统功能,代码结构与模块设计越规范,AI对业务理解越精准,开发质量越高[41] 前置规划与敏捷迭代 - Uncle Bob彻底放弃重度前置规划,拥抱敏捷开发思路:让AI先完成单个小型需求迭代,结束后人工复盘架构优化结构,再推进下一轮迭代[46] - 编程修改成本已无限趋近于零,无需耗费大量精力做重度前置规划,快速迭代持续优化才是最优解[48] - 纯粹的需求驱动开发模式不适配AI时代,最优解依然是敏捷迭代:小步快跑、快速反馈、迭代优化、实时重构[48] - 最终落地的可运行系统与可通过的检测标准才是真正的需求,不建议直接下载使用现成工具,应让AI读取工具逻辑自主复刻适配专属工具[49] 新人培养与底层基础 - 新人必须亲自手写代码,完整经历编码、调试、排错全过程,不能全程只做AI提示词工程师[5] - 新人应把自己当作“人类智能体”,接受自动化检测约束,积累实战经验,再进阶做战略架构[5] - 通过阅读经典软件工程书籍获取架构与战略思维,弥补AI时代架构反馈周期缩短但缺少历史踩坑经验的短板[5] - 底层基础价值从未改变,鼓吹基础无用的人终究会付出代价,AI虽然强大但依然会撞上复杂度天花板[54] - 新手必须从二进制、汇编、C语言等底层知识学起,再到高级语言与AI工具协作,逐层搭建认知,最终具备管控AI做战略编程的能力[52]
用 Astra+Codex 干掉 CUDA!奥特曼9个月AI造芯反杀英伟达 GB300
AI前线· 2026-08-26 16:23
核心观点 - OpenAI自研推理芯片Jalapeño在实测中,以不到对手一半的功耗,在推理吞吐量和延迟上全面超越英伟达GB200和GB300,标志着AI公司通过大模型自身能力攻破了CUDA生态壁垒,芯片行业竞争格局面临重塑[2][4][6] 芯片性能对比 - Jalapeño额定700W,实测持续功耗不超过550W,而GB200 TDP为1200W,GB300为1400W[13] - 在峰值每瓦吞吐量上,Jalapeño在GPT-OSS 120B、DeepSeek R1 670B和Kimi K2.5 1T上分别达到对比系统的1.9倍、1.7倍和1.5倍[24] - 端到端延迟表现优于对手1.7至3.6倍[13] - 在等速对比口径下,以DeepSeek R1为例,当单用户生成速度维持在约169 token/秒时,Jalapeño每千瓦可处理约1.23万token/秒,GB300仅约118,差距约104.3倍[21] - 在GPT-OSS和Kimi K2.5上,类似口径差距分别约为53.7倍和56.1倍[21] - Jalapeño在GPT-OSS上单用户每秒最高生成约1,459个token,GB200约535个token/秒[24] - 在DeepSeek R1上,Jalapeño单用户生成速度最高约700 token/秒,GB300约169 token/秒,差距约4.1倍[24] - 在Kimi K2.5上,Jalapeño单用户生成速度最高约694 token/秒,GB300约182 token/秒,差距约3.8倍,最低端到端延迟分别为1.56秒和5.31秒[24] 芯片规格参数 - Jalapeño FP8性能为3.4 PFLOPS,FP4性能为13.4 PFLOPS,HBM容量为216 GiB,HBM带宽为15.4 TB/s,TDP为700W[3] - 对比英伟达GB300:FP8性能5 PFLOPS,FP4性能15 PFLOPS,HBM容量288 GB,HBM带宽8 TB/s,TDP为1400W[3] - 对比英伟达Rubin:FP8性能17.5 PFLOPS,FP4性能35 PFLOPS,HBM容量288 GB,HBM带宽20 TB/s,TDP为1800-2300W[3] AI造芯流水线 - OpenAI利用自家旗舰模型GPT-6(代号Astra)和内部加强版Codex下场造芯,9个月完成硬件设计与优化,流片后3个月内从零设计出完整底层代码软件栈[4] - 硬件设计层:AI被用于探索实现方案、缩短验证周期,并直接优化芯片内部算术电路,使核心计算面积显著缩减,从设计到流片仅用9个月,而传统ASIC研发周期动辄数年[25] - Jalapeño采用一整块Compute Die,左右各三颗共6颗HBM4,顶部为I/O Chiplet,计算核心与HBM4切分成对应“切片”,每个核心切片直连本地HBM,走极简低延迟访问路径[27] - 软件编译层:OpenAI使用内部增强版Codex,让AI自动寻找更优的算子实现,在DeepSeek R1适配中,Codex在几乎没有底层算子工程团队介入下,很快写出可运行且高效的MLA算子实现[29] - 在GPT-OSS的部分注意力和混合专家模块中,AI生成的底层代码比此前人类专家编写的版本快1.5~1.8倍[30] - 模型移植层:OpenAI自研编程语言和编译引擎,绕开CUDA生态,让AI直接把高层算法翻译成底层硬件配置[32] 行业影响与趋势 - SemiAnalysis判断,考虑到OpenAI能在自家芯片上如此快速地适配新模型,CUDA的护城河岌岌可危[23] - 过去十年,Graphcore、寒武纪、Cerebras等挑战者都倒在CUDA软件高墙下,但新一代挑战者换成了大模型,它们在算力上“反噬”宿主,重塑芯片设计产业链[6] - 腾讯云CEO汤道生表示腾讯整体算力“严重不足”,已拖慢混元模型训练和产品发展[32] - 从Anthropic组建内部芯片团队并与三星讨论定制AI芯片,到国内DeepSeek和智谱,模型公司实现算力供给闭环已成共识[33] - 当AI介入芯片设计,软硬件协同的迭代速度将被彻底改写[33]