端侧AI小模型战略 - 财报，业绩电话会，研报，新闻

端侧AI小模型战略

搜索文档

虎嗅APP· 2025-09-05 21:56

苹果端侧AI战略 - 苹果在HuggingFace上全面开源视觉语言模型FastVLM和MobileCLIP2 构成其端侧AI小模型战略核心[4][5] - FastVLM在生成第一个token的响应速度上比同类模型LLaVA-OneVision-0.5B快85倍视觉编码器规模缩小3.4倍[7][9] - 7B版本性能优于Cambrian-1-8B模型响应速度快7.9倍通过混合视觉编码器FastViTHD实现速度与性能平衡[9] 技术实现特点 - FastVLM采用卷积网络和Transformer融合的混合视觉编码器减少高分辨率图像处理产生的tokens数量[10] - 模型支持0.5B/1.5B/7B多个尺寸可在iPhone等个人设备实现实时浏览器字幕功能[13][14] - 处理单帧画面仅需1-2秒 8帧关键帧分析在几秒内完成在保证速度同时维持极高准确性[16][22] 行业背景与战略定位 - 苹果面对AI进展缓慢质疑内部组建AKI团队瞄准ChatGPT 同时推进端侧小模型B计划[36] - 2024年7月开源DCLM-7B模型性能逼近Mistral-7B和Llama3 显示小模型技术积累[37] - WWDC 2024宣布Apple Intelligence由多个高度优化的AI小模型组成矩阵处理日常任务[37] 商业逻辑与竞争优势 - 端侧AI战略基于用户体验/软硬件生态/用户隐私三大基石符合品牌承诺[39][44] - 本地设备处理避免敏感数据上传与百度合作因隐私政策分歧受阻[42][44] - 利用A系列/M系列芯片边际性能实现最经济可持续的商业模式[46][48] 行业趋势 - 英伟达认为小模型是Agent未来初创公司通过小模型切入医疗/金融等垂直领域[48] - 行业对小模型兴趣升温但苹果将其提升到生死存亡战略高度[49][51]

虎嗅· 2025-09-04 22:21

苹果开源视觉语言模型FastVLM和MobileCLIP2 - 苹果在HuggingFace上全面开源视觉语言模型FastVLM和MobileCLIP2 构成端侧AI小模型战略核心 [1][3] - FastVLM在部分任务响应速度比同类模型LLaVA-OneVision-0.5B快85倍视觉编码器规模缩小3.4倍 [2][6] - FastVLM-7B版本与Cambrian-1-8B对比时性能更优生成首个token响应速度快7.9倍 [6] 技术架构与性能表现 - 采用新型混合视觉编码器FastViTHD 结合卷积网络和Transformer 输出更少但更精华的tokens [7][9] - 支持高分辨率图像快速编码在iPhone等个人设备实现实时任务处理 [5][14] - 提供0.5B/1.5B/7B多个版本实测单帧画面分析时间仅1-2秒 8帧解读在几秒内完成 [13][17] 端侧AI战略定位 - 苹果通过小模型战略强化隐私保护数据处理完全在设备端完成避免云端传输敏感信息 [43][49] - 端侧AI保障用户体验可靠性摆脱网络依赖在无信号环境下保持核心智能功能在线 [50] - 利用A系列/M系列芯片边际性能将计算任务分配至本地设备形成经济可持续的商业模式 [51][53] 行业背景与战略布局 - 苹果面对AI竞争压力内部组建AKI团队瞄准ChatGPT 同时推进端侧小矩阵模型开发 [40][41] - 2024年7月发布DCLM-7B开源模型性能逼近Mistral-7B/Llama3等同级模型 [41] - WWDC 2024宣布Apple Intelligence由多专业小模型组成处理邮件整理/文稿润色等日常任务 [41] 行业趋势与差异化路径 - 英伟达等企业重视小模型作为Agent未来初创公司聚焦医疗/金融等垂直领域微调应用 [54] - 苹果端侧战略与其硬件生态/隐私承诺深度绑定区别于行业主流云端大模型路径 [43][56] - 行业普遍追求参数规模时苹果通过专才型小模型在细分场景实现更精准性能表现 [50]