后训练

搜索文档
娃哈哈宗馥莉被起诉,原告自称是同父异母弟妹|首席资讯日报
首席商业评论· 2025-07-14 12:10
大中矿业临武项目争议 - 公司澄清网传临武项目基础用水用电无法保证的消息不属实 [1] - 公司矿产资源中目前未发现稀土相关元素 [1] A股市场展望 - A股连续3周大涨,股权风险溢价指标显示仍处机会水平,"上台阶"行情有望延续 [2] - 银行板块表现强势,财政注资叠加化债推进带来估值修复,险资提供资金面支撑 [2] - 低利率环境下,长周期考核配合OCI账户凸显银行板块配置价值 [2] - 建议关注中报业绩和反内卷主题,重点行业包括有色、建材、电力设备等10个领域 [2] - A股中报业绩向好率高于去年同期,建议布局高景气TMT、全球竞争力中游制造等结构性方向 [3] 公司动态 - 雷军回应李想关于理想i8发布会场地问题,提出"相互致敬"化解竞争 [4] - 娃哈哈宗馥莉因资产纠纷在香港被起诉,三名自称同父异母弟妹的原告要求获得各7亿美元信托基金权益 [5][6][7] - 中国神华前6月煤炭销售量204.9百万吨,同比下降10.9% [8] 行业数据 - 上半年全国铁路完成固定资产投资3559亿元,同比增长5.5% [9] - 白羽肉鸭行业已淘汰900万只种鸭,日产苗量降低200万只,未来或有三成种鸭企业退出 [11] - 韩国6月经合组织领先指数连续第七个月上升至101.08,为2021年11月以来最高 [13] 政策与规则 - 上交所明确个人投资者参与科创成长层股票交易门槛仍为"50万元资产+2年经验" [10] 科技与创新 - Perplexity CEO表示可能利用月之暗面Kimi K2模型进行后训练 [12] - 岚图FREE+上市,三款车型售价21.99-27.99万元,搭载华为乾崑智驾方案 [14][15]
迎接AI——理性看待变革,积极布局未来
创业邦· 2025-07-07 18:27
AI技术发展现状与趋势 - 大模型进入能力边界与不确定性并存阶段,单纯追逐参数规模意义有限,需与产品深度融合创造可持续场景价值[1][5] - 模型核心能力源自预训练而非后训练,高质量训练数据已大部分耗尽,模型解析能力提升将趋于平稳[6][7] - 模型不具备真正智能且存在"幻觉"问题,需理解其不确定性特点才能有效融入产品[5] - 模型结构化数据处理能力增强,可能替代传统数据库功能[10] AI应用落地实践 - APUS在代码生成领域实现70%代码由模型生成,旧代码维护33%由模型辅助完成[11] - 设计团队规模缩减85%,AI可基于爆量素材日生成数千个同类素材[12] - 圣经类产品升级为多媒体形式并引入AI牧师功能,覆盖美国10%人口[13] - 医疗大模型已在三甲医院应用,累计服务超100万人,实现初步诊断与分诊[14] - 开发具备情报分析能力的Agent系统,应用于商业与政治情报领域[15] 企业AI战略与组织变革 - 企业常见误区是高估AI短期价值而低估长期潜力,需围绕"为什么做-做什么-怎么做"构建战略路径[19] - AI不仅是生产资料更是生产力,需重新定义生产关系以适配新型生产力[23] - 组织需培养复合型AI项目负责人,需同时理解AI原理、知识流转机制和业务细节[22] - 生产力释放后需重新规划人员技能方向和组织架构,如客服岗位裁减80%后团队结构调整[23] CEO实施AI的建议 - 从上而下定义AI应用场景,从公司P&L价值和长期战略角度思考[26] - 从下而上推动文化变革,通过细微效率提升促进组织对AI的理解[26] - 从后往前做建设,以终为始明确场景再倒推技术需求[26] - 避免在大模型主航道上构建壁垒,否则会被快速迭代的技术碾压[27] - CEO需明确适合引入AI的业务环节,避免空喊口号[27] - 面对AI要巧思而非硬来,发挥人类创造力找到适配应用方式[28] 行业展望 - AI将如同移动互联网深刻影响每家企业业务形态,需全力以赴拥抱[29] - 全球大模型企业已从两年前的众多竞争者缩减至不超过10家具备持续发展能力[27]
公元:DeepSeek只打开一扇门,大模型远没到终局 | 投资人说
红杉汇· 2025-05-11 13:09
人工智能与具身智能赛道现状 - 当前AI与具身智能赛道处于类似互联网初期的百花齐放阶段,底层技术和垂直细分领域机会众多[5] - 具身智能领域可能处于类似2018年LLM的阶段,尚未出现GPT时刻,但AGI的长期前景被普遍看好[8][9] - 行业变化极快,AI领域"一天相当于人间一年",模型迭代速度远超传统商业模式演进速度[7] DeepSeek的影响 - DeepSeek的R1模型通过开源后训练方法论实现了"技术平权",将全球AI研发重新拉回同一起跑线[6] - 该突破改变了国内大模型行业格局,但预训练与后训练技术仍需双轮发展,行业终局尚未确定[6] - 春节期间的技术突破导致行业认知发生剧烈变化,两个月内从"后训练重要"转向"预训练重要"[6] 投资逻辑变化 - 传统基于DAU/MAU的商业评估模式失效,用户可能因技术突破瞬间转移[7] - 投资人需要快速建立对AGI能力的感知,而非依赖传统商业指标[7] - 具身智能投资的核心逻辑是押注物理世界AGI的实现概率[9] 创业范式转变 - 新时代创业更强调技术颠覆创新而非明确商业化路线[1] - 当前创业者难以清晰描述具体应用场景,更多聚焦技术路线本身[8] - 成功要素转变为对AGI的信念而非传统商业计划[9] 行业参与者特点 - 顶级投资人需保持高度热爱和好奇心以应对快速变化的技术环境[10] - 国内大模型可能形成DeepSeek、千问和豆包三强格局的预测出现[6]
AI Agent:算力需求空间?
2025-05-06 10:28
纪要涉及的行业 AI算力行业 纪要提到的核心观点和论据 1. **算力需求增长逻辑** - **AI应用渗透推动推理需求**:AI应用逐渐渗透到生活和工作各环节,改变使用习惯,使算力推理需求快速增长,微软、谷歌等大厂推理需求占比可能达60%-70%,主要源于老应用改造而非开发全新APP [1][2] - **细分领域仍有增长潜力**:训练环节市场预期悲观,但实际可能更好,预训练边际效应减缓,后训练增速不明显,但细分领域如AI Agent有增长潜力 [1][4] 2. **市场预期情况** - **算力产业链与AI应用分化**:从2024年5月开始,除ASIC外,算力产业链边际走弱,英伟达股价未创新高,市场对整体算力需求预期悲观;而AI应用领域表现强劲,如Palantir股价创新高,市场对AI应用预期较高 [1][5] 3. **解决算力需求问题方向** - **训练与推理两手抓**:解决算力需求青黄不接问题需关注训练和推理两方面,训练算力需求短期难提升,推理依赖Agent发展,Agent在特定场景已有所起色 [1][7] 4. **2025年算力需求来源** - **老应用改造、新衍生应用与Post Training**:2025年算力需求主要来自老应用改造(如推荐引擎在海外大厂的应用)、新衍生应用(如Agent)以及Post Training阶段,Agent面向ToB/ToD场景,特定领域需求显现 [1][12] 5. **Chatbot与Agent对比** - **应用场景与爆款潜力不同**:Chatbot面向ToC市场,易形成爆款;Agent面向ToB和ToD场景,不易成为爆款,其算力需求难被资本市场迅速感知 [13] - **任务复杂度与交互方式差异大**:Chatbot单次交互量约1000个TOKEN,一对一、一问一答式交互;Agent完成单个任务所需TOKEN量达几万甚至十万个,多任务、多Agent协作执行,消耗数据量和TOKEN数量远高于Chatbot [25] - **存储和算力需求有别**:Chatbot对存储和内存要求低;Agent执行任务各步骤需连贯操作,对存储和内存要求高,对计算能力和存储都有较高需求 [27][28] 6. **算力需求计算与评估** - **训练与推理算力需求公式**:训练算力需求预期约为6ND,推理算力需求预期约为2ND,N代表模型参数量,D代表数据集 [16] - **评估服务器或GPU卡数量**:通过总需求除以单个GPU卡的算力估算所需设备数量,同时考虑设备实际利用率 [34] 7. **模型选择与优化** - **优先选择小模型**:选择模型参数时优先考虑小模型,大厂做推理应用倾向先上小模型,降低成本,提高可接受性 [31] - **优化模型访问和推理方法**:使用低精度计算、模型蒸馏,结合硬件优化如KV缓存优化,可降低内存消耗,提高整体效率 [35] 其他重要但是可能被忽略的内容 1. **后训练情况**:后训练自2024年9月推出,对市场影响不明显,从事厂商数量有限,数据难跟踪,在模型参数量上维持在几万亿量级,虽算力需求预期不明显,但能提升推理能力,如DeepSeek R1体现后训练扩展法则 [8][9][19] 2. **AI Agent产品表现**:一些AI Agent产品如Mariner在美国市场表现良好,融资和用户增长迅速,在海外人力成本高的地区受众广泛,但在中国市场难推广 [2] 3. **大型科技公司资本开支**:微软和Meta本季度未削减资本开支,对未来算力需求持坚定态度,若后续应用进展顺利,算力规划短期内不会下降 [40] 4. **过去一季度AI应用发展**:过去一个季度多个AI应用发展迅速,如Mariner 3月月活访问量达2310万,Cursor有2000多万,微软3月产生50万亿个TOKEN,占季度总量一半 [38]