Workflow
强化学习环境
icon
搜索文档
Kimi实习生开公司,估值快200亿了
投中网· 2026-09-14 10:56
文章核心观点 AI训练数据服务正从传统低门槛的现金流生意,转变为由年轻高学历创业者主导、资本追捧的高估值赛道,但单纯的数据生意天花板明显,行业正探索向SaaS化、RSI等更深层服务模式转型 行业现状与融资热度 - 一家由阿里通义、月之暗面等大厂实习生创立的AI数据公司,不到一年拿下千万美元级订单,完成约三轮融资,即将完成3亿美元融资,估值达25亿美元,投资方包括红杉、阿里和腾讯[3] - 国内AI训练数据公司约二十多家,传统数据服务模式(人工标注、专家外包、数据交付)难以讲出增长故事,但95后、00后创业者凭借模型训练经验带来新想象空间,搅动融资热度[4] - 海外数据公司Surge AI成立于2020年,2025年收入超10亿美元,市场估值超150亿美元[6] - 海外数据公司Mercor早期为AI招聘平台,后组织专业人士成为训练数据供应网络,2025年以100亿美元估值融资,2026年计划按200亿美元估值筹集约5亿美元[7] 数据需求变化 - 大模型智力水平提升后,数据质量要求提高,名校背景高学历从业者加入,法律、医生、记者等资深人士入驻数据服务平台,数据标注收入每小时500-1000元[3] - 医疗、法律、金融等专业领域及需要主观判断的复杂任务中,对资深人才标注需求快速增长,大型AI公司愿支付高额溢价[7] - 今年Agent全面爆发,所需数据类型从简单专家数据转向更接近环境的数据,需要可闭环、可验证的训练环境,模型在其中反复行动、获得反馈[10] - 美国创业公司AfterQuery专门做强化学习环境,为前沿大模型输出专家推理数据集、强化学习仿真环境、模型评测服务[10] - Anthropic管理层讨论未来一年内拿出10亿美元投入强化学习环境,OpenAI 2025年全年数据开销约10亿美元,内部预测到2030年将涨到80亿美元[11] - 国内从今年5、6月份开始,市场上出现一批提供高质量数据的新团队,模型厂对新领域数据需求上涨[11] 创业者特征 - 国内数据初创公司创始人多为头部模型大厂实习生,兼具business sense和researcher属性,参与过模型训练工作并发表论文[14] - 模型训练一线工作由名校PhD承担,他们从实习开始承担具体执行工作,随后从模型厂或外包团队中走出成立数据创业公司[14] - 投资人判断创业者画像要求团队至少达到T0或T1级别,最好是95后、98后到00后这一代真正参与过一线模型训练的人[14] - 工程能力同样关键,从数据pipeline搭建到Query设计、数据清洗和质量控制,背后有复杂工程链路,并非简单人工标注[15] - 数据业务可成为模型厂之外的候选人团队,甚至小型预训练、后训练组织,投资人可在早期以较小代价获得研究员密度较高的团队[15] 数据生意天花板 - 单纯数据生意难以支撑持续发展,Mercor年化收入1亿美元,但60%到70%总收入需支付给承包商,留给公司空间有限[17] - Scale AI超过一半营收用于直接业务成本,包括承包商薪资,国内数据标注员时薪200至500元,专业性更强的人可达上千元[17] - 数据业务订单并非完全确定,客户签下1亿美元订单并不意味着半年、一年或两年后一定能实现对应规模收入,连续交付不达标可能缩减或取消订单[17][18] - 海外大厂分工成熟,外部数据公司年度预算到2027年、2028年仍在增长,有被并购的退出机会,但中国市场逻辑不同,数据外包公司被并购或上市空间有限[18] 行业转型方向 - 未来数据生意可能不再是“一条数据卖多少钱”的模式,数据创业公司开始试图站到SaaS位置,进入传统企业工作流帮助完成AI化改造[18] - 数据公司可进入企业工作流,积累真实任务轨迹和交互反馈,沉淀到自身模型和训练体系中,数据从一次性交付商品变为连接客户工作流、模型训练和长期服务的基础设施[19] - 大厂付费方式将从按数据条数付费,变为为一套能持续产生高质量数据、完成任务执行和模型反馈的系统付费[19] - 海外Turing、Scale、Invisible等公司发展咨询或更深度的企业服务业务,从单纯提供数据和人力,进一步介入客户AI工作流[19] - 数据越深入客户核心业务风险越高,Mercor今年遭遇数据泄露后,Meta暂停合作,OpenAI也展开调查[19] RSI与未来叙事 - 2026年以来头部模型厂商发版节奏压缩到月度级,背后关键变量可能是RSI(递归式自我改进),即AI参与甚至改进自身研发流程[21][22] - 由Meta前FAIR研究总监田渊栋等8位顶级AI研究员联合创办的RSI实验室完成6.5亿美元融资,投后估值约46.5亿美元[22] - 一些数据初创公司开始把RSI作为融资叙事,在新区搭建“半RSI”系统,某些环节可能做到接近一半甚至70%到80%[23] - RSI创业门槛极高,同时需要前沿模型、巨额算力、顶尖研究人才、训练基础设施、大规模实验能力及足够强的模型评估系统,当前能尝试闭合完整循环的仍主要是OpenAI、Anthropic、Google DeepMind及极少数新Lab[23] - 市场上不同团队讲的RSI并非同一件事,有的对标大模型公司做下一代模型研发,有的只发生在产品自动化层面,有的指数据管线自净化自迭代,层次、方向和scope不同,短中期内可能存在明显差距[24]