注意力机制
搜索文档
今天,「人工智能」这个学科诞生70年了
机器之心· 2026-08-31 17:48
文章核心观点 文章回顾了人工智能学科自1955年达特茅斯会议以来七十年的发展历程,指出其发展轨迹是一条反复冲高、摔落的锯齿线,每一次寒冬的成因都惊人相似:承诺跑得比能力快 文章认为,当前(2026年)行业已进入以“能办事的智能体”为核心的新阶段,并指出黄仁勋声称“已实现AGI”的言论,在学术定义模糊的背景下,与商业利益紧密相关 人工智能的起源与命名 - 1955年8月31日,约翰·麦卡锡、马文·明斯基、纳撒尼尔·罗切斯特和克劳德·香农四人向洛克菲勒基金会提交了举办达特茅斯人工智能夏季研究项目的提案,申请了13500美元,获批7500美元[2][5][6] - 提案列出的待办事项包括:让机器使用语言、形成抽象和概念、解决目前只有人类能解决的问题、自我改进,这些构成了2026年整个行业的产品路线图[6] - “人工智能”一词是麦卡锡为避开诺伯特·维纳的“控制论”圈子而生造的词,它从诞生第一天起就没有可操作的定义,导致其永远无法被证明实现或失败[9] - 1956年夏季会议期间,艾伦·纽厄尔和赫伯特·西蒙展示了“逻辑理论家”程序,能证明《数学原理》中五十二条定理里的三十八条,其中一条证明比罗素原版更简洁[9] 黄金十年与第一次寒冬 - 1958年,弗兰克·罗森布拉特造出感知机(Mark I Perceptron),《纽约时报》报道称其未来将能行走、说话、看见、书写、自我复制并意识到自己的存在[15] - 1959年,阿瑟·塞缪尔的跳棋程序通过自我对弈赢过本人,这是“机器学习”一词首次有实物对应[18] - 1965年,赫伯特·西蒙预言二十年内机器将能完成人所能做的任何工作;1970年,明斯基对《Life》杂志称三到八年内会有具备普通人一般智力的机器[21] - 1969年,明斯基和西摩·帕普特出版《感知机》,用数学证明单层感知机无法表达异或逻辑,对多层网络训练问题持悲观态度,导致神经网络方向经费此后十几年基本断流[21][23] - 1973年,《莱特希尔报告》指出AI在所有领域未能兑现承诺,面对真实世界规模问题会因组合爆炸而失效,报告发布后英国AI研究经费几乎被全部撤销[26][27] - 第一次寒冬的成因是AI承诺的东西和它能交付的东西之间出现了一条鸿沟[28] 专家系统崛起与第二次寒冬 - 1980年,卡内基梅隆为DEC开发的XCON系统开始为VAX小型机自动配置订单,每年为公司节省约四千万美元,点爆了整个专家系统市场[31] - 1980年代中后期,AI相关产业规模据称达到数十亿美元量级,日本于1982年启动“第五代计算机”计划[31][32] - 1987年,通用工作站性能超过专用LISP机器,Symbolics等硬件生意市场在几个月内蒸发;专家系统无法自己学习,维护成本随规模超线性增长[33] - 到1990年代初,“人工智能”在企业采购和风投圈几乎成为污点,日本的第五代计划于1992年结束,未达成预定目标[34] - 第二次寒冬的成因与第一次基本一样[35] 改名求生与深度学习奠基 - 1990年代到2000年代中期,研究者不再说做AI,改称机器学习、数据挖掘、模式识别等,这段历史被称为“AI之冬里的伪装”[37] - 1997年,IBM深蓝以3.5比2.5战胜加里·卡斯帕罗夫,但胜利靠专用芯片每秒搜索两亿个棋局位置实现,几乎不包含任何学习,被解读为暴力算力的胜利[37] - 1997年,塞普·霍克赖特和于尔根·施密德胡伯发表长短期记忆网络(LSTM),解决了循环神经网络的梯度消失问题,二十年后撑起整个语音识别和机器翻译产业[39] - 杰弗里·辛顿、杨立昆、约书亚·本吉奥在神经网络路线走不通的年代坚持下来,被戏称为“加拿大黑手党”[41] - 2006年,辛顿等人关于深度置信网络的论文给这个方向重新起名为“深度学习”[43] - 2007年前后,李飞飞开始做ImageNet,包含约1500万张标注图片、覆盖两万多个类别,赌注是算法不行是因为数据太少[44] 2012年转折与Transformer时代 - 2012年9月,AlexNet在ImageNet竞赛中top-5错误率为15.3%,第二名是26.2%,它用了两块英伟达GTX 580显卡训练,以及有ImageNet这么大的数据[47][49] - 2016年3月,AlphaGo以4比1战胜李世石,第二局第37手(神之一手)被公认为好棋,第一次让人直观看到系统的判断可能来自人类棋谱之外的地方[50] - 2017年10月,AlphaGo Zero完全不使用人类棋谱,从零开始自我对弈,三天后超过战胜李世石的版本[52] - 2017年,谷歌八位研究者发表《Attention Is All You Need》,提出Transformer架构,只靠注意力机制建模序列关系,最大好处是可以大规模并行训练[52] - 2020年5月,GPT-3(175B参数)发布,不需要微调,只靠在提示词里给几个例子就能完成新任务,这种“上下文学习”能力是规模带来的涌现副产品[56] - 2020年,OpenAI的Jared Kaplan等人发表Scaling Laws论文,指出模型性能与参数量、数据量、算力之间存在可预测的幂律关系[57] - 2022年11月30日,ChatGPT发布,五天获得一百万用户,两个月达到一亿月活,成为当时史上用户增长最快的消费级应用[59] 2023-2026年:从对话到智能体 - 2024年9月,OpenAI发布o1,把强化学习用在推理链条上,让模型在回答前先“想”得更久,这条“推理时扩展”路径让数学和代码能力出现阶跃[62] - 2024年10月,诺贝尔物理学奖授予约翰·霍普菲尔德和杰弗里·辛顿,化学奖授予戴维·贝克、德米斯·哈萨比斯和约翰·江珀[62] - 2025年1月,DeepSeek-R1发布,性能对标OpenAI o1,但训练成本低一个量级,且完全开源,改写了“必须靠堆算力才能追赶”的默认假设[65] - 2025年7月,OpenAI内部实验模型和谷歌DeepMind的Gemini Deep Think分别在国际数学奥林匹克(IMO)上达到金牌水平,六道题解出五道[65] - 2025年2月,MathArena评测还显示所有顶级模型在IMO真题上连铜牌线都够不着,五个月后达到金牌[66] - 2026年1月,清华主办的AGI-Next峰会上,与会专家表述竞争转向“能办事”的智能体,支撑判断包括:推理成本在两年内下降超过95%,让“每个业务流程配一个Agent”在经济上成立[69] - 到2026年年中,前沿实验室模型迭代周期从季度级压缩到月度级,百万级token上下文成为旗舰模型标配,模型控制电脑、执行长程任务、在协作工具里作为独立身份常驻都从演示变成付费功能[69] 七十年历史揭示的五件事 - 每一次寒冬都是因为承诺跑得比能力快,技术曲线是连续的,资金曲线是跳跃的,两者错位的地方就是寒冬[72] - 苦涩的教训:依赖人类知识的方法短期领先,但长期一定会被单纯利用算力扩展的通用方法超过,从符号规则输给统计学习到精心设计的架构输给更大的模型,这个剧本演了至少三遍[72] - 莫拉维克悖论仍然成立:对机器来说,通过智力测验或下棋这类“高级”任务相对容易,而一岁小孩的感知和运动能力却极难实现,今天的模型能拿IMO金牌,但让机器人稳定地叠好一件衬衫仍然是研究课题[73] - AI效应:一旦某件事成功了,就没人再管它叫AI了,语音识别、机器翻译、垃圾邮件过滤、人脸解锁、推荐系统都曾经是AI研究的最前沿,现在它们只是功能[73] - 路线之争从未真正结束:杨立昆公开质疑仅靠自回归语言模型无法通向真正的智能,主张世界模型;而缩放定律的信徒认为历史已反复证明押注规模的一方会赢[73] 关于AGI是否实现的判断 - 如果按1955年提案的标准(使用语言、形成抽象和概念、解决当时只有人类能解决的问题、自我改进),答案接近“是”,今天的系统在前三项上的表现会让麦卡锡他们目瞪口呆[75] - 如果按1965年西蒙的标准(机器能完成人所能做的任何工作),答案是明确的“否”,而且看不到日期[76] - 当“AGI已实现”这句话出自全球市值最高的公司掌门人之口,且发布时点紧贴财报和芯片订单预期,它就不再只是一个学术判断[76]