AI技术发展时间线 1943
人工智能技术发展时间线:从人工神经元到自主智能体(1943—2026)
# 人工智能技术发展时间线:从人工神经元到自主智能体(1943—2026)
更新日期:2026 年 8 月 22 日
范围:收录改变技术路线、产业形态或公众使用方式的主要节点。主体尽量同时标明公司/机构与核心个人;同一模型的小版本、纯跑分刷新和未形成后续影响的实验不单列。
一、理论奠基与人工智能诞生(1943—1959)
| 时间 | 主体(机构 / 个人) | 突破 | 实现了什么 |
|---|---|---|---|
| 1943 | 芝加哥大学 / 沃伦·麦卡洛克、沃尔特·皮茨 | 提出首个形式化人工神经元模型 | 用逻辑和数学描述神经元,证明神经网络可以表示逻辑运算,奠定连接主义基础。论文 |
| 1949 | 麦吉尔大学 / 唐纳德·赫布 | 提出赫布学习规则 | 用“共同激活就增强连接”解释学习,为后来的无监督学习、联想记忆和神经网络训练提供思想基础。 |
| 1950 | 曼彻斯特大学 / 艾伦·图灵 | 提出“机器能思考吗”与模仿游戏 | 把机器智能转化为可观察、可检验的人机对话问题,即后来所称的图灵测试。论文 |
| 1951 | 普林斯顿大学 / 马文·明斯基、迪恩·埃德蒙兹 | 建造 SNARC 神经网络机器 | 用约 40 个模拟神经元学习走迷宫,是早期可运行的神经网络硬件之一。 |
| 1955 | 达特茅斯会议提案 / 约翰·麦卡锡、马文·明斯基、纳撒尼尔·罗切斯特、克劳德·香农 | 正式提出“Artificial Intelligence”研究计划 | 将机器学习、语言、抽象、推理等问题统一为一个研究领域。原始提案 |
| 1956 | 兰德公司与卡内基理工 / 艾伦·纽厄尔、赫伯特·西蒙、克利夫·肖 | Logic Theorist | 首次让程序自动证明数学定理,确立“符号表示 + 搜索 + 推理”的经典 AI 路线。 |
| 1956 夏 | 达特茅斯学院会议 | 人工智能成为独立学科 | 研究者开始系统研究推理、学习、语言、视觉和智能机器,1956 通常被视为 AI 元年。 |
| 1957—1958 | 康奈尔航空实验室 / 弗兰克·罗森布拉特 | 感知机 Perceptron | 让机器从样本中自动调整权重,能够学习线性分类,是现代神经网络训练的直接前身。 |
| 1958 | MIT / 约翰·麦卡锡 | 发明 LISP | 提供适合符号处理、递归和程序生成的语言,长期成为 AI 研究主力工具。 |
| 1959 | IBM / 亚瑟·塞缪尔 | 跳棋程序与“机器学习”概念 | 程序通过自我对弈改进策略,展示机器不必逐条写规则也能从经验提升。 |
二、符号主义扩张、早期应用与第一次低潮(1960—1979)
| 时间 | 主体(机构 / 个人) | 突破 | 实现了什么 |
|---|---|---|---|
| 1961 | 通用汽车、Unimation / 乔治·德沃尔、约瑟夫·恩格尔伯格 | Unimate 投入生产线 | 第一代工业机器人进入汽车制造,机器自动化从实验室进入工厂。 |
| 1965 | 斯坦福大学 / 爱德华·费根鲍姆、布鲁斯·布坎南、约书亚·莱德伯格等 | DENDRAL 专家系统 | 将化学家的知识编码为规则,能根据质谱推断分子结构,证明“专业知识 + 推理机”可解决窄领域问题。 |
| 1966 | MIT / 约瑟夫·魏岑鲍姆 | ELIZA | 用模式匹配模拟心理咨询对话,第一次让公众直观感受到自然语言交互,同时暴露“像理解”不等于真正理解。 |
| 1966—1972 | SRI / 查尔斯·罗森团队 | Shakey 机器人 | 把视觉、环境建模、路径规划和动作控制组合起来,是首批能感知并规划行动的通用移动机器人。 |
| 1968 | 斯坦福大学 / 特里·维诺格拉德 | SHRDLU | 在积木世界中理解指令、回答问题并执行操作,展示受限世界里的语言理解与行动。 |
| 1969 | MIT / 马文·明斯基、西摩·派普特 | 《Perceptrons》分析单层感知机局限 | 指出 XOR 等问题无法由单层网络解决;在训练方法和算力尚未成熟时,连接主义研究明显降温。 |
| 1972 | 马赛大学 / 阿兰·科尔梅罗、菲利普·鲁塞尔 | Prolog | 以事实、规则和逻辑查询编程,推动知识表示、自然语言处理和专家系统。 |
| 1972—1976 | 斯坦福大学 / 爱德华·肖特利夫、布鲁斯·布坎南 | MYCIN | 用约 600 条规则辅助诊断细菌感染和建议抗生素,成为医学专家系统代表;因责任与集成问题未直接临床部署。 |
| 1973—1974 | 英国科学研究委员会 / 詹姆斯·莱特希尔等 | 研究评估与资助收缩 | 组合爆炸、算力不足、承诺过高导致项目削减,第一次“AI 寒冬”开始。 |
| 1970 年代后期 | 多所大学与企业 | 知识工程成为主线 | AI 从追求通用智能转向在封闭领域收集专家规则,以可解释的规则系统换取可用性。 |
三、专家系统商业化与神经网络复兴(1980—1999)
| 时间 | 主体(机构 / 个人) | 突破 | 实现了什么 |
|---|---|---|---|
| 1980 | 卡内基梅隆大学、DEC / 约翰·麦克德莫特 | XCON(R1)专家系统 | 自动配置计算机订单,显著降低人工配置成本,证明专家系统可以产生商业价值。 |
| 1982 | 加州理工学院 / 约翰·霍普菲尔德 | Hopfield 网络 | 用能量函数实现联想记忆和模式恢复,使神经网络重新获得理论关注。 |
| 1986 | 多伦多大学、UCSD / 大卫·鲁梅尔哈特、杰弗里·辛顿、罗纳德·威廉姆斯 | 反向传播推广 | 让多层神经网络能够高效计算梯度并学习内部表示,解决单层感知机无法解决的一类问题。论文 |
| 1987—1993 | AI 软件/硬件产业 | 第二次 AI 寒冬 | 专家系统维护成本高、规则脆弱,LISP 机器市场崩溃;产业认识到仅靠人工规则难以扩展。 |
| 1989—1998 | 贝尔实验室 / 杨立昆、莱昂·博图、帕特里克·哈夫纳等 | 卷积神经网络与 LeNet-5 | 通过局部连接、权重共享和反向传播识别手写数字,进入银行支票读取等真实业务。 |
| 1992 | IBM / 杰拉尔德·特索罗 | TD-Gammon | 用时序差分强化学习自我对弈,达到接近顶尖人类的西洋双陆棋水平,验证“试错 + 奖励”学习。 |
| 1995 | AT&T / Corinna Cortes、Vladimir Vapnik | 支持向量机成熟 | 在小样本、高维分类中表现强,成为深度学习爆发前最重要的统计学习方法之一。 |
| 1997 年 5 月 | IBM / 冯祥熙、Murray Campbell、A. Joseph Hoane Jr. 等 | Deep Blue 战胜国际象棋世界冠军卡斯帕罗夫 | 用专用硬件、搜索、评估函数和棋谱知识,在明确规则的大型搜索问题上超越人类冠军。 |
| 1997 | 慕尼黑工业大学 / Sepp Hochreiter、Jürgen Schmidhuber | LSTM | 通过门控记忆缓解循环网络的梯度消失,使长序列语音、文本和时间序列学习成为可能。论文 |
| 1998—1999 | 学术界与互联网企业 | 数据驱动方法取代大规模手写规则 | 随着网页、数字文本和日志增长,概率模型、统计学习与机器学习逐渐成为主流。 |
四、数据、GPU 与深度学习爆发前夜(2000—2011)
| 时间 | 主体(机构 / 个人) | 突破 | 实现了什么 |
|---|---|---|---|
| 2001 | UC Berkeley / Leo Breiman | 随机森林 | 通过多个决策树集成获得稳定、易用的分类和回归能力,成为长期使用的传统机器学习基线。 |
| 2004—2005 | DARPA;斯坦福大学 / Sebastian Thrun 团队 | 无人车 Grand Challenge | 2005 年 Stanley 完成长距离沙漠赛道,推动感知、定位、规划与控制集成。 |
| 2006 | 多伦多大学 / 杰弗里·辛顿、Simon Osindero、Yee-Whye Teh | 深度置信网络与逐层预训练 | 证明深层网络可以有效训练,“深度学习”重新成为研究中心。 |
| 2006—2007 | NVIDIA / Ian Buck 等 CUDA 团队 | GPU 通用并行计算 | 让研究者用显卡高吞吐训练矩阵密集型神经网络,后来成为大模型扩展的关键基础设施。 |
| 2007 | 斯坦福大学 / 吴恩达、Rajat Raina 等 | GPU 加速深度学习实验 | 展示 GPU 可把大型神经网络训练提速数十倍,明确了“更大数据 + 更大模型 + 并行计算”的路线。 |
| 2009 | 普林斯顿、斯坦福 / 李飞飞、贾邓等 | ImageNet 数据集 | 建立千万级、按 WordNet 组织的标注图片库,让视觉算法可以统一训练和公平比较。论文 |
| 2010 | ImageNet 团队 | ILSVRC 视觉竞赛 | 用年度公开基准持续推动图像分类、检测模型迭代,形成数据—基准—算法的进步循环。 |
| 2011 | IBM / David Ferrucci 团队 | Watson 赢得《Jeopardy!》 | 把问句分析、信息检索、证据评分和并行计算组合起来,在开放领域问答中击败人类冠军。 |
| 2011 | Apple / Siri 团队(源自 SRI) | 语音助手进入大众手机 | 把语音识别、自然语言理解和任务接口整合为消费级入口。 |
五、深度学习成为主流,Transformer 出现(2012—2017)
| 时间 | 主体(机构 / 个人) | 突破 | 实现了什么 |
|---|---|---|---|
| 2012 | 多伦多大学 / Alex Krizhevsky、Ilya Sutskever、Geoffrey Hinton | AlexNet | 用 GPU、ReLU、Dropout 和大型 CNN 大幅刷新 ImageNet,计算机视觉进入深度学习时代。论文 |
| 2013 | Google / Tomas Mikolov、Kai Chen、Greg Corrado、Jeff Dean | word2vec | 高效学习具有语义关系的词向量,让语言中的相似性和类比可用向量计算。论文 |
| 2013—2015 | DeepMind / Volodymyr Mnih、David Silver 等 | DQN 深度强化学习 | 将卷积网络与 Q-learning 结合,直接从像素学习多款 Atari 游戏,证明同一算法可跨任务学习控制策略。论文 |
| 2014 | Google / Ilya Sutskever、Oriol Vinyals、Quoc Le | Seq2Seq | 用编码器—解码器把任意长度输入映射为输出,推动端到端机器翻译和生成式 NLP。论文 |
| 2014 | 蒙特利尔大学 / Dzmitry Bahdanau、Kyunghyun Cho、Yoshua Bengio | 神经注意力机制 | 模型生成每个词时动态关注输入的相关部分,缓解固定长度表示瓶颈。 |
| 2014 | 蒙特利尔大学 / Ian Goodfellow、Yoshua Bengio 等 | GAN | 让生成器与判别器对抗训练,显著推动逼真图像生成、风格迁移和数据合成。论文 |
| 2015 | 微软亚洲研究院 / 何恺明、张祥雨、任少卿、孙剑 | ResNet | 用残差连接稳定训练百层以上网络,成为视觉模型和后来多种深层架构的基础组件。论文 |
| 2015 | Google Brain / TensorFlow 团队 | TensorFlow 开源 | 降低训练和部署神经网络的工程门槛,加速深度学习产业化。 |
| 2016 年 3 月 | DeepMind / Demis Hassabis、David Silver、Aja Huang 等 | AlphaGo 击败李世石 | 结合策略网络、价值网络、蒙特卡洛树搜索与自我对弈,在围棋这一超大搜索空间中达到超人水平。论文 |
| 2016 | DeepMind / Aaron van den Oord 等 | WaveNet | 直接生成原始音频波形,显著提高语音合成自然度,也影响后续音乐和音频生成。 |
| 2016 | Google / Yonghui Wu、Quoc Le、Jeff Dean 等 GNMT 团队 | 神经机器翻译规模化 | 端到端神经网络开始替代传统统计机器翻译,AI 首次大规模改变日常语言服务。 |
| 2017 | Meta AI / PyTorch 团队 | PyTorch 开源成熟 | 动态计算图和 Python 化接口提升研究效率,后来成为大模型研究与训练主流框架之一。 |
| 2017 年 6 月 | Google Brain / Ashish Vaswani、Noam Shazeer、Niki Parmar、Jakob Uszkoreit、Llion Jones、Aidan Gomez、Łukasz Kaiser、Illia Polosukhin | Transformer | 完全以自注意力建模序列,可并行训练、扩展到超大数据和参数规模,成为现代大语言模型、多模态模型的核心架构。论文 |
| 2017 | DeepMind / David Silver 等 | AlphaZero | 只给规则、通过自我对弈掌握围棋、国际象棋和将棋,显示通用学习算法可减少人工领域知识。 |
六、基础模型与生成式 AI 成形(2018—2022)
| 时间 | 主体(机构 / 个人) | 突破 | 实现了什么 |
|---|---|---|---|
| 2018 年 6 月 | OpenAI / Alec Radford、Ilya Sutskever 等 | GPT-1 | 先用海量文本做生成式预训练,再用少量标注微调,确立 GPT 路线。官方说明 |
| 2018 年 10 月 | Google / Jacob Devlin、Ming-Wei Chang、Kenton Lee、Kristina Toutanova | BERT | 用双向 Transformer 预训练理解上下文,刷新大量自然语言理解任务并普及“预训练 + 微调”。论文 |
| 2018 | DeepMind / John Jumper、Demis Hassabis 团队 | AlphaFold 1 | 在 CASP13 蛋白结构预测竞赛领先,证明深度学习可以解决高价值科学问题。 |
| 2019 年 2 月 | OpenAI / Alec Radford、Jeff Wu 等 | GPT-2 | 展示大规模语言模型可在少量或无任务训练下生成连贯长文本,社会开始重视生成滥用风险。官方说明 |
| 2019 | Google / Colin Raffel 等 | T5 | 把翻译、摘要、分类、问答统一为“文本到文本”,推动任务统一化。 |
| 2020 年 1 月 | OpenAI / Jared Kaplan 等 | 神经语言模型 Scaling Laws | 量化模型规模、数据量、计算量与损失的关系,使大模型训练从经验放大走向可预测扩展。 |
| 2020 年 5 月 | OpenAI / Tom Brown 等 | GPT-3(1750 亿参数) | 通过上下文示例完成翻译、问答、写作和代码等任务,展示少样本与提示学习。论文 |
| 2020 | UC Berkeley / Jonathan Ho、Ajay Jain、Pieter Abbeel | DDPM 扩散模型 | 用逐步加噪与去噪生成高质量图像,后来成为主流图像、视频和音频生成底座。论文 |
| 2020 | Meta AI、UCL / Patrick Lewis 等 | RAG(检索增强生成) | 让生成模型先检索外部知识再回答,为企业知识库、可更新问答和带来源回答奠定基础。 |
| 2020—2021 | DeepMind / John Jumper、Demis Hassabis、AlphaFold 团队 | AlphaFold 2 | 将蛋白质三维结构预测准确度推向接近实验可用水平,并通过数据库开放大量预测结果。官方项目 |
| 2021 年 1 月 | OpenAI / Aditya Ramesh 等 | DALL·E | 把自然语言直接转成新图像,文本到图像生成进入公众视野。官方说明 |
| 2021 年 1 月 | OpenAI / Alec Radford 等 | CLIP | 用海量图文对学习开放词汇视觉概念,使图像理解可由自然语言驱动。官方说明 |
| 2021 | OpenAI、GitHub、Microsoft / Codex 与 Copilot 团队 | AI 编程助手产品化 | 模型从代码补全扩展到按自然语言生成函数,生成式 AI 首先在软件开发中形成规模化付费场景。 |
| 2022 年 1 月 | Google Brain / Jason Wei 等 | Chain-of-Thought 提示 | 让大模型生成中间推理步骤,显著改善算术、常识和符号推理。论文 |
| 2022 年 1 月 | OpenAI / Long Ouyang、Jan Leike 等 | InstructGPT 与 RLHF | 用人类示范和偏好排序训练模型遵循指令,解决“会续写但不好用”的关键产品问题。官方说明 |
| 2022 年 3—4 月 | DeepMind / Jordan Hoffmann 等;Google / Aakanksha Chowdhery 等 | Chinchilla 与 PaLM | Chinchilla 指出参数和训练数据应更合理配比;PaLM 展示大规模稠密 Transformer 的能力涌现,训练方法从只堆参数转向重视数据与计算最优。 |
| 2022 年 4 月 | OpenAI / DALL·E 团队 | DALL·E 2 | 扩散模型显著提升图像写实度、编辑和变体生成。官方说明 |
| 2022 年 8 月 | Stability AI、CompVis、Runway / Robin Rombach 等 | Stable Diffusion 开放发布 | 潜空间扩散显著降低图像生成算力,开放权重让个人电脑、本地部署和创作生态快速扩张。官方发布 |
| 2022 年 9 月 | OpenAI / Whisper 团队 | Whisper | 用 68 万小时多语言、多任务数据训练通用语音识别模型,并开放权重,显著降低转写与翻译门槛。官方说明 |
| 2022 年 11 月 30 日 | OpenAI / ChatGPT 团队 | ChatGPT | 将对话界面、指令微调与 RLHF 结合,把大模型从研究/API 变成普通人可直接使用的通用助手。官方发布 |
七、大模型竞赛转向多模态、长上下文和开放生态(2023)
| 时间 | 主体(机构 / 个人) | 突破 | 实现了什么 |
|---|---|---|---|
| 2023 年 2 月 | Meta / Yann LeCun 团队 | LLaMA | 用更高质量数据训练一组较小但有竞争力的基础模型,推动开放研究与本地大模型生态。 |
| 2023 年 3 月 14 日 | OpenAI / GPT-4 团队 | GPT-4 | 接受文本和图像输入,在专业考试、复杂推理、编程与指令遵循上明显提高,确立多模态大模型方向。官方报告 |
| 2023 年 3 月 | Anthropic / Dario Amodei、Daniela Amodei 及 Claude 团队 | Claude 对外发布 | 以 Constitutional AI 和长文本处理为特色,形成与 OpenAI 并列的通用模型路线。官方发布 |
| 2023 年 3—6 月 | OpenAI 与开发者生态 | ChatGPT Plugins、函数调用 | 模型开始连接搜索、数据库、计算器与第三方服务,从“生成答案”走向“调用工具完成动作”。 |
| 2023 年 7 月 | Meta、Microsoft | Llama 2 | 公开预训练与对话模型权重并允许多数商业用途,开放权重大模型进入企业和开发者主流。官方发布 |
| 2023 年 7 月 | Anthropic | Claude 2 | 提升推理、编程与长文档能力,长上下文成为模型竞争的重要维度。官方发布 |
| 2023 年 8 月 | Meta / Code Llama 团队 | Code Llama | 在 Llama 2 上专门训练代码生成、补全与指令能力,开放代码模型快速普及。官方发布 |
| 2023 年 9 月 | Mistral AI / Arthur Mensch、Guillaume Lample、Timothée Lacroix 团队 | Mistral 7B | 用较小参数和高效注意力取得强性能,证明开放小模型可以兼顾成本、速度与本地部署。 |
| 2023 年 9—11 月 | OpenAI / DALL·E 3、GPT-4 Turbo 团队 | 更强图像生成、128K 上下文与 JSON/函数调用 | 大模型开始可靠地产生结构化输出,图像生成也能更准确理解复杂自然语言提示。 |
| 2023 年 11 月 | Anthropic | Claude 2.1 | 200K 上下文、较低幻觉率和工具调用测试版,使超长文档分析与企业流程更可行。官方发布 |
| 2023 年 12 月 | Google DeepMind / Demis Hassabis、Jeff Dean、Gemini 团队 | Gemini 1.0 | 从设计上统一文本、图像、音频和视频理解,Google 正式进入原生多模态基础模型竞赛。 |
| 2023 全年 | 阿里云 / Qwen 团队;DeepSeek 团队等 | 中国开放模型体系形成 | 通义千问、DeepSeek Coder 等持续开放权重,中文、代码和本地部署能力迅速提升,全球竞争不再只有美国闭源模型。 |
八、推理模型、实时多模态与工具协议出现(2024)
| 时间 | 主体(机构 / 个人) | 突破 | 实现了什么 |
|---|---|---|---|
| 2024 年 2 月 | Google DeepMind / Gemini 团队 | Gemini 1.5 | 采用 MoE 等技术,把可用上下文扩展到百万级,能处理大型代码库、长视频和大量文档。 |
| 2024 年 2 月 15 日 | OpenAI / Sora 团队 | Sora 研究预览 | 用扩散 Transformer 和时空 patch 生成最长约一分钟视频,视频生成开始呈现长时一致性与简单世界模拟能力。技术报告 |
| 2024 年 3 月 | Anthropic | Claude 3(Haiku、Sonnet、Opus) | 统一文本和视觉输入,覆盖低延迟到高性能档位,模型服务开始明确分层。官方发布 |
| 2024 年 4 月 | Meta | Llama 3 | 以更大训练数据和改进后训练提升开放模型通用能力,开放权重与闭源前沿模型差距继续缩小。官方发布 |
| 2024 年 5 月 13 日 | OpenAI | GPT-4o | 在一个低延迟系统中处理文本、视觉和语音,支持近实时自然对话,多模态从“分别调用模型”走向统一交互。官方发布 |
| 2024 年 6 月 | Anthropic | Claude 3.5 Sonnet 与 Artifacts | 提升代码、视觉和推理,并把生成结果放进可迭代工作区,AI 从聊天框向协作界面发展。官方发布 |
| 2024 年 7 月 | Meta | Llama 3.1 405B | 发布 405B 开放权重模型,支持 128K、工具调用与多语言,把开放模型推到前沿大模型规模。官方发布 |
| 2024 年 9 月 | OpenAI / o1 团队 | o1 推理模型 | 在回答前使用更多推理时计算,显著提升数学、科学和编程问题表现,行业从“预训练扩展”转向“训练 + 推理时扩展”。官方说明 |
| 2024 年 9 月 | Meta | Llama 3.2 | 发布视觉模型以及 1B/3B 端侧模型,覆盖云端多模态和手机本地 AI。官方发布 |
| 2024 年 10 月 | Anthropic | Computer Use 测试版 | 模型能看屏幕、移动鼠标、点击和输入,首次以通用 GUI 操作为公开模型能力。官方发布 |
| 2024 年 10 月 | OpenAI | ChatGPT Search | 把实时网页检索、答案生成和来源链接整合进对话,通用助手开始直接竞争搜索入口。官方发布 |
| 2024 年 11 月 | Anthropic / David Soria Parra、Justin Spahr-Summers 等 | Model Context Protocol(MCP) | 定义 AI 应用连接数据源和工具的开放协议,减少每个模型与每个系统单独集成的重复工作。官方发布 |
| 2024 年 12 月 | Google DeepMind | Gemini 2.0 | 强化原生工具调用、实时多模态和智能体能力,模型从回答器进一步转为可执行系统。 |
| 2024 年 12 月 | DeepSeek / 梁文锋与 DeepSeek 团队 | DeepSeek-V3 | 以 MoE 和高效训练实现强通用、代码和数学能力并开放模型,显著改变高性能大模型的成本预期。官方发布 |
| 2024 年 12 月 | OpenAI | Sora Turbo 产品化 | 文生视频从研究预览进入可用产品,支持文本、图像、视频输入和故事板编辑;同时仍存在物理错误和长时一致性限制。官方发布 |
九、从“会回答”转向“会推理、会用工具、能持续执行”(2025)
| 时间 | 主体(机构 / 个人) | 突破 | 实现了什么 |
|---|---|---|---|
| 2025 年 1 月 20 日 | DeepSeek / DeepSeek-R1 团队 | DeepSeek-R1 | 用强化学习强化长链推理,开放模型与蒸馏版本,推动高水平推理模型低成本化和本地化。官方发布 |
| 2025 年 1 月 23 日 | OpenAI / Operator、CUA 团队 | Operator 与 Computer-Using Agent | 模型通过视觉界面点击、输入和滚动网页,能执行预订、填表等浏览器任务。官方发布 |
| 2025 年 2 月 | OpenAI | Deep Research | 智能体可连续搜索、阅读和综合大量网页与文件,生成带来源的研究报告,研究流程开始自动化。官方发布 |
| 2025 年 2 月 24 日 | Anthropic | Claude 3.7 Sonnet、Claude Code | 把快速回答与扩展推理合并为混合模型,并推出能读代码库、改文件、运行命令的终端编程智能体。官方发布 |
| 2025 年 2 月 27 日 | OpenAI | GPT-4.5 | 通过更大规模预训练提高知识、写作、自然对话和模式识别,说明“直觉型预训练”仍与推理模型并行发展。官方发布 |
| 2025 年 3 月 | OpenAI | Responses API、Web Search、File Search、Computer Use、Agents SDK | 把模型、工具、追踪和智能体编排整合为开发平台,企业可构建可观察的任务代理。官方发布 |
| 2025 年 4 月 | Meta | Llama 4 Scout、Maverick | 采用 MoE、原生多模态和长上下文,在开放权重体系中引入更高效的专家混合架构。官方发布 |
| 2025 年 4 月 | OpenAI | o3、o4-mini | 推理模型能够在推理过程中自主调用网页、代码执行、文件和图像工具,并对图像进行推理。官方发布 |
| 2025 年 4 月 29 日 | 阿里云 / Qwen 团队 | Qwen3 | 在单一模型中支持思考/非思考模式,并开放稠密与 MoE 权重,强化多语言、数学、代码和智能体能力。官方发布 |
| 2025 年 5 月 | OpenAI / Codex 团队 | 云端 Codex 软件工程智能体 | 每个任务在隔离环境中读代码、修改、运行测试并提交结果,可并行处理多个工程任务。官方发布 |
| 2025 年 5 月 22 日 | Anthropic | Claude Opus 4、Sonnet 4 | 面向长时间编码、工具使用和智能体任务优化,编程助手开始承担跨文件、跨步骤工作。官方发布 |
| 2025 年 6 月 | MiniMax / 闫俊杰与 MiniMax 团队 | MiniMax-M1 | 开放混合注意力推理模型,提供百万级上下文和超长推理输出,推动长上下文推理的成本竞争。官方发布 |
| 2025 年 7 月 9 日 | xAI / Elon Musk、Grok 团队 | Grok 4 | 强化实时搜索、代码执行和原生工具使用,前沿模型竞争扩大到实时信息与智能体执行。官方发布 |
| 2025 年 7 月 17 日 | OpenAI | ChatGPT Agent | 合并浏览、研究、终端、文件和动作能力,可在用户监督下完成多步骤在线任务。官方发布 |
| 2025 年 7 月 22 日 | 阿里云 / Qwen 团队 | Qwen3-Coder、Qwen Code | 以 MoE、256K 原生上下文和工具调用面向仓库级智能体编程,开放代码智能体进入主流。官方发布 |
| 2025 年 8 月 5 日 | OpenAI | gpt-oss-120b、gpt-oss-20b | 以 Apache 2.0 发布开放权重推理模型,支持工具调用并可在较低成本硬件部署。官方发布 |
| 2025 年 8 月 7 日 | OpenAI | GPT-5 | 用路由系统统一快速回答与深度推理,加强编码、视觉、写作和工具调用,通用模型从单一网络走向“模型系统”。官方发布 |
| 2025 年 8 月 21 日 | DeepSeek | DeepSeek-V3.1 | 一个模型同时提供思考与非思考模式,继续训练长上下文并强化工具调用、多步智能体任务。官方发布 |
| 2025 年 8 月 28 日 | OpenAI | gpt-realtime | 将低延迟语音到语音、图像输入、电话 SIP 与 MCP 接入生产 API,实时语音智能体可以直接服务客户。官方发布 |
| 2025 年 9 月 | Anthropic | Claude Sonnet 4.5 | 进一步强化长时间编码、计算机操作和智能体可靠性,持续执行成为前沿模型核心指标。官方发布 |
| 2025 年 9 月 | OpenAI | Sora 2 | 视频模型加入同步对白与音效、增强物理一致性和可控性,生成媒介从无声短片走向视听一体;Sora 产品于 2026 年 4 月 26 日停止提供。官方发布 |
| 2025 年 10 月 | Anthropic | Agent Skills | 将说明、脚本和资源封装成可复用技能包,智能体能力开始以模块化方式分发。官方发布 |
| 2025 年 10 月 | OpenAI | AgentKit | 提供智能体构建、连接器、评估和部署组件,企业智能体工程从拼装 API 转向完整工具链。官方发布 |
| 2025 年 11 月 | Google DeepMind | Gemini 3 | 强化多模态推理、智能体编程和复杂任务执行,Google 模型体系进入以行动为中心的新一代。官方发布 |
| 2025 年 12 月 1 日 | DeepSeek | DeepSeek-V3.2、V3.2-Speciale | 把思考直接整合进工具使用,并以大规模智能体环境合成数据训练多步执行。官方发布 |
| 2025 年 12 月 11 日 | OpenAI | GPT-5.2 | 面向专业知识工作、长上下文、文档处理和长时间智能体任务优化,模型开始直接交付工作成果而非只给建议。官方发布 |
十、长时自主工作、端到端知识生产与具身智能(2026,截至 8 月 22 日)
| 时间 | 主体(机构 / 个人) | 突破 | 实现了什么 |
|---|---|---|---|
| 2026 年 2 月 5 日 | OpenAI | GPT-5.3-Codex | 将前沿编码、计算机操作和长期任务执行合并,面向完整软件工程生命周期持续工作。官方发布 |
| 2026 年 2 月 5 日 | Anthropic | Claude Opus 4.6 | 提升编码、规划、长任务和智能体能力,并测试百万级上下文,面向大型代码库和复杂工作流。官方发布 |
| 2026 年 2 月 17 日 | Anthropic | Claude Sonnet 4.6 | 把更强推理、代码和工具使用下放到更高性价比模型,智能体能力开始普及而非只存在于旗舰型号。官方发布 |
| 2026 年 2 月 | Google DeepMind | Gemini 3.1 Pro、Gemini 3 Deep Think | 强化原生多模态、复杂科学与抽象推理,可处理大型代码库、多文档和复合视觉材料。官方发布 |
| 2026 年 3 月 5 日 | OpenAI | GPT-5.4 | 面向专业工作、编码、智能体和可交付成果生成,把研究、分析、设计和软件执行进一步统一。官方发布 |
| 2026 年 4 月 21 日 | OpenAI | ChatGPT Images 2.0 | 加强图像内文字、编辑一致性与精确控制,图像模型更接近可反复修改的设计工具。官方发布 |
| 2026 年 4 月 21 日 | Google DeepMind | 新一代 Gemini Deep Research | 支持更长时间的自主研究、MCP 数据连接和可视化输出,从网页综述迈向多工具研究工作流。官方发布 |
| 2026 年 4 月 23 日 | OpenAI | GPT-5.5 | 提升百万级上下文、编码、研究、数据分析、文档/表格制作和计算机操作,可持续跨工具完成模糊的复合任务。官方发布 |
| 2026 年 4 月 24 日 | DeepSeek | DeepSeek-V4 Preview | 开放 MoE 模型扩展到百万级上下文并针对智能体优化,继续降低长期任务和私有部署门槛。官方发布 |
| 2026 年 5 月 | Google DeepMind | Gemini 3.5 Flash | 在较低延迟下提供前沿推理、代码、交互界面生成和智能体执行,实时应用能力提升。官方发布 |
| 2026 年 5 月 25 日 | xAI | Grok Build CLI | 推出终端软件工程智能体,能理解代码库、修改文件、运行命令并迭代验证。官方发布 |
| 2026 年 5 月 28 日 | Anthropic | Claude Opus 4.8 | 强化编码、计算机使用、长时智能体与自我校验,前沿模型竞争转向可靠完成整段工作。官方发布 |
| 2026 年 6 月 30 日 | Anthropic | Claude Sonnet 5 | 更主动地规划、调用浏览器和终端并保持任务进度,中型成本模型也能承担较长的自主任务。官方发布 |
| 2026 年 7 月 8 日 | OpenAI | GPT-Live | 新一代实时语音模型提高自然度、打断处理和工具衔接,语音智能体更接近连续人机协作。官方发布 |
| 2026 年 7 月 9 日 | OpenAI | GPT-5.6 | 继续提升推理、设计、软件工程、科研和端到端知识工作能力,重点从回答质量转向完整成果质量。官方发布 |
| 2026 年 7 月 16 日 | xAI | Grok 4.5 | 加强工具使用、实时信息和复杂执行,与通用聊天模型并行发展为行动型模型。官方发布 |
| 2026 年 7 月 21 日 | Google DeepMind | Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber | 形成高性能、低成本和网络安全专用模型组合,模型部署从“一个通用型号”转向按任务分层。官方发布 |
| 2026 年 7 月 24 日 | Anthropic | Claude Opus 5 | 进一步提高复杂编码、工具编排和长时自主执行,旗舰模型成为通用数字工作执行器。官方发布 |
| 2026 年 7 月 30 日 | Google DeepMind | Gemini Robotics 2、Robotics-ER 2 | 将视觉理解、任务编排、全身控制、灵巧操作和多机器人协作连接起来,AI 从屏幕内智能体向物理执行扩展。官方发布 |
| 2026 年 8 月 12 日 | xAI | Grok 4.6 | 强化长时间智能体、交互式成果和视觉工作,强调持续执行而非单轮回答。官方发布 |
| 2026 年 8 月 13 日 | Google / Gemini 团队 | Gemini 3.7 Flash | 以更低延迟和成本加强编码、长时软件工程、文档理解、网页开发和多步工具调用,面向大规模生产智能体。官方发布 |
| 2026 年 8 月 13 日 | DeepSeek | DeepSeek-V4 Pro | 在 V4 基础上增强生产级智能体、可调推理强度与 Responses API/Codex 兼容,开放模型进一步进入真实工作流。官方发布 |
| 2026 年 8 月 21 日 | DeepSeek | DeepSeek-V4-Flash-Vision-Exp | 为 V4 Flash 增加图像输入与多模态 API,DeepSeek 的开放智能体路线由文本、代码扩展到视觉理解。官方发布 |
截至 2026 年 8 月,AI 到了什么水平
| 能力领域 | 当前水平 | 仍然做不到或不可靠的部分 |
|---|---|---|
| 语言与推理 | 能处理复杂写作、数学、代码、法律/商业材料和多步分析;前沿模型会按任务自动选择快速回答或深度推理。 | 仍会幻觉、误引、偷换条件;高分不等于稳定掌握真理,关键结论仍需来源、计算或专家复核。 |
| 多模态 | 可统一理解文本、图片、图表、PDF、语音和视频;可生成并编辑图像、音频、音乐、语音和视频。 | 长视频一致性、精确空间关系、真实物理、人物身份连续性与版权边界仍不完全可靠。 |
| 软件工程 | 可理解大型代码库,规划改动,编辑多文件,运行测试,修复错误并提交 PR;多个智能体可并行工作。 | 模糊需求、遗留系统、隐性业务规则和高风险上线仍需资深工程师监督。 |
| 搜索与研究 | 可持续浏览、比较多来源、运行代码分析数据,并生成带引用的研究报告。 | 来源可能遗漏或误读,互联网本身存在错误;原创科学结论仍需要实验、同行评议和可复现验证。 |
| 计算机操作 | 能看屏幕并操作浏览器、终端、办公软件和部分企业系统,可跨工具完成完整流程。 | 页面变化、权限、验证码、提示注入和异常分支会造成失败;涉及付款、删除、发送和发布必须保留人类确认。 |
| 长上下文与记忆 | 部分模型支持百万级上下文,并能通过检索、压缩和外部记忆处理大型项目。 | “看得下”不等于“每处都记得准”;长期一致性和跨会话记忆仍依赖工程系统。 |
| 开放与本地模型 | 开放权重模型已具备强推理、代码和工具调用能力;小模型可在个人电脑、手机和边缘设备运行。 | 最强模型训练和高并发推理仍需要昂贵集群;本地模型通常在复杂推理和稳定性上弱于前沿云模型。 |
| 机器人 | 已能完成视觉理解、语言规划、灵巧抓取、全身动作和受控环境中的多机器人协作。 | 尚未形成可在任意家庭、工厂和公共空间长期安全工作的通用机器人,真实世界数据与安全是主要瓶颈。 |
| 自主性 | AI 已从聊天助手发展为能规划、调用工具、检查结果、持续数十分钟到数小时的数字智能体。 | 还不是可以无条件托管目标的“完全自主员工”;任务越长,错误累积、权限和安全风险越高。 |
**结论:**截至 2026 年 8 月,AI 已进入“多模态推理模型 + 工具调用 + 长时智能体 + 物理机器人”的阶段。它在大量知识工作上达到高水平助理或局部专家水平,并能直接产出代码、研究、文档、设计和操作结果;但尚无被学术界与产业界共同验证的通用人工智能(AGI),更不存在可以在开放世界中长期、稳定、低风险地替代人类判断的系统。
技术主线
形式化神经元 → 符号推理 → 专家系统 → 统计机器学习 → 深度学习 → Transformer → 基础模型 → 生成式多模态 → 推理模型 → 工具协议与计算机操作 → 长时自主智能体 → 具身智能。