---
doc_id: AIK-007
title: "AI技术发展时间线_1943"
owner: 文档治理团队
approver: 业务与技术负责人
status: active
version: 1.0.0
classification: internal
last_reviewed: 2026-08-25
next_review: 2027-02-21
---

# 人工智能技术发展时间线：从人工神经元到自主智能体（1943—2026）

**更新日期：2026 年 8 月 22 日**

> 范围：收录改变技术路线、产业形态或公众使用方式的主要节点。主体尽量同时标明公司/机构与核心个人；同一模型的小版本、纯跑分刷新和未形成后续影响的实验不单列。

## 一、理论奠基与人工智能诞生（1943—1959）

| 时间 | 主体（机构 / 个人） | 突破 | 实现了什么 |
|---|---|---|---|
| 1943 | 芝加哥大学 / 沃伦·麦卡洛克、沃尔特·皮茨 | 提出首个形式化人工神经元模型 | 用逻辑和数学描述神经元，证明神经网络可以表示逻辑运算，奠定连接主义基础。[论文](https://doi.org/10.1007/BF02478259) |
| 1949 | 麦吉尔大学 / 唐纳德·赫布 | 提出赫布学习规则 | 用“共同激活就增强连接”解释学习，为后来的无监督学习、联想记忆和神经网络训练提供思想基础。 |
| 1950 | 曼彻斯特大学 / 艾伦·图灵 | 提出“机器能思考吗”与模仿游戏 | 把机器智能转化为可观察、可检验的人机对话问题，即后来所称的图灵测试。[论文](https://academic.oup.com/mind/article/LIX/236/433/986238) |
| 1951 | 普林斯顿大学 / 马文·明斯基、迪恩·埃德蒙兹 | 建造 SNARC 神经网络机器 | 用约 40 个模拟神经元学习走迷宫，是早期可运行的神经网络硬件之一。 |
| 1955 | 达特茅斯会议提案 / 约翰·麦卡锡、马文·明斯基、纳撒尼尔·罗切斯特、克劳德·香农 | 正式提出“Artificial Intelligence”研究计划 | 将机器学习、语言、抽象、推理等问题统一为一个研究领域。[原始提案](https://jmc.stanford.edu/articles/dartmouth.html) |
| 1956 | 兰德公司与卡内基理工 / 艾伦·纽厄尔、赫伯特·西蒙、克利夫·肖 | Logic Theorist | 首次让程序自动证明数学定理，确立“符号表示 + 搜索 + 推理”的经典 AI 路线。 |
| 1956 夏 | 达特茅斯学院会议 | 人工智能成为独立学科 | 研究者开始系统研究推理、学习、语言、视觉和智能机器，1956 通常被视为 AI 元年。 |
| 1957—1958 | 康奈尔航空实验室 / 弗兰克·罗森布拉特 | 感知机 Perceptron | 让机器从样本中自动调整权重，能够学习线性分类，是现代神经网络训练的直接前身。 |
| 1958 | MIT / 约翰·麦卡锡 | 发明 LISP | 提供适合符号处理、递归和程序生成的语言，长期成为 AI 研究主力工具。 |
| 1959 | IBM / 亚瑟·塞缪尔 | 跳棋程序与“机器学习”概念 | 程序通过自我对弈改进策略，展示机器不必逐条写规则也能从经验提升。 |

## 二、符号主义扩张、早期应用与第一次低潮（1960—1979）

| 时间 | 主体（机构 / 个人） | 突破 | 实现了什么 |
|---|---|---|---|
| 1961 | 通用汽车、Unimation / 乔治·德沃尔、约瑟夫·恩格尔伯格 | Unimate 投入生产线 | 第一代工业机器人进入汽车制造，机器自动化从实验室进入工厂。 |
| 1965 | 斯坦福大学 / 爱德华·费根鲍姆、布鲁斯·布坎南、约书亚·莱德伯格等 | DENDRAL 专家系统 | 将化学家的知识编码为规则，能根据质谱推断分子结构，证明“专业知识 + 推理机”可解决窄领域问题。 |
| 1966 | MIT / 约瑟夫·魏岑鲍姆 | ELIZA | 用模式匹配模拟心理咨询对话，第一次让公众直观感受到自然语言交互，同时暴露“像理解”不等于真正理解。 |
| 1966—1972 | SRI / 查尔斯·罗森团队 | Shakey 机器人 | 把视觉、环境建模、路径规划和动作控制组合起来，是首批能感知并规划行动的通用移动机器人。 |
| 1968 | 斯坦福大学 / 特里·维诺格拉德 | SHRDLU | 在积木世界中理解指令、回答问题并执行操作，展示受限世界里的语言理解与行动。 |
| 1969 | MIT / 马文·明斯基、西摩·派普特 | 《Perceptrons》分析单层感知机局限 | 指出 XOR 等问题无法由单层网络解决；在训练方法和算力尚未成熟时，连接主义研究明显降温。 |
| 1972 | 马赛大学 / 阿兰·科尔梅罗、菲利普·鲁塞尔 | Prolog | 以事实、规则和逻辑查询编程，推动知识表示、自然语言处理和专家系统。 |
| 1972—1976 | 斯坦福大学 / 爱德华·肖特利夫、布鲁斯·布坎南 | MYCIN | 用约 600 条规则辅助诊断细菌感染和建议抗生素，成为医学专家系统代表；因责任与集成问题未直接临床部署。 |
| 1973—1974 | 英国科学研究委员会 / 詹姆斯·莱特希尔等 | 研究评估与资助收缩 | 组合爆炸、算力不足、承诺过高导致项目削减，第一次“AI 寒冬”开始。 |
| 1970 年代后期 | 多所大学与企业 | 知识工程成为主线 | AI 从追求通用智能转向在封闭领域收集专家规则，以可解释的规则系统换取可用性。 |

## 三、专家系统商业化与神经网络复兴（1980—1999）

| 时间 | 主体（机构 / 个人） | 突破 | 实现了什么 |
|---|---|---|---|
| 1980 | 卡内基梅隆大学、DEC / 约翰·麦克德莫特 | XCON（R1）专家系统 | 自动配置计算机订单，显著降低人工配置成本，证明专家系统可以产生商业价值。 |
| 1982 | 加州理工学院 / 约翰·霍普菲尔德 | Hopfield 网络 | 用能量函数实现联想记忆和模式恢复，使神经网络重新获得理论关注。 |
| 1986 | 多伦多大学、UCSD / 大卫·鲁梅尔哈特、杰弗里·辛顿、罗纳德·威廉姆斯 | 反向传播推广 | 让多层神经网络能够高效计算梯度并学习内部表示，解决单层感知机无法解决的一类问题。[论文](https://www.nature.com/articles/323533a0) |
| 1987—1993 | AI 软件/硬件产业 | 第二次 AI 寒冬 | 专家系统维护成本高、规则脆弱，LISP 机器市场崩溃；产业认识到仅靠人工规则难以扩展。 |
| 1989—1998 | 贝尔实验室 / 杨立昆、莱昂·博图、帕特里克·哈夫纳等 | 卷积神经网络与 LeNet-5 | 通过局部连接、权重共享和反向传播识别手写数字，进入银行支票读取等真实业务。 |
| 1992 | IBM / 杰拉尔德·特索罗 | TD-Gammon | 用时序差分强化学习自我对弈，达到接近顶尖人类的西洋双陆棋水平，验证“试错 + 奖励”学习。 |
| 1995 | AT&T / Corinna Cortes、Vladimir Vapnik | 支持向量机成熟 | 在小样本、高维分类中表现强，成为深度学习爆发前最重要的统计学习方法之一。 |
| 1997 年 5 月 | IBM / 冯祥熙、Murray Campbell、A. Joseph Hoane Jr. 等 | Deep Blue 战胜国际象棋世界冠军卡斯帕罗夫 | 用专用硬件、搜索、评估函数和棋谱知识，在明确规则的大型搜索问题上超越人类冠军。 |
| 1997 | 慕尼黑工业大学 / Sepp Hochreiter、Jürgen Schmidhuber | LSTM | 通过门控记忆缓解循环网络的梯度消失，使长序列语音、文本和时间序列学习成为可能。[论文](https://ieeexplore.ieee.org/abstract/document/6795963) |
| 1998—1999 | 学术界与互联网企业 | 数据驱动方法取代大规模手写规则 | 随着网页、数字文本和日志增长，概率模型、统计学习与机器学习逐渐成为主流。 |

## 四、数据、GPU 与深度学习爆发前夜（2000—2011）

| 时间 | 主体（机构 / 个人） | 突破 | 实现了什么 |
|---|---|---|---|
| 2001 | UC Berkeley / Leo Breiman | 随机森林 | 通过多个决策树集成获得稳定、易用的分类和回归能力，成为长期使用的传统机器学习基线。 |
| 2004—2005 | DARPA；斯坦福大学 / Sebastian Thrun 团队 | 无人车 Grand Challenge | 2005 年 Stanley 完成长距离沙漠赛道，推动感知、定位、规划与控制集成。 |
| 2006 | 多伦多大学 / 杰弗里·辛顿、Simon Osindero、Yee-Whye Teh | 深度置信网络与逐层预训练 | 证明深层网络可以有效训练，“深度学习”重新成为研究中心。 |
| 2006—2007 | NVIDIA / Ian Buck 等 CUDA 团队 | GPU 通用并行计算 | 让研究者用显卡高吞吐训练矩阵密集型神经网络，后来成为大模型扩展的关键基础设施。 |
| 2007 | 斯坦福大学 / 吴恩达、Rajat Raina 等 | GPU 加速深度学习实验 | 展示 GPU 可把大型神经网络训练提速数十倍，明确了“更大数据 + 更大模型 + 并行计算”的路线。 |
| 2009 | 普林斯顿、斯坦福 / 李飞飞、贾邓等 | ImageNet 数据集 | 建立千万级、按 WordNet 组织的标注图片库，让视觉算法可以统一训练和公平比较。[论文](https://www.computer.org/csdl/proceedings-article/cvpr/2009/05206848/12OmNxWcH55) |
| 2010 | ImageNet 团队 | ILSVRC 视觉竞赛 | 用年度公开基准持续推动图像分类、检测模型迭代，形成数据—基准—算法的进步循环。 |
| 2011 | IBM / David Ferrucci 团队 | Watson 赢得《Jeopardy!》 | 把问句分析、信息检索、证据评分和并行计算组合起来，在开放领域问答中击败人类冠军。 |
| 2011 | Apple / Siri 团队（源自 SRI） | 语音助手进入大众手机 | 把语音识别、自然语言理解和任务接口整合为消费级入口。 |

## 五、深度学习成为主流，Transformer 出现（2012—2017）

| 时间 | 主体（机构 / 个人） | 突破 | 实现了什么 |
|---|---|---|---|
| 2012 | 多伦多大学 / Alex Krizhevsky、Ilya Sutskever、Geoffrey Hinton | AlexNet | 用 GPU、ReLU、Dropout 和大型 CNN 大幅刷新 ImageNet，计算机视觉进入深度学习时代。[论文](https://papers.nips.cc/paper/4824-imagenet-classification-with-deep-convolutional-neural-networks) |
| 2013 | Google / Tomas Mikolov、Kai Chen、Greg Corrado、Jeff Dean | word2vec | 高效学习具有语义关系的词向量，让语言中的相似性和类比可用向量计算。[论文](https://arxiv.org/abs/1301.3781) |
| 2013—2015 | DeepMind / Volodymyr Mnih、David Silver 等 | DQN 深度强化学习 | 将卷积网络与 Q-learning 结合，直接从像素学习多款 Atari 游戏，证明同一算法可跨任务学习控制策略。[论文](https://www.nature.com/articles/nature14236) |
| 2014 | Google / Ilya Sutskever、Oriol Vinyals、Quoc Le | Seq2Seq | 用编码器—解码器把任意长度输入映射为输出，推动端到端机器翻译和生成式 NLP。[论文](https://arxiv.org/abs/1409.3215) |
| 2014 | 蒙特利尔大学 / Dzmitry Bahdanau、Kyunghyun Cho、Yoshua Bengio | 神经注意力机制 | 模型生成每个词时动态关注输入的相关部分，缓解固定长度表示瓶颈。 |
| 2014 | 蒙特利尔大学 / Ian Goodfellow、Yoshua Bengio 等 | GAN | 让生成器与判别器对抗训练，显著推动逼真图像生成、风格迁移和数据合成。[论文](https://papers.nips.cc/paper/5423-generative-adversarial-nets) |
| 2015 | 微软亚洲研究院 / 何恺明、张祥雨、任少卿、孙剑 | ResNet | 用残差连接稳定训练百层以上网络，成为视觉模型和后来多种深层架构的基础组件。[论文](https://arxiv.org/abs/1512.03385) |
| 2015 | Google Brain / TensorFlow 团队 | TensorFlow 开源 | 降低训练和部署神经网络的工程门槛，加速深度学习产业化。 |
| 2016 年 3 月 | DeepMind / Demis Hassabis、David Silver、Aja Huang 等 | AlphaGo 击败李世石 | 结合策略网络、价值网络、蒙特卡洛树搜索与自我对弈，在围棋这一超大搜索空间中达到超人水平。[论文](https://www.nature.com/articles/nature16961) |
| 2016 | DeepMind / Aaron van den Oord 等 | WaveNet | 直接生成原始音频波形，显著提高语音合成自然度，也影响后续音乐和音频生成。 |
| 2016 | Google / Yonghui Wu、Quoc Le、Jeff Dean 等 GNMT 团队 | 神经机器翻译规模化 | 端到端神经网络开始替代传统统计机器翻译，AI 首次大规模改变日常语言服务。 |
| 2017 | Meta AI / PyTorch 团队 | PyTorch 开源成熟 | 动态计算图和 Python 化接口提升研究效率，后来成为大模型研究与训练主流框架之一。 |
| 2017 年 6 月 | Google Brain / Ashish Vaswani、Noam Shazeer、Niki Parmar、Jakob Uszkoreit、Llion Jones、Aidan Gomez、Łukasz Kaiser、Illia Polosukhin | Transformer | 完全以自注意力建模序列，可并行训练、扩展到超大数据和参数规模，成为现代大语言模型、多模态模型的核心架构。[论文](https://papers.neurips.cc/paper/7181-attention-is-all-you-need) |
| 2017 | DeepMind / David Silver 等 | AlphaZero | 只给规则、通过自我对弈掌握围棋、国际象棋和将棋，显示通用学习算法可减少人工领域知识。 |

## 六、基础模型与生成式 AI 成形（2018—2022）

| 时间 | 主体（机构 / 个人） | 突破 | 实现了什么 |
|---|---|---|---|
| 2018 年 6 月 | OpenAI / Alec Radford、Ilya Sutskever 等 | GPT-1 | 先用海量文本做生成式预训练，再用少量标注微调，确立 GPT 路线。[官方说明](https://openai.com/index/language-unsupervised/) |
| 2018 年 10 月 | Google / Jacob Devlin、Ming-Wei Chang、Kenton Lee、Kristina Toutanova | BERT | 用双向 Transformer 预训练理解上下文，刷新大量自然语言理解任务并普及“预训练 + 微调”。[论文](https://arxiv.org/abs/1810.04805) |
| 2018 | DeepMind / John Jumper、Demis Hassabis 团队 | AlphaFold 1 | 在 CASP13 蛋白结构预测竞赛领先，证明深度学习可以解决高价值科学问题。 |
| 2019 年 2 月 | OpenAI / Alec Radford、Jeff Wu 等 | GPT-2 | 展示大规模语言模型可在少量或无任务训练下生成连贯长文本，社会开始重视生成滥用风险。[官方说明](https://openai.com/index/better-language-models/) |
| 2019 | Google / Colin Raffel 等 | T5 | 把翻译、摘要、分类、问答统一为“文本到文本”，推动任务统一化。 |
| 2020 年 1 月 | OpenAI / Jared Kaplan 等 | 神经语言模型 Scaling Laws | 量化模型规模、数据量、计算量与损失的关系，使大模型训练从经验放大走向可预测扩展。 |
| 2020 年 5 月 | OpenAI / Tom Brown 等 | GPT-3（1750 亿参数） | 通过上下文示例完成翻译、问答、写作和代码等任务，展示少样本与提示学习。[论文](https://openai.com/index/language-models-are-few-shot-learners/) |
| 2020 | UC Berkeley / Jonathan Ho、Ajay Jain、Pieter Abbeel | DDPM 扩散模型 | 用逐步加噪与去噪生成高质量图像，后来成为主流图像、视频和音频生成底座。[论文](https://proceedings.neurips.cc/paper/2020/hash/4c5bcfec8584af0d967f1ab10179ca4b-Abstract.html) |
| 2020 | Meta AI、UCL / Patrick Lewis 等 | RAG（检索增强生成） | 让生成模型先检索外部知识再回答，为企业知识库、可更新问答和带来源回答奠定基础。 |
| 2020—2021 | DeepMind / John Jumper、Demis Hassabis、AlphaFold 团队 | AlphaFold 2 | 将蛋白质三维结构预测准确度推向接近实验可用水平，并通过数据库开放大量预测结果。[官方项目](https://deepmind.google/science/alphafold/) |
| 2021 年 1 月 | OpenAI / Aditya Ramesh 等 | DALL·E | 把自然语言直接转成新图像，文本到图像生成进入公众视野。[官方说明](https://openai.com/index/dall-e/) |
| 2021 年 1 月 | OpenAI / Alec Radford 等 | CLIP | 用海量图文对学习开放词汇视觉概念，使图像理解可由自然语言驱动。[官方说明](https://openai.com/index/clip/) |
| 2021 | OpenAI、GitHub、Microsoft / Codex 与 Copilot 团队 | AI 编程助手产品化 | 模型从代码补全扩展到按自然语言生成函数，生成式 AI 首先在软件开发中形成规模化付费场景。 |
| 2022 年 1 月 | Google Brain / Jason Wei 等 | Chain-of-Thought 提示 | 让大模型生成中间推理步骤，显著改善算术、常识和符号推理。[论文](https://arxiv.org/abs/2201.11903) |
| 2022 年 1 月 | OpenAI / Long Ouyang、Jan Leike 等 | InstructGPT 与 RLHF | 用人类示范和偏好排序训练模型遵循指令，解决“会续写但不好用”的关键产品问题。[官方说明](https://openai.com/index/instruction-following/) |
| 2022 年 3—4 月 | DeepMind / Jordan Hoffmann 等；Google / Aakanksha Chowdhery 等 | Chinchilla 与 PaLM | Chinchilla 指出参数和训练数据应更合理配比；PaLM 展示大规模稠密 Transformer 的能力涌现，训练方法从只堆参数转向重视数据与计算最优。 |
| 2022 年 4 月 | OpenAI / DALL·E 团队 | DALL·E 2 | 扩散模型显著提升图像写实度、编辑和变体生成。[官方说明](https://openai.com/index/dall-e-2/) |
| 2022 年 8 月 | Stability AI、CompVis、Runway / Robin Rombach 等 | Stable Diffusion 开放发布 | 潜空间扩散显著降低图像生成算力，开放权重让个人电脑、本地部署和创作生态快速扩张。[官方发布](https://stability.ai/news-updates/stable-diffusion-public-release) |
| 2022 年 9 月 | OpenAI / Whisper 团队 | Whisper | 用 68 万小时多语言、多任务数据训练通用语音识别模型，并开放权重，显著降低转写与翻译门槛。[官方说明](https://openai.com/index/whisper/) |
| 2022 年 11 月 30 日 | OpenAI / ChatGPT 团队 | ChatGPT | 将对话界面、指令微调与 RLHF 结合，把大模型从研究/API 变成普通人可直接使用的通用助手。[官方发布](https://openai.com/index/chatgpt/) |

## 七、大模型竞赛转向多模态、长上下文和开放生态（2023）

| 时间 | 主体（机构 / 个人） | 突破 | 实现了什么 |
|---|---|---|---|
| 2023 年 2 月 | Meta / Yann LeCun 团队 | LLaMA | 用更高质量数据训练一组较小但有竞争力的基础模型，推动开放研究与本地大模型生态。 |
| 2023 年 3 月 14 日 | OpenAI / GPT-4 团队 | GPT-4 | 接受文本和图像输入，在专业考试、复杂推理、编程与指令遵循上明显提高，确立多模态大模型方向。[官方报告](https://openai.com/index/gpt-4-research/) |
| 2023 年 3 月 | Anthropic / Dario Amodei、Daniela Amodei 及 Claude 团队 | Claude 对外发布 | 以 Constitutional AI 和长文本处理为特色，形成与 OpenAI 并列的通用模型路线。[官方发布](https://www.anthropic.com/news/introducing-claude) |
| 2023 年 3—6 月 | OpenAI 与开发者生态 | ChatGPT Plugins、函数调用 | 模型开始连接搜索、数据库、计算器与第三方服务，从“生成答案”走向“调用工具完成动作”。 |
| 2023 年 7 月 | Meta、Microsoft | Llama 2 | 公开预训练与对话模型权重并允许多数商业用途，开放权重大模型进入企业和开发者主流。[官方发布](https://ai.meta.com/blog/llama-2/) |
| 2023 年 7 月 | Anthropic | Claude 2 | 提升推理、编程与长文档能力，长上下文成为模型竞争的重要维度。[官方发布](https://www.anthropic.com/news/claude-2) |
| 2023 年 8 月 | Meta / Code Llama 团队 | Code Llama | 在 Llama 2 上专门训练代码生成、补全与指令能力，开放代码模型快速普及。[官方发布](https://ai.meta.com/blog/code-llama-large-language-model-coding/) |
| 2023 年 9 月 | Mistral AI / Arthur Mensch、Guillaume Lample、Timothée Lacroix 团队 | Mistral 7B | 用较小参数和高效注意力取得强性能，证明开放小模型可以兼顾成本、速度与本地部署。 |
| 2023 年 9—11 月 | OpenAI / DALL·E 3、GPT-4 Turbo 团队 | 更强图像生成、128K 上下文与 JSON/函数调用 | 大模型开始可靠地产生结构化输出，图像生成也能更准确理解复杂自然语言提示。 |
| 2023 年 11 月 | Anthropic | Claude 2.1 | 200K 上下文、较低幻觉率和工具调用测试版，使超长文档分析与企业流程更可行。[官方发布](https://www.anthropic.com/news/claude-2-1) |
| 2023 年 12 月 | Google DeepMind / Demis Hassabis、Jeff Dean、Gemini 团队 | Gemini 1.0 | 从设计上统一文本、图像、音频和视频理解，Google 正式进入原生多模态基础模型竞赛。 |
| 2023 全年 | 阿里云 / Qwen 团队；DeepSeek 团队等 | 中国开放模型体系形成 | 通义千问、DeepSeek Coder 等持续开放权重，中文、代码和本地部署能力迅速提升，全球竞争不再只有美国闭源模型。 |

## 八、推理模型、实时多模态与工具协议出现（2024）

| 时间 | 主体（机构 / 个人） | 突破 | 实现了什么 |
|---|---|---|---|
| 2024 年 2 月 | Google DeepMind / Gemini 团队 | Gemini 1.5 | 采用 MoE 等技术，把可用上下文扩展到百万级，能处理大型代码库、长视频和大量文档。 |
| 2024 年 2 月 15 日 | OpenAI / Sora 团队 | Sora 研究预览 | 用扩散 Transformer 和时空 patch 生成最长约一分钟视频，视频生成开始呈现长时一致性与简单世界模拟能力。[技术报告](https://openai.com/index/video-generation-models-as-world-simulators/) |
| 2024 年 3 月 | Anthropic | Claude 3（Haiku、Sonnet、Opus） | 统一文本和视觉输入，覆盖低延迟到高性能档位，模型服务开始明确分层。[官方发布](https://www.anthropic.com/news/claude-3-family) |
| 2024 年 4 月 | Meta | Llama 3 | 以更大训练数据和改进后训练提升开放模型通用能力，开放权重与闭源前沿模型差距继续缩小。[官方发布](https://ai.meta.com/blog/meta-llama-3/) |
| 2024 年 5 月 13 日 | OpenAI | GPT-4o | 在一个低延迟系统中处理文本、视觉和语音，支持近实时自然对话，多模态从“分别调用模型”走向统一交互。[官方发布](https://openai.com/index/gpt-4o-and-more-tools-to-chatgpt-free/) |
| 2024 年 6 月 | Anthropic | Claude 3.5 Sonnet 与 Artifacts | 提升代码、视觉和推理，并把生成结果放进可迭代工作区，AI 从聊天框向协作界面发展。[官方发布](https://www.anthropic.com/news/claude-3-5-sonnet) |
| 2024 年 7 月 | Meta | Llama 3.1 405B | 发布 405B 开放权重模型，支持 128K、工具调用与多语言，把开放模型推到前沿大模型规模。[官方发布](https://ai.meta.com/blog/meta-llama-3-1/) |
| 2024 年 9 月 | OpenAI / o1 团队 | o1 推理模型 | 在回答前使用更多推理时计算，显著提升数学、科学和编程问题表现，行业从“预训练扩展”转向“训练 + 推理时扩展”。[官方说明](https://openai.com/index/learning-to-reason-with-llms/) |
| 2024 年 9 月 | Meta | Llama 3.2 | 发布视觉模型以及 1B/3B 端侧模型，覆盖云端多模态和手机本地 AI。[官方发布](https://ai.meta.com/blog/llama-3-2-connect-2024-vision-edge-mobile-devices/) |
| 2024 年 10 月 | Anthropic | Computer Use 测试版 | 模型能看屏幕、移动鼠标、点击和输入，首次以通用 GUI 操作为公开模型能力。[官方发布](https://www.anthropic.com/news/3-5-models-and-computer-use) |
| 2024 年 10 月 | OpenAI | ChatGPT Search | 把实时网页检索、答案生成和来源链接整合进对话，通用助手开始直接竞争搜索入口。[官方发布](https://openai.com/index/introducing-chatgpt-search/) |
| 2024 年 11 月 | Anthropic / David Soria Parra、Justin Spahr-Summers 等 | Model Context Protocol（MCP） | 定义 AI 应用连接数据源和工具的开放协议，减少每个模型与每个系统单独集成的重复工作。[官方发布](https://www.anthropic.com/news/model-context-protocol) |
| 2024 年 12 月 | Google DeepMind | Gemini 2.0 | 强化原生工具调用、实时多模态和智能体能力，模型从回答器进一步转为可执行系统。 |
| 2024 年 12 月 | DeepSeek / 梁文锋与 DeepSeek 团队 | DeepSeek-V3 | 以 MoE 和高效训练实现强通用、代码和数学能力并开放模型，显著改变高性能大模型的成本预期。[官方发布](https://api-docs.deepseek.com/news/news1226/) |
| 2024 年 12 月 | OpenAI | Sora Turbo 产品化 | 文生视频从研究预览进入可用产品，支持文本、图像、视频输入和故事板编辑；同时仍存在物理错误和长时一致性限制。[官方发布](https://openai.com/index/sora-is-here/) |

## 九、从“会回答”转向“会推理、会用工具、能持续执行”（2025）

| 时间 | 主体（机构 / 个人） | 突破 | 实现了什么 |
|---|---|---|---|
| 2025 年 1 月 20 日 | DeepSeek / DeepSeek-R1 团队 | DeepSeek-R1 | 用强化学习强化长链推理，开放模型与蒸馏版本，推动高水平推理模型低成本化和本地化。[官方发布](https://api-docs.deepseek.com/news/news250120/) |
| 2025 年 1 月 23 日 | OpenAI / Operator、CUA 团队 | Operator 与 Computer-Using Agent | 模型通过视觉界面点击、输入和滚动网页，能执行预订、填表等浏览器任务。[官方发布](https://openai.com/index/introducing-operator/) |
| 2025 年 2 月 | OpenAI | Deep Research | 智能体可连续搜索、阅读和综合大量网页与文件，生成带来源的研究报告，研究流程开始自动化。[官方发布](https://openai.com/index/introducing-deep-research/) |
| 2025 年 2 月 24 日 | Anthropic | Claude 3.7 Sonnet、Claude Code | 把快速回答与扩展推理合并为混合模型，并推出能读代码库、改文件、运行命令的终端编程智能体。[官方发布](https://www.anthropic.com/news/claude-3-7-sonnet) |
| 2025 年 2 月 27 日 | OpenAI | GPT-4.5 | 通过更大规模预训练提高知识、写作、自然对话和模式识别，说明“直觉型预训练”仍与推理模型并行发展。[官方发布](https://openai.com/index/introducing-gpt-4-5/) |
| 2025 年 3 月 | OpenAI | Responses API、Web Search、File Search、Computer Use、Agents SDK | 把模型、工具、追踪和智能体编排整合为开发平台，企业可构建可观察的任务代理。[官方发布](https://openai.com/index/new-tools-for-building-agents/) |
| 2025 年 4 月 | Meta | Llama 4 Scout、Maverick | 采用 MoE、原生多模态和长上下文，在开放权重体系中引入更高效的专家混合架构。[官方发布](https://ai.meta.com/blog/llama-4-multimodal-intelligence/) |
| 2025 年 4 月 | OpenAI | o3、o4-mini | 推理模型能够在推理过程中自主调用网页、代码执行、文件和图像工具，并对图像进行推理。[官方发布](https://openai.com/index/introducing-o3-and-o4-mini/) |
| 2025 年 4 月 29 日 | 阿里云 / Qwen 团队 | Qwen3 | 在单一模型中支持思考/非思考模式，并开放稠密与 MoE 权重，强化多语言、数学、代码和智能体能力。[官方发布](https://qwenlm.github.io/blog/qwen3/) |
| 2025 年 5 月 | OpenAI / Codex 团队 | 云端 Codex 软件工程智能体 | 每个任务在隔离环境中读代码、修改、运行测试并提交结果，可并行处理多个工程任务。[官方发布](https://openai.com/index/introducing-codex/) |
| 2025 年 5 月 22 日 | Anthropic | Claude Opus 4、Sonnet 4 | 面向长时间编码、工具使用和智能体任务优化，编程助手开始承担跨文件、跨步骤工作。[官方发布](https://www.anthropic.com/news/claude-4) |
| 2025 年 6 月 | MiniMax / 闫俊杰与 MiniMax 团队 | MiniMax-M1 | 开放混合注意力推理模型，提供百万级上下文和超长推理输出，推动长上下文推理的成本竞争。[官方发布](https://minimaxi.com/en/news/minimaxm1) |
| 2025 年 7 月 9 日 | xAI / Elon Musk、Grok 团队 | Grok 4 | 强化实时搜索、代码执行和原生工具使用，前沿模型竞争扩大到实时信息与智能体执行。[官方发布](https://x.ai/news/grok-4) |
| 2025 年 7 月 17 日 | OpenAI | ChatGPT Agent | 合并浏览、研究、终端、文件和动作能力，可在用户监督下完成多步骤在线任务。[官方发布](https://openai.com/index/introducing-chatgpt-agent/) |
| 2025 年 7 月 22 日 | 阿里云 / Qwen 团队 | Qwen3-Coder、Qwen Code | 以 MoE、256K 原生上下文和工具调用面向仓库级智能体编程，开放代码智能体进入主流。[官方发布](https://qwenlm.github.io/blog/qwen3-coder/) |
| 2025 年 8 月 5 日 | OpenAI | gpt-oss-120b、gpt-oss-20b | 以 Apache 2.0 发布开放权重推理模型，支持工具调用并可在较低成本硬件部署。[官方发布](https://openai.com/index/introducing-gpt-oss/) |
| 2025 年 8 月 7 日 | OpenAI | GPT-5 | 用路由系统统一快速回答与深度推理，加强编码、视觉、写作和工具调用，通用模型从单一网络走向“模型系统”。[官方发布](https://openai.com/index/introducing-gpt-5/) |
| 2025 年 8 月 21 日 | DeepSeek | DeepSeek-V3.1 | 一个模型同时提供思考与非思考模式，继续训练长上下文并强化工具调用、多步智能体任务。[官方发布](https://api-docs.deepseek.com/news/news250821) |
| 2025 年 8 月 28 日 | OpenAI | gpt-realtime | 将低延迟语音到语音、图像输入、电话 SIP 与 MCP 接入生产 API，实时语音智能体可以直接服务客户。[官方发布](https://openai.com/index/introducing-gpt-realtime/) |
| 2025 年 9 月 | Anthropic | Claude Sonnet 4.5 | 进一步强化长时间编码、计算机操作和智能体可靠性，持续执行成为前沿模型核心指标。[官方发布](https://www.anthropic.com/news/claude-sonnet-4-5) |
| 2025 年 9 月 | OpenAI | Sora 2 | 视频模型加入同步对白与音效、增强物理一致性和可控性，生成媒介从无声短片走向视听一体；Sora 产品于 2026 年 4 月 26 日停止提供。[官方发布](https://openai.com/index/sora-2/) |
| 2025 年 10 月 | Anthropic | Agent Skills | 将说明、脚本和资源封装成可复用技能包，智能体能力开始以模块化方式分发。[官方发布](https://www.anthropic.com/news/skills) |
| 2025 年 10 月 | OpenAI | AgentKit | 提供智能体构建、连接器、评估和部署组件，企业智能体工程从拼装 API 转向完整工具链。[官方发布](https://openai.com/index/introducing-agentkit/) |
| 2025 年 11 月 | Google DeepMind | Gemini 3 | 强化多模态推理、智能体编程和复杂任务执行，Google 模型体系进入以行动为中心的新一代。[官方发布](https://blog.google/products-and-platforms/products/gemini/gemini-3/) |
| 2025 年 12 月 1 日 | DeepSeek | DeepSeek-V3.2、V3.2-Speciale | 把思考直接整合进工具使用，并以大规模智能体环境合成数据训练多步执行。[官方发布](https://api-docs.deepseek.com/news/news251201/) |
| 2025 年 12 月 11 日 | OpenAI | GPT-5.2 | 面向专业知识工作、长上下文、文档处理和长时间智能体任务优化，模型开始直接交付工作成果而非只给建议。[官方发布](https://openai.com/index/introducing-gpt-5-2/) |

## 十、长时自主工作、端到端知识生产与具身智能（2026，截至 8 月 22 日）

| 时间 | 主体（机构 / 个人） | 突破 | 实现了什么 |
|---|---|---|---|
| 2026 年 2 月 5 日 | OpenAI | GPT-5.3-Codex | 将前沿编码、计算机操作和长期任务执行合并，面向完整软件工程生命周期持续工作。[官方发布](https://openai.com/index/introducing-gpt-5-3-codex/) |
| 2026 年 2 月 5 日 | Anthropic | Claude Opus 4.6 | 提升编码、规划、长任务和智能体能力，并测试百万级上下文，面向大型代码库和复杂工作流。[官方发布](https://www.anthropic.com/news/claude-opus-4-6) |
| 2026 年 2 月 17 日 | Anthropic | Claude Sonnet 4.6 | 把更强推理、代码和工具使用下放到更高性价比模型，智能体能力开始普及而非只存在于旗舰型号。[官方发布](https://www.anthropic.com/news/claude-sonnet-4-6) |
| 2026 年 2 月 | Google DeepMind | Gemini 3.1 Pro、Gemini 3 Deep Think | 强化原生多模态、复杂科学与抽象推理，可处理大型代码库、多文档和复合视觉材料。[官方发布](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-pro/) |
| 2026 年 3 月 5 日 | OpenAI | GPT-5.4 | 面向专业工作、编码、智能体和可交付成果生成，把研究、分析、设计和软件执行进一步统一。[官方发布](https://openai.com/index/introducing-gpt-5-4/) |
| 2026 年 4 月 21 日 | OpenAI | ChatGPT Images 2.0 | 加强图像内文字、编辑一致性与精确控制，图像模型更接近可反复修改的设计工具。[官方发布](https://openai.com/index/introducing-chatgpt-images-2-0/) |
| 2026 年 4 月 21 日 | Google DeepMind | 新一代 Gemini Deep Research | 支持更长时间的自主研究、MCP 数据连接和可视化输出，从网页综述迈向多工具研究工作流。[官方发布](https://blog.google/innovation-and-ai/models-and-research/gemini-models/next-generation-gemini-deep-research/) |
| 2026 年 4 月 23 日 | OpenAI | GPT-5.5 | 提升百万级上下文、编码、研究、数据分析、文档/表格制作和计算机操作，可持续跨工具完成模糊的复合任务。[官方发布](https://openai.com/index/introducing-gpt-5-5/) |
| 2026 年 4 月 24 日 | DeepSeek | DeepSeek-V4 Preview | 开放 MoE 模型扩展到百万级上下文并针对智能体优化，继续降低长期任务和私有部署门槛。[官方发布](https://api-docs.deepseek.com/news/news260424/) |
| 2026 年 5 月 | Google DeepMind | Gemini 3.5 Flash | 在较低延迟下提供前沿推理、代码、交互界面生成和智能体执行，实时应用能力提升。[官方发布](https://deepmind.google/blog/gemini-3-5-frontier-intelligence-with-action/) |
| 2026 年 5 月 25 日 | xAI | Grok Build CLI | 推出终端软件工程智能体，能理解代码库、修改文件、运行命令并迭代验证。[官方发布](https://x.ai/news/grok-build-cli) |
| 2026 年 5 月 28 日 | Anthropic | Claude Opus 4.8 | 强化编码、计算机使用、长时智能体与自我校验，前沿模型竞争转向可靠完成整段工作。[官方发布](https://www.anthropic.com/news/claude-opus-4-8) |
| 2026 年 6 月 30 日 | Anthropic | Claude Sonnet 5 | 更主动地规划、调用浏览器和终端并保持任务进度，中型成本模型也能承担较长的自主任务。[官方发布](https://www.anthropic.com/news/claude-sonnet-5) |
| 2026 年 7 月 8 日 | OpenAI | GPT-Live | 新一代实时语音模型提高自然度、打断处理和工具衔接，语音智能体更接近连续人机协作。[官方发布](https://openai.com/index/introducing-gpt-live/) |
| 2026 年 7 月 9 日 | OpenAI | GPT-5.6 | 继续提升推理、设计、软件工程、科研和端到端知识工作能力，重点从回答质量转向完整成果质量。[官方发布](https://openai.com/index/gpt-5-6/) |
| 2026 年 7 月 16 日 | xAI | Grok 4.5 | 加强工具使用、实时信息和复杂执行，与通用聊天模型并行发展为行动型模型。[官方发布](https://x.ai/news/grok-4-5) |
| 2026 年 7 月 21 日 | Google DeepMind | Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber | 形成高性能、低成本和网络安全专用模型组合，模型部署从“一个通用型号”转向按任务分层。[官方发布](https://deepmind.google/blog/introducing-gemini-3-6-flash-3-5-flash-lite-and-3-5-flash-cyber/) |
| 2026 年 7 月 24 日 | Anthropic | Claude Opus 5 | 进一步提高复杂编码、工具编排和长时自主执行，旗舰模型成为通用数字工作执行器。[官方发布](https://www.anthropic.com/news/claude-opus-5) |
| 2026 年 7 月 30 日 | Google DeepMind | Gemini Robotics 2、Robotics-ER 2 | 将视觉理解、任务编排、全身控制、灵巧操作和多机器人协作连接起来，AI 从屏幕内智能体向物理执行扩展。[官方发布](https://deepmind.google/blog/gemini-robotics-2-brings-whole-body-intelligence-to-robots/) |
| 2026 年 8 月 12 日 | xAI | Grok 4.6 | 强化长时间智能体、交互式成果和视觉工作，强调持续执行而非单轮回答。[官方发布](https://x.ai/news/grok-4-6) |
| 2026 年 8 月 13 日 | Google / Gemini 团队 | Gemini 3.7 Flash | 以更低延迟和成本加强编码、长时软件工程、文档理解、网页开发和多步工具调用，面向大规模生产智能体。[官方发布](https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-gemini-3-7-flash/) |
| 2026 年 8 月 13 日 | DeepSeek | DeepSeek-V4 Pro | 在 V4 基础上增强生产级智能体、可调推理强度与 Responses API/Codex 兼容，开放模型进一步进入真实工作流。[官方发布](https://api-docs.deepseek.com/news/news260813/) |
| 2026 年 8 月 21 日 | DeepSeek | DeepSeek-V4-Flash-Vision-Exp | 为 V4 Flash 增加图像输入与多模态 API，DeepSeek 的开放智能体路线由文本、代码扩展到视觉理解。[官方发布](https://api-docs.deepseek.com/news/news260821/) |

## 截至 2026 年 8 月，AI 到了什么水平

| 能力领域 | 当前水平 | 仍然做不到或不可靠的部分 |
|---|---|---|
| 语言与推理 | 能处理复杂写作、数学、代码、法律/商业材料和多步分析；前沿模型会按任务自动选择快速回答或深度推理。 | 仍会幻觉、误引、偷换条件；高分不等于稳定掌握真理，关键结论仍需来源、计算或专家复核。 |
| 多模态 | 可统一理解文本、图片、图表、PDF、语音和视频；可生成并编辑图像、音频、音乐、语音和视频。 | 长视频一致性、精确空间关系、真实物理、人物身份连续性与版权边界仍不完全可靠。 |
| 软件工程 | 可理解大型代码库，规划改动，编辑多文件，运行测试，修复错误并提交 PR；多个智能体可并行工作。 | 模糊需求、遗留系统、隐性业务规则和高风险上线仍需资深工程师监督。 |
| 搜索与研究 | 可持续浏览、比较多来源、运行代码分析数据，并生成带引用的研究报告。 | 来源可能遗漏或误读，互联网本身存在错误；原创科学结论仍需要实验、同行评议和可复现验证。 |
| 计算机操作 | 能看屏幕并操作浏览器、终端、办公软件和部分企业系统，可跨工具完成完整流程。 | 页面变化、权限、验证码、提示注入和异常分支会造成失败；涉及付款、删除、发送和发布必须保留人类确认。 |
| 长上下文与记忆 | 部分模型支持百万级上下文，并能通过检索、压缩和外部记忆处理大型项目。 | “看得下”不等于“每处都记得准”；长期一致性和跨会话记忆仍依赖工程系统。 |
| 开放与本地模型 | 开放权重模型已具备强推理、代码和工具调用能力；小模型可在个人电脑、手机和边缘设备运行。 | 最强模型训练和高并发推理仍需要昂贵集群；本地模型通常在复杂推理和稳定性上弱于前沿云模型。 |
| 机器人 | 已能完成视觉理解、语言规划、灵巧抓取、全身动作和受控环境中的多机器人协作。 | 尚未形成可在任意家庭、工厂和公共空间长期安全工作的通用机器人，真实世界数据与安全是主要瓶颈。 |
| 自主性 | AI 已从聊天助手发展为能规划、调用工具、检查结果、持续数十分钟到数小时的数字智能体。 | 还不是可以无条件托管目标的“完全自主员工”；任务越长，错误累积、权限和安全风险越高。 |

**结论：**截至 2026 年 8 月，AI 已进入“多模态推理模型 + 工具调用 + 长时智能体 + 物理机器人”的阶段。它在大量知识工作上达到高水平助理或局部专家水平，并能直接产出代码、研究、文档、设计和操作结果；但尚无被学术界与产业界共同验证的通用人工智能（AGI），更不存在可以在开放世界中长期、稳定、低风险地替代人类判断的系统。

## 技术主线

**形式化神经元 → 符号推理 → 专家系统 → 统计机器学习 → 深度学习 → Transformer → 基础模型 → 生成式多模态 → 推理模型 → 工具协议与计算机操作 → 长时自主智能体 → 具身智能。**
