AI技术发展时间线 1943

AI技术发展时间线 1943

人工智能技术发展时间线:从人工神经元到自主智能体(1943—2026)

操作指南MD下载原文件
# 人工智能技术发展时间线:从人工神经元到自主智能体(1943—2026)

更新日期:2026 年 8 月 22 日

范围:收录改变技术路线、产业形态或公众使用方式的主要节点。主体尽量同时标明公司/机构与核心个人;同一模型的小版本、纯跑分刷新和未形成后续影响的实验不单列。

一、理论奠基与人工智能诞生(1943—1959)

时间 主体(机构 / 个人) 突破 实现了什么
1943 芝加哥大学 / 沃伦·麦卡洛克、沃尔特·皮茨 提出首个形式化人工神经元模型 用逻辑和数学描述神经元,证明神经网络可以表示逻辑运算,奠定连接主义基础。论文
1949 麦吉尔大学 / 唐纳德·赫布 提出赫布学习规则 用“共同激活就增强连接”解释学习,为后来的无监督学习、联想记忆和神经网络训练提供思想基础。
1950 曼彻斯特大学 / 艾伦·图灵 提出“机器能思考吗”与模仿游戏 把机器智能转化为可观察、可检验的人机对话问题,即后来所称的图灵测试。论文
1951 普林斯顿大学 / 马文·明斯基、迪恩·埃德蒙兹 建造 SNARC 神经网络机器 用约 40 个模拟神经元学习走迷宫,是早期可运行的神经网络硬件之一。
1955 达特茅斯会议提案 / 约翰·麦卡锡、马文·明斯基、纳撒尼尔·罗切斯特、克劳德·香农 正式提出“Artificial Intelligence”研究计划 将机器学习、语言、抽象、推理等问题统一为一个研究领域。原始提案
1956 兰德公司与卡内基理工 / 艾伦·纽厄尔、赫伯特·西蒙、克利夫·肖 Logic Theorist 首次让程序自动证明数学定理,确立“符号表示 + 搜索 + 推理”的经典 AI 路线。
1956 夏 达特茅斯学院会议 人工智能成为独立学科 研究者开始系统研究推理、学习、语言、视觉和智能机器,1956 通常被视为 AI 元年。
1957—1958 康奈尔航空实验室 / 弗兰克·罗森布拉特 感知机 Perceptron 让机器从样本中自动调整权重,能够学习线性分类,是现代神经网络训练的直接前身。
1958 MIT / 约翰·麦卡锡 发明 LISP 提供适合符号处理、递归和程序生成的语言,长期成为 AI 研究主力工具。
1959 IBM / 亚瑟·塞缪尔 跳棋程序与“机器学习”概念 程序通过自我对弈改进策略,展示机器不必逐条写规则也能从经验提升。

二、符号主义扩张、早期应用与第一次低潮(1960—1979)

时间 主体(机构 / 个人) 突破 实现了什么
1961 通用汽车、Unimation / 乔治·德沃尔、约瑟夫·恩格尔伯格 Unimate 投入生产线 第一代工业机器人进入汽车制造,机器自动化从实验室进入工厂。
1965 斯坦福大学 / 爱德华·费根鲍姆、布鲁斯·布坎南、约书亚·莱德伯格等 DENDRAL 专家系统 将化学家的知识编码为规则,能根据质谱推断分子结构,证明“专业知识 + 推理机”可解决窄领域问题。
1966 MIT / 约瑟夫·魏岑鲍姆 ELIZA 用模式匹配模拟心理咨询对话,第一次让公众直观感受到自然语言交互,同时暴露“像理解”不等于真正理解。
1966—1972 SRI / 查尔斯·罗森团队 Shakey 机器人 把视觉、环境建模、路径规划和动作控制组合起来,是首批能感知并规划行动的通用移动机器人。
1968 斯坦福大学 / 特里·维诺格拉德 SHRDLU 在积木世界中理解指令、回答问题并执行操作,展示受限世界里的语言理解与行动。
1969 MIT / 马文·明斯基、西摩·派普特 《Perceptrons》分析单层感知机局限 指出 XOR 等问题无法由单层网络解决;在训练方法和算力尚未成熟时,连接主义研究明显降温。
1972 马赛大学 / 阿兰·科尔梅罗、菲利普·鲁塞尔 Prolog 以事实、规则和逻辑查询编程,推动知识表示、自然语言处理和专家系统。
1972—1976 斯坦福大学 / 爱德华·肖特利夫、布鲁斯·布坎南 MYCIN 用约 600 条规则辅助诊断细菌感染和建议抗生素,成为医学专家系统代表;因责任与集成问题未直接临床部署。
1973—1974 英国科学研究委员会 / 詹姆斯·莱特希尔等 研究评估与资助收缩 组合爆炸、算力不足、承诺过高导致项目削减,第一次“AI 寒冬”开始。
1970 年代后期 多所大学与企业 知识工程成为主线 AI 从追求通用智能转向在封闭领域收集专家规则,以可解释的规则系统换取可用性。

三、专家系统商业化与神经网络复兴(1980—1999)

时间 主体(机构 / 个人) 突破 实现了什么
1980 卡内基梅隆大学、DEC / 约翰·麦克德莫特 XCON(R1)专家系统 自动配置计算机订单,显著降低人工配置成本,证明专家系统可以产生商业价值。
1982 加州理工学院 / 约翰·霍普菲尔德 Hopfield 网络 用能量函数实现联想记忆和模式恢复,使神经网络重新获得理论关注。
1986 多伦多大学、UCSD / 大卫·鲁梅尔哈特、杰弗里·辛顿、罗纳德·威廉姆斯 反向传播推广 让多层神经网络能够高效计算梯度并学习内部表示,解决单层感知机无法解决的一类问题。论文
1987—1993 AI 软件/硬件产业 第二次 AI 寒冬 专家系统维护成本高、规则脆弱,LISP 机器市场崩溃;产业认识到仅靠人工规则难以扩展。
1989—1998 贝尔实验室 / 杨立昆、莱昂·博图、帕特里克·哈夫纳等 卷积神经网络与 LeNet-5 通过局部连接、权重共享和反向传播识别手写数字,进入银行支票读取等真实业务。
1992 IBM / 杰拉尔德·特索罗 TD-Gammon 用时序差分强化学习自我对弈,达到接近顶尖人类的西洋双陆棋水平,验证“试错 + 奖励”学习。
1995 AT&T / Corinna Cortes、Vladimir Vapnik 支持向量机成熟 在小样本、高维分类中表现强,成为深度学习爆发前最重要的统计学习方法之一。
1997 年 5 月 IBM / 冯祥熙、Murray Campbell、A. Joseph Hoane Jr. 等 Deep Blue 战胜国际象棋世界冠军卡斯帕罗夫 用专用硬件、搜索、评估函数和棋谱知识,在明确规则的大型搜索问题上超越人类冠军。
1997 慕尼黑工业大学 / Sepp Hochreiter、Jürgen Schmidhuber LSTM 通过门控记忆缓解循环网络的梯度消失,使长序列语音、文本和时间序列学习成为可能。论文
1998—1999 学术界与互联网企业 数据驱动方法取代大规模手写规则 随着网页、数字文本和日志增长,概率模型、统计学习与机器学习逐渐成为主流。

四、数据、GPU 与深度学习爆发前夜(2000—2011)

时间 主体(机构 / 个人) 突破 实现了什么
2001 UC Berkeley / Leo Breiman 随机森林 通过多个决策树集成获得稳定、易用的分类和回归能力,成为长期使用的传统机器学习基线。
2004—2005 DARPA;斯坦福大学 / Sebastian Thrun 团队 无人车 Grand Challenge 2005 年 Stanley 完成长距离沙漠赛道,推动感知、定位、规划与控制集成。
2006 多伦多大学 / 杰弗里·辛顿、Simon Osindero、Yee-Whye Teh 深度置信网络与逐层预训练 证明深层网络可以有效训练,“深度学习”重新成为研究中心。
2006—2007 NVIDIA / Ian Buck 等 CUDA 团队 GPU 通用并行计算 让研究者用显卡高吞吐训练矩阵密集型神经网络,后来成为大模型扩展的关键基础设施。
2007 斯坦福大学 / 吴恩达、Rajat Raina 等 GPU 加速深度学习实验 展示 GPU 可把大型神经网络训练提速数十倍,明确了“更大数据 + 更大模型 + 并行计算”的路线。
2009 普林斯顿、斯坦福 / 李飞飞、贾邓等 ImageNet 数据集 建立千万级、按 WordNet 组织的标注图片库,让视觉算法可以统一训练和公平比较。论文
2010 ImageNet 团队 ILSVRC 视觉竞赛 用年度公开基准持续推动图像分类、检测模型迭代,形成数据—基准—算法的进步循环。
2011 IBM / David Ferrucci 团队 Watson 赢得《Jeopardy!》 把问句分析、信息检索、证据评分和并行计算组合起来,在开放领域问答中击败人类冠军。
2011 Apple / Siri 团队(源自 SRI) 语音助手进入大众手机 把语音识别、自然语言理解和任务接口整合为消费级入口。

五、深度学习成为主流,Transformer 出现(2012—2017)

时间 主体(机构 / 个人) 突破 实现了什么
2012 多伦多大学 / Alex Krizhevsky、Ilya Sutskever、Geoffrey Hinton AlexNet 用 GPU、ReLU、Dropout 和大型 CNN 大幅刷新 ImageNet,计算机视觉进入深度学习时代。论文
2013 Google / Tomas Mikolov、Kai Chen、Greg Corrado、Jeff Dean word2vec 高效学习具有语义关系的词向量,让语言中的相似性和类比可用向量计算。论文
2013—2015 DeepMind / Volodymyr Mnih、David Silver 等 DQN 深度强化学习 将卷积网络与 Q-learning 结合,直接从像素学习多款 Atari 游戏,证明同一算法可跨任务学习控制策略。论文
2014 Google / Ilya Sutskever、Oriol Vinyals、Quoc Le Seq2Seq 用编码器—解码器把任意长度输入映射为输出,推动端到端机器翻译和生成式 NLP。论文
2014 蒙特利尔大学 / Dzmitry Bahdanau、Kyunghyun Cho、Yoshua Bengio 神经注意力机制 模型生成每个词时动态关注输入的相关部分,缓解固定长度表示瓶颈。
2014 蒙特利尔大学 / Ian Goodfellow、Yoshua Bengio 等 GAN 让生成器与判别器对抗训练,显著推动逼真图像生成、风格迁移和数据合成。论文
2015 微软亚洲研究院 / 何恺明、张祥雨、任少卿、孙剑 ResNet 用残差连接稳定训练百层以上网络,成为视觉模型和后来多种深层架构的基础组件。论文
2015 Google Brain / TensorFlow 团队 TensorFlow 开源 降低训练和部署神经网络的工程门槛,加速深度学习产业化。
2016 年 3 月 DeepMind / Demis Hassabis、David Silver、Aja Huang 等 AlphaGo 击败李世石 结合策略网络、价值网络、蒙特卡洛树搜索与自我对弈,在围棋这一超大搜索空间中达到超人水平。论文
2016 DeepMind / Aaron van den Oord 等 WaveNet 直接生成原始音频波形,显著提高语音合成自然度,也影响后续音乐和音频生成。
2016 Google / Yonghui Wu、Quoc Le、Jeff Dean 等 GNMT 团队 神经机器翻译规模化 端到端神经网络开始替代传统统计机器翻译,AI 首次大规模改变日常语言服务。
2017 Meta AI / PyTorch 团队 PyTorch 开源成熟 动态计算图和 Python 化接口提升研究效率,后来成为大模型研究与训练主流框架之一。
2017 年 6 月 Google Brain / Ashish Vaswani、Noam Shazeer、Niki Parmar、Jakob Uszkoreit、Llion Jones、Aidan Gomez、Łukasz Kaiser、Illia Polosukhin Transformer 完全以自注意力建模序列,可并行训练、扩展到超大数据和参数规模,成为现代大语言模型、多模态模型的核心架构。论文
2017 DeepMind / David Silver 等 AlphaZero 只给规则、通过自我对弈掌握围棋、国际象棋和将棋,显示通用学习算法可减少人工领域知识。

六、基础模型与生成式 AI 成形(2018—2022)

时间 主体(机构 / 个人) 突破 实现了什么
2018 年 6 月 OpenAI / Alec Radford、Ilya Sutskever 等 GPT-1 先用海量文本做生成式预训练,再用少量标注微调,确立 GPT 路线。官方说明
2018 年 10 月 Google / Jacob Devlin、Ming-Wei Chang、Kenton Lee、Kristina Toutanova BERT 用双向 Transformer 预训练理解上下文,刷新大量自然语言理解任务并普及“预训练 + 微调”。论文
2018 DeepMind / John Jumper、Demis Hassabis 团队 AlphaFold 1 在 CASP13 蛋白结构预测竞赛领先,证明深度学习可以解决高价值科学问题。
2019 年 2 月 OpenAI / Alec Radford、Jeff Wu 等 GPT-2 展示大规模语言模型可在少量或无任务训练下生成连贯长文本,社会开始重视生成滥用风险。官方说明
2019 Google / Colin Raffel 等 T5 把翻译、摘要、分类、问答统一为“文本到文本”,推动任务统一化。
2020 年 1 月 OpenAI / Jared Kaplan 等 神经语言模型 Scaling Laws 量化模型规模、数据量、计算量与损失的关系,使大模型训练从经验放大走向可预测扩展。
2020 年 5 月 OpenAI / Tom Brown 等 GPT-3(1750 亿参数) 通过上下文示例完成翻译、问答、写作和代码等任务,展示少样本与提示学习。论文
2020 UC Berkeley / Jonathan Ho、Ajay Jain、Pieter Abbeel DDPM 扩散模型 用逐步加噪与去噪生成高质量图像,后来成为主流图像、视频和音频生成底座。论文
2020 Meta AI、UCL / Patrick Lewis 等 RAG(检索增强生成) 让生成模型先检索外部知识再回答,为企业知识库、可更新问答和带来源回答奠定基础。
2020—2021 DeepMind / John Jumper、Demis Hassabis、AlphaFold 团队 AlphaFold 2 将蛋白质三维结构预测准确度推向接近实验可用水平,并通过数据库开放大量预测结果。官方项目
2021 年 1 月 OpenAI / Aditya Ramesh 等 DALL·E 把自然语言直接转成新图像,文本到图像生成进入公众视野。官方说明
2021 年 1 月 OpenAI / Alec Radford 等 CLIP 用海量图文对学习开放词汇视觉概念,使图像理解可由自然语言驱动。官方说明
2021 OpenAI、GitHub、Microsoft / Codex 与 Copilot 团队 AI 编程助手产品化 模型从代码补全扩展到按自然语言生成函数,生成式 AI 首先在软件开发中形成规模化付费场景。
2022 年 1 月 Google Brain / Jason Wei 等 Chain-of-Thought 提示 让大模型生成中间推理步骤,显著改善算术、常识和符号推理。论文
2022 年 1 月 OpenAI / Long Ouyang、Jan Leike 等 InstructGPT 与 RLHF 用人类示范和偏好排序训练模型遵循指令,解决“会续写但不好用”的关键产品问题。官方说明
2022 年 3—4 月 DeepMind / Jordan Hoffmann 等;Google / Aakanksha Chowdhery 等 Chinchilla 与 PaLM Chinchilla 指出参数和训练数据应更合理配比;PaLM 展示大规模稠密 Transformer 的能力涌现,训练方法从只堆参数转向重视数据与计算最优。
2022 年 4 月 OpenAI / DALL·E 团队 DALL·E 2 扩散模型显著提升图像写实度、编辑和变体生成。官方说明
2022 年 8 月 Stability AI、CompVis、Runway / Robin Rombach 等 Stable Diffusion 开放发布 潜空间扩散显著降低图像生成算力,开放权重让个人电脑、本地部署和创作生态快速扩张。官方发布
2022 年 9 月 OpenAI / Whisper 团队 Whisper 用 68 万小时多语言、多任务数据训练通用语音识别模型,并开放权重,显著降低转写与翻译门槛。官方说明
2022 年 11 月 30 日 OpenAI / ChatGPT 团队 ChatGPT 将对话界面、指令微调与 RLHF 结合,把大模型从研究/API 变成普通人可直接使用的通用助手。官方发布

七、大模型竞赛转向多模态、长上下文和开放生态(2023)

时间 主体(机构 / 个人) 突破 实现了什么
2023 年 2 月 Meta / Yann LeCun 团队 LLaMA 用更高质量数据训练一组较小但有竞争力的基础模型,推动开放研究与本地大模型生态。
2023 年 3 月 14 日 OpenAI / GPT-4 团队 GPT-4 接受文本和图像输入,在专业考试、复杂推理、编程与指令遵循上明显提高,确立多模态大模型方向。官方报告
2023 年 3 月 Anthropic / Dario Amodei、Daniela Amodei 及 Claude 团队 Claude 对外发布 以 Constitutional AI 和长文本处理为特色,形成与 OpenAI 并列的通用模型路线。官方发布
2023 年 3—6 月 OpenAI 与开发者生态 ChatGPT Plugins、函数调用 模型开始连接搜索、数据库、计算器与第三方服务,从“生成答案”走向“调用工具完成动作”。
2023 年 7 月 Meta、Microsoft Llama 2 公开预训练与对话模型权重并允许多数商业用途,开放权重大模型进入企业和开发者主流。官方发布
2023 年 7 月 Anthropic Claude 2 提升推理、编程与长文档能力,长上下文成为模型竞争的重要维度。官方发布
2023 年 8 月 Meta / Code Llama 团队 Code Llama 在 Llama 2 上专门训练代码生成、补全与指令能力,开放代码模型快速普及。官方发布
2023 年 9 月 Mistral AI / Arthur Mensch、Guillaume Lample、Timothée Lacroix 团队 Mistral 7B 用较小参数和高效注意力取得强性能,证明开放小模型可以兼顾成本、速度与本地部署。
2023 年 9—11 月 OpenAI / DALL·E 3、GPT-4 Turbo 团队 更强图像生成、128K 上下文与 JSON/函数调用 大模型开始可靠地产生结构化输出,图像生成也能更准确理解复杂自然语言提示。
2023 年 11 月 Anthropic Claude 2.1 200K 上下文、较低幻觉率和工具调用测试版,使超长文档分析与企业流程更可行。官方发布
2023 年 12 月 Google DeepMind / Demis Hassabis、Jeff Dean、Gemini 团队 Gemini 1.0 从设计上统一文本、图像、音频和视频理解,Google 正式进入原生多模态基础模型竞赛。
2023 全年 阿里云 / Qwen 团队;DeepSeek 团队等 中国开放模型体系形成 通义千问、DeepSeek Coder 等持续开放权重,中文、代码和本地部署能力迅速提升,全球竞争不再只有美国闭源模型。

八、推理模型、实时多模态与工具协议出现(2024)

时间 主体(机构 / 个人) 突破 实现了什么
2024 年 2 月 Google DeepMind / Gemini 团队 Gemini 1.5 采用 MoE 等技术,把可用上下文扩展到百万级,能处理大型代码库、长视频和大量文档。
2024 年 2 月 15 日 OpenAI / Sora 团队 Sora 研究预览 用扩散 Transformer 和时空 patch 生成最长约一分钟视频,视频生成开始呈现长时一致性与简单世界模拟能力。技术报告
2024 年 3 月 Anthropic Claude 3(Haiku、Sonnet、Opus) 统一文本和视觉输入,覆盖低延迟到高性能档位,模型服务开始明确分层。官方发布
2024 年 4 月 Meta Llama 3 以更大训练数据和改进后训练提升开放模型通用能力,开放权重与闭源前沿模型差距继续缩小。官方发布
2024 年 5 月 13 日 OpenAI GPT-4o 在一个低延迟系统中处理文本、视觉和语音,支持近实时自然对话,多模态从“分别调用模型”走向统一交互。官方发布
2024 年 6 月 Anthropic Claude 3.5 Sonnet 与 Artifacts 提升代码、视觉和推理,并把生成结果放进可迭代工作区,AI 从聊天框向协作界面发展。官方发布
2024 年 7 月 Meta Llama 3.1 405B 发布 405B 开放权重模型,支持 128K、工具调用与多语言,把开放模型推到前沿大模型规模。官方发布
2024 年 9 月 OpenAI / o1 团队 o1 推理模型 在回答前使用更多推理时计算,显著提升数学、科学和编程问题表现,行业从“预训练扩展”转向“训练 + 推理时扩展”。官方说明
2024 年 9 月 Meta Llama 3.2 发布视觉模型以及 1B/3B 端侧模型,覆盖云端多模态和手机本地 AI。官方发布
2024 年 10 月 Anthropic Computer Use 测试版 模型能看屏幕、移动鼠标、点击和输入,首次以通用 GUI 操作为公开模型能力。官方发布
2024 年 10 月 OpenAI ChatGPT Search 把实时网页检索、答案生成和来源链接整合进对话,通用助手开始直接竞争搜索入口。官方发布
2024 年 11 月 Anthropic / David Soria Parra、Justin Spahr-Summers 等 Model Context Protocol(MCP) 定义 AI 应用连接数据源和工具的开放协议,减少每个模型与每个系统单独集成的重复工作。官方发布
2024 年 12 月 Google DeepMind Gemini 2.0 强化原生工具调用、实时多模态和智能体能力,模型从回答器进一步转为可执行系统。
2024 年 12 月 DeepSeek / 梁文锋与 DeepSeek 团队 DeepSeek-V3 以 MoE 和高效训练实现强通用、代码和数学能力并开放模型,显著改变高性能大模型的成本预期。官方发布
2024 年 12 月 OpenAI Sora Turbo 产品化 文生视频从研究预览进入可用产品,支持文本、图像、视频输入和故事板编辑;同时仍存在物理错误和长时一致性限制。官方发布

九、从“会回答”转向“会推理、会用工具、能持续执行”(2025)

时间 主体(机构 / 个人) 突破 实现了什么
2025 年 1 月 20 日 DeepSeek / DeepSeek-R1 团队 DeepSeek-R1 用强化学习强化长链推理,开放模型与蒸馏版本,推动高水平推理模型低成本化和本地化。官方发布
2025 年 1 月 23 日 OpenAI / Operator、CUA 团队 Operator 与 Computer-Using Agent 模型通过视觉界面点击、输入和滚动网页,能执行预订、填表等浏览器任务。官方发布
2025 年 2 月 OpenAI Deep Research 智能体可连续搜索、阅读和综合大量网页与文件,生成带来源的研究报告,研究流程开始自动化。官方发布
2025 年 2 月 24 日 Anthropic Claude 3.7 Sonnet、Claude Code 把快速回答与扩展推理合并为混合模型,并推出能读代码库、改文件、运行命令的终端编程智能体。官方发布
2025 年 2 月 27 日 OpenAI GPT-4.5 通过更大规模预训练提高知识、写作、自然对话和模式识别,说明“直觉型预训练”仍与推理模型并行发展。官方发布
2025 年 3 月 OpenAI Responses API、Web Search、File Search、Computer Use、Agents SDK 把模型、工具、追踪和智能体编排整合为开发平台,企业可构建可观察的任务代理。官方发布
2025 年 4 月 Meta Llama 4 Scout、Maverick 采用 MoE、原生多模态和长上下文,在开放权重体系中引入更高效的专家混合架构。官方发布
2025 年 4 月 OpenAI o3、o4-mini 推理模型能够在推理过程中自主调用网页、代码执行、文件和图像工具,并对图像进行推理。官方发布
2025 年 4 月 29 日 阿里云 / Qwen 团队 Qwen3 在单一模型中支持思考/非思考模式,并开放稠密与 MoE 权重,强化多语言、数学、代码和智能体能力。官方发布
2025 年 5 月 OpenAI / Codex 团队 云端 Codex 软件工程智能体 每个任务在隔离环境中读代码、修改、运行测试并提交结果,可并行处理多个工程任务。官方发布
2025 年 5 月 22 日 Anthropic Claude Opus 4、Sonnet 4 面向长时间编码、工具使用和智能体任务优化,编程助手开始承担跨文件、跨步骤工作。官方发布
2025 年 6 月 MiniMax / 闫俊杰与 MiniMax 团队 MiniMax-M1 开放混合注意力推理模型,提供百万级上下文和超长推理输出,推动长上下文推理的成本竞争。官方发布
2025 年 7 月 9 日 xAI / Elon Musk、Grok 团队 Grok 4 强化实时搜索、代码执行和原生工具使用,前沿模型竞争扩大到实时信息与智能体执行。官方发布
2025 年 7 月 17 日 OpenAI ChatGPT Agent 合并浏览、研究、终端、文件和动作能力,可在用户监督下完成多步骤在线任务。官方发布
2025 年 7 月 22 日 阿里云 / Qwen 团队 Qwen3-Coder、Qwen Code 以 MoE、256K 原生上下文和工具调用面向仓库级智能体编程,开放代码智能体进入主流。官方发布
2025 年 8 月 5 日 OpenAI gpt-oss-120b、gpt-oss-20b 以 Apache 2.0 发布开放权重推理模型,支持工具调用并可在较低成本硬件部署。官方发布
2025 年 8 月 7 日 OpenAI GPT-5 用路由系统统一快速回答与深度推理,加强编码、视觉、写作和工具调用,通用模型从单一网络走向“模型系统”。官方发布
2025 年 8 月 21 日 DeepSeek DeepSeek-V3.1 一个模型同时提供思考与非思考模式,继续训练长上下文并强化工具调用、多步智能体任务。官方发布
2025 年 8 月 28 日 OpenAI gpt-realtime 将低延迟语音到语音、图像输入、电话 SIP 与 MCP 接入生产 API,实时语音智能体可以直接服务客户。官方发布
2025 年 9 月 Anthropic Claude Sonnet 4.5 进一步强化长时间编码、计算机操作和智能体可靠性,持续执行成为前沿模型核心指标。官方发布
2025 年 9 月 OpenAI Sora 2 视频模型加入同步对白与音效、增强物理一致性和可控性,生成媒介从无声短片走向视听一体;Sora 产品于 2026 年 4 月 26 日停止提供。官方发布
2025 年 10 月 Anthropic Agent Skills 将说明、脚本和资源封装成可复用技能包,智能体能力开始以模块化方式分发。官方发布
2025 年 10 月 OpenAI AgentKit 提供智能体构建、连接器、评估和部署组件,企业智能体工程从拼装 API 转向完整工具链。官方发布
2025 年 11 月 Google DeepMind Gemini 3 强化多模态推理、智能体编程和复杂任务执行,Google 模型体系进入以行动为中心的新一代。官方发布
2025 年 12 月 1 日 DeepSeek DeepSeek-V3.2、V3.2-Speciale 把思考直接整合进工具使用,并以大规模智能体环境合成数据训练多步执行。官方发布
2025 年 12 月 11 日 OpenAI GPT-5.2 面向专业知识工作、长上下文、文档处理和长时间智能体任务优化,模型开始直接交付工作成果而非只给建议。官方发布

十、长时自主工作、端到端知识生产与具身智能(2026,截至 8 月 22 日)

时间 主体(机构 / 个人) 突破 实现了什么
2026 年 2 月 5 日 OpenAI GPT-5.3-Codex 将前沿编码、计算机操作和长期任务执行合并,面向完整软件工程生命周期持续工作。官方发布
2026 年 2 月 5 日 Anthropic Claude Opus 4.6 提升编码、规划、长任务和智能体能力,并测试百万级上下文,面向大型代码库和复杂工作流。官方发布
2026 年 2 月 17 日 Anthropic Claude Sonnet 4.6 把更强推理、代码和工具使用下放到更高性价比模型,智能体能力开始普及而非只存在于旗舰型号。官方发布
2026 年 2 月 Google DeepMind Gemini 3.1 Pro、Gemini 3 Deep Think 强化原生多模态、复杂科学与抽象推理,可处理大型代码库、多文档和复合视觉材料。官方发布
2026 年 3 月 5 日 OpenAI GPT-5.4 面向专业工作、编码、智能体和可交付成果生成,把研究、分析、设计和软件执行进一步统一。官方发布
2026 年 4 月 21 日 OpenAI ChatGPT Images 2.0 加强图像内文字、编辑一致性与精确控制,图像模型更接近可反复修改的设计工具。官方发布
2026 年 4 月 21 日 Google DeepMind 新一代 Gemini Deep Research 支持更长时间的自主研究、MCP 数据连接和可视化输出,从网页综述迈向多工具研究工作流。官方发布
2026 年 4 月 23 日 OpenAI GPT-5.5 提升百万级上下文、编码、研究、数据分析、文档/表格制作和计算机操作,可持续跨工具完成模糊的复合任务。官方发布
2026 年 4 月 24 日 DeepSeek DeepSeek-V4 Preview 开放 MoE 模型扩展到百万级上下文并针对智能体优化,继续降低长期任务和私有部署门槛。官方发布
2026 年 5 月 Google DeepMind Gemini 3.5 Flash 在较低延迟下提供前沿推理、代码、交互界面生成和智能体执行,实时应用能力提升。官方发布
2026 年 5 月 25 日 xAI Grok Build CLI 推出终端软件工程智能体,能理解代码库、修改文件、运行命令并迭代验证。官方发布
2026 年 5 月 28 日 Anthropic Claude Opus 4.8 强化编码、计算机使用、长时智能体与自我校验,前沿模型竞争转向可靠完成整段工作。官方发布
2026 年 6 月 30 日 Anthropic Claude Sonnet 5 更主动地规划、调用浏览器和终端并保持任务进度,中型成本模型也能承担较长的自主任务。官方发布
2026 年 7 月 8 日 OpenAI GPT-Live 新一代实时语音模型提高自然度、打断处理和工具衔接,语音智能体更接近连续人机协作。官方发布
2026 年 7 月 9 日 OpenAI GPT-5.6 继续提升推理、设计、软件工程、科研和端到端知识工作能力,重点从回答质量转向完整成果质量。官方发布
2026 年 7 月 16 日 xAI Grok 4.5 加强工具使用、实时信息和复杂执行,与通用聊天模型并行发展为行动型模型。官方发布
2026 年 7 月 21 日 Google DeepMind Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber 形成高性能、低成本和网络安全专用模型组合,模型部署从“一个通用型号”转向按任务分层。官方发布
2026 年 7 月 24 日 Anthropic Claude Opus 5 进一步提高复杂编码、工具编排和长时自主执行,旗舰模型成为通用数字工作执行器。官方发布
2026 年 7 月 30 日 Google DeepMind Gemini Robotics 2、Robotics-ER 2 将视觉理解、任务编排、全身控制、灵巧操作和多机器人协作连接起来,AI 从屏幕内智能体向物理执行扩展。官方发布
2026 年 8 月 12 日 xAI Grok 4.6 强化长时间智能体、交互式成果和视觉工作,强调持续执行而非单轮回答。官方发布
2026 年 8 月 13 日 Google / Gemini 团队 Gemini 3.7 Flash 以更低延迟和成本加强编码、长时软件工程、文档理解、网页开发和多步工具调用,面向大规模生产智能体。官方发布
2026 年 8 月 13 日 DeepSeek DeepSeek-V4 Pro 在 V4 基础上增强生产级智能体、可调推理强度与 Responses API/Codex 兼容,开放模型进一步进入真实工作流。官方发布
2026 年 8 月 21 日 DeepSeek DeepSeek-V4-Flash-Vision-Exp 为 V4 Flash 增加图像输入与多模态 API,DeepSeek 的开放智能体路线由文本、代码扩展到视觉理解。官方发布

截至 2026 年 8 月,AI 到了什么水平

能力领域 当前水平 仍然做不到或不可靠的部分
语言与推理 能处理复杂写作、数学、代码、法律/商业材料和多步分析;前沿模型会按任务自动选择快速回答或深度推理。 仍会幻觉、误引、偷换条件;高分不等于稳定掌握真理,关键结论仍需来源、计算或专家复核。
多模态 可统一理解文本、图片、图表、PDF、语音和视频;可生成并编辑图像、音频、音乐、语音和视频。 长视频一致性、精确空间关系、真实物理、人物身份连续性与版权边界仍不完全可靠。
软件工程 可理解大型代码库,规划改动,编辑多文件,运行测试,修复错误并提交 PR;多个智能体可并行工作。 模糊需求、遗留系统、隐性业务规则和高风险上线仍需资深工程师监督。
搜索与研究 可持续浏览、比较多来源、运行代码分析数据,并生成带引用的研究报告。 来源可能遗漏或误读,互联网本身存在错误;原创科学结论仍需要实验、同行评议和可复现验证。
计算机操作 能看屏幕并操作浏览器、终端、办公软件和部分企业系统,可跨工具完成完整流程。 页面变化、权限、验证码、提示注入和异常分支会造成失败;涉及付款、删除、发送和发布必须保留人类确认。
长上下文与记忆 部分模型支持百万级上下文,并能通过检索、压缩和外部记忆处理大型项目。 “看得下”不等于“每处都记得准”;长期一致性和跨会话记忆仍依赖工程系统。
开放与本地模型 开放权重模型已具备强推理、代码和工具调用能力;小模型可在个人电脑、手机和边缘设备运行。 最强模型训练和高并发推理仍需要昂贵集群;本地模型通常在复杂推理和稳定性上弱于前沿云模型。
机器人 已能完成视觉理解、语言规划、灵巧抓取、全身动作和受控环境中的多机器人协作。 尚未形成可在任意家庭、工厂和公共空间长期安全工作的通用机器人,真实世界数据与安全是主要瓶颈。
自主性 AI 已从聊天助手发展为能规划、调用工具、检查结果、持续数十分钟到数小时的数字智能体。 还不是可以无条件托管目标的“完全自主员工”;任务越长,错误累积、权限和安全风险越高。

**结论:**截至 2026 年 8 月,AI 已进入“多模态推理模型 + 工具调用 + 长时智能体 + 物理机器人”的阶段。它在大量知识工作上达到高水平助理或局部专家水平,并能直接产出代码、研究、文档、设计和操作结果;但尚无被学术界与产业界共同验证的通用人工智能(AGI),更不存在可以在开放世界中长期、稳定、低风险地替代人类判断的系统。

技术主线

形式化神经元 → 符号推理 → 专家系统 → 统计机器学习 → 深度学习 → Transformer → 基础模型 → 生成式多模态 → 推理模型 → 工具协议与计算机操作 → 长时自主智能体 → 具身智能。