按发展时间点
前置萌芽期 (20世纪初 – 1955年)
理论奠基:图灵提出图灵机理论 (1936) 和图灵测试 (1950);麦卡洛克与皮茨提出人工神经元模型 (1943);维纳《控制论》、香农《信息论》相继问世。
硬件准备:第一台通用电子计算机 ENIAC 诞生 (1946)。
阶段特征:思想、理论、硬件模型已齐备,人工智能的概念呼之欲出。
正式诞生与第一次热潮 (1956年 – 1960年代末)
标志事件:达特茅斯会议 (1956) 正式提出“人工智能”一词。
主导路线:符号主义,即用逻辑符号和规则模拟人类推理。
代表成果:逻辑理论家程序、跳棋/象棋博弈程序、简单的自然语言对话系统。
阶段特征:学界普遍乐观,认为很快能攻克通用智能;但算力不足、常识知识难以编码的隐患已悄然埋下。
第一次AI寒冬 (1970年代)
直接诱因:符号主义在复杂场景下失效,算力与数据严重匮乏。
关键节点:英国发布《莱特希尔报告》(1973) 否定AI研究价值,各国政府大幅削减经费。
结果:行业萧条,企业停止投资,大量研究人员转行,AI进入寒冬。
专家系统复兴与第二次寒冬 (1980年代)
技术转向:从追求通用推理,转向构建面向特定领域的“专家系统”,依靠知识库与推理机解决问题。
典型应用:医疗诊断系统MYCIN、化学分析系统DENDRAL,并在工业、金融等领域成功落地。
产业热潮:全球AI市场超10亿美元,日本启动“第五代计算机”计划。
泡沫破裂:专家系统知识维护成本高、难以跨领域复用。1987年市场泡沫破裂,AI迎来第二次寒冬。
多元探索与神经网络蛰伏 (1990年代 – 2000年代)
三大流派并行:符号主义(轻量化转型)、联结主义(神经网络,如CNN雏形用于手写数字识别)、行为主义(机器人自适应)各自探索。
里程碑事件:IBM“深蓝”击败国际象棋世界冠军卡斯帕罗夫 (1997)。
技术积蓄:统计学习方法(支持向量机、随机森林等)兴起,互联网带来海量数据,GPU提升算力,为后续爆发埋下伏笔。
阶段特征:低调深耕的蛰伏蓄力期。
深度学习大爆发 (2010年代)
转折点:AlexNet在2012年ImageNet图像识别大赛中一鸣惊人,开启端到端自主学习的新范式。
技术突破:计算机视觉(人脸识别、自动驾驶)、自然语言处理(机器翻译、语音识别)、博弈等领域集中突破。
标志事件:AlphaGo击败围棋世界冠军李世石 (2016),引发全球对AI的全民关注。
产业生态:科技巨头全面入局,TensorFlow、PyTorch等框架开源,AI从实验室迅速走向应用。
生成式AI与大模型时代 (2020年代至今)
大语言模型崛起:以GPT系列为代表,展现出强大的通用理解与生成能力,迅速适配写作、编程、教育等无数日常场景。
多模态融合:文本、图像、音频、视频的统一理解与生成成为现实,催生文生图、文生视频、数字人等应用。
行业全面普惠:AI下沉至普通人日常使用,低代码AI与行业垂直大模型快速普及,全球AI法规与伦理准则陆续出台。
按发展能力点
第一阶段:手工逻辑——用规则堆砌的“智能”(1950s - 1980s)
核心理念
符号主义,即认为智能可以通过“如果……就……”的逻辑规则来模拟。
典型能力
逻辑推理、在定义好的狭窄领域里做专家。
会下棋:1959年的跳棋程序和1997年击败国际象棋冠军的“深蓝”,都属此类。它们的核心是穷举和评估棋局,而非“理解”棋局。
当专家:1970年代的医疗诊断系统MYCIN,包含了成百上千条专家录入的规则,能根据症状推理出可能的细菌感染和用药建议。
局限
严重依赖人类手工输入知识,无法处理规则之外的模糊地带。比如,它无法识别一张照片里是猫还是狗。这种系统很“脆”,一碰就碎。这也是导致两次“AI寒冬”的根本原因:人力堆砌的知识总是不完整、不灵活。
代表产物
逻辑理论家 (Logic Theorist):1956年,被称为“世界上第一个人工智能程序”,能自动证明数学定理。
跳棋程序 (Checkers):1959年,具备自我学习能力,能通过不断对弈提升水平,最终击败了人类冠军。
ELIZA:1960年代早期自然语言处理程序,能模拟心理医生与人类进行简单的文字对话,靠的是预设的脚本规则。
MYCIN 专家系统:1970年代,用于辅助诊断血液感染和推荐抗生素,在特定领域的准确性超过了部分人类专家。
第二阶段:统计学习——让机器从数据中“找规律”(1990s - 2010s)
核心理念
从“逻辑推理”转向“概率统计”,联结主义开始抬头。人们不再教机器规则,而是给它大量的数据和答案,让算法自己去找到输入和输出之间的映射关系。
典型能力
分类、回归、浅层的模式识别。
垃圾邮件过滤:不再是靠规则“含‘促销’二字即为垃圾邮件”,而是通过学习海量已标注的邮件,自动计算出某些词组合起来是垃圾邮件的概率。
手写数字识别:银行用支持向量机(SVM)等方法,能比较准地识别信封上的邮编。但这些模型需要人工设计复杂的“特征”(比如数字的笔画走向、交叉点),很费功夫。
关键进步:机器有了从有限数据中“归纳”的能力,开始能容忍现实世界的些许模糊。但它的瓶颈在于,需要非常专业的领域知识来为每个任务手工设计特征,通用性很差。
代表产物
垃圾邮件过滤器:通过学习大量已标注的邮件数据,自动计算新邮件为垃圾邮件的概率,成为此时期最普及的应用之一。
手写数字识别系统:基于支持向量机(SVM)等方法,成功应用于银行支票识别和邮政编码分拣,是模式识别商业化的里程碑。
IBM 深蓝:1997年击败国际象棋世界冠军卡斯帕罗夫,核心是用精巧算法暴力穷举棋步可能,本质是统计学搜索。
早期推荐系统:电商和视频网站开始用“协同过滤”等算法,通过分析用户行为数据来推测你可能喜欢什么。
第三阶段:深度学习——从“设计特征”到“自主学习”(2010s - 2020s初)
核心理念
表征学习,端到端的自主学习,无需人工设计特征。
这是AI能力的一次质变,核心理念是表征学习。我们不再需要费心告诉机器应该看哪里,而是直接给它原始数据(像素、波形、文字)和最终目标,中间的神经网络会自动学习如何提取最有用、最抽象的特征。
典型能力
精准感知(看、听、说),形成策略(下棋)。
视觉的觉醒(2012年):AlexNet在图像识别上的突破,就是这种能力的完美展示。第一层神经元可能只识别边缘和颜色,第二层识别眼睛和鼻子,再深层识别出整张脸。这些层级特征全是网络自己从数百万张图片中“悟”出来的,效果远超人类手工设计。
博弈的巅峰(2016年):AlphaGo不再像“深蓝”那样暴力穷举。它的策略网络和价值网络,通过分析几千万盘人类棋谱和不断的自我对弈,学会了评估局势的“大局观”和落子的“棋感”,下出了人类从未见过的创造着法。这标志着机器拥有了强大的感知和策略制定能力。
机器第一次能如此精准地理解这个非结构化的世界——看、听、说。人脸识别、语音助手、机器翻译开始走向实用。
局限
每个模型仍是只会单一任务的“专才”,缺乏通识。
代表产物
AlexNet:2012年出现,在图像识别领域取得巨大突破,直接开启了深度学习时代。
Siri / 小爱同学等语音助手:深度学习让语音唤醒、识别和合成变得实用,开启了人机语音交互。
人脸识别系统:被大规模应用于手机解锁、安防和支付认证,AI开始能精准识别个体。
AlphaGo:2016年击败围棋世界冠军李世石,展现了AI在复杂博弈中策略制定的创造力。
机器翻译:以谷歌翻译为代表,从过去的词组拼凑式翻译,转向能理解并生成更流畅、更贴近人类表达的整体段落。
第四阶段:大模型——从“专才”到“通才”的涌现(2020s至今)
核心理念
生成式AI和规模法则
模型参数达到千亿甚至万亿级别,训练数据涵盖几乎整个互联网的文本和图像。量变最终引发了质变。
典型能力
涌现出了逻辑推理、跨模态生成与创造等通用能力。
里程碑能力:上下文理解与生成,以及“涌现”能力。
不仅是识别,更是创造(2022年后):以GPT系列为代表,模型的能力不再是简单的分类,而是能够基于前文,预测出下一个最合理的词或像素,从而生成连贯的长文、逼真的图像和流畅的视频。
“涌现”的奇迹:当模型参数突破某个临界点后,突然解锁了训练时没有明确教过的能力,比如逻辑推理、代码生成、数学解题、思维链,甚至一定的幽默感。这些能力不是人为设计的规则,而是模型在海量数据和参数下自发产生的。
多模态贯通:最新的模型能像人一样,同时理解文字、图像、声音,并让它们互相关联。给它一张图,它能讲出其中的故事;给它一段描述,它能生成相应的图片或视频。
能力本质:大模型正在成为一个通用的世界知识底座和推理引擎。它从单任务“专才”进化成了能处理各种复杂任务的“通才”,并开始具备人类最引以为傲的逻辑推理和创造力雏形。
本质
从机械执行的“专才”,进化为理解与创造的“通才”。
代表产物
核心引擎:基础模型<br>这是大模型时代的基石,按处理的数据类型可以分为:
大语言模型:<br>
海外:OpenAI的GPT-4系列、Google的Gemini系列、Anthropic的Claude系列、Meta的开源模型LLaMA系列。<br><br>国内:百度的文心一言、阿里的通义千问、字节的豆包、月之暗面的Kimi、DeepSeek系列等。
多模态大模型<br>
文生图:Midjourney、Stable Diffusion、OpenAI的DALL-E。
文生视频:OpenAI的Sora、国内的可灵和即梦。
全能理解:能同时处理图文音视频的模型,如GPT-4o、Gemini。
落地应用:衍生生态<br>这些基础模型能力被封装和集成到各种应用中,直接服务于用户。
AI对话与助手
消费级产品:ChatGPT、Microsoft Copilot、国内的豆包、Kimi智能助手。
平台集成:Windows、Office 365、手机厂商系统(如Siri、小爱同学)中的AI助理。
AI创作工具
办公写作:写作文档、邮件、PPT。
图像设计:用自然语言生成海报、插画。
视频与音乐:AI剪辑、生成配乐、数字人播报。
AI编程助手
代表产品是 GitHub Copilot,能用自然语言描述需求直接生成代码,极大提升了开发效率。
行业垂直应用
AI制药:加速新药分子发现。
AI教育:提供一对一的个性化辅导。
AI金融:用于风险评估、智能投顾等。
按应用生态
模型部署与运行:让模型“跑起来”<br>这类工具让你在本地或服务器上运行大模型,是保障数据隐私和降低成本的基础。
vLLM
定位为企业级高性能推理引擎。它就像数据中心的高效发动机,通过连续批处理、多GPU分布式推理等技术,最大化吞吐量,适合需要服务大量用户的生产环境
LM Studio
定位为桌面端图形化模型管理工具。它就像一个带应用商店的本地模型管家,提供漂亮的界面,让你能一键下载、管理和对比测试各种开源模型,完全无需接触命令行
llama.cpp
定位为在低配设备上运行的C++推理框架。它是极客的“万能钥匙”,经过极致优化,甚至能在树莓派、旧笔记本或手机上运行大模型,适合资源受限的场景
ollama
应用开发平台:把能力“拼起来”<br>这类平台提供可视化、低代码的方式,帮助快速构建AI应用,大大降低开发门槛。
Coze (扣子)
定位为字节跳动推出的AI Bot开发平台。就像有海量插件的机器人制造工厂,它集成了丰富的插件市场和多模态交互能力,特别适合开发社交媒体、电商导购等场景的智能体
FastGPT
定位为专注高性能对话与内容生成。可以看作是响应极快的对话引擎,它基于流式响应和分布式推理,能做到5秒内响应复杂查询,适合做客服话术生成、AI原型验证等
AutoGen
定位为微软推出的多智能体协作框架。它像一个为AI Agent(智能体)准备的“项目管理办公室”,允许定义多个不同角色的Agent,让它们像团队一样协作完成复杂任务
LangChain
定位为“代码优先”的LLM应用开发框架。它提供了一套标准化积木,让专业开发者用代码灵活地“搭积木”,构建从简单到复杂的各类应用,生态非常庞大
Dify
知识增强与检索 (RAG):让大脑“有据可查”<br>这类工具通过检索外部知识库来增强模型,有效解决大模型“幻觉”和知识时效性问题。
RAGFlow
定位为深度文档理解RAG引擎。它就像是处理复杂文档的“解剖大师”,能高精度地解析PDF、PPT、表格等复杂格式,并进行多路召回,适合金融、法律等对文档分析要求极高的行业
MaxKB<br>
定位为大模型驱动的知识库问答系统。可以看作是开箱即用的企业知识库问答专家。它支持多模型接口和多模态检索,在石油行业井控知识库等场景中,知识检索准确率可达98.7%。
AnythingLLM
定位为全栈LLM应用框架。它就像一个高度灵活的万能工具箱,支持超过10种向量数据库,任何组件都可替换,适合教育和医疗领域需要深度定制的解决方案。
openspg
知识图谱增强 (GraphRAG):让大脑“逻辑严谨”<br>除了用文本检索,还可以用知识图谱为模型注入逻辑推理能力,这就是GraphRAG路线。
Microsoft GraphRAG
定位为微软开源的知识图谱RAG框架。它是从全局视角理解文档集的“布道者”,通过构建知识图谱和社区分层总结,让大模型不仅能回答具体问题,还能回答“这个数据集主要讲什么”这类总结性问题。
Graphify
定位为零配置的轻量级知识图谱工具。它可以被看作是极简主义的个人知识库构建师。它能自动将你的本地文件夹(代码、论文、图片)一键转化为知识图谱,号称能节省71.5倍的token消耗。
LightRAG
定位为香港大学开源的图结构RAG框架。它以轻量高效为特点,在保持强大图结构检索能力的同时,追求更低的计算开销。
NebulaGraph
定位为企业级分布式图数据库。作为GraphRAG方案中扎实的基座,它专注于高效存储和处理海量图数据,是支撑上层应用的基础设施。
工作流自动化与交互界面:把一切“连起来”<br>这类工具负责将AI能力与现有业务系统连接,或提供更友好的用户交互界面。
n8n
定位为开源智能流程自动化平台。它像一个万能胶,通过可视化方式将AI模型与钉钉、企微、数据库等280多个系统连接起来,实现跨平台自动化流程。
Open WebUI
定位为类ChatGPT的本地化交互界面。它是一款零代码AI画布,可以一键对接Ollama等后端模型,让你通过聊天界面与本地模型交互,并支持RAG、权限管理等企业级功能。