Skip to content

AI 基础认知

「你不需要成为数学家才能理解AI,但你需要理解它在做什么。」

—— 这是这个阶段最核心的一句话

为什么需要这个阶段?

很多新人一上来就想学深度学习、大模型,结果被各种术语淹没:监督学习、反向传播、Transformer、KV Cache、RLHF……

这些术语背后的思维方式才是关键。这个阶段不写代码、不推公式,只做一件事:帮你建立对 AI 领域的全局认知框架

有了框架,后面的学习就像拼图——你知道每一块该放在哪里。


什么是 AI、ML、DL?

这是 AI 领域最基础的三个概念,也是最容易混淆的。让我们一次说清楚。

三个概念的关系

text
┌──────────────────────────────────────────────────┐
│                    AI                            │
│           人工智能(最大范围)                      │
│                                                  │
│   ┌────────────────────────────────────────┐     │
│   │              ML                        │     │
│   │         机器学习                        │     │
│   │                                        │     │
│   │   ┌────────────────────────────────┐   │     │
│   │   │           DL                   │   │     │
│   │   │       深度学习                  │   │     │
│   │   │                                │   │     │
│   │   │   Transformer、CNN、RNN...     │   │     │
│   │   └────────────────────────────────┘   │     │
│   └────────────────────────────────────────┘     │
└──────────────────────────────────────────────────┘

它们是包含关系:AI ⊃ ML ⊃ DL

AI(Artificial Intelligence)—— 人工智能

定义:让机器表现出类似人类智能的技术总称。

AI 是最大的概念。只要是让机器"看起来有智能",都算 AI。这包括:

  • 写规则让机器执行(专家系统)
  • 让机器从数据中学习(机器学习)
  • 用神经网络模拟大脑(深度学习)
text
举例:
- 1997年击败卡斯帕罗的"深蓝" → AI(规则搜索,不是ML)
- 手机上的语音助手 → AI
- 自动驾驶汽车 → AI
- ChatGPT → AI

ML(Machine Learning)—— 机器学习

定义:让机器从数据中自动学习规律,而不是人工编写规则的方法。

ML 是 AI 的一个子集。核心思想是:

text
传统编程:  规则 + 数据 → 答案
机器学习:  数据 + 答案 → 规则

也就是说,你不再需要告诉机器"怎么做",而是给它大量数据和正确答案,让它自己总结规律

text
举例:
- 垃圾邮件分类:给机器看1万封邮件(标注了"垃圾"/"正常"),它学会自动分类
- 房价预测:给机器看历史房价数据,它学会预测新房价格
- 推荐系统:给机器看用户行为数据,它学会推荐你可能喜欢的商品

DL(Deep Learning)—— 深度学习

定义:使用多层神经网络从数据中学习的机器学习方法。

DL 是 ML 的一个子集。"深度"指的是神经网络有很多层(深度)。它是目前 AI 领域最主流、最成功的方法。

text
举例:
- 图像识别:CNN识别照片中的猫和狗
- 语音识别:将语音转为文字
- 机器翻译:将中文翻译成英文
- ChatGPT:用Transformer生成人类级别的文本

三者对比总结

AIMLDL
范围最大中等最小
方法任何让机器有智能的方法从数据中学习规律用深度神经网络学习
数据需求不一定中等大量
计算需求不一定中等
典型代表专家系统、搜索算法决策树、SVM、线性回归CNN、RNN、Transformer
当前热度基础最热

💡 一句话理解

AI 是目标,ML 是路径,DL 是当前最好用的交通工具。


AI 的三要素:算法、数据、算力

了解 AI、ML、DL 的关系后,下一步看看 AI 靠什么运转。算法、数据、算力构成了 AI 的三大要素,缺一不可。

要素核心概念应用及关联技术
算力(Computing Power)衡量计算设备执行算法、处理数据的能力数据中心、分布式计算、云计算、边缘计算、HPC
算法(Algorithm)解决问题、实现特定功能的有序指令和步骤ML、DL、NLP、CV、推荐系统
数据(Data)对现实世界的描述和反映,以数字/文字/图像形式表现数据挖掘、数据分析、数据仓库、可视化、数据安全
  • 算法是程序和规则,用于处理数据并从中学习(如决策树、SVM、神经网络)。
  • 模型是算法在给定数据上训练后的结果,可用来预测/分类。

算法开发流程

深入理解业务知识 → 抽象总结数学模型 → 描述分析业务问题
→ 构建求解数学问题 → 算法选型原型开发
  • 建模:建立 X 与 Y 的关系(如 y=ax+b),描述关系的表达就是算法。
  • 训练:找到最优参数 a、b(loss 最小化)。
  • 微调:针对新任务微小改变全部或部分参数数值。
  • 推理:输入新 x*,用训练好的模型推断 y*。
  • 分为「0~1 破题阶段」与「1~N 持续提升阶段」。

数据质量决定算法性能上限

数据质量很差,再强大的算法也无法得到很好性能;数据质量很好,即使简单算法也能得到很好性能。

  • 数据质量 = 特征 + 样本集
  • 特征质量(影响训练与推理):预处理、特征工程、人工标注,本质是选择高信噪比特征。
  • 样本集质量(主要影响训练):取决于数据空间遍历程度与采样密度;手段包括联邦学习、持续学习、增量学习。
  • 典型案例:Meta LLaMA 65B(约 4.5TB 数据)效果好于 OpenAI GPT-3 175B(约 570GB 数据)。观点从「以模型为中心」走向「以数据为中心」(钢板 AI 质检得分从 57.6 提升到 60.2)。

AI 发展简史

了解历史,能帮助你理解今天的技术为什么是这样的。

时间线总览

text
1950s        1980s        1990s        2012         2017         2022
  │            │            │            │            │            │
  ▼            ▼            ▼            ▼            ▼            ▼
图灵测试    专家系统     深蓝胜     AlexNet    Transformer   ChatGPT
诞生        兴起         国际象棋   革命        论文发表      引爆

第一阶段:起源与乐观(1950s-1960s)

时间事件意义
1950图灵发表《计算机器与智能》提出"图灵测试":机器能否思考?
1956达特茅斯会议"人工智能"一词正式诞生
1958感知机(Perceptron)最早的神经网络雏形

这一阶段,人们对 AI 极度乐观,认为"二十年内机器将能完成人类所有工作"。

第二阶段:第一次寒冬(1970s)

事实证明,早期的乐观太天真了。AI 遇到了根本性困难:

  • 计算能力不足
  • 数据严重匮乏
  • 感知机被发现无法解决"异或"等简单问题

研究经费大幅削减,AI 进入第一次寒冬。

第三阶段:专家系统时代(1980s)

专家系统是这一阶段的代表:把人类专家的知识编码成规则,让机器按规则推理。

text
例子:医疗诊断专家系统
规则1:如果 发烧 AND 咳嗽 → 可能是感冒
规则2:如果 发烧 AND 咳嗽 AND 呼吸困难 → 可能是肺炎
...(数万条规则)

专家系统一度很成功,但很快暴露了问题:现实太复杂,规则写不完。AI 进入第二次寒冬。

第四阶段:机器学习崛起(1990s-2000s)

随着计算机性能提升和数据量增长,统计机器学习开始大放异彩。

时间事件意义
1997IBM 深蓝击败国际象棋世界冠军AI 首次在复杂博弈中胜过人类
2006Hinton 提出"深度学习"概念神经网络重新受到关注
2011IBM Watson 赢得《危险边缘》自然语言理解里程碑

第五阶段:深度学习革命(2012-2020)

2012 年是 AI 历史的转折点

时间事件意义
2012AlexNet 赢得 ImageNet 竞赛深度学习在图像识别中碾压传统方法
2014GAN(生成对抗网络)提出AI 开始学会"创造"
2016AlphaGo 击败李世石深度强化学习震惊世界
2017Google 发表《Attention is All You Need》Transformer 架构诞生
2018BERT 和 GPT 发布预训练语言模型时代开启

为什么是 2012 年爆发? 三个因素同时成熟:

  1. 算力:GPU 让大规模计算成为可能
  2. 数据:互联网积累了海量标注数据
  3. 算法:深度神经网络训练方法成熟

第六阶段:大模型时代(2022-至今)

时间事件意义
2022.11ChatGPT 发布AI 从"专用"走向"通用",引发全球关注
2023GPT-4、LLaMA、Qwen 等大模型涌现大模型成为行业基础设施
2024多模态大模型、Agent 概念兴起AI 开始具备"行动力"
2025+推理优化、端侧部署、行业落地大模型从实验室走向生产

💡 启示

AI 的发展不是一帆风顺的,经历了多次寒冬和复兴。今天的繁荣建立在算力、数据、算法三者共同进步的基础上。理解这段历史,能让你对 AI 的未来有更理性的判断。


AI 的趋势与产业洞察

了解 AI 的宏观趋势,能让你的学习更有方向感。

AI 发展波次与里程碑(从专用走向通用):

  • 1956 达特茅斯会议(提出 AI 概念)→ 1997 深蓝胜国际象棋 → 2015-2020 深度学习+海量数据 → 2020-2022 单模态大模型 → 2022-2023 多模态/多模型协同 → 未来 5~10 年 AGI。
  • 对比尺度:100 万亿参数 ≈ 100 万亿个人类大脑突触。

人工智能五阶段(L1→L5):① Chatbots(对话)→ ② Reasoner(推理,生成思维链)→ ③ Agentic(原生工具调用智能体)→ ④ Innovator(自主生成新创意)→ ⑤ Organization(执行整个组织工作)。越往后越依赖企业私有数据与逻辑注入。

三大定律(为什么模型往大走)

  1. Scaling Law(规模定律):性能强依赖模型规模(OpenAI 2020)。
  2. Chinchilla(数据-参数等比):模型大小与训练 Token 数等比缩放,数据达参数量 20 倍后训练才饱和(DeepMind 2022)。
  3. Emerging(涌现):模型规模达到一定量级后才涌现出更强的推理等能力,阈值随评测口径不同而异(约在 6B~10B 参数量级)(Google 2023)。

模型趋势:从千亿稠密 → 万亿稀疏(MoE),走向超长序列(4K→1M→10M Token)与多模态(Sora 文生视频 60 秒、Gemini 1.5 达 100 万 Token)。

行业趋势:从「技术出发」(第一幕)走向「客户出发」(第二幕);行业核心场景 2024 年起加速落地(智能客服、辅助诊断、智慧政务等);行业头部(互联网、金融、电力、医疗、运营商)率先布局。

政策趋势:全球 170+ 国家/地区发布数字战略、60+ 将 AI 升级为国家战略;中国「人工智能+」写入 2024 年《政府工作报告》;面对制裁(禁止使用/设计/制造先进芯片),自主可控是必由之路


关键概念详解

把 AI 领域的几个核心概念拆开讲清楚,后面的学习会轻松很多。

模型与神经网络

  • 模型:从海量数据中学习隐藏的模式或规律,进而预测或生成数据。
  • 神经网络模型:由大量节点(神经元)相互关联构成的计算模型,是深度学习核心。每个节点的输出函数称为激励函数,每条连接代表信号传输的权重

神经网络数学表达: $$ f(x) = \sum_{i=1}^{n} x_i w_i + b $$

  • 权重(weight):两个节点的连接强弱,即传递上个节点的记忆值。
  • 偏置(bias):模拟神经元的敏感性,每个神经元不同。
  • 参数:通常指权重 + 偏置。
  • 节点:输入节点、隐藏节点(层数即深度)、输出节点。

训练过程:① 正向计算(输入→模型→输出)② 反向计算(由输出修正参数)→ 不断修正直到拟合训练数据。

三大学习范式

机器学习主要有三种学习方式,理解它们的区别是 AI 入门的关键。

1. 监督学习(Supervised Learning)

核心:给机器"带答案的练习题",让它学会做题。

text
训练数据:
  输入(X)         →    输出(Y)
  ─────────              ─────────
  一封邮件内容            垃圾邮件
  一封邮件内容            正常邮件
  一封邮件内容            垃圾邮件
  ...(几万条)           ...

学成后:
  新邮件内容      →    机器自动判断:垃圾/正常

典型任务

  • 分类:判断属于哪个类别(垃圾邮件检测、图像分类)
  • 回归:预测连续数值(房价预测、温度预测)

特点:需要大量标注数据(即"带答案的练习题"),这是最大的成本。

2. 无监督学习(Unsupervised Learning)

核心:给机器"没有答案的题目",让它自己发现规律。

text
训练数据:
  输入(X)
  ─────────
  用户的消费行为数据(没有标签)
  ...

学成后:
  机器自动发现:用户可以分为3类(虽然没人告诉它应该分几类)

典型任务

  • 聚类:将相似的数据分组(用户分群)
  • 降维:压缩数据特征(数据可视化)
  • 异常检测:发现不正常的数据(欺诈检测)

特点:不需要标注数据,但结果可能不如监督学习精确。

3. 强化学习(Reinforcement Learning)

核心:让机器在环境中"试错",通过奖励/惩罚学会最优策略。

text
类比:训练小狗
  做对了 → 给零食(奖励)
  做错了 → 不给零食(惩罚)
  反复训练 → 小狗学会了坐下、握手

机器也一样:
  做出决策 → 得到奖励/惩罚 → 调整策略 → 反复迭代

典型应用

  • AlphaGo 下围棋
  • 自动驾驶决策
  • 游戏AI(如 Dota 2 的 OpenAI Five)
  • 机器人控制

特点:不需要标注数据,但需要定义好奖励函数,训练过程不稳定。

三种范式对比

监督学习无监督学习强化学习
数据有标签无标签环境交互
类比做带答案的练习题自己找规律试错学习
典型任务分类、回归聚类、降维决策、控制
数据成本
代表案例图像分类用户分群AlphaGo

💡 现在的大模型用到了哪些?

现代大语言模型(如 ChatGPT)的训练过程实际上综合使用了这三种范式

  • 预训练:无监督学习(从海量文本中学习语言规律)
  • SFT:监督学习(用问答对教它怎么回答)
  • RLHF:强化学习(用人类反馈优化回答质量)

训练、推理、微调

这三个词是 AI 工程师日常最高频的概念。

训练(Training)

定义:让模型从数据中学习的过程。

text
类比:学生备考
  大量做题(训练数据) → 总结规律(更新参数) → 形成能力(训练好的模型)

训练是最"重"的环节:

  • 需要大量数据
  • 需要大量算力(GPU/NPU)
  • 需要大量时间(几小时到几个月)
  • 成本最高

推理(Inference)

定义:用训练好的模型处理新数据、给出结果的过程。

text
类比:学生考试
  拿到新题目(输入数据) → 运用学到的知识(模型参数) → 给出答案(推理结果)

推理是"轻"的环节(相对训练而言):

  • 不需要训练数据
  • 算力需求相对较低
  • 需要快速响应(毫秒级到秒级)
  • 是模型实际"使用"的环节

训练是一次性的(大部分情况),推理是持续的。 我们日常使用 ChatGPT,就是在"推理"。

微调(Fine-tuning)

定义:在已有模型基础上,用少量新数据继续训练,让模型适应特定任务。

text
类比:已经有驾照的司机,学习开卡车
  不需要从科目一重新学(不需要重新训练)
  只需要学习卡车的特殊操作(用少量数据微调)
  → 很快就能开卡车了

微调是"性价比最高"的环节:

  • 不需要从头训练
  • 数据量要求小
  • 算力和时间成本远低于从头训练
  • 效果好——站在巨人的肩膀上

三者关系

text
┌──────────┐     ┌──────────┐     ┌──────────┐
│   训练    │ ──→ │   微调    │ ──→ │   推理    │
│ Training │     │Fine-tune │     │Inference │
└──────────┘     └──────────┘     └──────────┘
  从零开始        在已有基础上       实际使用
  成本最高        适应性调整         持续运行
  数据最多        数据较少           不需要数据
训练微调推理
目的从零学习适应特定任务使用模型
数据量海量少量不需要
算力需求极高中等较低
时间天-月小时-天毫秒-秒
频率一次性偶尔持续

AI 能做什么、不能做什么

理解 AI 的能力边界,比盲目崇拜或轻视 AI 都重要。

AI 能做的事

已经做得很好的

领域能力例子
图像识别超越人类水平人脸识别、医学影像筛查
语音处理接近人类水平语音转文字、语音合成
自然语言高质量生成翻译、写作、代码生成
模式发现高效准确欺诈检测、推荐系统
博弈决策超越人类水平围棋、国际象棋、电子竞技

正在快速进步的

领域现状挑战
自动驾驶L3/L4 级别初步商用长尾场景、法规、安全
代码生成辅助编程已成熟复杂逻辑、系统设计
科学发现辅助研究AlphaFold 预测蛋白质结构
多模态理解文本+图像+视频真正的跨模态推理
AI Agent概念验证中可靠性、长链路任务

按应用方向看,AI 的能力可以归为三大类:

AI 三大应用方向(决策/感知/生成)

方向关键能力典型应用
决策式 AI决策优化工业优化、决策优化平台、知识图谱
感知视觉 CV图像识别、人脸/人体识别、内容审核、图像搜索、目标跟踪、行为分析
认知/生成生成式 AI / NLP对话机器人、多模态数据处理

此外,还有两个重要的模型方向:

  • 推荐搜索类:代表模型有 DLRM、DIEN 等,用于商品推荐、广告推送、购物搜索(Google Search Labs 也在用)。
  • AI4S(科学计算):代表模型有 EvoFormer、AlphaFold 2 等,用于生物医学、气象预测、方程求解。

AI 做不好的事

根本性局限

  1. 没有真正的理解力

    • AI 模式匹配能力极强,但不"理解"概念的含义
    • ChatGPT 能写关于引力的文章,但它不"体验"引力
  2. 没有常识

    • AI 缺乏人类从生活经验中获得的基本常识
    • 可能给出语法完美但逻辑荒谬的答案
  3. 没有真正的创造力 AI 的"创造"本质上是重组已有知识,不是从无到有的原创。

  4. 不可靠的事实准确性

    • 大模型会"一本正经地胡说八道"(幻觉,Hallucination)
    • 不能盲目信任 AI 给出的所有信息
  5. 缺乏可解释性

    • 深度学习是"黑箱",很难解释为什么得出某个结论
    • 在医疗、法律等高风险领域,这是大问题

实用性局限

局限说明举例
数据依赖没有足够数据就学不好罕见疾病诊断
分布外泛化遇到训练时没见过的场景就表现差自动驾驶遇到异常天气
对抗样本微小扰动就能骗过AI在停车标志上贴贴纸导致识别错误
计算成本大模型训练和推理成本高昂GPT-4 训练成本估计超 1 亿美元
隐私安全训练数据可能泄露模型可能"记住"训练数据中的敏感信息

⚠️ 关键认知

AI 是工具,不是魔法。 它在某些任务上远超人类,在另一些任务上还不如小学生。优秀的 AI 工程师不仅知道 AI 能做什么,更知道它不能做什么,以及为什么不能


算力:为什么用 NPU/GPU 而不是 CPU?

前面提到算力是 AI 三大要素之一,这一节具体看看为什么 AI 计算要选专用芯片。

处理器计算特点晶体管用途适用场景代表
CPU适合复杂逻辑运算(通用软件)70%+ 用于 Cache 和控制单元,核心几个到几十个办公、数据库、数值计算鲲鹏
GPU适合逻辑简单、计算密集型高并发任务70%+ 用于计算单元,核心几千到上万个图像识别、NLP、推荐英伟达
NPU神经网络专用处理器达芬奇/百核架构,专为 AI 优化AI 计算(昇腾)昇腾

NPU 为什么更快(并行计算):以 16×16 矩阵乘法为例,CPU 串行需 4096 个时钟周期;NPU 分配 256 线程,仅需 16 个时钟周期

算力单位与数据类型

  • 算力量级:K(10³)/M(10⁶)/G(10⁹)/T(10¹²)/P(10¹⁵)/E(10¹⁸)。
  • 算力单位:OPS(每秒整数运算)、FLOPS(每秒浮点运算)。
  • 数据类型:INT8(推理)、FP16(训练)、FP32(高性能计算)、FP8(加速训练与推理)。
  • 算力示例:昇腾 310 最大 22 TOPS INT8;昇腾 910 最大 320 TFLOPS FP16;Atlas 800 训练服务器最大 2.56 PFLOPS FP16;鹏城云脑 II 达到 1 EFLOPS FP16。

推荐学习资源

入门书籍

书名作者说明推荐指数
《人工智能:一种现代方法》Stuart RussellAI 领域"圣经",全面系统★★★★☆
《机器学习》(西瓜书)周志华国内经典教材,中文友好★★★★☆
《AI 3.0》梅拉妮·米歇尔通俗读物,理解 AI 能力边界★★★★★
《深度学习革命》凯德·梅茨AI 发展史,故事性强★★★★☆

在线课程

课程平台说明推荐指数
AI for EveryoneCoursera吴恩达出品,非技术向,建立认知★★★★★
机器学习Coursera吴恩达经典课程★★★★★
HCIA-AI 认证课程昇腾云学院昇腾生态入门★★★★☆
李宏毅机器学习YouTube/B站中文,讲解生动★★★★★

社区与资讯

社区说明
昇腾社区昇腾开发者官方社区
Hugging Face全球最大 AI 模型社区
Papers With Code论文+代码,跟踪前沿
机器之心国内 AI 资讯
知乎 AI 话题中文 AI 讨论

播客/视频

名称说明
Lex Fridman Podcast深度访谈 AI 领域大牛
B站 李沐《论文阅读》经典论文精读
B站 李宏毅《机器学习》系统课程,生动易懂

阶段总结与自测

你应该掌握的概念清单

完成本阶段后,确认你能用自己的话解释以下概念:

  • [ ] AI、ML、DL 的关系和区别
  • [ ] AI 发展的几个关键节点(图灵测试、AlexNet、Transformer、ChatGPT)
  • [ ] AI 的三要素(算法、数据、算力)及其作用
  • [ ] 模型与神经网络的基本结构(权重、偏置、参数、节点)
  • [ ] 监督学习、无监督学习、强化学习的区别
  • [ ] 训练、推理、微调分别是什么
  • [ ] AI 的三大应用方向(决策、感知、生成)
  • [ ] AI 的能力边界(能做什么、不能做什么)
  • [ ] 为什么 AI 计算常用 NPU/GPU 而不是 CPU

自测问题

试着回答以下问题,如果都能答上来,说明你已经建立了基础认知:

  1. 为什么说"深度学习"是"机器学习"的子集?
  2. ChatGPT 的训练过程中,分别用到了哪些学习范式?
  3. 训练和推理有什么区别?为什么训练成本远高于推理?
  4. 什么是 AI 的"幻觉"问题?为什么会产生?
  5. 为什么 2012 年被称为深度学习革命的起点?
  6. AI 三要素是什么?它们分别起什么作用?
  7. 为什么 AI 计算常用 NPU 而不是 CPU?

✅ 自测结果

如果 7 个问题都能答上 → 恭喜,进入阶段二:数学与编程基础

如果只能答 4-5 个 → 回顾本文,重点看"关键概念详解"部分

如果大部分答不上 → 没关系,多读几遍,或者配合视频课程学习


下一步

🚀 下一阶段

👉 阶段二:数学与编程基础 —— 开始动手学 Python 和数学

「认知是行动的先导。你已经建立了框架,接下来就是填充血肉。」

AscendMate · AscendLA · GitHub 统计(近14天):仓库访问 次 · 独立访客 人 · 克隆