本文基于北京航空航天大学何静副教授团队编写的《生成式人工智能应用实战(慕课版)》科普报告整理而成,面向零基础读者,用通俗类比讲透 AI、机器学习、深度学习、AIGC、大模型、智能体与具身智能之间的关系与原理。全文可独立阅读,所有概念、类比、对比、工具清单与案例信息均已完整呈现。
一、报告概览:一份为”小白”准备的AI入门地图
《生成式人工智能应用实战(慕课版)》是一份面向零基础读者的科普报告,由北京航空航天大学人文与社会科学高等研究院何静副教授团队编写,清华大学新闻与传播学院、人工智能学院双聘教授沈阳(@新媒沈阳)作序推荐。
报告开篇便点明定位——“一篇科普报告每多一个公式读者数量就减半。该报告仅用于科普,面向对象为小白”。这意味着整份报告刻意回避了复杂的数学公式与技术黑话,转而用”认猫”“学霸”“厨房””森林”等大量生活化类比,帮助读者建立对AI的直观理解。
报告逻辑层层递进,共分11个章节,核心解决四个问题:
- AI是什么、怎么学会的——从感知、决策、学习、推理四个维度建立认知;
- AIGC是什么、怎么生成的——理解生成式AI的”三件法宝”;
- 大模型与智能体是什么——搞懂当前最热的技术底座;
- 具身智能是什么——展望AI从”屏幕里”走向”现实世界”的未来。
二、AI是什么:给机器装上一颗”大脑”
报告用一句话定义AI:人工智能(Artificial Intelligence),指让机器具备像人一样思考、学习和决策的能力。通俗来说,它就像给机器装上了一个大脑,让机器不再是简单的工具,而是能理解我们、陪伴我们、和我们一起学习的伙伴。
AI的能力可以用四个关键词概括,这四步也恰好模拟了人类”从看到 → 到思考 → 再行动”的完整过程:
| 能力 | 人类的做法 | AI的做法 | 生活案例 |
|---|---|---|---|
| 感知 | 用眼睛看、耳朵听、手触摸感受世界 | 用摄像头”看”、麦克风”听”、传感器”触摸” | 手机能认出照片里的人是不是你 |
| 决策 | 面对选择”判断利弊”然后行动 | 基于计算结果”做出最优选择” | 地图APP帮你选出不堵车的最快路线 |
| 学习 | 通过模仿、练习、总结获得经验 | 通过分析海量数据来学习 | 让AI看10万张猫的照片,它就能学会认猫 |
| 推理 | 分析信息、做出判断(“这动物是不是猫?”) | 根据数据和模型计算最可能的答案 | AI识图时判断这张图更像”猫”还是”狗” |
关键洞察:AI的”聪明”不是程序员写死规则的结果,而是靠”学习”获得的。人学认猫只需要看几只猫、听老师讲一讲就记住了;而AI学认猫,要看10万张猫的图片,从中总结出”猫的特征”。数据喂得越多,AI就越”聪明”。
三、AI是如何学会的:人工智能、机器学习、深度学习的关系
报告用一个核心观点点破三者的区别:机器学习靠人”讲重点”,深度学习自己”抓重点”。
这是一个层层嵌套的包含关系:
| 层级 | 定位 | 通俗解释 |
|---|---|---|
| 人工智能(AI) | 总目标 | 让机器变得”像人一样聪明” |
| 机器学习(ML) | 关键方法之一 | 通过大量数据自己”总结规律” |
| 深度学习(DL) | 目前最强的技术路线 | 模仿人脑结构,自动”分层”提取信息 |
机器学习与深度学习的本质区别,在于”特征提取”这个环节由谁完成:
| 对比点 | 机器学习(ML) | 深度学习(DL) |
|---|---|---|
| 特征提取 | 人工设计 | AI自动学出来 |
| 适用任务 | 简单结构化任务(分类、推荐) | 复杂任务(图像、自然语言等) |
| 举例(识别猫) | 喂它猫的图,人还要提前告诉它”猫耳朵尖、有胡须” | 喂它猫的图,不用人告诉特征,它能自动学出耳朵、胡须、眼神 |
| 类比 | 老师教学生 | 学生自学 |
一句话总结:机器学习需要人来”划重点”(人工设计特征),深度学习则让机器自己”抓重点”(自动学习特征),因此深度学习能胜任图像识别、自然语言处理等更复杂的任务。
四、AIGC是什么:AI不仅能”识别”,还能”创作”
AIGC(AI Generated Content),即”AI生成内容”,又称生成式AI。它意味着人工智能不仅能”识别”、“判断”,还可以主动”创作”出全新的内容,比如文字、图像、音乐以及视频。
4.1 AIGC能生成哪些内容
报告列出了AIGC的四大内容类型及代表性工具:
| 生成内容类型 | 示例 | 代表性工具 |
|---|---|---|
| 文字 | 写作文、写脚本、写代码 | DeepSeek、文心一言、ChatGPT |
| 图像 | 画头像、插画、设计草图 | 即梦、豆包、Midjourney |
| 音频 | AI配音、朗读文章、变声效果 | 海绵音乐、网易天音、Suno |
| 视频 | 数字人解说、AI换脸、视频生成 | 可灵、海螺、Sora |
4.2 深度学习的两种模式:判别式 vs 生成式
要理解AIGC,必须先区分深度学习的两种模式:
| 维度 | 判别式 | 生成式 |
|---|---|---|
| 比喻 | 分类大师 | 创造大师 |
| 任务 | 区分 & 判断 | 理解 & 创造 |
| 典型应用 | 人脸识别(张三 or 李四?)、情感分析(正面 or 负面?) | 广告文案生成、医疗辅助诊断(给出诊断建议) |
核心区别:判别式AI负责”分辨”,生成式AI负责”创造”。AIGC正是生成式AI的应用形式,它让AI从”只能回答对错”进化到”能够从无到有地创作”。
五、AIGC是如何生成内容的:三件法宝
报告用”认猫”这个贯穿全文的比喻,形象说明了AIGC生成内容的完整过程——学习(训练阶段)→ 创造(生成阶段):
- 学习(训练阶段):投喂数据,让机器看无数张猫咪照片 → 提炼规律(耳朵、眼睛、鼻子、胡须、尾巴…)→ 机器在”脑中”形成”猫的灵魂概念”,能区分”什么是猫,什么不是猫”。
- 创造(生成阶段):输入提示(如”躺在沙滩上打哈欠的猫”)→ 机器不会照抄原图,而是基于”猫的灵魂概念”自由组合 → 生成全新猫的形象。
AIGC能生成内容,靠的是**“三件法宝”——数据、模型、算法**:
| 关键要素 | 作用 | 通俗解释 |
|---|---|---|
| 训练数据 | 学习素材 | AI看了海量文本/图像,学会了”怎么说话、怎么画图” |
| 大模型 | 理解能力 | 像”看过几百万本书”的AI大脑,能理解你的要求 |
| 生成算法 | 表达能力 | 像”动笔写作/动手画图”的过程,把想法输出成作品 |
关键洞察:AIGC生成的内容”真实又独特,从未存在过,但完全符合’猫’的特征”。这解释了为什么AI能持续创作出全新的文字、图像和视频——它不是复制,而是基于学习到的规律进行”自由组合”。
六、大模型是什么:厨房里专门做某类菜系的厨师
大模型(Large Model),指在海量数据和算力支持下训练出的、参数规模庞大、具备跨领域泛化和生成能力的人工智能模型。
报告用了一个非常巧妙的”厨房类比”来区分”生成式AI”与”大模型”,并澄清了一个常见误区——对话产品和基座大模型实际上是两个东西:
| 类比对象 | 对应关系 | 举例 |
|---|---|---|
| 生成式AI | 整个厨房 | 各类生成式AI应用 |
| 大模型 | 厨房里专门做某类菜系的厨师 | 各类基础模型 |
| 文字大模型 | 川菜厨师 | ChatGPT、DeepSeek |
| 图片大模型 | 苏菜厨师 | Midjourney、Stable Diffusion |
| 音乐大模型 | 粤菜厨师 | Suno AI、Udio AI |
| 视频大模型 | 鲁菜厨师 | 即梦、可灵 |
6.1 常见大模型的四大类型
| 类型 | 代表产品 | 模型类型说明 |
|---|---|---|
| 文生文 | ChatGPT、DeepSeek | 大语言模型 |
| 文生图 | Midjourney、Stable Diffusion | 图像生成模型 |
| 文生音乐 | Suno AI、Udio AI | 音乐生成模型 |
| 文生视频 | 即梦、可灵 | 视频生成模型 |
关键洞察:大模型不是一个”万能模型”,而是按内容类型分门别类的”专业厨师”。文字、图像、音乐、视频各自有对应的大模型,这是理解当下AI产品矩阵的基础。
七、大模型的原理:一个”根据输入预测下一个词”的超级机器
报告把大模型比作一个”超级学霸”,其学习和思考过程分三步:
7.1 第一步:海量读书(训练)
学霸读遍互联网上的书、文章、网页,目的不是”背书”,而是总结语言规律。
- 例子:“中国的首都是___” → 北京;“猫喜欢吃___” → 鱼 / 老鼠
- 它会判断每个词跟其它词的关系有多重要
- 结果:形成一个复杂的概率网络(神经网络)
7.2 第二步:把句子拆成 Token
用户提问”为什么天空是蓝色的?”,学霸将问题切分成 Token(词或字碎片)。
| 操作步骤 | 类比说明 |
|---|---|
| 把句子拆成 Token | 把一句话像拼图一样分成一个个”词块” |
| 遮掉一个词 | 模型猜这个词应该是什么 |
| 猜得准就得分,错就调整 | 模型通过反复猜 → 更新参数 → 越猜越聪明 |
Token(词元),是大模型”看懂语言”的最小拼图单位。
7.3 第三步:像玩”疯狂填词”一样逐字预测
接到问题(输入)→ 预测下一个字(生成)→ 逐字逐词预测下一个最合理的词 → 不断调整句子结构保证通顺和逻辑 → 最终生成完整答案。
例如:“为什么天空是蓝色的?” → 最可能的开头是”因为” → “太阳” → “光” → “进入” → “大气层” → …… 最终生成”因为太阳光进入大气层后,发生了瑞利散射……”
报告特别提醒:大模型本质上就是”根据输入,预测下一个最可能出现的词”的超级机器。但它有时会犯错(猜错词),或者编造信息——因为它的目标是让句子看起来合理,而不是100%正确,就像学霸有时候也会凭感觉答错题一样。这一提醒对普通用户理解AI”一本正经胡说八道”的现象至关重要。
八、智能体是什么:从”被动工具”到”主动助手”
智能体(Agent),是一种具有感知、决策和行动能力的实体,它生活在电脑、手机、互联网里,能理解任务 → 自主分析 → 自动执行。
智能体与传统AI模型的最大区别,在于”主动性”:
| 对比维度 | 一般 AI 模型 | 智能体(AI Agent) |
|---|---|---|
| 角色定位 | 被动工具(像搜索引擎、问答机器人) | 主动助手(像私人助理、执行机器人) |
| 工作方式 | 一问一答、输出结果,完成一小步就结束 | 拆解任务、制定计划、执行多步行动,直到完成目标 |
| 主动性 | 没有主动性,只能等用户发指令 | 有主动性,会根据目标自己思考和行动 |
| 示例行为 | 回答问题、翻译句子、生成一段文字 | 自动写报告、搜索信息、调用日历、发送邮件,一站式完成任务 |
| 指令依赖 | 高度依赖用户提示:你不说,它不做 | 可以接受一个简单目标,自主规划怎么完成,甚至自己补全信息 |
核心对比案例:普通程序需要你手动一步步操作(查 → 选 → 比 → 买);智能体只需一条目标指令,就会全流程代劳。智能体能理解模糊需求、主动做出判断、真正做到自动化、智能化。
九、智能体是如何完成任务的:核心循环”感知 → 思考 → 行动 → 奖励”
报告以”让智能体玩俄罗斯方块”为例,生动拆解了智能体的核心工作循环:
| 环节 | 智能体玩俄罗斯方块的行为 |
|---|---|
| 感知 | 看到屏幕上当前堆积的方块形状和下一个即将落下的方块(是长条形的还是正方形的) |
| 思考 | “如果把下一个长条形的方块横过来放在这个缺口,就能消除整整四行,得到高分!” |
| 行动 | 控制手柄,将方块移动到目标位置并旋转 |
| 奖励 | 成功消除四行,游戏给它加了很高的分数(奖励信号),它就知道这个决策棒极了 |
关键洞察:智能体的核心循环就是 感知 → 思考 → 行动 → 奖励。通过不断尝试和反馈,智能体逐渐学会最优策略。从玩游戏到订票、开车、理财,本质都是这个闭环,只是任务复杂度不同——这句话点明了智能体从”游戏演示”走向”真实生产力”的底层逻辑。
十、具身智能是什么:AI从”屏幕里”走向”现实世界”
具身智能(Embodied Intelligence),指拥有”身体”的人工智能,它不仅能思考,还能看世界、听声音、动手动脚、和环境互动。
报告用一句话点明核心理念:人类理解世界靠的不仅是大脑,还有身体。具身智能 = AI 脑袋 + 感知五官 + 行动四肢,是”真正走出屏幕、进入现实世界的人工智能”。
| 对比维度 | 传统 AI | 具身智能 |
|---|---|---|
| 比喻 | 博览群书但从不运动的”学霸” | 喜欢动手实践、在运动中学习的”高手” |
| 知识来源 | 处理抽象数据 | 来自”眼睛”、”手指”与真实物理设备(游戏机、电视)的交互 |
以”让具身智能玩俄罗斯方块”为例:
- “眼睛” = 摄像头 → 从屏幕中获取方块信息
- “手指” = 机械手指 → 操作手柄完成移动、旋转
三大关键挑战:
- 从复杂环境中提取有效信息(视觉感知);
- 协调身体动作,精准执行指令(运动控制);
- 处理物理世界的不确定性与延迟(真实交互)。
十一、具身智能是如何动起来的:五大核心技术
报告以”小孩学走路”(摔倒 → 爬起 → 再摔倒 → 再爬起)类比具身智能的运动规律,并总结了五大核心技术:
| 核心技术 | 作用 | 详细描述 | 示例应用 |
|---|---|---|---|
| 传感器 | 感知环境信息 | 通过触觉、视觉、听觉等传感器收集物理世界数据,提供实时反馈 | 六足机器人感知地面硬度调整步态 |
| 强化学习 | 通过试错提升决策能力 | 与环境互动,基于奖励机制优化行为策略,逐步学会复杂任务 | Optimus在搬运中学习最佳抓取力度 |
| 仿生设计 | 模仿生物结构和行为 | 借鉴自然界生物的形态和运动方式,设计更灵活高效的机器人 | Cheetah机器人模仿猎豹奔跑姿势 |
| 模拟环境 | 提供安全高效的训练空间 | 在虚拟环境中模拟现实场景,预先训练和测试,降低物理实验成本和风险 | Octobot在虚拟管道中优化蠕动路径 |
| 深度学习 | 处理复杂数据并提取模式 | 用神经网络分析传感器数据,识别环境特征并预测行动结果 | 机器人通过图像识别区分障碍物类别 |
核心循环:具身智能的运动规律同样是 感知 → 思考 → 行动 的循环,通过不断试错与反馈,在真实环境中逐渐学会更聪明、更灵活的动作。
以”六足机器人走沙滩”为例完整演示这一闭环:
| 环节 | 六足机器人走沙滩的过程 |
|---|---|
| 感知 | 脚踩下去 → 发现地面很软,像沙滩 |
| 决策 | AI大脑快速分析风险 → “沙地容易陷脚 → 抬高、放轻” |
| 行动 | 调整步态 → 脚步更高、更轻 |
结果:像踩在鸡蛋上一样,小心翼翼走过去。
十二、它们之间是什么关系:AI森林的完整图谱
报告用一个极富画面感的”森林比喻”,把 AI、大模型、AIGC、智能体、具身智能五个概念的关系讲得清清楚楚:
| 概念 | 森林比喻 | 本质定位 |
|---|---|---|
| AI | 整片森林 | 最大集合,包含所有技术与子领域 |
| 大模型 | 森林里最高大的几棵关键树木(基础设施) | 当前AI的主力技术范式,既支撑AIGC也支撑智能体 |
| AIGC | 利用大树结出的”果实”(生成的内容) | 基于大模型的内容生成,是一种应用形式 |
| 智能体 | 森林里活跃、有自主能力的”生物”(软件或实体) | 基于大模型的行动系统,可调用工具、与环境交互 |
| 具身智能 | 能跑能跳、能搬东西的”动物型生物” | “有身体”的智能体,能与物理世界互动 |
关系总结:
- AI 是最大集合,包含了所有技术与子领域;
- 大模型是当前 AI 的主力技术范式,它既支撑 AIGC,也支撑智能体的发展;
- AIGC 是基于大模型的内容生成,是一种应用形式;
- 智能体(Agent)是基于大模型的行动系统,可以调用工具、与环境交互;
- 具身智能是”有身体”的智能体,能与物理世界互动。
这一层级关系,构成了理解整个AI技术版图的”一张地图”,也是这份科普报告最核心的知识框架。
十三、配套资源:一份”书课一体”的实战教程
报告最后推荐了配套图书《生成式人工智能应用实战(慕课版)》,核心信息如下:
| 项目 | 内容 |
|---|---|
| 书名 | 生成式人工智能应用实战(慕课版) |
| 作者 | 何静(北京航空航天大学) |
| 作序推荐 | 沈阳(清华大学新闻与传播/人工智能学院双聘教授) |
| ISBN | 978-7-115-68074-7 |
| 内容定位 | 以AIGC技能应用为抓手,赋能文案、图像、音视频、智能搜索与数据分析、智能化办公、学习生活等场景,全书无代码应用 |
| 实训案例 | 95个真实场景的AIGC实训案例 |
| 教学视频 | 74个实训教学视频 |
| 综合项目 | 3个大型AIGC综合项目实训 |
| 书课一体 | 配套北京航空航天大学线上精品课(何静教授亲自录制) |
| 适用人群 | 高校课程教材 + 行业读者自学(适配无计算机基础人群) |
| 图书主页 | https://www.ryjiaoyu.com/book/details/55443 |
十四、核心结论:这份科普报告的三大价值
综合报告全文,这份面向小白的科普报告有三大核心价值:
1. 用”生活化类比”击穿技术门槛。 从”认猫”“学霸”“厨房厨师”到”森林”,报告用一系列日常比喻,让零基础读者也能理解AI、机器学习、深度学习、AIGC、大模型、智能体、具身智能这些抽象概念。全文刻意避免公式(“每多一个公式读者数量就减半”),是可读性极高的入门读物。
2. 理清了五个关键概念的层级关系。 报告最核心的贡献,是用”森林——大树——果实——生物——动物”这个比喻,把AI(总集合)、大模型(技术底座)、AIGC(内容生成应用)、智能体(行动系统)、具身智能(有身体的智能体)的关系讲得明明白白,帮读者建立起AI技术版图的整体认知框架。
3. 揭示了两条底层规律。 一是”判别式 vs 生成式”的分野——AI从”只会分辨”进化到”能够创作”,是AIGC浪潮的起点;二是”感知 → 思考 → 行动 → 奖励”这一贯穿智能体与具身智能的核心闭环——它解释了AI从”被动问答”走向”主动执行”、从”屏幕里”走向”现实世界”的进化方向。

