单选题2.2 新一代信息技术及应用12 / 22
正在加载题目…
系统集成项目管理工程师 · 第三版 · 第2章 信息技术发展
智能体根据任务结果调整策略,属于哪种学习方式?
22 道章节练习题
答案与解析
正确答案 C
抓住“尝试行动—得到反馈—调整策略”这条线,就能选C。系统不是照着每一步的标准路线抄答案,而是在与环境交互时利用结果反馈,逐渐改进行动选择。这里关注的是累计回报,不只是眼前一步的得分。
例如一条近路最终导致货物受损,虽然前面走得快,整次任务的回报仍可能很差。这也解释了为什么强化学习要考虑行动的后续结果。奖励可能稀疏或延迟,不能把教材的简要说明扩写成“每一步都必须立即得到非零奖励”。本题限定在仿真环境中试错,也不意味着可以让真实设备无约束冒险训练。
选项分析
- A
- 描述的是带标签分类任务;题干没有逐条给正确路线标签,而是用行动结果反馈改进策略。
- B
- 聚类主要按相似性组织样本,本题的重点不是分组,而是交互后选择更合适的行动。
- C
- 环境、行动、奖励和策略更新四个要素都在题干中出现,足以识别强化学习。
- D
- 固定规则推理不等于通过试错更新策略,与题干明确描述的学习过程不一致。
容易混淆的地方
以为奖励就像老师批作业,每走一步都要马上给分;或者将机器学习全部理解为带标准答案的分类训练。
再巩固一步
- 先找反馈来自哪里:样本标签、样本相似性,还是行动后的环境反馈。它们对应不同的学习问题。
原创章节练习题 · 第三版 · 《系统集成项目管理工程师教程》第3版 · 2.2.5 · 纸书第88页查看完整题目与详解