题库系统集成项目管理工程师

系统集成项目管理工程师 · 第三版 · 第2章 信息技术发展

智能体根据任务结果调整策略,属于哪种学习方式?

22 道章节练习题
单选题2.2 新一代信息技术及应用12 / 22

在仿真环境中,搬运智能体反复尝试路线,根据任务完成、碰撞等结果获得奖励或惩罚,并调整后续行动策略,以提高累计回报。这最符合()。

选择答案
未作答
答案与解析

正确答案 C

抓住“尝试行动—得到反馈—调整策略”这条线,就能选C。系统不是照着每一步的标准路线抄答案,而是在与环境交互时利用结果反馈,逐渐改进行动选择。这里关注的是累计回报,不只是眼前一步的得分。

例如一条近路最终导致货物受损,虽然前面走得快,整次任务的回报仍可能很差。这也解释了为什么强化学习要考虑行动的后续结果。奖励可能稀疏或延迟,不能把教材的简要说明扩写成“每一步都必须立即得到非零奖励”。本题限定在仿真环境中试错,也不意味着可以让真实设备无约束冒险训练。

选项分析

A
描述的是带标签分类任务;题干没有逐条给正确路线标签,而是用行动结果反馈改进策略。
B
聚类主要按相似性组织样本,本题的重点不是分组,而是交互后选择更合适的行动。
C
环境、行动、奖励和策略更新四个要素都在题干中出现,足以识别强化学习。
D
固定规则推理不等于通过试错更新策略,与题干明确描述的学习过程不一致。

容易混淆的地方

以为奖励就像老师批作业,每走一步都要马上给分;或者将机器学习全部理解为带标准答案的分类训练。

再巩固一步

  • 先找反馈来自哪里:样本标签、样本相似性,还是行动后的环境反馈。它们对应不同的学习问题。
原创章节练习题 · 第三版 · 《系统集成项目管理工程师教程》第3版 · 2.2.5 · 纸书第88页

练习小结

题目纠错

未发送。正式接收渠道尚未接通。

查看纠错信息