返回代表工作
腾讯开悟 · 峡谷追猎强化学习
面向局部可观测生存博弈的多目标分层 PPO 方案,联合优化生存、收集与探索策略。
- 我的角色
- 队长、强化学习方案与训练工程
- 方法与工具
- PPO · Actor-Critic · Hierarchical policy · LSTM / Transformer Policy
01
问题与挑战
智能体需要在复杂地图中躲避追击并收集资源,任务同时具有局部可观测、多目标冲突、稀疏奖励和长程规划难题。
02
关键贡献
设计分层 Actor 与多头 Critic,将移动、技能释放和不同任务目标的价值估计解耦。
融合局部观测、目标关系和历史状态,并使用 LSTM / Transformer Policy 维持长短期决策上下文。
围绕生存、资源收集与地图探索设计多目标奖励和阶段化 Reward Shaping,缓解稀疏奖励与目标冲突。
持续迭代采样、评估与训练配置,结合失败回放定位策略坍缩和探索不足问题。
03
结果与公开边界
方案获得东部赛区初赛前列成绩,并获全国总决赛三等奖;公开仓库记录了网络、奖励与训练设计。
查看 GitHub