返回代表工作
竞赛项目2026全国总决赛三等奖

腾讯开悟 · 峡谷追猎强化学习

面向局部可观测生存博弈的多目标分层 PPO 方案,联合优化生存、收集与探索策略。

我的角色
队长、强化学习方案与训练工程
方法与工具
PPO · Actor-Critic · Hierarchical policy · LSTM / Transformer Policy
多目标分层 PPO 的状态编码、策略网络与奖励反馈结构图

问题与挑战

智能体需要在复杂地图中躲避追击并收集资源,任务同时具有局部可观测、多目标冲突、稀疏奖励和长程规划难题。

关键贡献

  1. 设计分层 Actor 与多头 Critic,将移动、技能释放和不同任务目标的价值估计解耦。

  2. 融合局部观测、目标关系和历史状态,并使用 LSTM / Transformer Policy 维持长短期决策上下文。

  3. 围绕生存、资源收集与地图探索设计多目标奖励和阶段化 Reward Shaping,缓解稀疏奖励与目标冲突。

  4. 持续迭代采样、评估与训练配置,结合失败回放定位策略坍缩和探索不足问题。

结果与公开边界

方案获得东部赛区初赛前列成绩,并获全国总决赛三等奖;公开仓库记录了网络、奖励与训练设计。

  • PPO
  • Actor-Critic
  • Hierarchical policy
  • LSTM / Transformer Policy
  • Multi-objective rewards
  • Reward shaping
查看 GitHub