📖 说明
WASD 移动 鼠标 瞄准 左键 射击 Shift / 右键 冲刺($0.3$ 秒 $\times3$ 速,冷却 $1.5$ 秒,与机器人同款) R 换弹 P 暂停 F 全屏 ESC 认输
绝对对称:双方都是 100 血、移速 3.2、同一把冲锋枪(12 伤害 / 30 发弹匣 / 1.4 秒换弹)。没有任何强化、没有任何数值差异。
🧠 它的大脑是真的网络:12 个感知输入(距离/双方血量/弹药/方位/视线/来袭子弹威胁/受击记忆/视野丢失时长/是否卡住…)→ 12 个隐层神经元 → 7 个输出(追击·拉开·左移·右移 × 连发·点射·停火)。每 0.15 秒思考一次,头顶显示它当前的决策。贴墙卡住时有本能的绕行反射;你刚躲进掩体的 1.5 秒内它会朝你的方向盲射压制。
训练是 PPO + GAE:Actor(策略网络)看局面做决策;Critic(价值网络)评估局面好坏。GAE(λ=0.95) 把"走位为 5 秒后击杀创造的条件"传回给当初的决策;PPO 截断(ε=0.2) 保证每次训练只微调策略、永不崩盘。击中你 +1、被你击中 −1,奖励挂在扣扳机那一刻的决策上,局末统一结算。大脑存在云端,所有人共享同一只。
你和它之间唯一的区别:你有操作,它有学习。