2026/7/22 18:43:32

GECCO 2025,基于自动景观特征的强化学习自适应差分进化算法

GECCO 2025,基于自动景观特征的强化学习自适应差分进化算法 目录1.摘要2.研究背景与 MetaBBO3.RLDE-AFL 双层框架4.自动景观特征学习5.强化学习驱动的 DE 动态配置6.实验结果7.参考文献8.算法辅导·应用定制·读者交流1.摘要元黑箱优化Meta-Black-Box OptimizationMetaBBO通过学习可迁移的元策略为底层优化器动态选择算法配置能够减少为新问题手工设计自适应机制的工作。然而现有方法通常依赖人工构造的状态特征既需要领域知识也可能消耗额外函数评估。论文提出 RLDE-AFL将可学习的景观特征提取器嵌入强化学习驱动的差分进化DE中联合学习特征编码与动态算法配置策略该方法用带尾数—指数目标值嵌入的注意力网络将种群及其适应度转化为可表达、可泛化的景观状态同时把多种变异、交叉算子及其参数纳入统一动作空间。2.研究背景与 MetaBBO黑箱优化无法直接使用目标函数解析式或梯度而NFL定理意味着不存在对所有问题都占优的固定算法。传统自适应 DE 依靠人工规则选择算子并调整缩放因子、交叉率设计成本较高。MetaBBO 以神经策略替代部分人工设计上层策略根据第t tt代状态s t s_tst​输出底层算法配置ω t \omega_tωt​底层优化后的目标值变化再作为学习信号。J ( θ ) arg ⁡ max ⁡ θ ∈ Θ E f ∈ I [ ∑ t 1 T P e r f ( A , ω t , f ) ] , ω t π θ ( s t ) . J(\theta)\arg\max_{\theta\in\Theta}\mathbb{E}_{f\in\mathcal{I}}\left[\sum_{t1}^{T}\mathrm{Perf}(A,\omega_t,f)\right],\qquad \omega_t\pi_\theta(s_t).J(θ)argθ∈Θmax​Ef∈I​[t1∑T​Perf(A,ωt​,f)],ωt​πθ​(st​).已有 RL-DE 方法多使用人工统计特征且往往只选择算子或只控制参数候选算子池也较小。RLDE-AFL 的目标是同时降低状态设计依赖、扩大策略行为多样性并让同一策略适应不同维度、预算和问题分布。3.RLDE-AFL 双层框架RLDE-AFL 由上层元智能体和下层 DE 优化器组成。第t tt代状态包含种群X t X_tXt​、目标值Y t Y_tYt​与时间戳t tt修改后 NeurELA 把它们编码为个体级景观表示Actor 为每个个体选择变异算子、交叉算子及相应参数。下层 DE 按配置产生下一代并将改进量作为奖励返回上层从而形成状态—配置—优化—奖励的闭环。该过程被建模为马尔可夫决策过程策略学习目标为π ∗ arg ⁡ max ⁡ π ∈ Π ∑ t 1 T γ t − 1 R ( s t , a t ) , \pi^*\arg\max_{\pi\in\Pi}\sum_{t1}^{T}\gamma^{t-1}R(s_t,a_t),π∗argπ∈Πmax​t1∑T​γt−1R(st​,at​),其中γ \gammaγ为折扣因子T TT为优化时域。论文采用近端策略优化PPO训练策略使配置决策直接面向跨问题的累计优化收益。4.自动景观特征学习为统一不同搜索空间解向量按各维上下界缩放。不同问题的目标值可能跨越多个数量级简单的种群内最小—最大归一化会抹去问题间以及优化阶段间的绝对尺度差异。RLDE-AFL 将每个目标值写成科学计数法y t , i ϖ t , i 10 e t , i y_{t,i}\varpi_{t,i}10^{e_{t,i}}yt,i​ϖt,i​10et,i​再以( ϖ t , i , ϵ t , i ) (\varpi_{t,i},\epsilon_{t,i})(ϖt,i​,ϵt,i​)表示其中ϵ t , i e t , i / η \epsilon_{t,i}e_{t,i}/\etaϵt,i​et,i​/ηη \etaη是尺度因子时间特征则归一化为s t i m e t / T s_{\mathrm{time}}t/Tstime​t/T。NeurELA 的输入因此由位置、尾数和指数构成而非单一归一化适应度。观测先经3 × 64 3\times643×64的线性嵌入再依次通过跨个体注意力和跨维度注意力。第二阶段加入正弦—余弦位置编码以保留维度顺序随后沿维度平均池化得到每个个体的 64 维表示归一化时间戳经 MLP 映射为 16 维表示与景观特征拼接成 80 维决策向量。5.强化学习驱动的 DE 动态配置动作空间覆盖 14 种变异算子和 3 种交叉算子。变异池包括经典的 rand/1、best/1、rand/2、best/2、current-to-rand/1、current-to-best/1、rand-to-best/1以及引入 pbest、外部档案、距离采样、时间档案和拓扑邻域的高级变体交叉池包含二项式、指数式和 p-binomial 交叉。Actor 对每个个体分别输出变异与交叉算子的分类概率并输出相应参数的正态分布。为兼容参数数量不同的算子网络统一产生最多 3 个变异参数和 2 个交叉参数算子只读取所需的前若干项。Critic 先估计每个个体状态价值再对种群求平均。即时奖励以当前最优值的归一化改进定义r t y t − 1 ∗ − y t ∗ y 0 ∗ − y ∗ , r_t\frac{y^*_{t-1}-y^*_t}{y^*_0-y^*},rt​y0∗​−y∗yt−1∗​−yt∗​​,其中y t ∗ y^*_tyt∗​为第t tt代已找到的最优目标值y 0 ∗ y^*_0y0∗​为初始种群最优值y ∗ y^*y∗为问题全局最优值。6.实验结果实验基于 MetaBox使用合成 COCO-BBOB、含噪合成问题和 Protein-Docking 基准。传统基线包括 DE、MadDE、JDE21、NL-SHADE-LBC 和 AMCDE学习型基线包括 DE-DDQN、DE-DQN、LDE、GLEET、RL-HPSDE 与 RL-DAS。论文直接把在 10 维合成问题上训练的模型迁移到 20 维问题不作微调。RLDE-AFL 在 16 个测试问题上继续保持整体优势说明跨维度注意力能够处理维度变化依赖固定维度状态的 RL-DAS 则无法迁移。7.参考文献Guo H, Ma S, Huang Z, et al. Reinforcement learning-based self-adaptive differential evolution through automated landscape feature learning[C]//Proceedings of the Genetic and Evolutionary Computation Conference. 2025: 1117-1126.8.算法辅导·应用定制·读者交流xx