‹ 返回 2026-06-30

NormGuard:流匹配强化学习中的保奖励范数约束

NormGuard: Reward-Preserving Norm Constraints in Flow-Matching Reinforcement Learning

▲ 3 💬 1 2026-06-30

摘要

(无摘要)