2026-08-022026 年顶尖 AI 实验室如何构建 RL 智能体:从 RLHF 到 RULER↗从 RLHF 到 RLVR 再到 RULER,系统提示词正被用作奖励函数;DeepSeek R1-Zero 仅用 GRPO 与可验证奖励,将 AIME 2024 从 15.6% 提升至 77.9%。