强化学习 强化学习(RL)是机器学习的一个分支,智能体通过与环境交互、试错获取奖励信号来学习最优策略。在 LLM 领域,RLHF(人类反馈强化学习)是使模型输出对齐人类偏好的关键技术;Karpathy 等对其当前效果持批评态度。 关联 Karpathy 批评强化学习