返回 AI 大白话
了解工具背后 · 免费公开

RLHF

Reinforcement Learning from Human Feedback

先打个比方

像评审比较多份作业,把偏好反馈用于下一轮训练。

放到你的工作里

评审把清楚承认资料不足的回答排在编造完整答案的回答前面,这种偏好可用于训练。

现在,回来看它的意思

把人对回答的偏好转成训练信号,再用强化学习调整模型行为,让输出更接近设定的评价标准。

但别这样理解

人的偏好会有分歧,也不等于事实真伪;你点一次赞,不代表模型立即为你完成一次RLHF。

现在就试一小步

写出好回答的三项标准,再比较两份示例,看看不同标准是否会产生冲突。

找一个能做这件事的工具

想再了解一点

Training language models to follow instructions with human feedback

官方参考查阅于 2026-09-09 · 类比和例子为本站原创解释。