2026-08-15·AI 詞彙百科RLHF 是什麼?ChatGPT 比 GPT-3 更會聊天的關鍵訓練法RLHF 是用人類的偏好選擇來教 AI 講話的訓練法,全名人類回饋強化學習。這篇拆解它的三個階段、獎勵模型怎麼來的,以及為什麼 13 億參數的模型靠它就能贏過 1750 億參數的前輩。