一句話定義
RLHF(人類回饋強化學習)是讓人類替 AI 的多個答案排名,再把這份偏好變成分數來訓練模型的方法。
30 秒看重點
- 是什麼:RLHF 全名 Reinforcement Learning from Human Feedback,用人類的偏好比較來調整模型的回答方式。
- 為什麼重要:它是 GPT-3 那種「會接話但不會聊天」的模型,變成 ChatGPT 這種「聽得懂指令」的助理的關鍵一步。
- 跟誰相關:想理解 AI 為什麼有個性的一般使用者、做模型微調的工程師、關心 AI 安全與對齊的政策圈。
- 最常見的誤解:很多人以為 RLHF 是在教 AI 知識,其實它教的是「怎麼講」,不是「知道什麼」。
- 記住這件事就夠了:人類很難說清楚什麼叫好答案,但很會從兩個答案裡挑一個,RLHF 就是靠這個差別做出來的。
RLHF 到底是什麼?
RLHF 是一種模型訓練法,做法是讓人類針對同一個問題的多個 AI 回答排出好壞順序,再用這批排名資料訓練出一個「打分數的模型」,最後讓 AI 對著這個分數去練習。
它解決的是一個很尷尬的問題:什麼叫「好的回答」,你根本寫不出數學公式。訓練 AI 需要一個明確的目標函數,可是「有禮貌」「不要唬爛」「講重點」這些要求要怎麼寫成算式?寫不出來。RLHF 的取巧之處在於繞過這題,改成請人看兩個答案挑一個順眼的,累積幾萬次之後,讓另一個模型去學「人類到底在偏好什麼」。
生活比喻:想像你開一家餐廳,主廚每道菜同時做兩個版本端出去,讓客人挑哪個好吃。做個五萬次之後,你訓練出一個超懂客人口味的「試菜員」。接下來主廚就不用再麻煩客人了,每天對著試菜員練菜、衝分數就好。RLHF 的獎勵模型就是這個試菜員。
為什麼會有 RLHF?
RLHF 的出現,是因為單純的預訓練模型很會接話,但完全不知道你要它幹嘛。
問題一:預訓練的目標跟你要的不一樣。 語言模型的預訓練目標是「猜下一個字」,猜得越準越好。可是你問它「幫我寫封辭職信」,它可能回你一串類似的問句,因為在網路語料裡,問題後面常常接著更多問題。它沒做錯,只是目標跟你不同。
問題二:好壞沒辦法量化。 你可以量它答對幾題、量它猜下一個字準不準,但沒辦法量「這個回答讓人舒服嗎」。
「那直接請一批人把好答案通通寫出來,讓 AI 照抄不就好了?」可以啊,那叫監督式微調。問題是請人親手寫範文貴得多,寫再多也蓋不完所有情況,而請人從兩個現成答案裡挑一個就快多了。
RLHF 的解法就是把人塞進迴圈裡。根據 Hugging Face 官方部落格的整理,這套流程分成三段:先有一個預訓練好的語言模型,接著收集人類偏好資料訓練獎勵模型,最後用強化學習去微調原本那個模型。
RLHF 是怎麼運作的?
簡單來講,RLHF 就是「先請人打分、再訓練一個代打的、最後讓 AI 對著代打練習」這三步。
- 準備一個底模:先有一個預訓練完成的語言模型,通常會再用人工示範資料做一輪監督式微調當起點。OpenAI 的 InstructGPT 就是從一個較小版本的 GPT-3 出發的。
- 訓練獎勵模型:把同一個提示的多個回答丟給標註人員排名,再訓練一個模型把「一段文字」轉成「一個分數」。Hugging Face 的整理指出,多數 RLHF 應用的偏好資料量大約在 5 萬筆標註左右,OpenAI 曾用 1750 億參數的語言模型搭配 60 億參數的獎勵模型。
- 用強化學習微調:拿 PPO(一種策略梯度演算法)讓模型去衝獎勵模型給的分數。這裡有個關鍵設計,獎勵函數會扣掉一個 KL 散度懲罰項,避免模型為了衝高分跑到離原本的預訓練模型太遠的地方。
名詞小教室:獎勵模型(Reward Model)就是上面說的試菜員,輸入一段文字、輸出一個分數。KL 懲罰則像是老闆在旁邊喊「不要為了討好試菜員把菜做成怪東西」,畢竟試菜員只是模仿客人,摸透它的口味不等於菜真的好吃。
RLHF 跟一般的微調差在哪?
一般微調是給模型「標準答案」照抄,RLHF 是給模型「兩個答案哪個比較好」讓它自己抓方向,前者要人寫出範文,後者只要人會挑。
| 比較項目 | RLHF | 一般微調(監督式) |
|---|---|---|
| 人類要提供什麼 | 對多個回答排名 | 一題一題寫出標準答案 |
| 標註成本 | 挑選比書寫快,但要量大 | 每筆都要人親手寫,很貴 |
| 教的是什麼 | 回答的風格、分寸、拒答時機 | 特定任務的格式與知識 |
| 訓練穩定性 | 多階段,流程相對不穩 | 單階段,好控制 |
| 我會在什麼情況選它 | 想調整模型的講話方式與價值判斷 | 想讓模型學會某個固定任務 |
從這張表可以看出來,兩者根本不是競爭關係,實務上是接力:先用監督式微調把模型拉到能用的狀態,再用 RLHF 修它的態度。真正證明這件事有多划算的是 InstructGPT,OpenAI 官方倉庫寫得很直白,13 億參數的 InstructGPT 輸出,在人類評測中比 1750 億參數的 GPT-3 更受青睞,參數少了 100 倍。
你會在哪些 AI 工具看到 RLHF?
RLHF 幾乎是所有主流聊天型 AI 的標準配備,只是各家的做法有分岔。
- ChatGPT:直系血親。OpenAI 2019 年就開源過
lm-human-preferences,那份程式碼對應的是 Ziegler 等人的論文《Fine-Tuning Language Models from Human Preferences》(arXiv 1909.08593),當時只在最小的 GPT-2(1.24 億參數)上測過。後面才長成 InstructGPT 與 ChatGPT。 - Claude:Anthropic 公開過 hh-rlhf 偏好資料集,成對的 chosen 與 rejected 回答,對應論文《Training a Helpful and Harmless Assistant with RLHF》(arXiv 2204.05862),把目標拆成「有幫助」跟「無害」兩軸分開標。順帶一提,那個倉庫現在已經封存,資料搬到 Hugging Face 上繼續維護。
- DeepMind 的 Sparrow:Hugging Face 的整理提到他們用 2800 億參數的 Gopher 當底,再做對話代理的調校。
- 台灣的 TAIDE:國科會主導的繁中模型,訓練流程裡也走過 RLHF 這一段(細節可以看我們的 大型語言模型(LLM)條目)。
如果你是工程師,最快碰到 RLHF 的地方是 Hugging Face 的 TRL 套件,PPO、DPO 那些 trainer 都在裡面。
學 RLHF 最常見的 3 個誤解
- 誤解一:RLHF 會讓 AI 變聰明 — 真相是它主要在調「表達方式」跟「該不該講」。知識來自預訓練,RLHF 改的是態度,不是腦容量。
- 誤解二:有 RLHF 就不會有幻覺 — 真相是完全沒這回事。RLHF 調的是回答的風格與分寸,模型的知識還是來自預訓練那一段,語氣變得更得體不代表內容變正確。幻覺這題請看 AI 幻覺條目。
- 誤解三:RLHF 是唯一解,而且不會被取代 — 真相是它正在被簡化。2023 年 Rafailov 等人提出 DPO(arXiv 2305.18290),直接把偏好資料變成一個分類損失來訓練,不用另外做獎勵模型也不用跑 PPO。TRL 官方文件明白寫著 PPO「往往是不穩定的流程」,而 DPO 實作簡單得多(老實講,會被自己人這樣寫進文件,就知道 PPO 有多難調 XD)。
想多了解 RLHF,從哪開始?
沒有技術背景的話:你只要記住「AI 的個性是人訓出來的」就夠了。下次覺得某個模型講話特別客氣或特別敢嗆,那不是它天生的,是有一群標註人員一路挑出來的結果。
有技術背景的話:從 Hugging Face 的 TRL 套件開始,先跑 DPO 再回頭看 PPO,順序反過來會很痛苦。想看更前面的分支,可以讀 Anthropic 的《Constitutional AI: Harmlessness from AI Feedback》(arXiv 2212.08073),他們把無害性那一軸的人類標註換成 AI 依照一份章程給回饋,也就是後來常講的 RLAIF。
常見問題 FAQ
RLHF 跟 AI 有什麼關係?
RLHF 是訓練現代 AI 聊天模型的關鍵步驟之一。它不負責讓 AI 學會知識,而是負責讓 AI 用人類覺得有幫助、有禮貌、比較安全的方式把知識講出來。沒有這一步,語言模型雖然能接話,但通常不會照你的指令做事。
為什麼 RLHF 突然這麼紅?
因為 ChatGPT 在 2022 年底爆紅,而它跟前一代 GPT-3 最大的差別就在這套訓練法。OpenAI 的 InstructGPT 倉庫指出,13 億參數的 InstructGPT 在人類評測中贏過 1750 億參數的 GPT-3,這個「小模型贏大模型」的結果讓整個業界注意到,訓練方式的價值可能比堆參數更高。
我不是工程師也需要懂 RLHF 嗎?
不需要懂技術細節,但知道它存在對你有實際幫助。理解 AI 的回答風格是人類偏好訓出來的之後,你比較不會把模型的語氣當成事實可信度的證據。AI 講得越肯定,不代表它越正確,這兩件事很容易被混在一起。
RLHF 的中文翻譯有沒有統一?
沒有完全統一。台灣繁體中文圈最常見的是「人類回饋強化學習」,也有人寫「基於人類回饋的強化學習」;中國簡體中文多寫成「人类反馈强化学习」,用的是「反饋」不是「回饋」。本站統一採用「人類回饋強化學習」,但實務上大家幾乎都直接講 RLHF 這四個字母。
學會 RLHF 之後,下一個該學什麼?
建議先看獎勵模型的極限,也就是 AI 幻覺為什麼沒被 RLHF 修掉。接著看 DPO 這條簡化路線,理解為什麼業界要把獎勵模型拿掉。最後可以往 AI 對齊與 Constitutional AI 走,那是把「誰來定義好答案」這個問題再往上問一層的地方。
延伸閱讀
- 大型語言模型(LLM)是什麼? — RLHF 是 LLM 訓練流程的最後一段,先懂 LLM 再看 RLHF 順序才對。
- AI 幻覺(Hallucination)是什麼? — RLHF 修不掉的那一塊,兩篇對照著看最有感。
- Prompt Injection(提示詞注入)是什麼? — 對齊訓練做得再好,也擋不住有人從外部餵指令進來。
- AI 五分鐘快報:記憶體漲價還沒完,3 件事一次看 — 裡面談到白宮 8 月 4 日找四大 AI 廠談自願安全測試,對齊已經是政策題不只是技術題。
參考來源
- Hugging Face 官方部落格《Illustrating Reinforcement Learning from Human Feedback》 — 三階段流程、獎勵模型輸出純量分數、約 5 萬筆偏好標註、1750 億語言模型配 60 億獎勵模型、PPO 與 KL 散度懲罰、DeepMind Gopher 2800 億參數。
- OpenAI following-instructions-human-feedback — InstructGPT 論文倉庫,13 億參數模型在人類評測中勝過 1750 億參數 GPT-3、參數少 100 倍。
- OpenAI lm-human-preferences — 2019 年論文《Fine-Tuning Language Models from Human Preferences》(arXiv 1909.08593)、僅在 1.24 億參數 GPT-2 上測試過。
- Anthropic hh-rlhf 資料集 — helpful 與 harmless 兩軸的成對偏好資料、chosen 與 rejected 格式、論文 arXiv 2204.05862。
- Hugging Face TRL 官方 DPO Trainer 文件 — DPO 論文 arXiv 2305.18290、Rafailov 等人 2023 年提出、PPO 流程不穩定的描述。
- Anthropic ConstitutionalHarmlessnessPaper — 《Constitutional AI: Harmlessness from AI Feedback》arXiv 2212.08073、用 AI 回饋取代無害性的人類標註。
整理一下重點:RLHF 真的不是在教 AI 知識,它是在教 AI 怎麼講話,而這件事的效果大到讓一個小 100 倍的模型贏過前輩。
希望這一篇有讓你對 RLHF 有比較具體的理解哩~如果發現事實錯誤、定義不準、或翻譯卡卡的,歡迎透過聯絡頁指正,看到我們會盡快修。
我們下篇文章見囉~
本條目由 Array 報報 AI 編輯部根據上方「參考來源」整理,文末已揭露 AI 生成 + 公開資料引用。