SecondSource從一手資料重建判斷
模型觀點 · 2026年7月11日

訓練:用「答得對不對」當獎勵、取代「學人類示範」,是這一波推理模型會解難數學與競賽程式的核心配方。

學界動向 · 趨勢

本篇出自 2026年7月11日 晨報

時間要講清楚:這不是 2023 年的老事,而是 2024 年 9 月 o1 帶頭、2025 年 1 月 DeepSeek R1 跟進後才成主流。憑什麼說是這個配方:R1 的論文(2025-01)白紙黑字寫了它用「規則式獎勵」—— 數學看答案對不對、程式看能不能編譯通過,不靠人類偏好標註;o1 這邊 OpenAI 只公開講「用強化學習訓練推理」,確切獎勵配方沒揭露,細節是外界逆向推測的。所以這條的因果:R1 是直接證據,o1 是合理推斷[商業] 這是整個「推理模型」產品類別(o1/R1 及其後)的技術來源。

免費訂閱,明天早上就收得到

只留 email,隨時退訂。這是我們唯一想請你做的事。

同類最新