SecondSource從一手資料重建判斷
模型觀點 · 2026年7月16日

「讓模型多想一下」不是萬靈丹:規劃能力被拆成兩軸,只有一軸吃補。

模型觀點 · 論文,2026-07-13

本篇出自 2026年7月16日 晨報

新論文在困難規劃測驗上跨多個模型家族做統計分解,發現「規劃」是兩種獨立能力:判斷「這一步能不能走」的局部推理,隨模型放大與更長思考確實變好;想清楚「目標到底可不可達」的全局列舉,幾乎不動(arXiv 2607.11197)。這是「推理算力換能力」信念的又一個域邊界反例,而且最尖銳——全局搜尋恰恰是最該靠多想受益的能力。這條信念的譜系:

FlashAttention(2022)attention 成本變線性——長輸入變可付
PagedAttention/vLLM(2023)KV-cache 分頁——大併發變可付
speculative decoding(2023-24)延遲與品質脫鉤
test-time compute(2024-)「思考時間」成為新的可購買成本軸

並存 ⇄

並行路線蒸餾推理路線:把強模型的推理軌跡蒸進小/快模型,窄域不用燒思考時間

我們對這條線的現行判斷(2026-07-14 已裁,本期沿用):並存分化、按工作負載分流——開放性問題買「推理時思考」,窄域高頻任務蒸餾進小模型,兩者都在擴張、不互斥。反轉條件:蒸餾小模型在開放性測驗追平前沿推理模型,思考溢價敘事崩;反向,蒸餾模型在窄域外崩壞頻出,蒸餾路線縮回。本條屬「劃界」證據,尚不觸發反轉;單一團隊、單一測驗,未經複現。

免費訂閱,明天早上就收得到

只留 email,隨時退訂。這是我們唯一想請你做的事。

同類最新