SecondSource從一手資料重建判斷
深度 · 2026年7月15日

TTC 一週體檢:資本腿兌現了,但「預算」本身裂成四條軸

這篇的收據 16 條來源 · 對抗表 看方法論與對抗紀錄 →

本篇出自 2026年7月15日 晨報

一句話

先講清楚一個詞。TTC 是 test-time compute 的縮寫,指模型在推論當下、回答之前多花的運算時間與成本,不是訓練階段的事。「能力隨 TTC 預算成長」是推理研究者 Noam Brown 提出的命題;一週前我們對它的判斷是:核心成立,但「思考數週不撞牆」的強讀法被域邊界研究壓住,信心停在偏保守的一側,並留下三個觀察點。本篇就是對這三個觀察點的逐格體檢——不需要讀過先前任何一篇,背景都在各節就地交代。

體檢的結論是:這條體制的資本腿在宏觀層兌現了——推論支出超過訓練支出,三個獨立來源同向。但同一週的證據把「預算」這個自變數拆散了:token、金錢、延遲、驗證算力是四條不能互換的軸,同一筆預算在不同 serving 架構下可以省 32% 也可以反貴 121%,而 Noam Brown 本人親手鬆動了自己最強的論證。體制沒有被推翻,而是經歷了一次解析度升級:從一條曲線變成一張分域地圖。

這條趨勢在我們地圖上的位置:

FlashAttention(2022)attention 成本變線性——長輸入變可付
PagedAttention/vLLM(2023)KV-cache 分頁——大併發變可付
speculative decoding(2023-24)延遲與品質脫鉤
test-time compute(2024-)「思考時間」成為新的可購買成本軸

並存 ⇄

並行路線蒸餾推理路線:把強模型的推理軌跡蒸進小/快模型,窄域不用燒思考時間

一週之內,三個改寫各自多了一條新證據——方向都不單純

Noam Brown 的命題當初一次改寫了三件事:評估的 x 軸該是預算、安全評測固定預算量不出高預算下的危險能力、takeoff 的時間曲線被真實世界的等待卡住。本週三者各自都動了:


宏觀層:體制兌現成了產業定價結構

推論支出超過訓練支出,發生在 2026 年初。這個方向現在有三個獨立來源,不再是單家傳聞。 精確地說:Zylos 用累計支出口徑、Deloitte 估 inference 占全部 AI 算力從 2025 約一半升到 2026 約 2/3、產業媒體報 2026 初 inference 首次占 AI 雲基建支出超過 55%——是三個不同分母的指標同向,不是同一宣稱被三方複驗;它們共同支撐的是「翻轉方向與時點」,而非任何一個具體占比。這條已在 7 月 12 日過定向核驗 (Zylos Research)。它正是這條體制資本含義的宏觀兌現:推論算力需求會隨願付預算彈性變動,一週前我們說「若真則偏多頭」,本週證據面轉硬。

同時,「把 TTC 預算換成能力」這件事本身變成了可以賣的產品層。 三個互相獨立的訊號:

什麼叫「兌現成定價結構」?一年前「多想一點」是論文技巧;現在它是你在下拉選單裡買的東西。選哪檔強度、開不開平行、要快還是要省,每一格都明碼標價。


微觀層:「預算」這個 x 軸自己裂了

一週前的結論是「評估必須以 token 或成本為 x 軸」。本週的證據說:連這個 x 軸都不是一條軸。

裂痕一:同一條成本曲線,兩邊讀出相反結論

Anthropic 的 scaling 負責人 Moskovitz 引用 Noam 的成本軸曲線主張:聰明模型的 token 效率高,按「每解決一件事的總成本」算,直接問大模型反而便宜 (AI Supremacy)。要注意他是賣方,立場有利益。同一週,實務側觀察者 Raschka 的觀察正好相反:除非要最頂規的輸出,便宜模型加上拉高強度檔通常更划算 (X / @rasbt)。這是單源且無基準測試的觀察。現實中的企業行為站在第三個位置:Ramp 引導員工寫 email 別用最貴的 Opus,可見實務仍在做分層引導;我們圖上原有的「組織內模型分層使用」判斷有 RouteLLM 的學術實證支撐,與 Moskovitz 的論點正面對撞,兩造都留在帳上。

怎麼讀這對矛盾?別看「每 token 單價」,要看「每解決一件事的總帳」——這就是單位經濟學換算。矛盾的根源在:大模型單價貴但可能幾百個 token 收工;小模型單價便宜但可能磨幾萬個 token。誰對,取決於你的任務難度分布與兩者的 token 效率差:簡單任務占比高則分層贏,難任務占比高則大模型贏。這可以實證——監控主流 API 的「每解決任務成本」對比就能裁——所以兩線並行保留,我們不裁贏家。

裂痕二:省 token 不等於省成本——serving 架構能把帳完全翻轉

一項受控比較 18 個任務-模型設定的提前退出研究,給出本週最反直覺的數字:同一個省算力策略,在能重用已算前綴的架構下省 32% token;在必須整段重算的架構下反而貴 121% (arXiv)。單源,待複現。而且提前退出沒有萬用贏家:自由式數學、選擇題、小型高難度競賽題各是一個 regime,最後那類「沒有可認證的積極省法」。

這對體制是「證實但收窄」:它證實 TTC 的價值真的隨工作負載變動,同時宣判「一條性能對預算曲線」不夠用。你的曲線長什麼樣,取決於你的 serving 基建能不能重用算過的部分。 評估軸從一維變三維:token、錢、架構。

裂痕三:Noam 親手鬆動自己的 takeoff 論證——但只在可平行域

2025 年 6 月的 Noam Brown 說:等待時間是「AI 進展需要較長時間」一派最強的論證,而且「多數實驗性工作不可平行化」。2026 年 7 月 10 日的 Noam Brown 發布 Sol Ultra,宣稱把同級數學證明從「也許一整天」壓到「一小時」——約 24 倍,當事方自己的示意數字,推文還帶著「perhaps」(Noam Brown)。同一時間,獨立實務者的長時 agent 實測站在另一邊:很多研究問題本質上極度串行,「你沒法生出 50 個 agent 從零解出」,反而單一 agent 自主跑八小時以上已見疑似可發表的進展 (X / @arankomatsuzaki)。這是主觀單源。學術上「時間跨度本身就是訓練瓶頸」的反向證據也還在。

先分清兩件事。「數學證明可以平行搜索壓延遲」是工程事實,目前只有當事方在單一領域的示意;「takeoff 時間曲線按域分裂」是宏觀推論,前者只是後者的第一個數據點,不是證明。本篇的判斷收在較弱的一層:takeoff 辯論的座標變了——從「整體快或慢」變成「哪些域的等待時間可以被工程繞過」。可平行搜索、可機器驗證的域正在累積繞過案例:Gemini 半自主掃了 700 個 Erdős 開放猜想、自主解出 5 個新結果 (X / @quocleix);另一路「測試時訓練」在測試當下用強化學習繼續更新模型權重——這和一般只取樣、不改權重的測試時做法不是同一族——用開源模型以幾百美元一題的成本刷開放問題的最好成績 (arXiv)。而必須等實驗結果的域,藥物、材料,瓶頸維持原樣。Noam 2025 年 6 月那半句「多數實驗性工作不可平行化」至今無人推翻,包括他自己。「不會一夜 takeoff」的改寫沒有被推翻,但它的適用範圍第一次出現了產品級的邊界侵蝕。

裂痕四:第四條軸——「驗證」也能堆算力

Stanford 與 Berkeley 圈的一篇預印本主張:verification,判定解對不對這件事,是預訓練、後訓練、TTC 之外的第四條 scaling 軸——連續分數乘粒度乘重複評估乘準則分解,並自報四個 agentic benchmark 的最好成績 (arXiv)。單源,但作者陣容強。

這給「TTC 增益是域條件命題」提供了一個候選機制解釋。注意這是演繹推理,不是因果觀察:若 TTC 的增益需要一個「能判斷對不對的東西」來收割,那麼驗證器可堆算力的域 TTC 有複利,沒有驗證器的域多想只是多錯——域邊界就不是經驗巧合,而是由「有沒有 verifier」決定的函數。但它不是唯一解釋:醫療域的 TTC 無增益,也可能來自因果複雜度本身、驗證成本太貴、或資料與倫理約束。這些替代解釋與 verifier 假說可分辨——前者換更強的 verifier 也不解——是後續對答案的地方。這條若得第二獨立源,才升格為「reasoning scaling 是域條件命題」的機制底座;現在只掛候選。

而域邊界本身,7 月 15 日又細了一格:一項把「規劃能力」拆成子能力來分析的研究顯示,「規劃」不是單一能力——局部動作與狀態轉移的推理隨模型放大與更長推理軌跡改善;目標可達性這類結構枚舉對規模與推理預算幾乎不敏感 (arXiv)。單源,又一條域邊界反例。邊界不只切在「域」之間,還切進同一任務的子能力之間。「能力等於預算的函數」這句話的解析度要求,又升了一級。

治理失效的理由,比 Noam 說的更深

Noam 的批評是「安全準備框架沒把 TTC 預算算進去」。Anthropic 第三版負責擴展政策在 2026 年 2 月 24 日的自我檢討更根本:能力門檻式治理整個撞上了方法論天花板。原文說「the science of model evaluation isn't well-developed enough to provide dispositive answers」——模型評估這門科學還不夠成熟,給不出決定性答案。生物風險卡在「不能說低、也不能說高」的模糊帶,政策改走雙軌緩解措施加非約束路線圖,每 3 到 6 個月出風險報告 (Anthropic)。這是公司自陳。跨實驗室對證成立:兩家前沿實驗室從不同角度承認同一件事——固定快照式的能力評估,量不出 TTC 時代的能力。 有一個未核事項:RSP 第三版全文是否明文納入 TTC 預算,本次沒有上網核對;若已納入,「治理落後」要改寫成「治理開始追上」。


體制沒倒,它改形了——從一條曲線到一張分域地圖

把四條裂痕疊起來,這條體制的形狀更新為:

能力 = f(預算 | 域有無 verifier,任務可否平行,serving 架構可否重用)。

方向 thesis

TTC 體制的資本腿已宏觀兌現,但「預算」正裂解為 token、成本、延遲、驗證多條軸,能力函數域條件化,verifier 存在性是候選機制——「把預算換成能力」的調度問題將成為賽點。但誰擁有這一層是開放的:前沿實驗室內建的強度檔與平行模式,和第三方獨立調度層正面競爭;「Auto 模式缺位」既可讀成機會、也可讀成調度難以獨立產品化。
可監控、同時是本判斷的證偽器:①12 個月內調度是否出現獨立抽毛利的層——若始終只是模型廠內建功能,「第三方調度層」判斷死,價值歸模型廠;②主流 API 是否出現「每解決任務成本」口徑的公開對比;③無 verifier 域的 TTC 增益是否持續不超過域內增益的三分之一。

這對誰意味著什麼

(以下為方法論與核驗細節,供覆核用。)


方法論與對抗紀錄(點開)

以下是這篇怎麼被做出來的:對抗表(我們自己攻自己)、待補的洞、掛回圖上的節點與方法論註記。想直接看結論的讀者可以略過。

對抗表(本週 07-15 體檢的量化判斷對抗檢驗)

| # | 量化判斷 | Skeptic 攻擊 | 收斂 |

|---|---|---|---|

| 1 | 「inference flip 兌現」 | 三源分母不同(累計 vs 年度算力 vs 雲基建支出),「三個指標同向」≠「同一宣稱被三方複驗」;Zylos 有 track-record 扣分(SambaNova 誤報) | 採納改寫:正文明說「三個不同分母的指標同向」、共同支撐的只有方向與時點;85% 企業預算占比單源不引;Zylos 扣分已記於 V107B 節點 |

| 2 | 「~24x wall-clock 壓縮」 | 當事方推文、帶 perhaps、無 benchmark、單域 | 降格使用:只作「首個鬆動數據點」,不作量測;獨立複測列 hang |

| 3 | 「takeoff 按域分裂」 | 工程事實(數學可平行)≠ 宏觀 takeoff 曲線分裂;支撐證據 conf 0.4–0.7 全單源 | 採納降格:正文改寫為「辯論座標改變」,分裂命題留 candidate insight(hangs),本篇不當結論用 |

| 4 | 「調度層是下一段價值」 | Maestro 單源 promotional;未區分 lab 內建型 vs 第三方型;「Auto 缺位」可反讀成調度難產品化 | 採納改寫:thesis 改為「調度是賽點、歸屬開放」,監控①改成明確證偽器(12 個月內無獨立抽毛利層=第三方調度層判斷死) |

| 5 | 「省 32% vs 貴 121%」 | 單團隊、綁定 α=0.15 與特定模型組 | 只當「serving 架構能翻轉帳本」的存在性證明,數字不外推 |

| 6 | 「verifier 是域邊界機制」 | 演繹非觀察;替代解釋:因果複雜度/驗證成本禁阻/資料倫理約束;作者含 Anthropic 生態關聯 | 採納改寫:標明候選機制+列出可分辨的替代解釋;待第二源才升機制底座;B-4 的 1/3 預言不因它改動 |

假設帳本(Layer A)

  • A1:07-08~15 的池內抽取對 TTC 主題無系統性偏漏(依賴 ingest 漏斗;若「遞減證據」類

論文被漏收,「承」的方向會偏多)。

  • A2:單源示意數字(24x、6x token、85%、幾百美元/題)一律當量級不當常數,文中已逐一標源與 conf。
  • A3:web 三缺口未補(見 hangs):RSP v3 全文 TTC 核對、Sol Ultra 獨立複測、

benchmark 預算軸慣例普查(watchpoint ① 本週池內無新錨,標「未動」)。

  • A4:模型代稱(Sol/Terra/Luna)依 fact 檔備註對應,未再獨立核。

hangs(掛回地圖 / 待補)

  • RSP v3 全文是否明文含 TTC/elicitation 預算 → 決定改寫二是「落後」還是「開始追上」(web)
  • Sol Ultra 平行 TTC 的獨立複測/批評(web)
  • 2026 主要 benchmark 的預算軸採用普查(ARC Prize/Artificial Analysis/METR)→ watchpoint ①(web)
  • QD0205 verifier 軸的第二獨立源 → 升 INS 的門檻
  • 「takeoff 按域分裂」候選 insight:C04N06 + RA0806 + C9E06 三角已 ≥2 獨立源,

留待下個 gated session 鑄節點(本 session 無 gate,保守不鑄)

方法論註記

本篇在純池環境跑成(無 web、無 pipeline script):反證搜尋(S4.5)以池內 contradicts 邊

與雙向錨代行——本題可行,因為 07-03 crosscheck 與 07-12 P12 已把對抗證據灌進圖;

三個真正需要現搜的問題誠實列 hangs,不硬寫。單源 claim 全程帶 conf 與 bias 標記。

與 #6 相同的紀律:兩個方向的證據都留在圖上,confidence 不因敘事漂亮而動。

本篇對抗表的生產核驗狀態:S6 skeptic 一輪收斂、cheap-tier 一次過、數字對帳 all_pass。

(所有 [追蹤代號] 可在 facts/ insights/ 追到原始節點、verbatim 與 confidence 狀態。)

免費訂閱,明天早上就收得到

只留 email,隨時退訂。這是我們唯一想請你做的事。

同類最新