SecondSourceAI 產業洞見 · 完整版檔案庫

AI 宣稱拿下奧數滿分:證明能驗,過程只有它自己說了算

SecondSource 晨報 · 2026/7/20 · https://secondsource.io/issues/2026-07-20

本期一眼

本期素材:2026-07-20 的研究日報;今日真正新的 3 條(其中 2 條錨定 OpenAI 總裁 Brockman 的 X 貼文,對單一帳號的依賴先講明),另 2 條為舊事件的查證更新(事件日 5/28、6/15,逐條標明);回顧素材多出自 Dwarkesh Podcast 2024-25 年舊訪談的重讀,同一節目來源、彼此不互為印證,全標原發年月。昨夜掃 44 篇新內容、另收 X 原創貼文 17 條 → 本期 21 條帶連結的收據。

今日主線

1. [本週](事件日 07-15/16,公司公開 07-16 起)六題全解、42/42,宣稱者是一家新創,不是兩大 lab。 第 67 屆國際數學奧林匹亞(IMO)7/15-16 在上海舉行;賽後,專攻 AI 定理證明的新創 Axiom Math 在 GitHub 公開其系統 AxiomProver 對六道賽題的完整形式證明,自稱六題全解、42/42 滿分(GitHub,07-16)。對照基線:2025 年 OpenAI 與 Google DeepMind 模型的成績公開發表為 35/42、達金牌線。要注意兩者證據等級不同:去年那個分數是公開發表的成績,今年這條 42/42 只有公司自己說,證據等級要看下一段的驗證。若獲證實,競賽數學一年內就從「金牌級」推進到「滿分」,而且做到的是新創。細節裡有一根刺:公司自報單題耗時從 24 分鐘到 14 小時以上,而人類賽制是每天 4.5 小時考 3 題,「14 小時解一題」若屬實,並不在人類賽制時限內。OpenAI 總裁 Greg Brockman 7/19 發文稱「感覺是推進數學的分水嶺時刻,能真正改善生活的科學與醫療突破感覺很近了」,時點吻合,但推文連結未指名事件,指涉關係是推斷(X / @gdb,07-19)。

驗證: 這條的證據結構是不對稱的:證明以 Lean 4(一種形式證明語言)寫成,任何人可用軟體機器驗證「證明本身是對的」,不需要信任公司;但「在賽制時限內、無人工介入、由 AI 自主完成」只有公司自己的說法。目前只看到這一個來源,周邊全是內容轉貼、不算獨立確認;在本報追蹤的 51 家科技/財經媒體與公開內容轉載範圍內,事發四天未見任一家的獨立確認。本報把它當待驗宣稱保守記帳,升級條件寫明:IMO 官方或一線媒體確認賽制條件,任一即可。

判斷更新: 形式證明這條路線今年已有前一階。先說 agent 是什麼:它指能自主連續執行多步驟任務的 AI 程式,不必人一步步下指令。5 月一組研究團隊的 agent 系統自主解掉 353 個 Erdős 開放問題(匈牙利數學家 Erdős 留下的未解問題集)中的 9 個,每題成本只有幾百美元(arXiv,2026-05)。今天的宣稱若獲證實,就是下一階:從「解開放問題」到「競賽滿分」。為什麼值得盯:數學證明可以被機器逐步驗證,是驗證成本最低的領域,AI 的能力進展會在這裡最先顯形;Brockman 那句「科學與醫療突破很近」,講的正是從數學往其他領域的傳導。若形式化證明的自主能力真到這量級,對 AI 輔助證明工具、科研 agent 產品線會是直接可用的能力躍升,值得重評優先序。盯什麼:IMO 官方名單或一線媒體任一確認賽制條件,在此之前一律當未證實的公司片面說法看待。

2. [證據更新](事件日 05-28,官方稿今日逐字核實)Anthropic 的 $47B 年化營收,從分析師轉述升級為官方口徑;同一輪融資,記憶體三雄用股權綁住最大買家。 Claude 開發商 Anthropic 5/28 官方宣布 Series H 輪:募資 $65B、投後估值 $965B,新聞稿並自述 run-rate 營收本月稍早跨過 $47B——run-rate 是把單月營收乘 12 的年化口徑,不是經審計的全年營收,兩者差異必須標明(Anthropic 官方新聞稿,05-28)。本報今天把這份官方稿逐字核對完;重點不是事件本身(5 月的事),是口徑升級:此前「$44B+」的說法出自半導體與 AI 基建研究機構 SemiAnalysis 的分析,同文口徑下 2025 年還是 $9B,約半年 5 倍(SemiAnalysis,2026-05),現在官方數字對上了。輪內還有兩個結構訊號:hyperscaler 先前承諾的 $15B 投資入輪(含 Amazon 的 $5B);Micron、Samsung、SK hynix 三家記憶體廠以策略投資人身份入股。

驗證: 官方新聞稿對「公司如此宣布」是最強證據;數字本身仍是公司自報、未經審計。分析師先前口徑與官方口徑互相對上,是這條今天升級的原因。

判斷更新: 2023-25 年的資本流向是 AI 公司向上游搶產能;供應商反過來用股權綁定最大買家,是資本第一次從基建層反向流入模型層的訊號。HBM(高頻寬堆疊記憶體)是 AI 晶片眼下最緊缺的部件,它下一輪產能分配的優先順序,值得對照這張股東名單讀。記憶體產能有限,供應商既然用股權綁住 Anthropic,其他模型商在下一輪 HBM 採購優先序上的位置就值得留意;這目前只是個開放問題,沒有證據顯示這輪投資附帶排他條款或產能保證。與下方「深度報告」合看:這條升級的是那篇毛利分析的收入端;毛利端還有三本帳,見該段。

3. [證據更新](產品發布 06-15,獨立佐證今日對齊)AWS 幫內容網站向 AI 爬蟲收費,它給的兩個宣傳數字,被第三方實測拆成一半可信、一半存疑。 Amazon 雲端部門 AWS 6/15 在其網站防火牆服務(WAF)上線「AI 流量貨幣化」:內容擁有者可對 AI 爬蟲逐請求收費。爬蟲命中收費規則時,伺服器回覆「HTTP 402 需要付款」與機器可讀的價格表,以美元穩定幣、開放的 x402 協定結算,可辨識 650 多種 AI 爬蟲,AWS 不抽成(AWS 官方部落格,06-15)。x402 就是以 HTTP 402「需要付款」狀態碼為基礎設計的開放付款協定。背後的結構問題:傳統搜尋爬蟲索引內容後會回導流量,AI 爬蟲拿內容生成摘要、幾乎不回導,出版方承擔流量成本卻換不到讀者。AWS 為此給了兩個需求數字,本報逐一拿去對第三方數據查核。「AI 爬蟲年增 300%」:全球最大內容遞送網路(CDN)商之一的 Akamai,4 月以自家網路實測發布同一數字,與 AWS 無利益一致性(Akamai 新聞稿,04-08);Cloudflare、Fastly、Imperva 三家的量測口徑各異但方向一致、甚至更高,AWS 這個數在同業實測裡反而偏保守。「AI 爬蟲佔許多內容站流量五成以上」:沒有任何獨立來源以同一口徑量到,最接近的是 Imperva 的「全體機器流量(不限 AI)佔 53%」,分母與分子都不同,不能當佐證。

驗證: 前一個數字今日升級為多方獨立實測印證;後一個維持「供應商行銷口徑」看待。

判斷更新: 給內容平台與出版的商務負責人兩句可直接用的:對外引「AI 爬蟲年增三倍」,現在有三家以上獨立實測背書;談判時的流量佔比,用自己站上的實測數字,別用供應商給的分母。

4. [今日] OpenAI 總裁自述 ChatGPT Work 的關鍵形態:agent 跑在雲端,筆電闔上也在做事。 OpenAI 面向工作場景的 agent 產品 ChatGPT Work,總裁 Brockman 7/19 自述它最好的特性之一是跑在雲端:手機上能用、筆電闔上也行,並直言至今拿到 agent 魔力的主流方式「都得讓筆電開著,頗荒謬」(X / @gdb,07-19)。現有主流的寫程式與辦公 agent,長時任務多半得綁定本地裝置、保持開機在線:agent 跑十分鐘,電腦就得開著十分鐘。改跑雲端,數小時級的背景任務第一次能脫離本機、在雲端持續執行。

驗證: 產品負責人的一手自述,有行銷誘因;原文只講這一項特性,完整規格與定價未見,先記方向。

判斷更新: 對企業 IT 與選型的人,一個新的採購評估項成形:長時任務要不要人開著電腦陪跑。

也發生了

深度報告(昨夜完稿):賣 token 終於賺錢了,然後呢

核心判斷。 Anthropic 賣 token 從賠錢變賺錢是事實,但要分三層讀:收入端有官方口徑(見今日主線第 2 點);毛利端是內部與分析師一致、但未經審計的改善;「獲利季」還只是指引。高毛利眼下只在最貴的旗艦 agentic 檔成立,由三根支柱撐著:算力短缺、對開源模型的品質差距、買方的 ROI 質詢還沒傳導到帳單。三根都在動,三根都沒倒。

為什麼現在挖。 本報 2026/7/19 期主線第 1 點記過:四個行家同週指向「AI 值錢的位置正在離開模型本身」。同一週,「模型商毛利翻正」的反向敘事也在變硬,兩邊必有一邊要修正。這篇挖的就是:翻正撐不撐得住。市場上還掛著一對活矛盾:有創辦人說「過去半年每家模型商實際上都在漲價」,也有媒體報導 OpenAI 內部在考慮大降價,本報兩條都留著、不先裁。

毛利有三本帳,別混著讀。 The Information(以內部文件報導見長的科技訂閱媒體)報的是 2025 全年、全成本口徑:毛利預測曾從 50% 下修到約 40%,原因之一是雲端推理成本比預期高(The Information);SemiAnalysis 的口徑只算推理服務:從 38% 升到 70% 上下(SemiAnalysis,2026-05);CNBC 引投資人口徑:每 $1 營收的算力成本從 0.71 降到 0.56(CNBC,2026-05)。時序上,下修在前、講 2025;改善在後、講 2026。拿 40% 去打 70% 是口徑錯配。三本帳沒有一本經過審計,上市文件才是終審法院。

```tree TREND-BUSINESS-FRONTIER-PRICING-POWER

基建層捕獲期(2023-25)(價值被晶片/電力/

記憶體吃走,模型商賣 token 賠錢(2024

推理毛利 -94%))

└ 單 token 經濟翻正(2026H1)(agentic 需求 ×

token 成本崩;推理毛利轉正、

首個獲利季在望——但留不留得住開吵) ?

├ vs 路徑A:定價權持久論(SemiAnalysis):

短缺+品質差距→按價值定價,低毛利時代結束

├ vs 路徑B:商品化預設論(Evans/Narayanan):

賣 token 無差異+零切換,

毛利遲早被壓向成本

└ vs 路徑C:需求摻水論(Gurley/Chamath):

現在的需求訊號含補貼與未清算的 ROI,

資本窗一關會現形

```

什麼會推翻它。 旗艦檔出現實際降價,「定價權持久」這一線就翻。最近的檢驗點是 8/31:Anthropic 中階模型 Sonnet 5 的上市促銷價是每百萬 token $2/$10(輸入/輸出),官方預告 8/31 後回標準價 $3/$15;屆時不回,促銷就成了事實降價(發布日價格整理:Simon Willison,06-30)。價格階梯的下段其實已經開戰:Google 把消費端 AI 訂閱從 $7.99 降到 $4.99,被科技媒體稱為訂閱價格戰的鳴槍(TechCrunch,06-09)。給用 API 建產品的人一句可直接用的:若 9/1 後 Sonnet 5 回標準價,現在用促銷價估算的單位經濟模型就得重跑,能路由到中低檔的用量先路由下去。

對答案日。 本報自設 12 個月觀察窗。最近的一格是 9/1 回看 Sonnet 5 回不回價;最重的一格,是 Anthropic 上市文件裡經審計的毛利,最終落在哪一本帳。

大神觀點(回顧)

本週的大神級發言(Brockman 兩則)已入今日主線第 1、4 點;本欄出一則回顧,配合本報正在做的「把舊預測釘進帳上」工作。

模型觀點(學術與技術)

昨夜新進的 28 篇學術論文尚在閱讀中,本欄今日不硬湊新論文;出兩則回顧,都與今日主線直接相關,標明原發時間。

過去洞見

「三條互相印證的證據」,攤開驗完只剩一條半(本報深度研究,2026-07-04)。 7 月 1 日,Meta 被報導要仿 SpaceX 把過剩算力出租變現,市場當天重挫半導體股(TechCrunch,2026-07-01)。當時流行把三條證據串成「算力供過於求」:Oracle 的 GPU 雲毛利偏低、B200 晶片租金三週下跌、Meta 拋售算力。本報的深度研究逐條驗獨立性,結果:Oracle 那條講的是「機房用租的、客戶又集中」的公司結構劣勢,不是全行業過剩;租金下跌是三週的單點數字,且與 Meta 拋售出自同一天的同一報導原點;真正獨立的供給側證據,只有 SoftBank 宣布的 10GW 級新算力服務一條。名義三條、實質約一條半。反面證據同場保留:SemiAnalysis 同期反共識指出,Meta 的算力採購在加速、其出租段定價是同業 3-4 倍的溢價;真正的供過於求會壓出折價,不會壓出溢價(SemiAnalysis,2026-07-02)。可帶走的一句:看到「三條證據互相印證」,先問它們是不是同一個原點投出來的三個影子。(Oracle GPU 雲毛利率與 B200 三週租金跌幅的實際數字出自訂閱來源,公開版從略。)

來源與盤點

過去 24 小時。 昨夜我們掃了 44 篇新內容:學術論文 28(主題掃描;另 47 位追蹤作者無新作,少數查詢逾時未完成,該範圍外不作保證)、播客舊集逐字稿 13(夜裡以較保守的標準讀完 11 篇、濾掉 2 篇無新訊號的,幫讀者省時間)、部落格 2、電子報 1(濾除);X 原創貼文另收 17 條,取自 305 個追蹤帳號的原創(@gdb 2、@elonmusk 12、@LisaSu 1、@sundarpichai 1、@steipete 1),未跑全網掃描。訂閱電子報與檔案庫(Stratechery、Colossus、7 家 Substack 檔案)無新文;財報來源 27 家無新申報;總經來源無新官方發布,本期無總經段。我們昨夜整理出 15 條新事實,其中 6 條出自 2024 年 Dwarkesh 舊訪談的重讀,全數列回顧、不當新事件;凌晨完成一篇深度研究(見深度報告段);白天對 3 條做了當日定向查證(今日主線第 2、3 點與深度報告段的營收錨)。今日無新增追蹤來源、無一次性回填。覆蓋聲明:本期只能保證上述掃描範圍內的訊號。

我們追蹤的來源。 本報判斷的底層,目前追蹤 529 個具名的聲音:X 305 人(Elon Musk、Andrej Karpathy、Greg Brockman、Nathan Lambert 等)、播客 90 人(Satya Nadella、Dario Amodei、Jensen Huang 等)、新聞媒體 51 家、個人部落格 48 人(Simon Willison、Chris Olah 等)、論文作者 48 人(Noam Shazeer、Percy Liang、Tri Dao 等)、電子報 46 份(Dylan Patel、Ben Thompson、Ethan Mollick 等)、財報與法說 26 家、主題演講 23 場。

本報不是新聞摘要:我們從每天的 AI 資訊流裡捕捉真正重要的洞見與值得長期追蹤的行家判斷,並交代每一條是怎麼驗證的 — 重點永遠是「哪條判斷變硬了、誰說得準」,不是今天發生了什麼。

—— SecondSource·由研究系統自動生成 · 19 個來源 · 回信給我們,就是最好的意見回饋

---