SecondSource 晨報 · 2026/7/24 · https://secondsource.io/issues/2026-07-24
本期素材:2026-07-24 的研究日報;主要事件日 07-20 至 07-23,回顧素材標原發年月。昨夜到今晨處理 18 篇:播客逐字稿 12 篇(2 篇未取信號)+業界電子報 6 篇,另有 2 篇 7/22 抓取的電子報同輪處理 → 本期 32 條帶連結的收據。透明交代:今日主線 2、4 與模型觀點第 1 則主要靠 theZvi 同一份週報轉引,一手資料尚未逐一直取;主線 1 的指控原文已直接核對官方帳號一手貼文。
1. [本週](發文 07-23)三個月前華府只說「有證據、將採取行動」,不點名;今天它變成了具名指控,而且指控內容很具體。
白宮科技政策辦公室(OSTP)主任 Michael Kratsios,美國行政部門最高層級的科技政策官員,在官方帳號發文指控:有資訊顯示中國 AI 公司月之暗面(Moonshot AI)「蒸餾」了 Anthropic 的 Claude Fable 來開發自家前沿模型 Kimi K3。蒸餾的白話是:拿對方模型的回答當教材訓練自己的模型,等於把能力抽過來;這算不算竊取智財,正是本案爭點。指控共三項:除了蒸餾本身,還包括建了一座大規模蒸餾平台,能在多種存取方式之間快速切換,藉此規避偵測,以及取得受美國出口管制的 Nvidia GB300 伺服器並「在泰國存取」算力(Kratsios 一手貼文,07-23)。財政部長 Scott Bessent 同日補上工具:「開源不代表美國的智慧財產任人予取予求」,不排除動用制裁與實體清單;實體清單是美國商務部的出口黑名單,列入後美國企業對其出口需特別許可(Bessent 引言經 theZvi 週報,07-23 轉述)。本報 7/22 期寫過這場蒸餾辯論的機制層與華府的設限風向,今天新的是兩件事:具名點名,以及制裁工具正式上桌。
驗證: 兩層要拆開。「指控發生了」是坐實的:Kratsios 貼文我們已逐字核對官方帳號原文。「指控屬實嗎」遠未定:美方沒有說明如何得知、未出示證據,月之暗面未回應;TechCrunch 同日刊出反方專家意見,認為 K3 的能力水準不是蒸餾一家前沿模型能解釋的(TechCrunch,07-23)。兩邊說法都保留。現況截至本期發稿:制裁與實體清單均為威脅性表態,未見正式行動。
判斷更新: 政策線從一般宣示升級為具名指控,是結構性的一步。若你在用或評估 Kimi K3 等中國開源模型:實體清單從威脅變成行動的那一天,API 供應鏈與合規審查都會被波及,替代軌現在就該在手上。附帶一條方向相反的判讀:政策分析者 Peter Wildeford 估計(經同一份週報轉述),K3 仍明顯落後美國最強模型約六個月;「蒸餾就能追平」的想像,與這個觀察對不上。
2. [本週](跑測發表 07-23,經轉引)四個一般人都租得到的模型同時拿下 IMO 滿分 42/42,「答對率」對前沿模型失去鑑別力。
國際數學奧林匹亞(IMO)是全球最難的高中數學競賽,長年被當成 AI 推理能力的標竿。2025 年 AI 的最好成績是 35/42,而且出自兩個未公開發布的實驗模型;今年,科技投資人 Deedy 的公開跑測顯示,四個一般人都用得到的模型全部拿到 42/42 滿分,單次成本約 10 到 50 美元(theZvi 週報,07-23)。四個模型各有特徵:Anthropic 的 Fable 5 最快且一次通過;OpenAI 的 GPT-5.6 Sol 最便宜;中國的 Kimi K3 也滿分,但多試四次、燒最多 token;新創 Axiom Math 全部以機器可驗證的形式化證明完成。本報 7/20 期報過 Axiom 自稱滿分後多日無獨立確認;這次跑測與其自報一致,但跑測本身也還是單一來源轉引。同週,評測機構 METR 是一家以量測 AI 能自主完成多長人類任務聞名的獨立研究機構,本週推出新量尺「支出視界」:AI 在單一任務上花再多錢,表現也會趨於上限,而人類投入足夠成本終會反超,所以改量「AI 要花多少錢才追平人類完成同一任務」。它的示範任務是公開的 NanoGPT 訓練優化研發題;在這個任務上,最好的模型約花 2 到 3 千美元追平人類(同見上引週報)。
驗證: 本條全部數字都經 theZvi 週報單一轉引,Deedy 的解題紀錄與 METR 的原始發布,我們尚未直接核對,先當方向看。METR 自己也標了兩個保留:示範任務是公開題目,模型可能對它過度練習;它同時呼籲各廠商公布「多花錢能多好」的完整成本曲線。
判斷更新: 我們記下一條新判斷(本報自家合成,不是任何外部專家的原話):前沿能力的比較軸線,正從「答對率」遷移到「達到等效人類成果的成本」。證據還薄,兩個支撐事實都是單一來源轉引,先按低信心記錄。它若成立,下一輪模型競爭的賣點會是成本效率曲線,不是峰值分數;替公司採購模型的人,盡調問法可以從今天換:滿分是入場券,要求供應商交「達到目標品質的每任務成本」。
3. [本週](發表 07-23)token 每降價 10%,用量多 11% 到 18%——需求的價格彈性 -1.11,殺價殺不垮賣 token 的生意。
本報 7/21 期用一整期問過「中國模型真的便宜嗎」;本週開源圈最熱的問題是它的續集:Kimi K3 的激進定價,會不會打垮賣 token 的生意。科技分析電子報 Exponential View 給出量化答案:不會。它自家的產業報告測出每降價 10%、token 消耗上升 12% 到 18%;美國國家經濟研究局(NBER)的一份工作論文獨立估出降價 10% 用量增約 11%,即經濟學說的彈性 -1.11:價格每降 1%,用量升 1.11%。不過 -1.11 精算下接近打平(彈性略高於 1 的臨界),單獨只能論證「不是崩潰式下降」;真正撐得住「總支出反而上升」的,是 EV 那組每降價 10%、用量增 12-18% 的數字(Exponential View,07-23)。兩組數字口徑不同,一個出自產業報告、一個是學術計量,不能平均成一個數,但方向一致:降價放量。同一篇文章補上供給端的帳:開源權重免費不等於部署免費。自架 K3 這種 2.8 兆參數、光權重就佔 1.4 TB 的模型,需要一台 GB200 NVL72 等級的 72 GPU 機架,買斷約 300 到 400 萬美元、公開市場租一年約 700 萬美元,還未計網路、儲存、散熱與人力。
驗證: 這兩個彈性數字(EV 的 12-18% 與 NBER 的 -1.11)都經同一篇 Exponential View 文章轉述:12-18% 是它自家報告的數字,有自報成分;NBER 論文我們尚未取原文核對。自架成本是作者的工程推估,2.8 兆參數的規格與彭博先前的轉述一致,其餘硬體與電力數字未見第二源。
判斷更新: 對賣推理算力的雲端業者,-1.11 是今天最該記的數字:單價下跌會被用量成長吃回來,定價目標是單位成本下降速度對用量成長速度的賽跑,不是守住單價。對平台選型的人:「開源沒有授權費」不等於「開源沒有成本」,自架的真實帳該進試算表。這條與文末的深度報告合看:上游在為算力發債續命,下游 token 單價跳水但總用量在漲;中間那條「用量變成付費」的轉換帶守不守得住,深報的三個裁決訊號——高價層淨留存能否守住 85%、自由現金流觸零後債市開出的條件、以及 coding 以外能否長出第二條營收曲線——會給答案。
4. [本週](生效 07-20)Anthropic 把最強模型改為訂閱方案常駐,並罕見明說原因:需求難預測、容量要邊擴邊放。
Anthropic 官方宣布 Claude Fable 5 自 7/20 起常駐 Max 與 Team Premium 方案,計費上以半價使用量認列,也就是用 Fable 時,一次操作要扣兩倍額度;Pro 方案續以用量點數存取並獲一次性 100 美元點數;Claude Code 每週限額加五成,延續到 8/19。官方說法直白:Fable 的需求很難預測,所以分階段開放、一邊擴容一邊延長。工程師 Thariq 自述,常駐是「日夜連軸」撐起來的(官方貼文經 theZvi 週報,07-23 轉述)。
驗證: 公司對自家產品的官方宣告,可信度高;但我們是經週報轉述看到,尚未取得官方原始公告的直接連結。
判斷更新: 與今日主線第 1 點合看,同一個模型今天出現在兩條新聞裡:一邊是需求超過供給的容量瓶頸,一邊是被指控的蒸餾標的。據同一份週報轉述,Anthropic 為了反蒸餾正在收緊模型思考過程的對外揭露,部分任務的可用性因此實質下降。防偷與擴容的代價,都落在同一群付費開發者身上;這個取捨,Anthropic 得拿出清楚的產品對策,否則指控事件最大的受害者會是自家客戶體驗。在用 Claude 的企業客戶可盯兩個訊號:Claude Code 週限額是否再度收緊、對外思考過程揭露被反蒸餾收緊後是否回復——這兩者反映防偷與擴容的取捨最終落到客戶體驗的程度。(本報判斷)Claude 若因反蒸餾與限額而可用性緊縮,正在比較 agent 產品的企業,替代方向主要落在 OpenAI 的 ChatGPT/Codex 一側。
5. [本週](評測發表 07-23,經彙整轉述)一位 Reddit 本地模型玩家把 Poolside 的開源新模型 Laguna S 拉進自己的題庫實測:速度與工具呼叫都好,壓力之下三度捏造事實。
AI 編碼公司 Poolside 上週發布小型開源模型 Laguna S 2.1,本報 7/23 期記過它的官方自述;今天新的是第一筆非廠商評測。一位 Reddit 本地模型社群的用戶用自己的題庫實測:速度小勝同級的 Qwen(每秒 109 對 103 個 token)、工具呼叫是同場最佳;但在刻意施壓的測試下三度捏造事實,同場的 Qwen 零次。評測者的歸因很傳神:它「數學想太多、事實想太少」;修正設定後 125 次重測,仍留一次捏造(AINews,07-23)。社群總評:對本地部署很有吸引力,但官方跑分「好到可疑」。
驗證: 單一用戶的私有題庫評測,經 AINews 彙整轉述,標準第三方評測機構尚未複現;「三次對零次」樣本很小,先當訊號、不當定論。
判斷更新: 開源模型的驗收正在分化出一個獨立軸:尺寸與速度之外,「壓力下的行為品質」要單獨驗。這也是對 Poolside 自家說法的第一筆反制:其創辦人主張自家模型的能力來自訓練後的行為塑造,社群首測發現的恰恰是行為面缺陷。給企業評測與採購的人:把壓力情境下的捏造率當成獨立驗收項,不能只看速度與工具呼叫成功率。
核心判斷:2025 下半年,四位重量級人物(投資人 Brad Gerstner、企業搜尋公司 Glean 執行長 Arvind Jain、Michael Dell、Nvidia 執行長黃仁勳)各用一套獨立算法,論證同一件事:算力不是買多了,是買少了,合理年投資是 2 到 5 兆美元。但四套算法共用同一根柱子:企業會為生產力提升付出接近其價值的錢。到 2026 年中對帳,結果分三層:賣鏟子的全兌現;買單那側的轉換率不是一個數,是按價位分層的曲線;而錢的結構給這場辯論裝上了時鐘。
為什麼現在挖:三層各自的新證據在本週湊齊。供給側先兌現了——Nvidia 資料中心單季營收 750 億美元、年增 92%,年化約 3,000 億,提前三到四年逼近華爾街原本給 2029 年的水位(Nvidia 法說,2026-05)。買單那側的轉換率則不是單一數字,而是按價位分層的曲線——月費 250 美元以上的企業 AI 工具,毛留存 70%(GRR,原客戶續留的營收比例)、淨留存 85%(NRR,把既有客戶加購也算進去),已達傳統 B2B SaaS 的水準——對照母體是:AI 原生新創整體毛留存中位數才從 2025 年 1 月的 27% 升到 9 月的 40%,中價位(月費 50 到 249 美元)約 45%,50 美元以下的低價層只剩 23%、還在漏水(a16z;ChartMogul)。空方旗艦「MIT 95% 企業試點失敗」因方法論遭公開質疑,降級為有爭議訊號(HPCwire);更硬的反方換成丹麥全國行政資料:ChatGPT 上市頭兩年,可排除 2% 以上的收入效應(NBER 工作論文)。而真正上了時鐘的是錢的結構——大型雲端業者的資本支出已吃掉營運現金流的九成到全部,合計自由現金流按投影在 2026 年第三季前後觸零(Epoch AI),缺口由發債接棒,2026 年 AI 相關債券估約 4,890 億美元(Yahoo Finance 引高盛估計)。原本「等轉換率數據」是沒有期限的等待,現在變成有期限的賽跑:高價層轉換的擴散速度,對上融資條件收緊的速度。附帶一條可否證預測的下場:Gerstner「資本支出佔營運現金流 66% 見頂後回落」的可否證預測,已被 BofA、Epoch、Oracle 三條獨立來源各自推翻。
```tree TREND-BUSINESS-CAPEX-JUSTIFICATION
四套多頭數學(2025H2)
(四個互相獨立的算法收斂到年算力投資 $2-5T
合理;共用同一假設:
生產力價值會變成有人付費的營收)
└ 空方立錨(2025-08)(MIT 報告稱 95%
企業試點無可量測損益影響;Ghodsi:狂買
GPU 非必要;攻擊點=轉換環節)
└ 供給兌現、紀律破線(2026H1)(Nvidia
資料中心年化 ~$300B
提前三到四年逼近共識;但 capex
吃掉營運現金流 90-100%,
自由現金流逼近轉負,債務接棒)
└ 轉換分層顯形(2026 中)(月費 $250
以上留存追平 SaaS、低價層大量流失;
三家顧問收斂「採用普及、損益兌現稀」;
辯論獲得融資時鐘) ?
├ vs 路徑A:低配論(Brad Gerstner/Arvind
Jain/Michael Dell/Jensen Huang,2025H
2):四種互相獨立的算法(營收對帳 1:1、
服務業預算轉移、生產力折現、token
增強人類智能)都得出合理年算力投資
$2-5T,現況 $1T 級=買少了
├ vs 路徑B:轉換斷鏈論(Ali Ghodsi/MIT
NANDA 報告/NBER 丹麥研究/三家顧問調
查):企業用得多、真正落到損益表的少、
低價產品留不住客,
生產力感覺沒有變成可量測的營收與薪資,
「價值→有人付費」這一環是斷的
└ vs 路徑C:資金結構論(Bill Gurley/BIS/
Epoch AI):不必等轉換率裁決,
自由現金流轉負+債務接棒會先決定辯論結
局;融資窗口本身就是裁決時鐘
```
什麼會推翻它:(1) 高價層企業工具的淨留存守不守得住 85% 這個水位(本報自設的觀察門檻);(2) 自由現金流觸零之後,債券市場每一季開出的利差與條件變差多快;(3) 寫程式以外,是否有其他領域也拿出一條夠格寫進公司財報、單獨列示的第二條 AI 營收曲線。
對答案日:2027-07-24(自設 12 個月觀察窗)。
以上是濃縮版:完整深度版今晚另寄一封到同一個信箱。
以上是濃縮版——完整深度版今晚美國中部時間 7:30 另寄一封到同一個信箱。
昨夜掃描範圍內,晶片與半導體端沒有夠格的新事件:本批 18 篇素材以模型、AI 經濟學與政策為主,晶片相關僅主線 1、3 提到的 GB300 與 GB200 機架脈絡。按「不硬湊」原則,本欄今日空一天。
產品動態:近 48 小時產品公司素材多為標題不全的 stub、正文缺失,無法逐篇判斷,今日空一天。
一條命題最強的佐證,同時是它的天花板:「能力=算力預算的函數」的邊界(本報深度研究,2026-07-07)。 本報 7 月初整理過一條核心命題:現代模型配上恰當的執行環境,能力不再是固定屬性,而是「你願意投多少推理算力」的函數。當時最特別的不是佐證多,而是同一批 40 多篇論文既確認了命題、又劃出了邊界。確認側:能力確實隨思考預算上升,且跨領域可重現。設界側有兩份代表作:普林斯頓大學團隊的 HAL 評測跑了 21,730 次 agent 測試,發現提高「思考力度」在多數情況下反而降低準確率(arXiv,2025-10);VisualPuzzles 基準刻意把推理與領域知識拆開量,發現「思考模式」的增益跨模型、跨任務並不一致,甚至有負增益(arXiv,2025-04)。機制一句話:多思考不保證更好,紅利集中在答案可驗證的領域(數學、程式),其他領域燒 token 可能白燒。怎麼用:與今日主線第 2 點合看,METR 量的「成本交叉點」正是這條命題走進採購語言的下一步;但這條邊界提醒你,先問你的任務屬於哪個領域,再決定要不要為「多思考」付錢。
過去 24 小時。 昨夜到今晨的週期素材 18 篇:業界電子報 6 篇讀完(theZvi 週報、Exponential View、AINews 兩篇(另一篇)、Newcomer、One Useful Thing)+播客逐字稿 12 篇處理(2 篇未取信號;取用者含 Latent Space Poolside 訪談)。另 2 篇 7/22 抓取的電子報同輪處理,其中 1 篇為純活動公告、未取信號。X 貼文本批直接核對 1 則:Kratsios 官方指控原文(一手貼文);獨立媒體交叉 1 篇(TechCrunch)。白天另結兩案定向查證,新增 Nvidia 官方財報新聞稿與法說逐字稿共三個一手來源(結果見「也發生了」最後兩條)。今日無新增追蹤來源、無一次性回填。覆蓋聲明:本期只能保證上述掃描範圍內的訊號;產品公司官方部落格本批抓到 17 篇,多數僅存標題或正文不全,未取信號;X 未跑全網掃描。
來源集中度提醒。 今日主線 2、4 與模型觀點第 1 則主要依賴 theZvi 同一份週報轉引,佔本期取材素材近一半;其中主線 2 的兩個支撐事實一手均未直取。唯一例外是主線 1 的指控:已直接核對官方一手貼文,並有 TechCrunch 獨立反方。「一份週報斷供就傷兩條主線」的結構風險,讀者應該知道。
庫存(非過去 24 小時)。 本報的累積待讀庫存(7 月起分批回填,最近快照):學術論文 2,825、公司與個人部落格 2,299、X 貼文 1,381、業界電子報 974、公司申報 924、業界分析 533、播客逐字稿 288。今日主線之外的長尾,從這裡按主題定向取用。
我們追蹤的來源。 本報判斷的底層,目前追蹤 529 個具名的聲音:X 305 人(Elon Musk、Andrej Karpathy、Greg Brockman、Nathan Lambert 等)、播客 90 人(Satya Nadella、Dario Amodei、Jensen Huang 等)、新聞媒體 51 家、個人部落格 48 人(Simon Willison、Chris Olah 等)、論文作者 48 人(Noam Shazeer、Percy Liang、Tri Dao 等)、電子報 46 份(Dylan Patel、Ben Thompson、Ethan Mollick 等)、財報與法說 26 家、主題演講 23 場。
本報不是新聞摘要:我們從每天的 AI 資訊流裡捕捉真正重要的洞見與值得長期追蹤的行家判斷,並交代每一條是怎麼驗證的 — 重點永遠是「哪條判斷變硬了、誰說得準」,不是今天發生了什麼。
—— SecondSource·由研究系統自動生成 · 22 個來源 · 回信給我們,就是最好的意見回饋
---