SecondSource 晨報 · 2026/7/12 · https://secondsource.io/issues/2026-07-12
本期素材:研究系統 2026-07-12 日報。當期事件出自 2026-07-04 至 07-10 一週;另有 2024-11 檔案的判斷升格與一則 2026-02 現況勘誤,均標原發時間。本週有新具名觀點(Lilian Weng,07-04)。
本報不是新聞摘要:我們從每天的 AI 資訊流裡捕捉真正重要的洞見與值得長期追蹤的行家判斷,並交代每一條是怎麼驗證的 — 重點永遠是「哪條判斷變硬了、誰說得準」,不是今天發生了什麼。
本批來源盤點:過去 24 小時例行抓取(單位分開,類別不互比):X 有 227 個追蹤帳號有動靜,拉回 2,514 則貼文,原創 697 則全數讀完,轉推與回覆共 1,817 則只記數不讀(=幫你省的時間);讀最多的是 @bhorowitz 71 則、@sundeep 50、@nathanbenaich 44、@emollick 36、@karpathy 20。播客與部落格新進 13 篇(20VC 3 集、All-In 2 集、Google DeepMind 播客 2 集等;已讀 6 集、1 集整集無新料濾掉,部落格 6 篇待讀)。夜間另讀完 32 篇檔案與週報彙整(2 篇整篇無新料濾掉)。一次性回填(非過去 24 小時素材):檔案庫本週灌入學術論文 2,088 篇、部落格 1,652、上市公司申報 851、電子報 848 等歷史材料,只供回查、不冒充新聞。持續追蹤 529 人(文末「我們追蹤的來源」),本日無一次性新增;回顧素材不計入本批數字。
1. [本週] OpenAI 兩年前砍掉模型選單、主打「簡化」,這次 GPT-5.6 上線把複雜度全加了回來 — 一口氣 36 個變體。07-09 GPT-5.6 正式上線,開發者介面上同一代模型排出 36 種組合(三個版本 × 多檔「思考深度」),用戶額度莫名燒光,OpenAI 一週內兩次重置全體用量、公開承認「預設把用戶推向過貴的設定」(swyx 的 AINews 彙整,2026-07-10)。最傷的是自動分派子任務的功能:主任務預設複製最貴的配置給每個分身,你看不到、也改不了,錢就這樣流掉。
驗證:目前只看到這份彙整一個來源,且它是 07-09/10 的切片 — 現況(截至本期):混亂可能幾天內被修掉,講結構可以,數字先參考。
判斷更新:當模型能力越來越靠「多個分身平行做事」堆出來,「怎麼配置、誰管預算」本身成了產品的主要摩擦 — 替企業管 AI 開銷的工具,是一個正在打開的缺口。
2. [本週] 同一個 48 小時,AI 圈冒出兩個「AI 已經會自己做尖端研究」的猛料,但做基礎建設的人給它們潑了冷水。先說猛料(都出自 AINews,2026-07-10,且都還沒經同行審查):一,有人說最新的 GPT-5.6 開了 64 個分身同時算,一小時就證出一道數學界擱了幾十年、沒人解得出來的難題(OpenAI 總裁 Greg Brockman 還轉發放大);二,有人說一個人配上模型,就寫出上百萬行、電腦能自動檢查對錯的數學證明。冷水這邊:算力平台 Modal 的技術長 07-08 受訪說,客戶真正拿 AI 來自動化研究,根本不在這種尖端層,全是幫忙「掃參數」——把訓練前要手動一個個試的旋鈕,交給模型跑苦工(Latent Space,2026-07-08)。
驗證:宣稱方與潑冷水方互相獨立,矛盾原樣保留。開獎點很乾淨:猜想證明過不過得了數學界審查 — 過了,研究自動化的敘事升一級;沒過,就是行銷。
判斷更新:「AI 自動化 AI 研究走到哪」從各說各話變成一對可追蹤的校準指標,本報持續盯。
3. [本週] NVIDIA 開始替 GPU 租賃商作保 — 分析師稱之「AI 的中央銀行」。SemiAnalysis 07-06 詳解(公開部分):NVIDIA 當「保底承租人」— 中小租賃商的機器租不出去,由 NVIDIA 按約定價補足最低營收(換取超額營收約 18% 的分潤);銀行因此不必看小公司的生意,看 NVIDIA 的頂級信用就敢放款。已公告案例:澳洲 SharonAI 四萬顆新一代 GPU、六年保底總值 48.8 億美元;印尼 Firmus 的 360MW 資料中心(2026-06-29 公告,同文)。同文並預測:2024 到 2029 年 AI 累計資本支出約 11.1 兆美元,主要由信貸市場出資。
驗證:細節出自分析方免費公開部分,單方說法;NVIDIA 官方部落格有對應公告(原文)、SharonAI/Firmus 為公開商業公告,可各自對照。11.1 兆的預測只有這一家講,看方向就好。
判斷更新:盯 NVIDIA 的方式該換了:訂單與營收是滯後指標(保底一觸發,NVIDIA 自己接盤,營收反而多撐一兩季);領先指標是財報附註裡的保底承諾額與觸發率。這與下一條勘誤是同一個故事:這輪算力市場的結構工程,用的是信用,不是股權。
4. [證據更新] 一條大判斷本週變硬:AI 的算力開銷,「回答問題」已經超過「訓練模型」。這條原本只有一個來源,現在三方獨立同向 — Zylos 測算(2026-04)、Deloitte 預測 2026 年推論占算力三分之二(2026 年度預測),加上主線 3 的信貸結構,可當分水嶺事實引用了。另有一個型態值得記:這輪算力供給端的整併,沒有一件是乾淨併購 — Intel 對 SambaNova 是談判破局後改成合作+入股(CNBC,2026-02-24),NVIDIA 對 Groq 是 200 億美元「授權+挖人」而非買下(CNBC,2025-12-24)。
驗證:升格出自 07-12 三方獨立來源交叉;整併型態各有一手商業報導可查。
判斷更新:盯整併看「形態」比看「金額」重要 — 全是授權、挖人、入股,讓市場結構的變化更難從外部看見。
5. [本週] 「真正的產品是 harness,不是模型」— 這句行話本週從口號變成共識。harness 原意是馬具:馬再壯,沒有轡具拉不了車;圈內拿它指套在模型外面的那層工作環境 — 給什麼工具、劃什麼邊界、怎麼驗收。一週內三個互不相識的原點同時把它擺到中心:swyx 在 GPT-5.6 上線評論裡列它為 agent 時代四支柱之一(AINews,2026-07-10);《Fable 使用指南》整篇在教怎麼搭這層(AINews,2026-07);Lilian Weng 的 35 篇論文綜述(見「大神觀點」)。同週 Google 把代管 agent 做成正式產品、LangChain 開課開源(同前彙整)— 各陣營都在往這層押。
驗證:三個原點互相獨立、互不引用,卻在同一週說到同一件事上;再加下方「模型觀點」的法律評測從量測面補刀:模型單項都會,整案交不出,差的正是這層。
判斷更新:模型層的競爭軸正在裂成三條 — 能力、交付、個性 — 各有各的護城河,也各有各的翻車方式。
6. [趨勢觀察] 企業 AI 助理該做「萬用平台」還是「單一職能專家」?2024 年 11 月的兩場訪談,今天接成一條可驗證的對立軸。兩家企業 AI 助理新創的共同創辦人,相隔四天、互不引用地選了同一條路——「做一個什麼都能幫的萬用平台」。Dust 的 Stanislas Polu 的說法:讓 AI 滲透進全公司每個環節、自己維護所有工具的整合,這層整合就是護城河,但他也坦承這條路難賣(Latent Space,2024-11)。Lindy 的 Flo Crivello 用搜尋引擎打比方:各行各業的 AI 助理,彼此的共通點多過它們跟自己那個行業的共通點,所以做通用的划算(Latent Space,2024-11)。對面那條路是「只做一個職能、做到極致的專家」,代表是客服 AI 新創 Sierra 的共同創辦人 Bret Taylor(前 Salesforce 共同執行長、現 OpenAI 董事長)。
驗證:兩位都是利益方(賣的就是自家路線),但都誠實講了自己的弱點,對立軸因此可操作。2026 年開獎:萬用平台的高滲透率能否複製、MCP(讓各種工具用同一種「插頭」接上 AI 的開放標準)會不會把「自維整合」護城河攤平。
判斷更新:這是一張盡調清單 — 評萬用平台,問「整合深度有多少是標準化攤不平的」;評職能專家,問「單一職能到頂之後怎麼辦」。
Lilian Weng(2026-07-04,自家部落格):現在人類幫模型「搭工作環境」(harness)做的那些事,終究會被模型自己學會;但「告訴模型要做什麼」這件事,永遠不會消失。前 OpenAI 安全研究負責人、現正創業的 Weng,讀完 35 篇論文寫成綜述(原文,2026-07-04;圈內迴響)。她的意思拆開來說:harness 就是「怎麼給模型工具、怎麼劃它的邊界、怎麼驗收它交的東西」——這些現在靠人搭的功夫,會慢慢被模型內化;但「這次到底要解決什麼問題、放在什麼脈絡下」這個定方向的動作,得由人來下。連「AI 自我改進」這種最科幻的題目,實際發生的地方也是在改工具、改驗收,不是模型自己改自己的腦。
它接住本報哪條判斷:與今日主線第 2 點 Modal 的第一線實況同向(自動化發生在外圍苦力層,不在核心研究層),也是今日主線第 5 點共識的第三個獨立原點。折扣:她正在創業,文章方向與自家利益相關 — 框架照用,樂觀程度打折。
[量測結果,2026-07-07] 法律 AI 的殘酷錨點:最強模型的「整案全過率」只有 14.2%。做這份評測的是 Artificial Analysis——一家專門獨立評測各家 AI 模型、業界常引用其排行榜的第三方機構。它出了 120 個真實法律任務(跨 24 個執業領域),規定一個任務要「每個檢核點全部通過」才算過。結果最強的 Fable 5 也只拿 14.2%,次強兩家並列 7.5%;而中國的 GLM-5.2 每個任務的成本只要 Fable 的約 6%,換算下來便宜約 16 倍(轉引自 AINews,2026-07)。看得出來:模型通過「單項」檢查沒問題,但要交出「整份」能用的成品還差很遠——能力過剩、交付短缺,這正是今日主線第 5 點說 harness(那層工作環境)值錢的原因;而成本差 16 倍,預告價格戰會打進律師這種專業服務層。
驗證:這是 Artificial Analysis 公布的榜單,本報引其公開數字,尚未取得逐案原始資料,當方向看。
本報長期追蹤 AI 研究的趨勢動向(13 領域、59 個方法方向,翻成後果語言)。挑三條與本期主線相扣的,每條標時間與憑據:
[趨勢觀察] 超大規模雲端服務商(Hyperscaler,指 Google/Amazon/Microsoft 這種自建巨型資料中心的巨頭)自研晶片的壓力有多真?NVIDIA 這週的動作是最好的反面量尺。這些巨頭自己設計 AI 晶片、想把「租 NVIDIA」換成「用自家的」,已是進行中的趨勢(還沒撼動 GPU 主導)。而今日主線第 3 點那個保底計畫,SemiAnalysis 點出三大目的之一寫得很白:把買家基礎擴大到「少數敢拿自研晶片跟 NVIDIA 對打的巨頭」之外(SemiAnalysis,2026-07-06)——NVIDIA 願意動用自己的資產負債表去養新買家,反過來正好量出它多認真看待這個威脅。
驗證:動機句是分析方單方詮釋。怎麼用:看自研晶片新聞別只看發布會 — 盯 NVIDIA 為「非巨頭買家」花多少真金白銀,那才是威脅程度的誠實訊號。
(誠實說明:本則是趨勢背景解讀,非本週晶片新進展——本週晶片流無重大新料,故不硬湊時效標籤;晶片科普/背景素材未來將收進「模型科普」章節。)
AI 自動化越深,人的價值越往「驗證」搬 — 第一份內部樣本數據,今年 5、6 月就出現了。Anthropic 政策負責人 Jack Clark 在自家免費電子報 Import AI 連續兩期給出內部快照(#458,2026-05-26;#460,2026-06-08):公司多數程式碼已由 Claude 寫、2026 年併入程式庫的程式量是 2021-2024 年的 8 倍、一名工程師可有效帶 9 個 AI 分身 — 人的工作從「寫」變成「驗收+背書」,文件開始標注「多少由 AI 寫、多少由人擔保」。同期,驗證基建在別的領域各自冒出來:軟體的形式驗證、數學的自動形式化(見今日主線第 2 點)、政府的第三方模型評測。
驗證:核心數據是 Anthropic 講自己,目前只看到這個來源、又是自報 — 先看方向不看倍數;但「驗證變稀缺」有跨領域獨立佐證,本期法律評測的 14.2% 全過率正是需求端:產出越多,越需要有人把關。
怎麼用:評估 agent 導入成本,把「驗收人力」算進去,低估它的部署會失敗;職涯上,「域內驗證能力」(專業知識+審計思維)溢價上升,純生產技能在貶值。
X 追蹤 304 人(Elon Musk、Andrej Karpathy、Sam Altman、Greg Brockman、Mark Zuckerberg、Demis Hassabis、陳立武、Jeff Dean、Noam Brown…)、播客 90 人(Satya Nadella、Sundar Pichai、Dario Amodei、Matt Garman…)、電子報 46 人(Dylan Patel、Jack Clark、Nathan Lambert、Dwarkesh Patel、swyx、Ben Thompson、Ethan Mollick、Andrew Ng…)、個人部落格 48 人(Karpathy、Simon Willison、Chris Olah、Jason Wei、Boaz Barak…)、論文作者 48 人(Noam Shazeer、John Schulman、Percy Liang、Tri Dao…)、機構部落格 54 個(NVIDIA、Google Research、Hugging Face、SemiAnalysis、Interconnects、More Than Moore…)、財報/法說 26 人(Jensen Huang、Lisa Su、魏哲家…)、主題演講 23 人、媒體訪談 51 人、YouTube 4、書 2、課程 2、政府 1 — 共 529 人/來源。
—— SecondSource·由研究系統自動生成 · 21 個來源 · 回信即 feedback
---