SecondSourceAI 產業洞見 · 完整版檔案庫

AI 賣不進企業的原因多了第三個:「我敢不敢把資料給你」

SecondSource 晨報 · 2026/7/11 · https://secondsource.io/issues/2026-07-11

本期素材:研究系統 2026-07-11 日報。當期事件出自 2026-07-09 的 20VC 圓桌與 07-10 的 AI Engineer 現場;另有 2024 檔案回填與 2023 論文原文核對,均標原發時間。本週有新具名觀點(swyx,07-10)。

本報不是新聞摘要:我們從每天的 AI 資訊流裡捕捉真正重要的洞見與值得長期追蹤的行家判斷,並交代每一條是怎麼驗證的 — 重點永遠是「哪條判斷變硬了、誰說得準」,不是今天發生了什麼。

本批來源盤點:過去 24 小時例行抓取零失敗;夜間讀完 32 篇/集(播客圓桌、電子報、X、部落格 — 單位為篇或集,類別不互比),白天再讀 5 篇 2024 年檔案 — 共 37 篇,夠格進正文的當期事件只有 3 條加 3 組傳言,沒新料的直接濾掉(=幫你省的時間)。持續追蹤 529 人(X 304、播客 90、論文作者 48、部落格 48、電子報 46、財報 26 等);無一次性新增。回顧素材不計入本批。

今日主線

1. [本週] Palantir 執行長 Karp 上 CNBC 點破企業客戶的兩大疑慮 — 同週的 HubSpot 事件替他作了證。2026-07-09 的 20VC 圓桌(影片)轉述 Alex Karp 被瘋傳的 CNBC 訪談:大企業對前沿模型商(點名 Anthropic、OpenAI)的懷疑「史上最高」— 花的錢換到什麼,以及「我把資料都給他們,他們是不是拿去訓練、學我的生意、再賣給所有人?」同週 HubSpot 想把客戶的業務開發資料匯集共享給其他客戶,客戶炸鍋,一週內撤回(同場轉述)。

驗證:Karp 是利益方 — Palantir 賣的正是「這些人不能信」的解方,當天股價 +9%(圓桌口述,單源)— 他的話打折聽;但 HubSpot 撤回是獨立事件,恐懼有現實觸發點。圓桌另指控模型商就訓練資料來源「說謊」— 只此一源,先看方向。

判斷更新:企業採用 AI 的障礙,本報原追蹤兩軸 — 模型可靠性、內部流程改造;今天加開第三軸「資料/智財信任」,它會把需求推向「資料留自己手上、不綁死單一供應商」。

2. [本週] 微軟把 6,000 名工程師派進客戶辦公室 — 賣 AI 的方式,倒退回 30 年前 IBM 賣服務的樣子。同場圓桌(2026-07-09,影片)轉述:Microsoft 宣布投入 25 億美元、6,000 人駐場工程計畫,把工程師嵌進企業客戶端,明著回應「MIT 稱 95% 企業 AI 試點沒有可量測損益影響」;Amazon 早兩天同向。圓桌讀法:OpenAI/Anthropic 是「產品公司到骨子裡」,企業導入需要中間服務層,微軟正接演 IBM/HP 當年服務部門的角色 —「每家科技公司不是倒閉,就是活得夠久、變成下一代的 IBM」;代價是毛利遠不如賣模型。

驗證:25 億、6,000 人、MIT 的 95% 全是 VC 口頭轉述、只此一源 — 數字先參考;一手公告尚未取得,取得後以追蹤更新補發。

判斷更新:「企業採用卡在哪」正式成三方對撞 — 圓桌押「流程改造+駐場人才不足」;對撞本報既有的 Sarah Guo 判斷(2024 年末,Colossus 訪談:瓶頸是模型可靠性,不是流程);再加第 1 條的資料信任軸。三派更可能分場景並存,但哪層主導,決定服務層、評測層、私有部署層誰吃到錢。開獎點:駐場計畫一年後的續約率、Anthropic 營收爬坡斜率。

3. [本週] 一天冒出三組公司傳言,本報一條都沒當事實收。同出 07-09/07-10 材料流(20VC 圓桌):(a) DeepSeek 開始自研晶片、Anthropic 與 Samsung 洽談自研;(b) Nvidia 採「先用算力後付款」式收入認列、「前三大客戶集中度 80% 降到 50%」;(c) OpenAI 讓美國政府持股 5%(轉述者自承沒讀過原始來源)。三組全是單一圓桌口頭轉述,查證前不進本報任何判斷。

驗證:這條的內容就是驗證方式 — (b) 的集中度可對 Nvidia 提交證管會的季度申報直接核對,已排入查證;其餘兩組等第二獨立來源。在別處看到這三組說法,記得它們還停在「單一轉述、未驗證」。

4. [證據更新] OpenAI「紅色警報」事件今天重核:被超車的是 GPT-5.1,不是流傳的「GPT-5」。事件本身(2025-12-02,Altman 內部信示警競爭、暫緩廣告與購物助理以聚焦 ChatGPT)當時由 Fortune、Forbes 等多家美媒同日報導,本報 7 月初已多源確認;今天是口徑精修 — 流傳版說「Gemini 3 與 Claude 超越了 GPT-5」,逐字回核:Gemini 3(2025-11-18)評測對標的是 GPT-5.1;Anthropic 官方原話只稱 Opus 4.5(2025-11-24)是「世界最佳的寫程式、代理與電腦操作模型」(官方頁,2025-11,今日逐字核對命中)。

驗證:事件層多源;「超越誰」在轉述鏈裡失真了一級 — 這正是本報堅持回到官方原文的原因。附帶流傳的「戰場轉向每瓦效能、Nvidia 護城河動搖」推論仍是分析師詮釋、無一手可核,不採信不否定(私版另有細節)。

5. [趨勢觀察] 「錢該花在哪」的三條 2024 年答案,今天一起列入本報正式追蹤判斷。(2024 檔案,今日完成跨來源核對)互不相識的一線從業者分頭講出,2026 年回看全數兌現:

(一)「用檢索還是微調」是假辯論 — 檢索(RAG)管「知道什麼」,把事實在提問當下釘進上下文;微調管「怎麼表現」,像幹細胞分化成特定細胞 — 意即改行為模式,不是灌知識;要灌知識,用檢索。Gradient 的 Mark Huang(2024-05-30)與 Brightwave 的 Mike Conover(2024-06-11),同期各自講出同一套。

(二)程式碼是 agent 的通用介面 — 用程式包住模型換可靠性(流程寫進程式,模型只管語意),讓模型寫程式換行動空間(與其列 128 個工具,不如讓它自造)。Microsoft 的 Sam Schillace(2024-03)講前者,Imbue 與 Databricks 同場講後者(2024-06)。

(三)工具介面佔 agent 成敗的九成 — ReAct 與 SWE-agent 作者 Shunyu Yao(時任 OpenAI)說:把工具介面做得好用又可靠,大概就佔了成敗的九成,Devin 的突破也在介面、不在規劃(2024-09-27)。

驗證:六個獨立原點、互不引用、同年收斂;第(一)條打立場折扣 — 兩位表述者都賣這套系統。事後印證:「讓模型寫程式執行」型 agent 已成主流,微調灌知識被公認是反模式。

判斷更新:這是一份買方清單 — 評 agent 產品先問:行為邊界在哪、程式執行面多大怎麼設防、工具介面誰做的;付訓練費前先問:要行為改變還是知識注入。

大神觀點

swyx(2026-07-10,AI Engineer 大會現場):「我真心預期 Fable 是這一代大型語言模型的終點。」大會主辦人 swyx 前天現場論述(影片,2026-07-10):終結「一路變大」路線的不是能力天花板,是可用性經濟 — 最聰明的模型又慢又貴,而所有人共同的硬預算是時間;付得起無限的錢,也沒人付得起無限的等待。往下走要靠資料效率(人類讀百萬字級就出師,模型要讀數兆字)、持續學習、新架構 —「而這些我們都還沒有」。他同時給「AI 自我改進導致爆炸」降溫:目前的自我改進多半在已知範圍附近重組。

它接住本報哪條判斷:與 7/10 期 Ilya Sutskever「卡住模型的是泛化差距,不是規模」同向 — 一週內兩位獨立圈內人各自講了「規模時代讓位」。折扣:單一專家預測,先看方向。

模型觀點(學術與技術)

[證據更新] 兩篇常被引用、少被讀原文的 2023 年論文,今天逐字回到 arXiv 核對 —— 但它們談的是兩件不同的事,別混。為什麼翻舊論文:這兩篇的結論到 2026 年還被拿來當論據,傳著就走樣;回原文是為了校準現在的判斷,不是考古。

(一)推理是怎麼「訓」出來的一塊地基 ——《Let's Verify Step by Step》(OpenAI,2023-05,arXiv)。它證明:訓練時獎勵「推理的每一步都對」(過程監督),比只獎勵「最後答案對」更能教會模型解難題,在 MATH 一個代表子集拿到 78%,並開源 80 萬條逐步人工標註。這是訓練端的方法(不是推理端);它算是後來 o1 那條「花訓練算力教模型思考」路線的其中一塊地基 —— 但 o1 實際用的獎勵配方 OpenAI 沒完全公開(見下方「學界動向」的核實)。

(二)別被「新架構屌打 Transformer」的標題騙 ——《Never Train from Scratch》(ICLR 2024,2023-10,arXiv)。這篇跟推理無關,講的是「怎麼公平地比架構」:很多論文宣稱自家新架構(如狀態空間模型 Mamba 一類)電爆 Transformer,但比較時兩邊都是「從零開始訓練」;這篇證明,只要讓兩邊都先好好預訓練一輪,新架構的優勢就大幅縮水甚至消失 —— 意思是,「新架構大勝」的印象,有一部分是「沒讓 Transformer 先熱身」這個實驗設定造出來的假象。用處:2026 年再看到「某新架構全面超越 Transformer」的新聞,先問一句「有沒有控制預訓練這個變數」。

驗證:兩篇今日皆對 arXiv 原文逐字核對命中,數字(78%、80 萬條標註)出自論文本身。更正紀律:上一版把這兩篇並列成「推理敘事的兩篇種子論文」是錯的 —— 第(二)篇是架構評測方法學,與推理無關;已分開講。

學界動向

本報維護一張 AI 研究趨勢地圖(13 領域、59 個方法方向,標主流/上升/式微,翻成後果語言)。挑三條最有商業重量的,每條都補上「什麼時候的事、憑什麼這樣說」:

晶片與半導體

趨勢觀察「別買 H100」:算力跌價與電力漲價,是同一枚硬幣的兩面。推理服務商 Featherless 共同創辦人 Eugene Cheah 的租賃市場一手快照(客座文,2024-10):H100 時租從短缺期的每小時 $8 崩到 $2,年降幅 ≥40%;「NVIDIA 投影片承諾的每 GPU 小時 $4 × 4 年,不到 1.5 年就蒸發」—「GPU 已是商品硬體,比所有人預期的都快。」同月,半導體分析師 Doug O'Laughlin 記下電力側鏡像(Fabricated Knowledge,2024-10):三哩島核電廠為 AI 重啟、美東 PJM 電網容量拍賣價一年十倍($28.92 → $269/MW-日);他的關鍵判斷 — 核電真瓶頸是融資不是技術,Vogtle 造價 $14B 追到 $35B 的前科讓資本卻步。

驗證:兩條皆單一作者一手(自述經驗、自算數字),數字打折看,但互相獨立、同月指向同一結構。2026 年回看:H100 商品化說中了,但算力資本支出未收縮、上移到最新一代晶片叢集 — 稀缺從矽移向電網與資本。

怎麼用:盯兩個價:舊世代 GPU 時租(往下=商品化),電網容量拍賣價(往上=新瓶頸)。

過去洞見

能力不再是模型的固定屬性,而是「你願意燒多少算力」的函數 — 它同時改寫評估、安全、失控三個問題。OpenAI 推理研究負責人 Noam Brown 的命題(No Priors,2026-06-26):鷹架搭得當,模型可在單一問題上思考數週不停滯 — 同一個模型,給 $10 和給 $10 萬的算力,能力天差地別。後果:(1)不控算力預算的「A 比 B 強」是壞比較,單一分數排行榜失去意義;(2)安全評測若用固定預算測危險能力,而該能力隨預算繼續上升,測出來的「安全」是假的;(3)不會有一夜失控 — 最強能力要用真實時間換。量測錨:METR 縱向研究(arXiv,2025-03)— 模型能自主完成的任務長度約每 7 個月翻倍,但發表時 50% 成功率的上限僅約 50 分鐘:方向成立,週級自主還遠。

驗證:本報以數十篇 2025 年推理研究兩面檢查 — 支持面(能力隨預算上升跨領域重現)與設界面(某些領域多想反而更差)都在;可信度停在中等:核心成立,「無限外推」不成立。

怎麼用:看模型發布先問「這分數燒了多少算力」;讀「AI 將一夜失控」的文章,記得時鐘這道閘。

—— SecondSource·由研究系統自動生成 · 15 個來源 · 回信即 feedback

---