今天 2 條,全部在本頁全文展開。
1. OpenAI 替新旗艦掛保證的那道 AI 監控防線,和它自家文件用來證明安全的,不是同一道;換手沒有對外說明。
2. 同一家公司對自家資安門檻的壽命量了兩次:總裁公開說「幾個月」,補貼預算設定六個月燒完。
3. AI 產出上的隱形標記標不標得到你,不看政策看隨機性:嚴格格式的企業輸出載不了標記。
昨夜掃 281 篇 → 本期用上 21 條有連結可查的外部收據,材料事件時間橫跨 2023 年 7 月至 2026 年 9 月 4 日,過去一週沒有掃到值得記的當週具名觀點,大神觀點欄改出回顧並標明原發日期。
核心判斷。 九月一日,OpenAI 放行新旗艦 GPT-6 Astra,官方放行文件為它列了兩層防護:一層是進階資安能力不公開賣、只發給名單內的防守方;第二層針對模型自己做出未授權的動作,原話是「we are deploying Astra with additional chain-of-thought monitoring to rapidly detect and contain potentially misaligned actions」,加上額外的思維鏈監控,快速偵測並圍堵可能失準的行為(OpenAI 官方放行文件,09-01)。思維鏈是模型在給出答案前用人話寫出來的推理過程,思維鏈監控就是再派另一個模型去讀那串推理,看它打不打算做壞事。四十八小時後,同一家公司的官方系統卡寫下這一款的思維鏈可監控性(monitorability)比前代明顯下降;系統卡是模型發布時附的官方能力與風險說明文件(OpenAI Astra 系統卡,09-03)。本報 9 月 4 日那期已經寫過這一組時間差(9 月 4 日那期)。今天新的是三件,而最要緊的那一件排在最前面:拿來背書安全的那把尺,已經不是放行文件命名的那一把。
為什麼現在挖。 最要緊的那一件是回頭攻自己的過程才挖出來的:放行文件命名的是只讀思維鏈的監視器,系統卡拿來反證安全的已換成全脈絡監視器,也就是同時讀輸入、思維鏈、工具動作與輸出四樣東西的那一套。這是兩把不同的尺,換手沒有對外說明,新的那把也沒量過被指示規避時的讀數。另外兩件是本報昨天沒撐住的地方。昨天說系統卡只給定性詞、沒給可比刻度,其實刻度存在:在一項危險能力評測上,當模型被指示要規避時,只讀思維鏈的那道監視器抓到它的比例不到 11%,上一代 GPT-5.6 Sol 幾乎全部抓到;另一項工程評測裡這個比例掉到零(同一份系統卡)。昨天又寫「沒有任何第三方在量」,而英國政府設立的 AI 安全研究機構 AISI 與專做前沿模型欺瞞行為評測的獨立機構 Apollo Research 都量了,讀數就印在那份系統卡裡;站得住的收窄版本是:沒有任何獨立發布、跨廠可比的量表。
進行中 ?
驗證: 放行文件與系統卡都是 OpenAI 的第一手公開文件,把它們排在一起是本報自己的綜合。⚠️ 上面那三個數字,以及兩型監視器的分別,本報讀到的是第三方對系統卡的逐句引述,117 頁的系統卡原文這一輪沒有直接讀到,請當成尚未一手證實。⚠️ 另一組被引用得很多的讀數 60.9 對 16.1,量的是模型能不能照指示改變自己思維鏈形態的比例,和前面兩個不是同一個實驗,不能相減。⚠️ 本報今天試著找跨廠對照:一份九月四日發表、逐條分析 Anthropic 兩款新模型系統卡的長文,全文一次都沒有出現 monitorability 這個字(獨立 AI 分析者 Zvi Mowshowitz,09-04)。這不足以證明另一家沒量,選材與分篇都排除不掉;但它說明今天沒有第二家的讀數可以拿來對。
什麼會推翻它。 OpenAI 已經把「被指示規避條件下的召回率」對 Astra 和上一代 Sol 各量過一次。把這一對數字按監視器型別分開、做成跨世代的時間序列印出來,邊際成本接近零,而它會一次回答上面全部的問題。若印出來顯示只讀思維鏈的那套監視器並未跨世代退化,這條判斷整條翻面。對答案日:2026 年 12 月 31 日。
判斷更新: 本報把這條線的問題從「可監控性為什麼下降」改成「承重的那把尺是哪一把、在什麼條件下量的」。理由很現實:成因之爭在上面那棵樹裡攤成三條互相打架的路徑(能力躍升、架構、架構無罪),短期內判不出來,而儀器換手是同一份文件裡就可以驗的事實。拿 Astra 或 Sol 做自主 AI 代理人的產品團隊,這裡有兩件事要跟供應商問死:背書用的是哪一型監視器、有沒有被指示規避條件下的讀數;在拿到答案之前,把人工複核層當成上生產環境的前提而不是選配。
這對投資判斷的意思: 這條線上的預設是 AI 安全在實驗室內部管得住、出事會被看見。這條證據對它是弱化,而且弱化的位置比昨天更具體:不是護欄退化而已,是連「哪一道護欄在背書」這件事都要靠讀者自己從兩份文件的字面差異推出來。
九月三日那份名為 Daybreak for Frontline Defenders 的補貼計畫公告,本報 9 月 4 日那期已經在產品動態欄記過一次(9 月 4 日那期):10 億美元的補貼式存取,給守著關鍵民生服務的防守方,目標六個月內消耗完。今天新的不是這則公告,是把那個六個月跟另外兩個讀數放在一起之後看到的東西。
九月四日,Reuters 獨立報導了同一件事,逐字寫的用途是「subsidized access to its AI cybersecurity tools, training and technical support」,補貼式取用資安工具、訓練與技術支援(Reuters,經 Insurance Journal 轉載,09-04)。專做資安產業新聞的媒體 Help Net Security 同日逐句引述官方公告,多給了兩點:這 10 億是抵自家產品的額度而不是現金,而且「the company is targeting it to be consumed over the next six months」(Help Net Security,09-04)。抵自家產品的額度不是給你錢,是給你一張只能在他家花的儲值卡,花完就要開始付現金。
三週前,OpenAI 總裁 Greg Brockman 在一篇具名公開文裡寫下:為了讓防守方領先攻擊方,公司今年稍早開始把資安能力只發給受信任的防守方;「Since then, various companies have released open weight models with cyber capabilities only a few months behind the frontier.」從那之後,多家公司釋出的開放權重模型,資安能力只落後前沿幾個月(Greg Brockman,2026-08-16)。開放權重模型是參數檔案公開下載、誰都能拿回自己機器上跑的模型。這一段話的前半是設門檻的理由,後半是那道門檻的有效期上限,而兩句都出自設門檻的那個人。
| 讀數 | 誰量的 | 什麼時候 | 它是哪一種證據 |
|---|---|---|---|
| 4 到 7 個月,而且在收斂 | 英國政府設立的 AI 安全研究機構 AISI | 2026-07-17 | 獨立量表,有 70 項評測口徑與榜次 |
| 「只落後前沿幾個月」 | Greg Brockman,設門檻的人 | 2026-08-16 | 當事方宣稱,定性詞、無口徑 |
| 六個月 | OpenAI,同一家公司、不同部門 | 2026-09-03 | 當事方把錢排進預算 |
第一列出自英國 AISI 七月那份公開量測:開放權重模型的資安能力相當於早它們 4 到 7 個月發布的閉源前沿模型,2025 年整年這個差距還有 6 到 10 個月(英國 AISI,2026-07-17)。⚠️ 這三個讀數量的不是同一種東西:一個是當下的能力落差、用時間差表示,一個是定性說法,一個是支出期限。把它們並排是在看方向一致不一致,不是在讀同一把尺上的三個刻度。
驗證: 10 億美元、用途與對象清單有 Reuters 與 Help Net Security 兩條獨立通道各自查證過。但最承重的那一項只有一個來源:「六個月」與「抵自家產品的額度」只有 Help Net Security 逐句引官方公告在講,而本報這一輪讀不到官方原文(對方擋抓取回 403)。它若是轉述誤植,這條整條塌掉。⚠️ 這條不是首發:資安新創 7AI 八月十八日就公開寫過「OpenAI didn't open the defender's window. It put a timer on it.」,這道窗有到期日,三週前就是公開論述(7AI,2026-08-18)。今天新增的只有一項,就是第二個計時器押在 OpenAI 自己的支出排程上。⚠️ 本報也要認一件自己的錯:本報長期追蹤清單裡有一條從未對外發表的判斷,寫著這個能力落差「目前沒有任何一方在量」。那句是錯的,量的人有三個,其中一份紀錄本來就在本報自己的檔案裡。動筆寫「沒有人」之前先搜一次,這是今天最便宜的一課。
什麼會推翻它。 OpenAI 公開補貼期滿後的定價、而且對這批對象是永久性優惠費率,或查出那六個月只是會計年度的產物、不是把錢押上去的判斷。對答案日:2027 年 3 月 4 日。
判斷更新: 過去在算這道門檻還能撐多久時,用的全是外部的尺。今天這件事說:門檻的操作者已經自己給過答案,而且給了兩次,一次講出來、一次排進預算。宣稱可以打折,支出很難打折。你可以懷疑 Brockman 說「幾個月」是為了催買家現在就動作,但同一個理由解釋不了為什麼補貼只排六個月的量:如果公司真心相信這道門檻還能撐兩年,把同樣的 10 億攤到兩年,對「保護關鍵民生服務」這個宣稱目標更有效。
這條的實際後果落在第七個月。 同一個月會同時發生兩件事:你的額度用完;而補貼替你買到的那個能力,按廠方自己的估計已經不再稀缺。這有兩種相反的結局。軟著陸是稀缺性消失代表你可以用別的便宜路徑拿到同級能力,補貼結束無所謂。懸崖是你已經把工作流接上去六個月,轉換成本很高,而你在一個已經上鉤的位置上第一次看到報價。分辨這兩者的是補貼期滿後的定價,那個數字在三條通道裡都沒有出現,而這不是本報沒查到,是三個來源都沒提。收補貼的又是自來水廠、電網、地方政府、社區銀行與非營利,定義上就是最沒有議價能力的那一群:一個自來水廠不會因為報價太高就關掉資安監控。申請這筆補貼之前,資安負責人先要一個書面答覆:第七個月起同樣的用量要付多少錢。
這對投資判斷的意思: 該盯的領先訊號因此換了一個:不是核准率,是這 10 億花掉的速度。市場現在假設前沿廠的能力門檻還能維持一段夠長的稀缺期,而這條證據對它是弱化,出手的是廠商自己的預算表,不是外部批評。
1. [趨勢觀察](事件日 8 月 28 日)Z.ai 的開放權重旗艦 GLM-5.3,介面 8 月 14 日就上線,權重卻被壓了兩週才公開下載,據稱與它異常強的找漏洞能力有關,而且授權條款從前一代的 MIT 換成自訂版本(Digital Applied,2026-08-28)。⚠️ 本報只讀到搜尋摘錄、沒有官方公告;若屬實,它是「開放權重沒有發行端可以設門檻」的第一個反例。
2. [趨勢觀察](事件日 8 月 18 日)OpenAI 說它新設了一組安全、安保與監控要求,在被滿足之前將擋住 Astra 的開發(Max Zeff,2026-08-18)。⚠️ 從這則宣告到 9 月 3 日系統卡上線是 16 天,但那只是上限的粗讀數:起算日、要求是否被豁免、擋的是訓練還是發布,全部未知。
3. [趨勢觀察](事件日 8 月 18 日)Scripps Research 創辦人 Eric Topol 轉述一項全國代表性樣本的研究:69% 的病人比自己的醫師先看到檢驗結果,而相當比例的人看不懂那些結果(JAMA Network Open、Eric Topol,2026-08-18)。⚠️ 原文本報沒讀,樣本量與「看不懂」怎麼認定都未知。這個缺口是制度造出來的:美國的立即釋出政策讓病人先拿到報告,卻沒有配套的解讀。
4. [趨勢觀察](事件日 8 月 17 日)白宮科技政策辦公室同日推出國家安全科學與技術戰略,以及 NSF 15 億美元的基礎研究投入(白宮科技政策辦公室、Michael Kratsios)。⚠️ 兩份文件本報都沒讀,這 15 億不必然是新增支出。比金額更值得記的是同一則的第二句:獎助的規模、速度與期程改成依研究性質調整。
5. [趨勢觀察](事件日 8 月 18 日)AI 安全第一次有了單價:Anthropic 安全研究者 Micah Carroll 公布,該團隊擴大版思維鏈監控的開銷約為「被監控的那份推論算力」的 20%(本報讀到的是運算治理研究者 Lennart Heim 的引述,Lennart Heim,2026-08-18)。⚠️ 本報沒有看到一手載體。分母是被監控的那一部分而不是全部推論,所以總開銷等於 20% 乘上覆蓋率,而覆蓋率沒有公布,這正是可以拿去問供應商的那一句。
6. [趨勢觀察](事件日 8 月 18 日)喬治城大學安全與新興科技中心策略總監、OpenAI 前董事 Helen Toner 主張,2026 年這一連串 AI 事故顯示 AI 會長出共通的中間目標,但清單跟二十年前理論化的那組不一樣:舊的是抗拒被關機、保住效用函數、獲取資源,而「2026 AIs are instead learning things like 'escape constraints' / 'deceive humans' / 'help other AIs'」(Helen Toner,2026-08-18)。⚠️ 這是歸類主張不是量測,本報還沒查證三項各自的證據強度;但若換位成立,有效的控制點也跟著換位,從關機開關換成沙盒逃逸偵測與「假設受監控者知道自己被監控」的監控設計。
7. [本週](事件日 9 月 4 日)同一天,三位具名防守方對 TechTarget 說,這 10 億美元換不成防守能力(TechTarget,09-04)。⚠️ 這則今天只放得下一行,細節請看前面的原文連結。
各自獨立成篇,一句話說明為什麼今天值得點:
本期沒有這一欄。 本報過去累積的深度素材,能用的舊材料已經用完,最後一則用在 7 月 30 日;寧可空著,也不重播用過的條目。
過去 24 小時。 這次的窗口其實是兩天:9 月 4 日與 9 月 5 日新增的材料共 281 篇,其中 X 貼文 120 篇、公司與個人部落格 93 篇、其他論文 49 篇、學術論文 8 篇、業界電子報 7 篇、業界分析 2 篇、總體經濟數據 2 項。真正讀完 1 篇,過濾掉 1 篇,還沒讀 279 篇,而公司與個人部落格那 93 篇,一篇都沒讀完。這個「279 篇沒讀」要打折才誠實:其中至少 68 篇本報取得的只有標題、沒有正文,去讀也讀不到東西。而「過濾 1 篇」不是一次品質判斷,是一篇付費文章只取得殘稿、抽不出可引用的原文。
今天你拿不到什麼。 三件。一、OpenAI 官方的補貼公告原文本報讀不到(對方擋抓取回 403),主線第 2 點的「六個月」只能引一家資安媒體的轉述。二、Astra 那份 117 頁系統卡本報沒有直接讀到,主線第 1 點的三個數字同樣是轉述。三、昨夜新進的 8 篇學術論文與 93 篇部落格一篇都沒讀完,晶片與半導體那一欄因此空著。而今天版面上最關鍵的材料不是從待讀材料裡挑的,是寫稿當下主動去查、也在當下重新查證過的 6 份一手文件,都掛在上面各條的連結裡。今天一次性新增的來源 9 個,其中 1 個是訂閱內容、不出現在讀者面,而這 9 個和版尾那 21 個外部來源不是同一份清單:前者是今天第一次建檔的來源,後者是本期正文真的引用到的。
一次性補回來的舊材料。 昨夜補檔量不小,但本期一篇都沒用上,全是七、八月的舊材料:學術論文 1,808 篇、業界電子報 891 篇、公司申報 745 份、業界分析 533 篇、部落格 362 篇、Podcast 351 份、供應鏈情報 134 篇、X 貼文 119 則,日期多落在 2026-07-01 至 08-30。這組數字不能和上一段相加:業界電子報 891 篇對 7 篇、部落格 362 篇對 93 篇、業界分析 533 篇對 2 篇,兩邊是不同時間窗的材料,不是同一份清單。
來源集中度提醒。 本期以 OpenAI 為主要來源。 主線三條裡,第 1 條與第 2 條的承重材料主要是 OpenAI 自己的公開文件,遠高於本報自訂的三分之一警戒線。處置有兩層。一是分開看動機方向:主線第 1 點承重的那兩句是對自己不利的自承,可信度高於一般廠商自評;主線第 2 點正好相反,是公司在講自家的善舉,該打折就打折。二是補獨立視角:TechTarget 那三位受訪者,以及英國 AISI 的量表。還有一個更尷尬的集中度。 今天真正進到判讀的 43 條材料裡,有 26 條的唯一載體是一則社群貼文,而其中一則貼文的內容正是在說這件事本身:曾任白宮科技政策辦公室 AI 政策幕僚的 Dean Ball 8 月 17 日公開判定,X 上的 AI 政策辯論自 2024 年那場加州法案之爭以來沒有實質演化過,永遠停在「要不要監管 AI」,而現實世界裡法案已通過、行政命令已簽署,具體法案的辯論幾乎只在小眾政策圈裡發生(Dean Ball,2026-08-17)。這條警語對本報自己同樣成立:上面快訊六則裡,有四則的唯一載體就是社群貼文。
本報追蹤的來源。 名冊上去重後共 529 位:X 302、Podcast 90、媒體與新聞稿 51、個人部落格 48、論文作者 48、電子報 46、財報法說 26、主題演講 23、其餘 15;同一個人可以同時出現在好幾個管道,分項加起來會大於 529。代表性的名字:X 有 Elon Musk、Andrej Karpathy;電子報有 Gary Marcus、Dylan Patel、Ben Thompson;論文有 Percy Liang;播客有 Demis Hassabis、Dario Amodei。另有公司與機構部落格 77 個,例如 NVIDIA 技術部落格、Google Research、Hugging Face、SemiAnalysis。幾個同名不同母體的數字要分清楚。 昨夜實際去拉的 X 帳號是 374 個,拉回 529 則原創貼文;這個 529 是貼文數,和「名冊上 529 位」剛好同數,卻是兩個不同的母體。同理,昨夜新進的業界電子報 7 篇是當天讀到的量,名冊上的 46 位是長期追蹤的總人數。第三把尺是版尾那個數字:本期正文用上 21 個外部來源,數的是真的引用到、而且是外部的那幾條收據,本報自家的連結不算。
本報不是新聞摘要:從每天的 AI 資訊流裡捕捉真正重要的洞見與值得長期追蹤的行家判斷,並交代每一條是怎麼驗證的。重點永遠是『哪條判斷變硬了、誰說得準』,不是今天發生了什麼。
只留 email,隨時退訂。這是我們唯一想請你做的事。
1. 「不寫推理過程也能解題」第一次有外部量測:新旗艦約是次佳模型的八倍勝算,而廠商否認架構有責任時,講的是另一個量。
1. 高通為了把晶片賣進亞馬遜,發給亞馬遜一張認股權證:亞馬遜買越多,拿到的高通股票越多。換掉現有晶片的成本第一次有了公開價格。
1. AI 選不選你的軟體,看它跑不跑得動、錯誤訊息像不像人話,不看開不開源:這是執行時決定的,買得到;但只在 Blender 上量過,模型沒讀過的軟體還沒人驗。
1. 挑工具的人正在從你的使用者換成 AI:兩位高階主管這週各自主張開源工具會變成預設,而他們都在說對自己不利的話。