SecondSource從一手資料重建判斷
模型觀點 · 2026年9月5日

擱置三週的那份資安評測,發表版把最漂亮的那句話翻了面。

模型觀點 · 證據更新 (原推文 2026 年 8 月 14 日/發表版 8 月 21 日,本報今天結清)

本篇出自 2026年9月5日 晨報

八月十四日本報記過一則推文:某評測者拿到另一家實驗室的開放權重旗艦 GLM-5.3 搶先版,量它找漏洞的能力,給出四個很漂亮的數字。當時本報沒有直接收下,標了三個缺口:四個數字都沒有可複現的分母、沒交代那些漏洞是不是在訓練資料截止日之後才公開、那串推文的後兩則本報沒讀到。最要緊的是第二個:漏洞若在截止日之前就已公開,模型可能只是背過答案。今天去查,同一群人(資安公司 Aikido Security)在一週後把完整方法學發表了(Aikido Security,2026-08-21)。三個缺口今天都有答案,而結清之後的淨變化分成兩邊,不是那三個缺口的逐項對應。對本報有利的一點:分母是 32 個近期才揭露的漏洞,每個模型跑完整 32 個案例三次、共 96 次,作者自陳「We were careful about dataset freshness」,選材就是為了降低模型早就看過那些漏洞的機會。本報標的那個決定性疑慮,他們自己也想到了。對那則推文不利的兩點。先講清楚兩個詞:召回率是該找到的漏洞裡實際找到幾成,精準度是報出來的裡面有幾成是真的,報錯的那些就是誤報。召回從 24/32 改成 25/32;成本比較從「比 GPT-5.6-Terra 便宜 40%」變成「比 Sol 便宜 65.5%、比 Opus 5 便宜 69.8%」,對象與幅度都變了。而推文裡最漂亮的那句「它的誤報比其他高召回模型少」,在發表版被自家推翻:「The open models caught up with the frontier at much cheaper rates but also produced the most false leads for the pipeline to reject.」開放模型產生最多的誤報。⚠️ 從推文升級成部落格不會變成兩個獨立來源,這仍是同一個團隊的同一套自有評測,把握度照樣壓在單一來源的上限。⚠️ 漏洞清單與日期分布仍未公開,讀者無法自行複核那些漏洞「新鮮」到什麼程度。召回率你買得到,精準度你買不到。 跟供應商要誤報率與召回率一起報,只給召回率的報價單不能比較。這一則同時對今日主線第 2 點構成反向壓力: 如果評測者對,拿到開放權重就不等於拿到可用的攻擊能力,中間還隔著一個沒人量過的框架;若真是這樣,三個讀數指的到期日都要往後挪。

免費訂閱,明天早上就收得到

只留 email,隨時退訂。這是我們唯一想請你做的事。

同類最新