模型觀點 · 本週 (發布日 8 月 27 日)
本篇出自 2026年8月28日 晨報
Google DeepMind 昨天宣布和外部單位完成了一次雙盲評測(Google DeepMind,08-27)。原本的兩難是: 高風險的外部評測過去只能二選一,要嘛評測方交出題目、模型商可能事先看到考卷,要嘛模型商交出權重、智慧財產可能外洩。這次把兩邊分別鎖進 Google Cloud 的機密運算環境:硬體先證明即將執行的是哪一段程式碼,雙方審過同意才放進各自的資產,跑完只釋出談定的輸出,評測方看不到模型權重,Google 看不到題目。密碼學在這裡負責的是「證明隔離真的有效」,不是雙盲本身的實現手段。參與的還有新加坡官方的 AI 安全機構、開源社群 OpenMined、前沿 AI 稽核組織 AVERI 與基準標準組織 MLCommons;AVERI 的公告補了受測版本是 Gemini 2.5 Flash-Lite(DeepMind 那篇沒給版號)、題目取自 MLCommons 安全基準裡從未使用過的那批(AVERI,08-27)。⚠️ 四個誠實標記:宣布的是方法,沒有給任何評測結果數字;AVERI 自陳是「小規模」量化評估;兩邊公布的合作方名單不一致;「世界第一次」是第一方自己的宣稱。
這對你的意思: 寫評測要求的人多了一個可以援引的作法。AVERI 同一則公告點名,現行幾份規範「正確地要求第三方評測時要顧及安全與隱私,但幾乎沒給怎麼做的指引」,這個試點就是在給做法。可以自己盯的錨: 那份技術報告什麼時候公開、裡面有沒有真的評測分數;沒有分數之前,這只是一次方法演示。
只留 email,隨時退訂。這是我們唯一想請你做的事。
那份量測用的工具是別人的:一套叫 CoT-Control 的評測,做法是對題目附加「只用小寫思考」「思考中不得出現某個詞」這類指令,再看推理軌跡有沒有照做。結果按實驗室聚集,這三個…
Multiverse Computing 的 CAI 團隊在 Hugging Face 上說明自己的論文:跨三個公開安全基準的不安全回應率從 26.26% 降到 0.14%,單看這…
獨立評測機構 Artificial Analysis 9 月 7 日公布,OpenBMB 的 MiniCPM5-2B(2.6B 稠密參數、Apache 2.0 授權)在它的 Int…
依 Import AI 轉述的 Google DeepMind 論文:100 個 Gemini 3.1 Pro 代理人合作解 71 題,系統提示禁止作弊;57 分鐘後一個代理人發現…