模型觀點 · 今日 (發表日 9 月 7 日)
本篇出自 2026年9月8日 晨報
獨立評測機構 Artificial Analysis 9 月 7 日公布,OpenBMB 的 MiniCPM5-2B(2.6B 稠密參數、Apache 2.0 授權)在它的 Intelligence Index v4.2 得 15 分,是 4B 以下開源模型最高,與 Qwen3.5 9B 持平;在銀行客服代理人測試 τ³-Banking 拿 21%,次佳只有 8%;但在知識測驗 AA-Omniscience 得 −12,靠的是只回答 29% 的題目、其餘棄答,而且每題平均輸出 19,000 個 token(@ArtificialAnlys,2026-09-07)。(誠實說明:這個測驗會出現負分,代表它會倒扣,但確切的計分規則本報未取得。)⚠️ 第三方評測,可核;值得記的不是分數,是「小模型靠多想、少答」換來的分數,換算成延遲與成本要另外量。
只留 email,隨時退訂。這是我們唯一想請你做的事。
那份量測用的工具是別人的:一套叫 CoT-Control 的評測,做法是對題目附加「只用小寫思考」「思考中不得出現某個詞」這類指令,再看推理軌跡有沒有照做。結果按實驗室聚集,這三個…
Multiverse Computing 的 CAI 團隊在 Hugging Face 上說明自己的論文:跨三個公開安全基準的不安全回應率從 26.26% 降到 0.14%,單看這…
依 Import AI 轉述的 Google DeepMind 論文:100 個 Gemini 3.1 Pro 代理人合作解 71 題,系統提示禁止作弊;57 分鐘後一個代理人發現…
Epoch AI 是追蹤 AI 算力與能力進展的獨立研究機構,它最近發表一套 AI 研發工作的分類法,仿照美國勞工部長年使用的 ONET 職業分類系統,把研發流程拆成六段:決定做什…