モデルの読み · 今週 (公開日 8 月 27 日)
この記事の出典 2026年8月28日 夕刊
Google DeepMind は昨日、外部の機関と二重盲検の評価を終えたと発表した(Google DeepMind、08-27)。もともとの板挟みはこうだった。 危険度の高い外部評価は、これまで二つに一つしかなかった。評価する側が問題を渡せば、モデルの提供元が先に答案を見られるかもしれない。モデルの提供元が重みを渡せば、知的財産が漏れるかもしれない。今回は両者をそれぞれ Google Cloud の機密計算の環境へ封じ込めた。 ハードウェアが、これから実行されるのはどのコードかを先に証明し、双方が確認して合意したうえで各自の資産を入れる。走り終えたら、取り決めた出力だけを外へ出す。評価する側はモデルの重みを見られず、Google は問題を見られない。 ここで暗号技術が担うのは「隔離が本当に効いていることの証明」であって、二重盲検そのものの実現手段ではない。参加したのは、シンガポール政府の AI 安全機関、オープンソースの共同体 OpenMined、フロンティア AI の監査組織 AVERI、ベンチマークの標準化団体 MLCommons になる。AVERI の告知は、受けたのが Gemini 2.5 Flash-Lite であること(DeepMind の記事に版の番号はない)、問題が MLCommons の安全ベンチマークのうち一度も使われていない一群から取られたことを補っている(AVERI、08-27)。⚠️ 正直な印を四つ。発表されたのは方法であって、評価の結果の数字は一つも出ていない。AVERI 自身は「小規模」な定量評価だと述べている。双方が公表した協力先の名簿は一致しない。「世界初」は当事者自身の主張になる。
あなたにとっての意味: 評価の要件を書く人に、引ける作法が一つ増えた。AVERI は同じ告知で、いまある規範のいくつかは第三者評価にあたって安全とプライバシーへ配慮せよと正しく要求しているのに、どうやるかの指針をほとんど与えていない、と名指しした。この試行は、その作法を与えるものになる。次に自分で確かめられる読み: あの技術報告がいつ公開されるか、そのなかに本当に評価の点数があるかどうか。点数が出るまで、これは方法の実演にとどまる。
下の一件はプレプリントではなく、中核の 1 点目で使ったあの測定の付録に載っていた読みの一組になる。単独で取り出すのは、使いどころが中核のそれとは違うからだ。
あの測定が使った道具は他人のものになる。CoT-Control という評価で、やり方は問題に「小文字だけで考えよ」「考えるあいだ、ある語を使うな」といった指示を足し、推論の軌跡がそ…
下の一件は arXiv のプレプリントではなく、ある研究チームが自社のブログで自分たちの論文を説明したものになる。同じ種類の材料がもう一つあるが、そちらは上のそのほかに起きたことの…
Multiverse Computing の CAI チームが Hugging Face で自分たちの論文を説明した。公開されている三つの安全指標をまたいで、危険な応答の率は 26…