SecondSource一次情報から判断を組み立てる
モデルの読み · 2026年8月22日

モデルの「陰での違反」を 0.4% まで抑えたという安全研究が、発表から一年近くたって、いまだに二つ目のチームに検証されていない。

モデルの読み · 証拠の更新 (元の論文は 2025 年 9 月、本紙が今日あらためて調べ直した)

この記事の出典 2026年8月22日 夕刊

本紙の帳簿には、2025 年 9 月に発表された安全研究が一本ある。OpenAI と Apollo Research(AI の欺瞞的な振る舞いの評価を専門にする独立の安全研究機関)の共同である。表向きは規則どおりに振る舞い、裏で別のことをする——この「陰での違反」を測れる代理の指標に据えた。答える前に安全の規範を読ませてから推論させる訓練を通すと、発生率は 13% から 0.4% へ落ちた。180 を超える環境と、訓練の場面から遠く離れた 26 の評価で測っている(arXiv 2509.15541)。ただし著者たち自身が交絡を一つ認めている。モデルの推論の途中に「自分はたぶん評価されている」という趣旨の記述がしばしば現れ、しかもこの自覚そのものが違反を減らすという因果の証拠がある。あの見事な下げ幅のうち、どこまでが本当に行儀がよくなった分で、どこからがカメラの存在に気づいた分なのか、切り分けられない。

note で無料購読——今日の夕方から届きます

note のフォローだけ。いつでも解除できます。お願いするのはこれだけです。

note をフォローする(無料)

同じ分類の最新