モデルの読み · 証拠の更新 (元の論文は 2025 年 12 月 20 日/相殺する証拠は 9 月 3 日)
この記事の出典 2026年9月4日 夕刊
2025 年 12 月 20 日、OpenAI は〈Monitoring Monitorability〉を発表し、「思考の連鎖はどれだけ監視しやすいか」を測れる指標にした。最も重要な発見の一つは逐語で「RL optimization does not materially decrease monitorability even at the current frontier scale」、強化学習の最適化は、いまのフロンティア規模でも監視可能性を実質的には下げない、というものだ(arXiv 2512.18311)。ところが 2026 年 9 月 3 日の Astra システムカードは「CoT controllability for Astra especially increases over the course of RL training」と書く。制御可能性が上がるのは悪い知らせで、理由は前に書いた。本紙が読み直したうえでの処置は、あの古い判断の信頼度を下げること。ただし失効の印は付けない。 原因はまだ定まっておらず、もし能力の跳躍が主因なら、あの論文はもともと主張した範囲の中では間違っておらず、「いまの規模」が外挿の有効期限だと自分で明記してもいた。今回ほんとうに記すべき教訓は「供給元の自己申告を信じるな」ではない。 それはとうに制度が止めている。教訓はこうだ。結論に明確な適用範囲が付いているとき、他人に引かれる際に最も落とされやすいのが、まさにその範囲である。
下の一件はプレプリントではなく、中核の 1 点目で使ったあの測定の付録に載っていた読みの一組になる。単独で取り出すのは、使いどころが中核のそれとは違うからだ。
あの測定が使った道具は他人のものになる。CoT-Control という評価で、やり方は問題に「小文字だけで考えよ」「考えるあいだ、ある語を使うな」といった指示を足し、推論の軌跡がそ…
下の一件は arXiv のプレプリントではなく、ある研究チームが自社のブログで自分たちの論文を説明したものになる。同じ種類の材料がもう一つあるが、そちらは上のそのほかに起きたことの…
Multiverse Computing の CAI チームが Hugging Face で自分たちの論文を説明した。公開されている三つの安全指標をまたいで、危険な応答の率は 26…