モデルの読み · 今日 (出来事の日は 08-12)
この記事の出典 2026年8月14日 夕刊
Stella Biderman は、オープンな AI 研究組織 EleutherAI で事務局長を務める。機構的解釈可能性とは、モデルの内側を開き、具体的な回路と動作の仕組みを突き止めようとする研究の道筋を指す。主張は二層になっている。弱い版(元の投稿にある)は、干渉の結果を予測することにも、よい理論を立てることにも、機構のモデルは要らないというものだ。歴史の類比が三つ添えられている。ワクチンは細菌の理論より先にあった。熱力学の第二法則は、誤った熱の理論を抱いた人物が立てた。量子力学に標準の機構モデルはない。強い版(返信のなかにある)は、「mech interp の研究のほとんどは、実のところ本当の科学とは言えない」である(原文)。本紙は、引かれていたその論文の要旨を取り出して一度突き合わせた。 それは arXiv 2606.06533、題は〈Position: Don't Just "Fix it in Post": A Science of AI Must Study Training Dynamics〉で、筆頭著者は本人である。つまり独立した傍証ではなく、本人の主張そのものだ。要旨が言っているのは、AI の科学は事後の手直しを超え、モデルの振る舞いを生む訓練の動態を研究しなければならない、である。しかも機構的解釈可能性を、検討すべき進展の一つとして明示に挙げている。科学の外へ追い出してはいない(arXiv 2606.06533)。投稿は論文よりずっと強い。そして強くなったその一段には、根拠がない。 ⚠️ 本紙は要旨だけを読み、全文は読んでいない。これは立場を述べる論文であり、議題を主張する文類であって実証の結果ではないので、引くときに「研究が示した」と書いてはならない。三つの歴史の類比も、一つずつ確かめてはいない。意思決定にとっての実際の含みは、こうなる。「解釈可能性へ投資すべきだ」という論の多くは、「仕組みを理解して初めて、認証でき、干渉できる」を暗黙の前提に置いている。主張されているのは、その矢印が成り立たない、ということだ。これは解釈可能性が役に立たないという意味ではない。もし投資の理由が「機構の理解は必要条件である」の上に建っているなら、その理由は別のものへ取り替える必要がある、という意味だ。本紙はどちらが正しいかを裁かない——本紙の記録には、機構の発見を中核の価値とする素材が別にあり、どちらも覆されていない。矛盾はそのまま残す。
下の一件はプレプリントではなく、中核の 1 点目で使ったあの測定の付録に載っていた読みの一組になる。単独で取り出すのは、使いどころが中核のそれとは違うからだ。
あの測定が使った道具は他人のものになる。CoT-Control という評価で、やり方は問題に「小文字だけで考えよ」「考えるあいだ、ある語を使うな」といった指示を足し、推論の軌跡がそ…
下の一件は arXiv のプレプリントではなく、ある研究チームが自社のブログで自分たちの論文を説明したものになる。同じ種類の材料がもう一つあるが、そちらは上のそのほかに起きたことの…
Multiverse Computing の CAI チームが Hugging Face で自分たちの論文を説明した。公開されている三つの安全指標をまたいで、危険な応答の率は 26…