モデルの読み · 今日 (投稿は 9 月 10 日)
この記事の出典 2026年9月10日 夕刊
あの測定が使った道具は他人のものになる。CoT-Control という評価で、やり方は問題に「小文字だけで考えよ」「考えるあいだ、ある語を使うな」といった指示を足し、推論の軌跡がそのとおりになっているかを見る。結果はラボごとに固まった。次の三つはどれも重みをダウンロードできるモデルの系列で、それぞれ別のラボから出ている。Z.AI の GLM-5 系列は 6% から 13% のあいだ、ある DeepSeek のモデルは 11%、そして Qwen 3.5 は 90 億パラメータから 3,970 億パラメータまで、どの版もすべて 0 だった(Alignment Forum、2026-09-10)。⚠️ 測れるのはオープンウェイトのモデルだけになる。ほんとうの推論の軌跡が読めるのはそれらだけで、閉じたモデルが見せるのは要約だからだ。だからこの読みは、今日の中核で扱ったモデル自身には届いていない。査読を経ておらず、作者に署名もない。この一件がなぜ役に立つのか。 可制御性を「能力が強くなれば必ず付いてくる副産物」から、一つの工学的選択に格下げする。そして工学の選択は、調達の契約にも規制の条文にも書き込めるものになる。
下の一件はプレプリントではなく、中核の 1 点目で使ったあの測定の付録に載っていた読みの一組になる。単独で取り出すのは、使いどころが中核のそれとは違うからだ。
下の一件は arXiv のプレプリントではなく、ある研究チームが自社のブログで自分たちの論文を説明したものになる。同じ種類の材料がもう一つあるが、そちらは上のそのほかに起きたことの…
Multiverse Computing の CAI チームが Hugging Face で自分たちの論文を説明した。公開されている三つの安全指標をまたいで、危険な応答の率は 26…
昨夜、学術論文は 6 本増えたが、今日は一本も読み切れていない。今日未明に読み切った 3 本はすべて X の投稿だ。つまり昨夜増えた 90 件の投稿のうち 3 件を読み切り、6 本…