モデルの読み · 証拠更新 (元の発信は 2026-06-27)
この記事の出典 2026年8月11日 夕刊
実行の殻(harness)はモデルの外側を包むエージェントの実行環境で、文脈の管理、ツールの呼び出し、再試行の方針を受け持つ。Claude Code も Codex もこれにあたる。6 月、機械学習の教科書を書いた著者が小さな自己流の試験をして、アリババの Qwen3.6 が自社の Qwen-Code よりも OpenAI の Codex の上でよく動くと気づいた。本人も、これはごく小さな基準なので話半分に聞いてほしいと書いている。本紙は今日、狙いを定めた確認を終えた。一本は 8 つのモデル、6 つの実行の殻、106 の課題を覆い、実行の軌跡は 5,194 本ある。結論は、能力を裸のモデルにではなく「モデル×殻の組み合わせ」という層に帰すべきだ、というものだ(Harness-Bench、2026-05-27)。もう一本は、モデルを固定して殻だけ替えると、一発合格率が 27.4 ポイント振れると測った。モデルそのものを替えたときは 29.4 ポイントで、二つの量は近い(Claw-SWE-Bench、2026-06-10)。本紙のこの線についての内部の確信度は、これで 0.55 から 0.6 へ上がった(満点は 1。0.5 を下回るあいだは、どちらの側も主張できるだけの証拠がないことを意味する。採点の方法は方法論に置いた)。6 月には一人の小さな自己流の試験しかなかったものに、今日は千本単位の軌跡を持つ独立した基準が二本ついた。それでも動いたのは半目盛りだけで、この抑制そのものが方法である。⚠️ 新しい証拠は、もとの処方を同時に狭めた。27.4 ポイントは大きく、「慣れた殻に好きなモデルを押し込む」は、組み合わせを外したときの代償が重い。正しい読み方は「自社製どうしの結び付きは信用しない。ただし組み合わせは一対ずつ実測する」になる。⚠️ あの著者の具体的なデータ点は、二本とも直接には測り直しておらず、依然として単一のソースだ。本紙は Nvidia の論文が逆の結論を出したことも別に記録しており、両方を残してどちらが正しいかは裁いていない。
下の一件はプレプリントではなく、中核の 1 点目で使ったあの測定の付録に載っていた読みの一組になる。単独で取り出すのは、使いどころが中核のそれとは違うからだ。
あの測定が使った道具は他人のものになる。CoT-Control という評価で、やり方は問題に「小文字だけで考えよ」「考えるあいだ、ある語を使うな」といった指示を足し、推論の軌跡がそ…
下の一件は arXiv のプレプリントではなく、ある研究チームが自社のブログで自分たちの論文を説明したものになる。同じ種類の材料がもう一つあるが、そちらは上のそのほかに起きたことの…
Multiverse Computing の CAI チームが Hugging Face で自分たちの論文を説明した。公開されている三つの安全指標をまたいで、危険な応答の率は 26…