モデルの読み · 今週 (原発表に明確な日付がなく、本紙が確認できたのは 2026 年 7 月まで;07-27 に論評経由で収録)
この記事の出典 2026年7月28日 夕刊
AI データ研究機関の Epoch AI と評価機関 METR がベンチマーク MirrorCode を公開した。ソースコードを見ず、ネットにもつながない条件で、コマンドラインの入出力だけを頼りに目標プログラムを「作り直す」ことを AI に求めるものである。結果はこうである。Opus 4.7 は、両機関が人間なら 2〜17 週かかると見積もったタスクを、14 時間・推論コスト 251 ドルで解いた。25 本の目標プログラムのうち 17 本は少なくとも一度は満点で解かれたが、8 本は一度も完璧に解かれていない。最も難しいのは、Python の検査ツール ruff といった大型の実在ソフトウェアである。著者らは、1 年前の先行モデルなら約 30% しか取れず、しかもカレンダーツール程度の単純なプログラムに限られていたと述べる(Import AI #466、07-27)。検証: 一次は 2 つの評価機関による公開発表であり、本紙は伝聞経由で収録した。判断アップデート: 「AI が週単位のソフトウェアタスクを自律的に完了できる」は、個別の逸話から体系的な計測を得た。今日の中核 2 本目と同じ枠で見れば、長時間能力の計測と長時間リスクの管理は、同じ時間線の両端である。AI のコーディングエージェントに書き換えを任せられるかを決めるなら、この分布は規模で分けて見るとよい。境界のはっきりした小型ツール系のタスクには、すでに体系的な証拠がある。ruff クラスの大型の実在ソフトウェアは、25 本のうち 8 本がいまも誰にも完璧に解かれていない。クリティカルパスには入れないでおくこと。
下の一件はプレプリントではなく、中核の 1 点目で使ったあの測定の付録に載っていた読みの一組になる。単独で取り出すのは、使いどころが中核のそれとは違うからだ。
あの測定が使った道具は他人のものになる。CoT-Control という評価で、やり方は問題に「小文字だけで考えよ」「考えるあいだ、ある語を使うな」といった指示を足し、推論の軌跡がそ…
下の一件は arXiv のプレプリントではなく、ある研究チームが自社のブログで自分たちの論文を説明したものになる。同じ種類の材料がもう一つあるが、そちらは上のそのほかに起きたことの…
Multiverse Computing の CAI チームが Hugging Face で自分たちの論文を説明した。公開されている三つの安全指標をまたいで、危険な応答の率は 26…