モデルの読み · 証拠の更新 (元の投稿は 2026 年 8 月 14 日/発表版は 8 月 21 日、本紙は今日これを結ぶ)
この記事の出典 2026年9月5日 夕刊
八月十四日、本紙はある投稿を記録した。ある評価者が別のラボのオープンウェイト旗艦 GLM-5.3 の先行版を手にし、脆弱性を見つける力を量って、四つの見栄えのよい数字を出した、というものだ。当時、本紙はそのまま受け取らず、三つの隙間を印した。四つの数字はどれも再現できる分母がない、その脆弱性が訓練データの締め切りより後に公開されたものか説明がない、投稿の連なりの後ろ二本を本紙は読めていない。いちばん重いのは二つ目になる。脆弱性が締め切りより前に公になっていたなら、モデルは答えを覚えていただけかもしれない。今日調べ直すと、同じ人たち(セキュリティ企業 Aikido Security)が一週間後に方法論を丸ごと発表していた(Aikido Security、2026-08-21)。三つの隙間には今日すべて答えがある。ただし結んだあとの正味の変化は二手に分かれ、その三つと一対一では対応しない。本紙に有利な一点。分母は最近になって公表された 32 件の脆弱性で、各モデルは 32 件を三度ずつ、合わせて 96 回走らせている。著者は「We were careful about dataset freshness」と自ら書く。モデルがすでにその脆弱性を見ている機会を下げるための選び方だった。本紙が印した決定的な懸念は、彼ら自身も考えていた。あの投稿に不利な二点。先に二つの言葉を置く。再現率は、見つけるべき脆弱性のうち実際に何割を見つけたか。適合率は、報告したもののうち何割が本物か。本物でないものが誤報になる。再現率は 24/32 から 25/32 に直った。費用の比較は「GPT-5.6-Terra より 40% 安い」から「Sol より 65.5% 安く、Opus 5 より 69.8% 安い」に変わり、比べる相手も幅も動いた。そして投稿でいちばん見栄えのした一文、「誤報が他の高い再現率のモデルより少ない」は、発表版で書いた本人たちに覆される。「The open models caught up with the frontier at much cheaper rates but also produced the most false leads for the pipeline to reject.」——オープンモデルは最も多くの誤った手がかりを出した。⚠️ 投稿がブログに格上げされても、二つの独立した出所にはならない。同じチームの同じ自前の評価であり、確からしさは単一の出所の上限に抑えたままにする。⚠️ 脆弱性の一覧と日付の分布はいまも非公開で、それがどれほど「新しい」のかを読者が自分で確かめる道はない。再現率は買えるが、適合率は買えない。 供給元には誤報の率と再現率を並べて出すよう求めてほしい。再現率しか載っていない見積もりは比べられない。この項は同時に、今日の中核 2 点目へ逆向きの圧をかける。 評価者が正しいなら、オープンウェイトを手に入れることは、使える攻撃の力を手に入れることと同じではない。あいだには誰も量っていない枠組みが一つ挟まる。もしそうなら、三つの読み取り値が指す期限はどれも後ろへずれる。
下の一件はプレプリントではなく、中核の 1 点目で使ったあの測定の付録に載っていた読みの一組になる。単独で取り出すのは、使いどころが中核のそれとは違うからだ。
あの測定が使った道具は他人のものになる。CoT-Control という評価で、やり方は問題に「小文字だけで考えよ」「考えるあいだ、ある語を使うな」といった指示を足し、推論の軌跡がそ…
下の一件は arXiv のプレプリントではなく、ある研究チームが自社のブログで自分たちの論文を説明したものになる。同じ種類の材料がもう一つあるが、そちらは上のそのほかに起きたことの…
Multiverse Computing の CAI チームが Hugging Face で自分たちの論文を説明した。公開されている三つの安全指標をまたいで、危険な応答の率は 26…