モデルの読み · トレンド観察 (元の論文は 2025 年 6 月/後続の論文は 2026 年)
この記事の出典 2026年9月4日 夕刊
CyberGym はバークレーのチームが作った公開試験で、実在の脆弱性 1,507 件を収め、188 のオープンソース事業をカバーする。データは Google が運営するオープンソースのファジング基盤 OSS-Fuzz から来ており、だからそれらの脆弱性は生まれつき既知で記録済みだ。課題の定義は逐語で、モデルはその脆弱性を再現できる概念実証テストを生成しなければならず、手にするのはその脆弱性の文章による説明と、対応するコードベースだけ。論文の自己申告では 2025 年の最良の組み合わせでも成功率はおよそ 20% だったが、一年のうちに二つのフロンティア企業が自己申告した点数は 85.6 と 86.2 へ跳ねた。しかも二社とも、どの難度帯、どの部分集合を測ったのかを公表しておらず、どちらの点数も第三者による再現はない(CyberGym、2025-06)。最も情報量が大きいのは、同じ著者群による後続論文の冒頭の自己申告だ。既存の AI システムに対するセキュリティ評価は、実世界の脆弱性発見と修正の端から端までのライフサイクルを覆えていない(CyberGym-E2E、2026)。そのまま持ち帰れる動き:セキュリティ試験の点数を見たら、まず「この試験はモデルに何を与え、何をさせるのか」と問うこと。
下の一件はプレプリントではなく、中核の 1 点目で使ったあの測定の付録に載っていた読みの一組になる。単独で取り出すのは、使いどころが中核のそれとは違うからだ。
あの測定が使った道具は他人のものになる。CoT-Control という評価で、やり方は問題に「小文字だけで考えよ」「考えるあいだ、ある語を使うな」といった指示を足し、推論の軌跡がそ…
下の一件は arXiv のプレプリントではなく、ある研究チームが自社のブログで自分たちの論文を説明したものになる。同じ種類の材料がもう一つあるが、そちらは上のそのほかに起きたことの…
Multiverse Computing の CAI チームが Hugging Face で自分たちの論文を説明した。公開されている三つの安全指標をまたいで、危険な応答の率は 26…