モデルの読み · 評価 トレンド観察
この記事の出典 2026年8月5日 夕刊
評価機関 Artificial Analysis の AA-Omniscience の表は設計が変わっている。誤答は減点、知らないと認めるのは減点しない。だから知識の広さと「でっち上げを拒む」傾きを同時に測れる。Teortaxes(今日の中核の 1 本目と同じ評論者である)が新しい回の表を読んだ要点は、順位ではない。知識の面で最前に立つモデルが、同時に最もよくでっち上げるモデルの 1 つでもある(Teortaxes、07-21)。これは Artificial Analysis 自身の今年 1 月の方法論の発見と独立して同じ向きである。幻覚の率は総合の知能と相関せず、知識の正確さは総パラメータと強く相関し、動くパラメータとはほとんど相関しない(Latent Space のインタビューの保存庫、2026-01)——機種を一通り入れ替えたあとで同じ規則が再現した。1 回きりの写真が、時間の幅を持つ規則へ上がった。選定の読み方はこうである。細かい知識と長い尾の事実が要るなら、大きいパラメータへ寄る。「知らないと言うほうを選ぶ」信頼度が要るなら、学習の後段の配合と拒否の振る舞いを見る。2 つは 2 冊の帳簿である。知識の最も強いモデルを自動の審査に使うなら、そのでっち上げの傾きも同時に買うことになる。彼の読後の要約は点数を付けていないので、引くときはまず向きとして見ること。
下の一件はプレプリントではなく、中核の 1 点目で使ったあの測定の付録に載っていた読みの一組になる。単独で取り出すのは、使いどころが中核のそれとは違うからだ。
あの測定が使った道具は他人のものになる。CoT-Control という評価で、やり方は問題に「小文字だけで考えよ」「考えるあいだ、ある語を使うな」といった指示を足し、推論の軌跡がそ…
下の一件は arXiv のプレプリントではなく、ある研究チームが自社のブログで自分たちの論文を説明したものになる。同じ種類の材料がもう一つあるが、そちらは上のそのほかに起きたことの…
Multiverse Computing の CAI チームが Hugging Face で自分たちの論文を説明した。公開されている三つの安全指標をまたいで、危険な応答の率は 26…