モデルの読み · 今日 (公開日は 9 月 7 日)
この記事の出典 2026年9月8日 夕刊
独立の評価機関 Artificial Analysis が 9 月 7 日に公表した。OpenBMB の MiniCPM5-2B(稠密パラメータ 2.6B、Apache 2.0 ライセンス)は、同社の Intelligence Index v4.2 で 15 点を取った。4B 以下のオープンソースのモデルでは最高で、Qwen3.5 9B と並ぶ。銀行の顧客対応のエージェントを測る τ³-Banking では 21% を取り、次点は 8% しかない。ただし知識のテスト AA-Omniscience では −12 になる。これは 29% の問題にしか答えず残りを棄権し、しかも 1 問あたり平均 19,000 トークンを出力してのことだ(@ArtificialAnlys、2026-09-07)。(正直に断っておく。このテストには負の点数が出る。誤答に減点があるという意味になるが、正確な採点規則を本紙は取得していない。)⚠️ 第三者による評価であり、確かめられる。記す値打ちがあるのは点数ではなく、「小さなモデルが、よく考えてあまり答えないこと」で取った点数だという点になる。これを遅延と費用へ換算するには、別に測る必要がある。
下の一件はプレプリントではなく、中核の 1 点目で使ったあの測定の付録に載っていた読みの一組になる。単独で取り出すのは、使いどころが中核のそれとは違うからだ。
あの測定が使った道具は他人のものになる。CoT-Control という評価で、やり方は問題に「小文字だけで考えよ」「考えるあいだ、ある語を使うな」といった指示を足し、推論の軌跡がそ…
下の一件は arXiv のプレプリントではなく、ある研究チームが自社のブログで自分たちの論文を説明したものになる。同じ種類の材料がもう一つあるが、そちらは上のそのほかに起きたことの…
Multiverse Computing の CAI チームが Hugging Face で自分たちの論文を説明した。公開されている三つの安全指標をまたいで、危険な応答の率は 26…