モデルの読み · 今週 (発表日 9 月 2 日)
この記事の出典 2026年9月3日 夕刊
先に説明しておく。いまの大きなモデルの多くは専門家混合(MoE)という構えを取る。すべての語でモデル全体を走らせるのではなく、語ごとに少数の専門の子モデルへ振り分ける。だからモデルは巨大でも、一回に使う計算資源は一部で済む。工程でよく使う節約の手は「最も重要でない専門家を刈り取る」ことで、その重要さを判断する代理指標としてよく使われるのが「この専門家が何回振り分けられたか」になる。独立の研究者 Alexey Fateev は RTX PRO 6000 を 4 枚使い、GLM-5.3 Flash の配備用チェックポイント(総パラメータ 320B、活性 18B)を実際に走らせ、設定ファイルを読むのではなく一項ずつ量って、二つを取り出した。一つ、振り分けられた回数と専門家の実際の重要さは、ほとんど相関しない(スピアマンの順位相関係数は −0.222)。二つ、最も重要でない 2% の専門家を捨てても、出力の系列の 64% が変わった(最も重要な 2% を捨てた場合は 79% になる)(@superalesha、09-02)。これは「刈り取って費用を下げる」という工程の筋にとって悪い知らせになる。 よく使われるあの物差しは別のものを量っており、しかも正しく量れたところで、最も重要でないひと握りが痛みなく外せるわけではない。⚠️ 本紙はこの研究者の過去の実績について資料を持たない。単一のソースによる実測であり、まだ誰も再現していない。
下の一件はプレプリントではなく、中核の 1 点目で使ったあの測定の付録に載っていた読みの一組になる。単独で取り出すのは、使いどころが中核のそれとは違うからだ。
あの測定が使った道具は他人のものになる。CoT-Control という評価で、やり方は問題に「小文字だけで考えよ」「考えるあいだ、ある語を使うな」といった指示を足し、推論の軌跡がそ…
下の一件は arXiv のプレプリントではなく、ある研究チームが自社のブログで自分たちの論文を説明したものになる。同じ種類の材料がもう一つあるが、そちらは上のそのほかに起きたことの…
Multiverse Computing の CAI チームが Hugging Face で自分たちの論文を説明した。公開されている三つの安全指標をまたいで、危険な応答の率は 26…