モデルの読み · 今日 (公開日 8 月 24 日)
この記事の出典 2026年8月24日 夕刊
同じ計測のなかに、そのまま真似できる内容が一段ある。DP-attention は注意の計算(文のなかでどの語どうしが関係するかを判定する段階)を「データ並列」で切り分ける最適化で、一往復の固定長の場面ではたいてい得になる。ところが長い文脈の多往復の流量では、正から負へ転じる。MiniMax M3 というモデルの上では、同時実行数 40 のときスループットが有効にしない場合の六割まで落ち、最初の一字が返るまでの時間(送信を押してから最初の一字が見えるまで)は三倍以上に悪化した。同時実行数 32 のときのキャッシュ命中率は実測 28.8%、理論値は 96.0% になる。⚠️ この二組の数字は同時実行数の点が違う(40 と 32)。同じ一回の計測の二つの欄ではない。機序ははっきり書かれている。計算の単位はそれぞれ、キャッシュ領域の四分の一を私有するだけだ。30 万字の会話が次に別の単位へ割り振られれば、その一段はまるごと計算し直しになる(SemiAnalysis、08-24)。
そのまま持ち帰れるものが二つ。 一つ、先にキャッシュ命中率を測り、それからスループットを見る——命中率が崩れていれば、あとのスループットの数字はすべて無駄な計算になる。二つ、メインメモリへの退避をやるなら、メインメモリの容量は、ビデオメモリ側のキャッシュ容量よりはっきり大きくしておく。書き込みのときに同時に複製する設計だからだ。ビデオメモリへ書いたぶんは、同時にメインメモリへも書かれる。足りなければ、開いていないのと変わらない。どれだけ大きくするかについて、計測した側が出した目安は 1.5 倍から 3 倍で、原文はこの幅の両端をどう出したのか説明していない。⚠️ どちらも今日のこの単一のソースの計測から出ており、第三者の再実行はない。なお、本紙が今週さらった学術論文のなかに、単独で書く値打ちのある新しいものはなかった。この段に今号は新しいものがない——常緑の概念をニュースに見せかけることはしない。
下の一件はプレプリントではなく、中核の 1 点目で使ったあの測定の付録に載っていた読みの一組になる。単独で取り出すのは、使いどころが中核のそれとは違うからだ。
あの測定が使った道具は他人のものになる。CoT-Control という評価で、やり方は問題に「小文字だけで考えよ」「考えるあいだ、ある語を使うな」といった指示を足し、推論の軌跡がそ…
下の一件は arXiv のプレプリントではなく、ある研究チームが自社のブログで自分たちの論文を説明したものになる。同じ種類の材料がもう一つあるが、そちらは上のそのほかに起きたことの…
Multiverse Computing の CAI チームが Hugging Face で自分たちの論文を説明した。公開されている三つの安全指標をまたいで、危険な応答の率は 26…