モデルの読み
この記事の出典 2026年8月30日 夕刊
ある利用者が、Qwen3.8-Flash は低い精度のもとで複数回にわたる追跡が壊れ、キーバリューキャッシュを高い精度へ戻したら直ったと報告した(QuixiAI、08-29)。キーバリューキャッシュには、それまで一文字ずつ積み上げたベクトルが入っている。複数回のやり取りはこれで状態を保つ。精度を落として押し込めば誤差が積もる。そして誤差は一回きりの推論では見えず、複数回の追跡で初めて弾ける。⚠️ これは一人の利用者による運用経験で、事例は一つしかない。だが指しているものは普遍的になる。公開のときの仕様も価格も、すべて一回きりの指標だ。実際の運用での失効は状態の保持に現れる。そしてどのラボも、公開のときに複数回のやり取りでの安定性を示す数値を出していない。公開の数字だけを見て調達を決める人に欠けているのは、まさにこの一項になる。仕様と価格は並べて比べられるが、状態を保つ信頼性は比べられない。三社が仕様で並んだからといって、買い手の調達の危険まで並んだわけではない。
下の一件はプレプリントではなく、中核の 1 点目で使ったあの測定の付録に載っていた読みの一組になる。単独で取り出すのは、使いどころが中核のそれとは違うからだ。
あの測定が使った道具は他人のものになる。CoT-Control という評価で、やり方は問題に「小文字だけで考えよ」「考えるあいだ、ある語を使うな」といった指示を足し、推論の軌跡がそ…
下の一件は arXiv のプレプリントではなく、ある研究チームが自社のブログで自分たちの論文を説明したものになる。同じ種類の材料がもう一つあるが、そちらは上のそのほかに起きたことの…
Multiverse Computing の CAI チームが Hugging Face で自分たちの論文を説明した。公開されている三つの安全指標をまたいで、危険な応答の率は 26…