モデルの読み · トレンド観察 (投稿の初出は 07-17)
この記事の出典 2026年8月3日 夕刊
K3 の発表の資料に 2 本の線がある(いずれも Teortaxes が逐語で転引したものである)。1 本目は、開発の後期に K3 の初期の版が kernel の大半を書いた、というものである。kernel はモデルの走る速さを決める底層の加速のプログラムであり、前の版のモデルで次の版の土台を作ったに等しい。公式のブログは、K3 が自ら Game Boy Advance のエミュレータを作る実演を説明する箇所で、機構の説明として「recursive self-improvement」(再帰的な自己改良)という語を直接に使っている(Teortaxes、07-17)。検証: 2 つの段はいずれも逐語の引用であり、公式の原文へ戻って直接には確かめていない。同じ公式の資料から出ており、1 つのソースとして数える。ここでの「再帰的な自己改良」は、事業者の販促の文案が流用した言い方であり、指しているのは、前の版のモデルで加速のプログラムを書くのを助けさせることである。分野のなかで言う、モデルが自律的に自らの重みや構造を改良することとは同じものではなく、自律の能力の跳ね上がりが現れたことを意味しない。判断更新: 「一方だけの自主規制がフロンティアの速度を縛れるか」という命題について、いまどの信号を見るべきかが分かった。同じ事柄について、米国系には危険を考えて関連するデータの扱いを止め、抑制した研究所がある。Moonshot は逆に、それを売りとして販促の文案へ書き込んだ。今後、ある研究所が危険を考えてある種の能力へ制動を掛け、同じ時期に別の研究所が同種の能力を売りとして販促するたびに、非対称を 1 回記録する。積み上がった向きは、どんな安全の宣言よりもよく測れる。そしてオープンウェイトのモデルを選ぶとき、発行する側のこの種の能力についての開示の姿勢そのものが、デューデリジェンスの 1 項目である。
下の一件はプレプリントではなく、中核の 1 点目で使ったあの測定の付録に載っていた読みの一組になる。単独で取り出すのは、使いどころが中核のそれとは違うからだ。
あの測定が使った道具は他人のものになる。CoT-Control という評価で、やり方は問題に「小文字だけで考えよ」「考えるあいだ、ある語を使うな」といった指示を足し、推論の軌跡がそ…
下の一件は arXiv のプレプリントではなく、ある研究チームが自社のブログで自分たちの論文を説明したものになる。同じ種類の材料がもう一つあるが、そちらは上のそのほかに起きたことの…
Multiverse Computing の CAI チームが Hugging Face で自分たちの論文を説明した。公開されている三つの安全指標をまたいで、危険な応答の率は 26…