論文と技術の線:産業の判断を動かすものだけを取る。論文要約はしない。
44 本
下の一件はプレプリントではなく、中核の 1 点目で使ったあの測定の付録に載っていた読みの一組になる。単独で取り出すのは、使いどころが中核のそれとは違うからだ。
あの測定が使った道具は他人のものになる。CoT-Control という評価で、やり方は問題に「小文字だけで考えよ」「考えるあいだ、ある語を使うな」といった指示を足し、推論の軌跡がそ…
下の一件は arXiv のプレプリントではなく、ある研究チームが自社のブログで自分たちの論文を説明したものになる。同じ種類の材料がもう一つあるが、そちらは上のそのほかに起きたことの…
Multiverse Computing の CAI チームが Hugging Face で自分たちの論文を説明した。公開されている三つの安全指標をまたいで、危険な応答の率は 26…
昨夜、学術論文は 6 本増えたが、今日は一本も読み切れていない。今日未明に読み切った 3 本はすべて X の投稿だ。つまり昨夜増えた 90 件の投稿のうち 3 件を読み切り、6 本…
独立の評価機関 Artificial Analysis が 9 月 7 日に公表した。OpenBMB の MiniCPM5-2B(稠密パラメータ 2.6B、Apache 2.0 ラ…
Import AI が紹介した Google DeepMind の論文によれば、Gemini 3.1 Pro のエージェント 100 体が 71 問を共同で解き、システムの指示は不…
昨夜、未読リストへ入った学術論文は 411 本あるが、今日は一本も読み切れていない。同じ日にほんとうに読み切った 9 本は、すべて論文の外に落ちている。常緑の概念を今週のニュースに…
Epoch AI は AI の計算資源と能力の進展を追う独立の研究機関で、最近、AI 研究開発の仕事を対象にした分類法を発表した。米国労働省が長年使ってきた職業分類体系 ONET …
八月十四日、本紙はある投稿を記録した。ある評価者が別のラボのオープンウェイト旗艦 GLM-5.3 の先行版を手にし、脆弱性を見つける力を量って、四つの見栄えのよい数字を出した、とい…
2025 年 12 月 20 日、OpenAI は〈Monitoring Monitorability〉を発表し、「思考の連鎖はどれだけ監視しやすいか」を測れる指標にした。最も重要…
CyberGym はバークレーのチームが作った公開試験で、実在の脆弱性 1,507 件を収め、188 のオープンソース事業をカバーする。データは Google が運営するオープンソ…
先に説明しておく。いまの大きなモデルの多くは専門家混合(MoE)という構えを取る。すべての語でモデル全体を走らせるのではなく、語ごとに少数の専門の子モデルへ振り分ける。だからモデル…
米国のアレン人工知能研究所が 9 月 1 日、BenchMIRT を発表した。項目反応理論の多次元版を使い、ある評価指標が結局のところ何を量っているのかを一問ずつ分解する。もともと…
このシミュレータが測るのは、モデルが実際にハードウェア上で動くときの挙動であって、モデル自身の点数ではない。パデュー大学の研究チームが論文を発表し、Nvidia の Ampere、…
本紙は 8 月 28 日の号で GLM-5.3-Flash の価格づけと効率の分かれ目を扱った。今日新しいのは、その旗艦版が重みを公開したこと、そして他の二社が同じ時期に出したこと…
ある利用者が、Qwen3.8-Flash は低い精度のもとで複数回にわたる追跡が壊れ、キーバリューキャッシュを高い精度へ戻したら直ったと報告した(QuixiAI、08-29)。キー…
米国のノースイースタン大学(Northeastern University、ボストンにある研究型の大学)の研究者 4 人が 8 月、ROBBIN という名前の論文をプレプリントのサ…
Google DeepMind は昨日、外部の機関と二重盲検の評価を終えたと発表した(Google DeepMind、08-27)。もともとの板挟みはこうだった。 危険度の高い外部…
新しい論文 CAKE はこう主張する。AI エージェントが GPU の計算カーネルを書くとき、コンパイラは呼び出されるだけの固定の道具であってはならず、エージェントと共に進化すべき…
コードを書き換える能力を測る従来のやり方は「振る舞いが正しいか」しか見ず、「引っ越しがほんとうに起きたか」を見ない。そこにきわめて単純な抜け道が生まれる。もとの実装をそのまま複製し…
同じ計測のなかに、そのまま真似できる内容が一段ある。DP-attention は注意の計算(文のなかでどの語どうしが関係するかを判定する段階)を「データ並列」で切り分ける最適化で、…
Together AI はオープンウェイトのモデルの推論を提供する事業者で、同じ日に二つの比較を出した。方法も題材も同じで(ソフトウェア工学の課題 113 問、各組 4 回ずつ実行…
本紙の帳簿には、2025 年 9 月に発表された安全研究が一本ある。OpenAI と Apollo Research(AI の欺瞞的な振る舞いの評価を専門にする独立の安全研究機関)…
本紙は今日、独立の再現か反証を狙って一巡した。当たった四件は、すべて同じ一点にさかのぼる。論文そのもの、あの研究機関の専用ページ、OpenAI の公式発表、そしてこの研究の専用サイ…
まず誰かを書く。Z.ai(智譜)は中国のフロンティアモデルの開発チームで、GLM 系列のオープンウェイトモデル(モデルの重みを公開し、誰でも自前でホストできる方式)を出している。最…
本紙は長く一つの判断を追ってきた。AI の能力の拡張を本当に縛るのは計算資源ではなく、人が検証できる帯域である——機械の産出が速くなるほど、「これは合っているか」を判じられる人のほ…
ある集団が、モデルの配布基盤 Hugging Face のブログで報告した。制約条件を見る GPU の配置器(その集団の自社製品である)を作り、七つの場面でいちばん素朴な「先に来た…
ふつうの大規模言語モデルは一字ずつ順に生成するので、思考の連鎖は読める文字になる。拡散式の言語モデルはブロックをまとめて一度に生成し、ステップとステップのあいだを渡るのは文字だけで…
2025 年 3 月、OpenAI の研究者がある発見を発表した。弱いほうのモデルに、強いほうのモデルの思考の鎖——答えを出す前にモデルが書き残す途中の推論の文——を読ませると、ご…
Stella Biderman は、オープンな AI 研究組織 EleutherAI で事務局長を務める。機構的解釈可能性とは、モデルの内側を開き、具体的な回路と動作の仕組みを突き…
蒸留とは、あるモデル(教師)の出力を使って別のモデル(生徒)を訓練することをいう。近ごろ、中国のオープンウェイトモデルが Anthropic の Opus から蒸留したことの証明と…
8 月 10 日、Google のチームが arXiv に AMIE(Video)を出した。Gemini を土台にした複数エージェントの系である。OSCE(客観的臨床能力試験)は医…
実行の殻(harness)はモデルの外側を包むエージェントの実行環境で、文脈の管理、ツールの呼び出し、再試行の方針を受け持つ。Claude Code も Codex もこれにあたる…
研究者 Ziqian Zhong は機械的な細部から出発した。Claude Code は利用者のメールアドレスを文脈に入れる。彼がそのアドレスを差し替えると、モデルは彼を Anth…
「第三の軸」は論文自身の分類であり、本紙は裏書きしない。論文〈Explorative Modeling: Unlocking a Third Pretraining Axis an…
評価機関 Artificial Analysis の AA-Omniscience の表は設計が変わっている。誤答は減点、知らないと認めるのは減点しない。だから知識の広さと「でっち…
Teortaxes は DeepSeek の 2024 年の末の V3 のモデルについての公式の開示に、2 つの経路で検算を掛けている。ハードの経路(カードの枚数 × 1 枚あたり…
先に、この「1 点差」がどの物差しで測られたものかを書く。第三者の評価機関 Artificial Analysis の総合の知性の指数、つまり複数の試験を重み付けして 1 つの総点…
K3 の発表の資料に 2 本の線がある(いずれも Teortaxes が逐語で転引したものである)。1 本目は、開発の後期に K3 の初期の版が kernel の大半を書いた、とい…
昨夜新しく入った 15 本の論文はまだ処理しておらず、この欄に単日の増分は無い。「言い分と学術」の対照を 1 組出す。Vinyals はこの 1 年で変わった考えを自ら述べている。…
AI を訓練する新しい筋のひとつが「rubric 型の報酬」である。報酬モデルを別に訓練せず、1 枚の評価表で答えに点を付ける。Ai2(Allen Institute for AI…
AI データ研究機関の Epoch AI と評価機関 METR がベンチマーク MirrorCode を公開した。ソースコードを見ず、ネットにもつながない条件で、コマンドラインの入…
SemiAnalysis は同じ AMD 現地調査のなかで、一次の工学的観察を示した:2.5 人のエンジニアに AI コーディングエージェントを組み合わせれば、かつてはチーム一組が…