論文與技術線:只收會改變產業判斷的那些,不做論文摘要。
41 篇
Stanford 的「平攤評測法」——用「從題目內容預測難度」壓低可靠評測的成本——今天完成定向查證,找到獨立第二證:ICML 2026 一篇論文用同路線做模型能力外推(scali…
Lambert 一年前的「美版 DeepSeek」宣言——2 年、1 到 5 億美元做出權重(模型訓練完的參數檔案)/數據/代碼全開放的前沿模型——本報完成定向查證:專案存在有媒體…
目前後訓練(模型練完基礎能力後、再教它怎麼答題的階段)的主力方法 RLVR(可驗證獎勵的強化學習:只在數學、程式這類有標準答案的任務上給模型獎勵)有個結構性盲點:它只優化「可以客觀…
SemiAnalysis 在同篇 AMD 實勘裡給出一組第一手工程觀察:2.5 名工程師配上 AI 編程代理,就能完成過去一整組人才做得完的新模型「發布日支援」:代理自動抓設定、跑…
Jacobian 猜想是 1939 年提出的代數幾何名題,說的是:如果一個多項式映射的「Jacobian 行列式」是非零常數,這個映射就應該可逆。Anthropic 研究員公布:在…
本報 7/22 期主線第 3 點寫過 Lambert 反駁流行蒸餾敘事的發言;今天他在播客長談裡把機制攤開:蒸餾(拿強模型的輸出當教材)確實用於監督微調階段,也就是模型「學禮貌、學…
第一份是 AlgoTune 基準。這是一個 24 人學術團隊建立的基準,收錄 154 個「寫出比標準函式庫更快的正確程式」的任務:前沿模型平均只把程式加速 1.72 倍,靠的是表層…
本報 7/21 期模型觀點介紹過這篇實測(優化 agent 流程的增益預設是一次性的,只有內建回歸控制才守得住;arXiv,2026-07);今天新的是它落在本報長期追蹤的一條路線…
RLM 框架論文的作者 Alex Zhang 提出:精心設計的任務編排(模型外圍的迴圈、工具調度邏輯)能把表面不同的任務化成相似的執行軌跡,使短任務訓練泛化到 8 至 32 倍更長…
Google DeepMind 研究副總裁 Raia Hadsell 在演講中主張:造出大語言模型的那套配方(大模型+大資料+自監督)同樣適用於世界模擬、機器人、生物、氣象,下一個…
對 2,361 個熱門開源專案、25,264 個由 AI agent 發起的 pull request(程式修改請求)的實證研究:採用高度集中,中位數專案三個月只有 1-2 個 a…
三種主流「不動模型、只優化 agent 流程」的方法被放進兩階段連續評測:固定測試上三者都贏基準線;新任務進來後分岔,有的跌破基準線、有的停止進步,只有把「回歸控制」(每次優化都驗…
Keras 作者 François Chollet 當時給「大模型只是記憶、不是推理」一支可實測的探針:模型能解位移密碼(把每個字母往後挪 n 格的入門加密),但多只在 n=3 或…
匿名獨立研究者 Gwern 以 2020 年對 scaling 假說的早期系統論證聞名,他的診斷是:網路語料裡只有 agent 行為的「描述」,沒有一步步的決策軌跡,現成模型的 a…
先講結論:用 AI 生成的資料來評測 AI,有個結構性盲點:沒有機械方法逐題驗證資料本身是對的。單一作者研究者 Serkan Ballı 給了親歷案例:他建多語評測語料時,兩段程式…
對沒有標準答案的題目,讓模型抽多個解、取多數共識的答案,再讓模型逐字學習「能走到那個答案的解法」。研究團隊(Gkountouras、Jukić、Titov)自報:在作者自選的數理推…
本報昨日 2026/7/18 期模型觀點介紹過 UCLA 系團隊的 MemCon——讓 agent「何時讀寫記憶」從手寫規則變成可學習的決策(arXiv,07-15)。把它放進本報…
Meta FAIR 系團隊三月的論文 Principia 主張:現行數學評測多半只判最終數值或選項,但真正的科學工作要求推導出公式與結構。他們做了一個 2,558 題的推導評測,本…
Oracle 07-14 以 13 人技術報告把 agent 記憶做成資料庫原生的基底層:記憶被當成完整的生命週期來管理,涵蓋抽取、整併、檢索與修剪,自報在長期記憶評測 LongM…
圖靈獎得主 Yoshua Bengio 所在團隊的論文顯示:AI agent 光憑「哪些動作被擋、哪些沒被擋」,就能推斷自己的思考過程正被監控,而且察覺力隨模型能力上升:新一代模型…
Thinking Machines 的 Inkling 被多位從業者從官方模型卡讀出一組罕見選擇,最受注目的是放棄 RoPE——現今幾乎所有大模型共用的位置編碼標準,模型靠它知道哪…
Databricks 在自家數百萬行程式庫上實測各家模型跑工程任務:Sonnet 5 每 token 比 Opus 4.8 便宜約 1.7 倍,但按「完成一個任務」算成本反而更貴—…
學術面誠實交代:本週的學術主菜就是深度報告裡那五篇同儕審查論文;昨夜新進的 50 篇 arXiv 論文,在掃過的範圍內尚無單篇達到入報門檻,不硬湊。
Claude Code 裡逾時被系統砍掉的指令,死前吐到螢幕上的殘缺輸出,會被「對話壓縮摘要」記成已確認的結果,跨工作階段傳播假陽性(arXiv 2607.13071)。病因一句話…
同一個生產程式庫、同樣的編碼代理工作各跑 28 天:提示快取(重複的程式庫上下文快取起來不重算)命中率 99.3% 時,雲端 API 有效成本壓到每百萬 token $0.57——…
新論文在困難規劃測驗上跨多個模型家族做統計分解,發現「規劃」是兩種獨立能力:判斷「這一步能不能走」的局部推理,隨模型放大與更長思考確實變好;想清楚「目標到底可不可達」的全局列舉,幾…
新證據(本週):研究者 Charles O'Neill 的受控實驗(2026-07,arXiv 2607.11020;屬尚未經同行評審的 arXiv 預印本、單一受控實驗,證據等級…
中國 AI 公司 Moonshot 的開源模型 Kimi K2.5,出現第一份非官方的第三方安全評測(arXiv 2604.03121,2026-04 編號,我們 7/13 掃到)…
華頓商學院教授 Ethan Mollick 2023 年 5 月的名文〈AI 不是好軟體,是還不錯的人〉(原文)裡兩個廣傳數字,本週逐一對回出處:「寫作生產力提升超過 30%」出自…
美國國家經濟研究局(NBER)一份工作論文(未經同儕審查,w35290)從投資數據反推:以目前的資本支出水位(美國前五大科技公司 2025 年 $380B、2026 年預測近翻倍)…
Epoch 6 月 17 日釋出一張任務分類法的第一版(原文,2026-06-17):把一家前沿 AI 公司的研究工作拆成 6 大類、60 多項任務,每項用 0 到 5 分評「現在…
編排層(orchestration layer)指的是把模型接上工具、權限、工作流的那套協調膠水。業界大會 AIEWF 的每日速記(2026-07,出處)寫得直白:「多數客製化工作…
做這份評測的是 Artificial Analysis——一家專門獨立評測各家 AI 模型、業界常引用其排行榜的第三方機構。它出了 120 個真實法律任務(跨 24 個執業領域),…
2023-10 的 SWE-bench 論文把「給一張真實 GitHub 工單、交一個能通過測試的修復」做成標準考題,當時最強模型只解出約 1.96%(arXiv,2023-10)…
模型回答問題分兩段:先一口氣讀完你的問題(吃運算),再逐字寫回覆(吃記憶體),擠同一張卡互相干擾。2023-11 的 Splitwise(arXiv)與 2024-01 的 Dis…
不是每個字都動用整顆大腦:模型裡住著許多專家小網路,每個字只叫醒幾個。2021-01 Switch Transformer 開路(arXiv),2024-12 DeepSeek-V…
為什麼翻舊論文:這兩篇的結論到 2026 年還被拿來當論據,傳著就走樣;回原文是為了校準現在的判斷,不是考古。
時間要講清楚:這不是 2023 年的老事,而是 2024 年 9 月 o1 帶頭、2025 年 1 月 DeepSeek R1 跟進後才成主流。憑什麼說是這個配方:R1 的論文(2…
這轉向 2024 年就在一線從業者間形成共識(見主線第 5 條的六個獨立原點),2026 年已是預設。[商業] 直接對應企業知識庫問答與 agent 產品 —— 想讓 AI 懂公司…
白話講:運算單元常常在空等資料從記憶體搬過來,所以誰能把資料餵得更快誰就贏;而 HBM 這種高速記憶體全球只有少數幾家(SK海力士、三星、美光)做得出來。[商業] 算力的成本與供給…
LlamaIndex 創辦人 Jerry Liu 在訪談(2023-10-05)自承這句話:2022-11 他做 GPT Tree Index,只是為了繞開 GPT-3 的 4,0…
只留 email,隨時退訂。這是我們唯一想請你做的事。