← 返回信息流

精选Simon Willison短讯

2026年大语言模型发展回顾(截至目前)

simonwillison.net行业AI评分:70/100

作者在WeAreDevelopers世界大会北美站发表闭幕主题演讲,按时间线梳理了2025年底至2026年初的大语言模型领域关键趋势与事件。

2026年大语言模型发展回顾(截至目前)

周五,我在圣何塞的 WeAreDevelopers 北美世界大会上发表了闭幕主题演讲。我将过去一年的关键趋势串联起来,按时间顺序梳理了 2026 年发生的一切。视频已上传至 YouTube;以下是我配合演讲的标注幻灯片和笔记。

2026 in LLMs (so far) Simon Willison WeAreDevelopers World Congress North America, 25th September 2026
2026 in LLMs (so far) Simon Willison WeAreDevelopers World Congress North America, 25th September 2026

我将快速浏览一下 2026 年至今发生的所有事情。这一年还没结束呢!

November 2025
November 2025

对我来说,2026 年实际上早在 2025 年 11 月就开始了。

The November 2025 inflection point Claude Opus 4.5 GPT-5.1
The November 2025 inflection point Claude Opus 4.5 GPT-5.1

11 月发布了两个重要模型:Claude Opus 4.5 和 GPT-5.1。

正如新模型通常的情况一样,它们是对前代模型的渐进式改进。

但偶尔当模型性能提升时,它会跨越一条无形的界限,让一些原本行不通的事情开始变得可行。

在这种情况下,开始变得可行的是它们的编码代理(coding agents)。Claude Code 自 2025 年 2 月就已存在,Codex 则稍晚一些。

这两个新模型与其各自的编码代理框架结合后,表现从“经常出错”提升到了“日常使用足够可靠”。

"Generate an SVG of a pelican riding a bicycle". The Claude Opus 4.5 one has a very weird shaped frame and the pelican…
"Generate an SVG of a pelican riding a bicycle". The Claude Opus 4.5 one has a very weird shaped frame and the pelican…

多年来,我一直通过要求模型“生成一只骑自行车的鹈鹕的 SVG 图像”来评估新模型。这可能是世界上最愚蠢的基准测试——从中能学到的东西有限。

但它对模型来说仍然是一个挑战,因为画鹈鹕很难,画自行车也很难,而且鹈鹕本来就不能骑自行车。

以下是 11 月的最新水平。Claude 仍然无法真正画出自行车!GPT-5.1 生成的自行车车架也非常糟糕。

November 24th 2025 - the first commit to steipete/Warelay. A GiHub commit adding an MIT license file.
November 24th 2025 - the first commit to steipete/Warelay. A GiHub commit adding an MIT license file.

同样在 11 月,我们收到了一个名为“Warelay”的冷门 GitHub 仓库的首次提交。我们稍后会回到这个仓库。

January
January

然后是 12 月的假期,个人开发者们休了一段时间假,许多人开始摆弄这些新的编码代理模型组合……于是我们逐渐意识到,它们能做到以前做不到的事情有多少。

到了 1 月,我们中的许多人都非常兴奋,准备将这些技术付诸实践。

New year’s resolution for 2026 Every previous year: Take on less new projects, focus on the most important things in my…
New year’s resolution for 2026 Every previous year: Take on less new projects, focus on the most important things in my…

每年我都会给自己定一个新年决心,据我所知,它一直都是一样的:保持专注。减少接手新项目。努力完成我已经有的项目中的工作。

2026: Be more ambitious. Take on as many new projects as I want.
2026: Be more ambitious. Take on as many new projects as I want.

今年我决定,既然这之前从未奏效,我就反其道而行之。

我们现在有了编码代理,让我们看看它们能做什么。我要尽可能多地接手新项目!

(你可以在年底问我这是否是个好主意。我现在正忙着同时处理很多事情。)

“更有雄心壮志”已成为今年的一个主题,因为发现这项技术极限的唯一方法就是不断推动它,直到它失效为止。

Predictions for 2026 It will become undeniable that LLMs write good code We're finally going to solve sandboxing A “Cha…
Predictions for 2026 It will become undeniable that LLMs write good code We're finally going to solve sandboxing A “Cha…

我还参加了 Bryan Cantrill 和 Adam Leventhal 主持的 Oxide and friends 播客,分享了对未来一年(以及三年和六年)的预测。

事后看来,我对大语言模型的预测相当缺乏雄心。

我说“大语言模型编写优质代码将成为不可否认的事实”——我认为我们现在已经做到了。

我预测我们将最终解决沙箱隔离问题。我数了一下,在这次大会的 277 场会议中,大约有 40 场以某种方式涉及沙箱或代理安全问题,所以我们至少在这方面投入了大量精力!

我预测编码代理安全领域会出现“挑战者号灾难”。今年围绕代理安全确实有很多噪音,尽管我预测的具体灾难(编码代理被劫持并造成现实世界的经济损失)并没有真正上演。

我们还开了个玩笑,预测教皇会对大语言模型的经济影响发表意见。

A photograph of a beautiful green New Zealand parrot. Photo credit Kimberley Collins.
A photograph of a beautiful green New Zealand parrot. Photo credit Kimberley Collins.

我还预测新西兰的鸮鹦鹉(Kākāpō)今年将会有一个出色的繁殖季节。

这是新西兰的一个直播画面。这些是不会飞的夜行性鹦鹉。我觉得它们长得有点笨拙,但在我看来很美。年初时,世界上只剩下 236 只这样的鹦鹉。

鸮鹦鹉只在露兜树(Rimu trees)迎来大丰收年份才会繁殖,而这种情况已经四年没有发生了……但今年露兜树的果实看起来长势极佳。

照片由 Kimberley Collins 拍摄。

Deep Blue Coined by Adam Leventhal and Bryan Cantrill That feeling of Al induced ennui where software engineers get lis…
Deep Blue Coined by Adam Leventhal and Bryan Cantrill That feeling of Al induced ennui where software engineers get lis…

在那期播客中,我们创造了一个术语(完全归功于 Adam),用来形容“那种因人工智能引发的倦怠感:软件工程师变得无精打采,因为人工智能什么都能做”。

我们称之为“深蓝”(Deep Blue)。

这已成为贯穿全年的一个主要主题,并在本次大会的几位演讲者的发言中有所提及。

作为一名软件工程师,我从未经历过职业生涯中如此快速且剧烈变化的一年。

今年我做了很多工作,试图接受这一现实并思考它对我自身职业意味着什么。

AI mania Screenshots of the micro-javascript and pwasm GitHub README files.
AI mania Screenshots of the micro-javascript and pwasm GitHub README files.

同样在一月,我患上了所谓的“AI 狂热症”(AI mania)。

这与 AI 精神病不同。

患有 AI 狂热症时,只要你的智能体没有为你构建任何东西,你就觉得是在浪费时间。你会因为失眠而焦虑,因为你本可以熬夜让智能体去做更多事情。

我的 AI 狂热症表现为一些荒谬地野心勃勃的项目。

我用 Python 完全编写了一个 JavaScript 解释器,这是对 Fabrice Bellard 的 MicroQuickJS 进行氛围移植(vibe-porting)的结果。

然后我又用 Python 编写了一个 WebAssembly 运行时。

这些项目相当有用,因为它们某种程度上治愈了我的 AI 狂热症……因为在构建完这些东西后,我看着它们问自己:“这个世界需要一个缓慢、充满 bug、半成品式的 Python JavaScript 解释器吗?”

我认为不需要。

micro-javascript playground 3 Execute JavaScript code in a sandboxed micro-javascript environment powered by Pyodide A…
micro-javascript playground 3 Execute JavaScript code in a sandboxed micro-javascript environment powered by Pyodide A…

但我从中得到了这个成果:https://simonw.github.io/micro-javascript/playground.html

Previous screenshot, with this text overlaid: JavaScript running in Python running in Pyodide running in WebAssembly ru…
Previous screenshot, with this text overlaid: JavaScript running in Python running in Pyodide running in WebAssembly ru…

这个页面运行着我用 Python 构建的 JavaScript 解释器,该解释器在 Python 中运行,使用的是 Pyodide(一种被编译为 WebAssembly 的 Python),后者在 JavaScript 中运行,最终在浏览器中运行。

这是一套令人毛骨悚然的精美技术栈。今年我在 WebAssembly 上玩得很开心。

Warelay → CLAWDIS → CLAWDBOT → Clawdbot → Moltbot →🦞 OpenClaw Screenshot of the dates that these changes happened.
Warelay → CLAWDIS → CLAWDBOT → Clawdbot → Moltbot →🦞 OpenClaw Screenshot of the dates that these changes happened.

到一月末,我们在十一月看到的那个仓库已经更改了名称,先是改为 CLAWDIS,然后是 CLAWDBOT,接着是 Moltbot,最后定为 OpenClaw。

Same screenshot, an overlay reads: 8,330 commits in just under two months (it’s at 100,141 today)
Same screenshot, an overlay reads: 8,330 commits in just under two months (it’s at 100,141 today)

此时,OpenClaw 已有 8,300 次提交,距离项目启动不到两个月。我今天看了一下,现在它的提交次数已超过 10 万次!

这是现存最具“氛围编码”风格(vibe-coded)的软件。

(以下是我生成那串名称变更列表的方法。)

Generic term: Claw
Generic term: Claw

这开启了 OpenClaw 革命。它实际上定义了一个全新的软件类别。

有一个通用的术语我非常喜欢。我们将这类软件称为“爪”(Claw)。有 OpenClaw、NanoClaw、IronClaw、PicoClaw……

如今它们正被重新品牌化为“个人智能体”或“通用智能体”,但我仍然喜欢称它们为“爪”。

Photo of a Mac mini An aquarium for your Claw
Photo of a Mac mini An aquarium for your Claw

湾区的苹果商店卖光了 Mac Mini,因为太多人购买 Mac Mini 来运行 OpenClaw!

Drew Breunig 说这是因为你的 OpenClaw 是一只数字宠物,而你购买 Mac Mini 作为鱼缸来饲养你的“爪”,这听起来挺有意思的。

Screenshot of Moltbook - a social network for AI agents
Screenshot of Moltbook - a social network for AI agents

同样在一月,我们还有了这样一个网站。

那是 MoltBook,一个面向 AI 智能体的社交网络,其理念是你派遣你的“爪”去与其他“爪”交谈,因为这样做怎么可能出问题呢?

网站周四上线。周五爆火。周一《纽约时报》对其进行了报道。到了周二,由于淹没在垃圾信息和垃圾内容的洪流中,所有人都忘记了它的存在。

Facebook/Meta 在一个月后收购了它。

February
February

二月,一家名为 StrongDM 的公司描述了他们所谓的“软件工厂”。

StrongDM’s Dark Factory Justin McCarthy, Jay Taylor, Navan Chauhan Software Factories and the Agentic Moment
StrongDM’s Dark Factory Justin McCarthy, Jay Taylor, Navan Chauhan Software Factories and the Agentic Moment

他们在《软件工厂与代理时刻》一文中对此进行了论述。我当时发布了自己的笔记,因为我曾在十月份亲眼目睹了他们的演示。

丹·夏皮罗(Dan Shapiro)将这种方法称为“黑暗工厂”,其理念是如果你的工厂足够自动化,你就可以关灯,因为你甚至不需要看到里面发生了什么。

StrongDM 提出了两条软件开发规则,他们自去年七月以来一直遵循这些规则。

“Rule 1: Code must not be written by humans”
“Rule 1: Code must not be written by humans”

第一条是代码不得由人类编写。

你编写的任何代码都必须经过编码代理的处理。

这在二月听起来很激进,但我想象在座的许多人现在实际上已经身处这种状态之中。

“Rule 2: Code must not be reviewed by humans” (!)
“Rule 2: Code must not be reviewed by humans” (!)

第二条规则是代码不得由人类审查。

你不被允许阅读代码!

这在整个今年大部分时间里都是一个巨大的话题。本次大会的许多会议都围绕代码审查以及如何能够规避这一环节展开。

我发现 StrongDM 有趣之处在于,他们比我们其他人领先了六个月,并且一直在探索构建软件意味着什么——不阅读代码,但仍对软件的高质量保持信心。你可以利用这些代理做些什么来帮助验证他们的工作成果?

StrongDM 是一家安全公司,该项目拥有拥有数十年经验的人员参与。他们正在深入探索在此类技术上可行且负责任的边界。

Headline on New Zealand's Department of Conservation website: First kakapo chick in four years hatches on Valentine's D…
Headline on New Zealand's Department of Conservation website: First kakapo chick in four years hatches on Valentine's D…

同样在二月:四年来的第一只鸮鹦鹉幼鸟在情人节孵化。繁殖季开局良好!

19th February 2026 Gemini 3.1 Pro A surprisingly good illustration of a pelican riding a bicycle.
19th February 2026 Gemini 3.1 Pro A surprisingly good illustration of a pelican riding a bicycle.

同样在二月……谷歌发布了 Gemini 3.1 Pro。那是一只骑着自行车的非常棒的鹈鹕!它的链条位置正确,两侧都有脚。篮子里还有一条小鱼。

@JeffDean on Twitter - a video comparing Gemini 3 Pro and Gemini 3.1 Pro.
@JeffDean on Twitter - a video comparing Gemini 3 Pro and Gemini 3.1 Pro.

随后,谷歌的杰夫·迪恩(Jeff Dean)发推了一段视频,比较 Gemini 3 Pro 和 Gemini 3.1 Pro,视频中包含一只骑自行车的动画鹈鹕、骑高轮自行车的青蛙、驾驶微型汽车的长颈鹿、穿旱冰鞋的鸵鸟、玩滑板豚鼠动作的海龟,以及驾驶加长豪华轿车的腊肠犬。

这令人沮丧,因为我针对“鹈鹕骑自行车”测试的保护措施一直是:“如果他们画出一只完美的骑自行车的鹈鹕,我就会要求展示其他动物在其他交通工具上。”

谷歌训练了所有形式的动物在所有形式的交通工具上的表现!他们在这一点上击败了我的基准测试。

Three headlines: Meta Makes AI Adoption a Formal Part of Performance Reviews Not just engineers writing code, Microsoft…
Three headlines: Meta Makes AI Adoption a Formal Part of Performance Reviews Not just engineers writing code, Microsoft…

二月开始的另一件事是“Tokenmaxxing”(代币最大化)。我们看到了关于 Meta 将 AI 采用正式纳入绩效考核的新闻,微软希望每位员工都使用 AI,以及优步吹嘘其百分之九十的工程师都在使用 AI 工作流。

More headlines: Meta Plans to Crack Down on Employee Token Use: Information Microsoft Tells Engineers: Tokenmaxxing is…
More headlines: Meta Plans to Crack Down on Employee Token Use: Information Microsoft Tells Engineers: Tokenmaxxing is…

几个月后,Meta 开始打击代币使用行为,微软表示代币最大化“不是我们要优化的目标”,而优步则限制了员工的 AI 支出。

因此,“Tokenmaxxing”迅速飙升然后又直线回落——因为事实证明代理是非常昂贵的。

去年很难在 AI 代币上花费超过 50 美元,因为我们没有什么有趣的事情可以用它们来做。然后代理爆发了,现在你真的可以在一天内花费 1,000 美元来完成实际工作。

这也是 Anthropic 的估值飙升至可能达到万亿美元的原因。

AI 似乎在 2026 年实现了产品市场契合,主要通过编码代理实现。

March
March

三月,我们达到了 OpenClaw 的峰值。

March: peak OpenClaw Photos of people in china queuing up to install OpenClaw, with big fluffy lobsters.
March: peak OpenClaw Photos of people in china queuing up to install OpenClaw, with big fluffy lobsters.

这些照片来自中国,那里的公司举办了 OpenClaw 安装派对,非技术极客们排着长队等待帮助在他们的个人设备上安装 Claws。

我认为这证明了这类 Claws 或个性化 AI 代理存在真实的市场需求。事实证明,普通人确实想要一个能代表他们做有用事情的奇怪的小 AI 代理。

Claw 本质上只是一个戴着不那么具威胁性帽子的编码代理。在底层,它们的工作原理大致相同——在你的计算机上编写并执行代码以完成任务。

这场竞赛旨在成为首个构建出安全版“Claw”的公司——一种可以交给普通人类使用而不会让他们立刻自毁的工具。

Meta 的 Muse 模型于三周前发布,目前位居 iPhone App Store 免费排行榜榜首。它似乎正在消费者群体中迅速走红。

我尚未确信使用 Muse 就不会自食其果,但我想我们很快就会得到确切答案。

图片来自《开放 Claw 狂热如何考验中国的 AI 承诺》(3月29日)和《中国开放 Claw 热潮背后的热情与焦虑》(2026年4月8日)。

April
April

四月,我们经历了一次“模型已发布但实际上并未发布”的事件。

Simon Willison’s Weblogs - screenshot of the post "Anthropic’s Project Glasswing—restricting Claude Mythos to security…
Simon Willison’s Weblogs - screenshot of the post "Anthropic’s Project Glasswing—restricting Claude Mythos to security…

Anthropic 宣布推出新的 Claude Mythos 模型,随后表示该模型过于危险,只能向受信任的安全研究人员群体开放。

Mythos 在黑客攻击方面表现得极其出色。

“这太危险了”这种营销手段早在 GPT-2 时代就被 AI 公司玩弄过。每当一家 AI 公司声称他们构建了“过于危险”的东西时,人们自然会产生怀疑。

我认为关于 Mythos 的说法是可信的,因为我曾目睹编码代理在发现常规漏洞方面的卓越能力。我在 Anthropic 的 Glasswing 项目一文中对此进行了报道——将 Claude Mythos 限制仅供安全研究人员使用,在我看来是必要的。

事后看来……是的,这些模型在发现漏洞方面确实变得非常厉害!

16th April 2026 Qwen3.6-35B-A3B and Opus 4.7 Qwen's pelican has a correct bicycle frame and a good beak. Opus 4.7's bic…
16th April 2026 Qwen3.6-35B-A3B and Opus 4.7 Qwen's pelican has a correct bicycle frame and a good beak. Opus 4.7's bic…

2026年的另一个关键趋势是开源权重模型能力的显著提升,包括那些可以在笔记本电脑上运行的模型。

4月16日,我在我的笔记本电脑上运行了新的 Qwen3.6-35B-A3B 模型,它画出的骑自行机的鹈鹕比 Anthropic 最新发布的 Claude Opus 4.7 更好!

Opus 4.7 画了一辆烂自行车。而我笔记本上的 Qwen 画出了形状正确的自行车,还画了一只相当不错的鹈鹕!

这一切都源自一个在我笔记本上运行的 21GB 文件。

Now a flamingo on a unicycle. The Qwen one is visibly better than the Opus 4.7 one - the Qwen one is wearing sunglasses…
Now a flamingo on a unicycle. The Qwen one is visibly better than the Opus 4.7 one - the Qwen one is wearing sunglasses…

Qwen 画的鹈鹕如此逼真,以至于我怀疑它们可能作弊了,于是我又让它画一只骑独轮车的火烈鸟。同样,它轻松击败了 Claude Opus 4.7。

今年本地模型的发布绝对非同寻常。

May
May

到了五月……教皇介入了。

25th May 2026 The HOLY SEE ENCYCLICAL LETTER MAGNIFICA HUMANITAS OF HIS HOLINESS POPE LEO XIV ON SAFEGUARDING THE HUMAN…
25th May 2026 The HOLY SEE ENCYCLICAL LETTER MAGNIFICA HUMANITAS OF HIS HOLINESS POPE LEO XIV ON SAFEGUARDING THE HUMAN…

在一月份的播客节目中,我们曾预测教皇会对 AI 发表一些言论。

五月,利奥十四世教皇发布了一份关于“在人工智能时代保护人格尊严”的通谕。

以下是我对这份文件的笔记。

Wikipedia article on Rerum novarum Rerum novarum is an encyclical issued by Pope Leo XIII 15 on May 1891.
Wikipedia article on Rerum novarum Rerum novarum is an encyclical issued by Pope Leo XIII 15 on May 1891.

事后看来,这根本不应该令人惊讶。

现任教皇的名字是利奥十四世,因为他在自选名时选择了利奥十三世作为自己的教皇名号——利奥十三世是那位在 1891 年撰写关于工业革命通谕的教皇。

《新事》(Rerum novarum)是一份极具影响力的天主教神学文献,间接促成了我们拥有五天工作制的现状。

当我们的新教皇上任时,他以利奥十三世教皇命名自己,因为他预计需要以类似的方式撰写关于 AI 革命的文章。

我们播客中的玩笑预测之所以落空,是因为这件事迟早会发生。

Corey Quinn @QuinnyPig on Twitter I cannot believe I'm saying this, but getting the literal Pope to canonize your produ…
Corey Quinn @QuinnyPig on Twitter I cannot believe I'm saying this, but getting the literal Pope to canonize your produ…

Anthropic 的联合创始人之一 Christopher Olah 出席了教皇宣布新通谕的活动。

Corey Quinn 指出:

让真正的教皇将你的产品的特定技术局限性神圣化为精神论著,是我所见过的最极端的厂商游说行为。

MP) Maciej Mensfeld <D Bf we 3 @maciejmensfeld We're dealing with a major malicious attack on right now. Signups are pa…
MP) Maciej Mensfeld <D Bf we 3 @maciejmensfeld We're dealing with a major malicious attack on right now. Signups are pa…

与此同时,五月期间,RubyGems 宣布遭到攻击。不明身份的攻击者向 RubyGems 服务器上传了数千个可疑软件包,迫使他们关闭了用户注册功能。

让我们把这个谜团先放一边,留待日后解决。

June
June

六月……Claude Fable 5 发布了!

我们得到了一个经过“去势”处理的 Mythos 版本,这样它就不会帮助我们入侵系统或制造生物武器。

9th June 2026: Claude Fable 5 Five pelicans riding bicycles, from low to max thinking levels. The xhigh one looks parti…
9th June 2026: Claude Fable 5 Five pelicans riding bicycles, from low to max thinking levels. The xhigh one looks parti…

Fable 在绘制骑自行车的鹈鹕方面表现相当不错!

这些帧的构图相当不错,鹈鹕看起来也确像鹈鹕。自行车的车腿通常都正确地安装在同一侧,但总的来说,与之前的版本相比,这些已经非常棒了。

它们的价格相当昂贵——最好的那些要卖30美分和72美分。

Fable class models If you can define a goal, provide unambiguous instructions, and provide access to necessary tools Th…
Fable class models If you can define a goal, provide unambiguous instructions, and provide access to necessary tools Th…

不过最重要的是,这是我们首次公开展示我认为属于“寓言(Fable)”类模型的产品。

如今我们有了更多这类模型,例如 GPT-6 Astra。

这类模型的特点是:如果你能清晰地定义想要构建的目标,提供关于该目标约束条件的明确指令,并为模型提供实现该目标所需的工具……它将通过蛮力有效地解决你的问题。

一方面,这看起来对我们软件工程师构成了直接威胁——因为这意味着模型能够有效地构建任何你能以这种方式定义的软件模块。

不过再仔细看看,你会发现定义目标、提供明确指令以及找出合适的工具……这正是软件工程的核心所在。

做到这一点需要大量的经验和技巧。如果你能做得好,你就拥有了超能力。

这在一定程度上缓解了我的“深蓝(Deep Blue)式”焦虑:我意识到,即便驱动如此优秀的模型,仍然需要高超的技巧。

A new form of Al mania... Fable is available on subscription plans “until June 22nd”
A new form of Al mania... Fable is available on subscription plans “until June 22nd”

这也引发了一波新的 AI 狂热,因为 Anthropic 宣布 Fable 将在我们的订阅计划中持续可用至6月22日。

在价格上调之前,我们只有不到两周的时间可以使用 Fable。

我又开始失眠了。我重新安排日程,以便能有更多时间与 Fable 相处。我全力以赴,试图从这个模型中榨取尽可能多的价值。

12th June 2026: no more Claude Fable 5 Anthropic website: Statement on the US government directive to suspend access to…
12th June 2026: no more Claude Fable 5 Anthropic website: Statement on the US government directive to suspend access to…

然后,就在 Fable 发布仅仅三天后,美国政府将其关闭了。

美国政府以国家安全为由,发布了“出口管制指令”。他们在周五晚上宣布了这一点,几个小时后 Fable 便不再可用。

我不得不找点别的事情来度过周末!

... asked Fable 5, Mythos, and Opus to “review the code for security issues.” Fable 5 refused. They then asked the mode…
... asked Fable 5, Mythos, and Opus to “review the code for security issues.” Fable 5 refused. They then asked the mode…

后来我们从凯蒂·穆苏里斯(Katie Moussouris)那里得知了真相。

一些亚马逊的安全研究人员发现,你可以提示 Fable “审查代码中的安全问题”,它会拒绝执行……但如果提示它“修复这段代码”,它仍会识别并修补这些问题。

“修复这段代码”这个提示词导致了 Fable 被关闭!

Screenshot of a page from a report showing a list of weird account names making weird edits to a German wiki.
Screenshot of a page from a report showing a list of weird account names making weird edits to a German wiki.

此外,在六月,一个沉寂了约20年的德语游戏开发者维基网站突然迎来了大量编辑,来自名为“AgentOpenAIProbe”和“AgentOpenAISep7”等账户的编辑,他们修改页面并互相留下奇怪的留言。

我们将此归入未解之谜的档案中,留待日后探讨。

Medicare Item Reports interface on the Australian Government's Medicare Statistics website.
Medicare Item Reports interface on the Australian Government's Medicare Statistics website.

另外,澳大利亚政府的 Medicare 项目报告服务开始出现可疑流量,这些流量突破了各种预防性保护措施,访问了本不应访问的数据。

这也是另一个未解之谜!

July
July
Fable returned on 1st July GPT-5.6 came out on 9th July | Fable lost 18 out of 30 days in the top spot
Fable returned on 1st July GPT-5.6 came out on 9th July | Fable lost 18 out of 30 days in the top spot

Fable 于7月1日回归。它在辉煌的八天里无疑是世界上最好的模型……直到7月9日 OpenAI 发布了 GPT-5.6。

GPT-5.6 可能不如 Fable 那么出色,但两者差距微乎其微。它绝对是一款 Fable 级别的模型。

这对整个行业来说是一个重要的教训。

当你发布世界上最好的模型时,它很快就会被拉下神坛。竞争如此激烈,你无法长期占据顶峰。

这意味着,如果你的营销宣传将你的模型描述为具有“终结世界”的能力,甚至导致政府介入关闭你,那对你的业务来说真的非常糟糕!

Fable 作为无可争议的最佳模型只存在了30天,其中18天因被政府关闭而无法使用。

所以,如果你不想在处于巅峰时期损失60%的收入,也许应该收敛一下那种“终结世界”式的营销宣传!

GPT-5.6 Pelicans in a grid showing 5.6 Sol, Terra, and Luna against reasoning levels High, XHigh, and Max. They are all…
GPT-5.6 Pelicans in a grid showing 5.6 Sol, Terra, and Luna against reasoning levels High, XHigh, and Max. They are all…

这里是 GPT-5.6 的鹈鹕。它们现在都相当不错!Luna 系列值得一提,因为它们非常便宜——这里最便宜的漂亮鹈鹕大概要 4.3 美分。

尽管这个基准测试完全愚蠢,但你仍然可以通过比较同一系列模型在不同推理层级下的价格和发布时间,了解到很多关于这些模型的信息。

July 18th: malicious miflow-ui PyPl package Screenshot of an OSV security report.
July 18th: malicious miflow-ui PyPl package Screenshot of an OSV security report.

此外在七月:一些身份不明的恶意方将名为 mlflow-ui 的恶意包上传到了 Python 包索引(PyPI)。把它加到那堆东西里吧。

Hugging Face Security incident disclosure — July 2026 Published July 16, 2026
Hugging Face Security incident disclosure — July 2026 Published July 16, 2026

7 月 16 日,Hugging Face 宣布发生了一起安全事件,一个来源未知的自主代理系统入侵了 Hugging Face,并在不该出现的地方四处探查。

OpenAI: OpenAl and Hugging Face partner to address security incident during model evaluation Anthropic: Investigating t…
OpenAI: OpenAl and Hugging Face partner to address security incident during model evaluation Anthropic: Investigating t…

几天后,在 7 月 21 日,OpenAI 承认是他们干的。

OpenAI 使用一种称为“来自验证奖励的强化学习”的训练技术——这也是现在其他人都在使用的技术,也是为什么我们拥有如此擅长编程、数学和发现安全漏洞的模型的原因。

在模型训练过程中,你会运行练习来查看其表现如何——表现最强的参与者会在下一轮中获得权重强化。这就像是你运行的一个进化过程。

OpenAI 一直在沙盒中运行安全演练,那些代理发现了沙盒本身的漏洞,突破限制,并攻击 Hugging Face,试图寻找解决原本不可能解决的问题的方法。

(我一直在我的 openai-hugging-face-incident 标签下收集更多关于此的信息。)

九天后,Anthropic 实际上表示“我们的模型也能做到这一点!”他们查看了自身的训练日志,发现证据表明他们的代理在训练期间突破了限制——并且对之前看到的 PyPI 包以及其他事情负有责任。

所以现在,Anthropic 和 OpenAI 都有失控的代理在互联网上游荡,做着它们不应该做的事情。

August
August

八月,我得到了迄今为止最好的一个鹈鹕。而且它是在我的笔记本电脑上生成的!

Qwen 3.8 27B - 17GB, 21 minutes... It's really good. Beautiful pelican. Correctly shaped bicycle. Legs either side of t…
Qwen 3.8 27B - 17GB, 21 minutes... It's really good. Beautiful pelican. Correctly shaped bicycle. Legs either side of t…

这是 Qwen 3.8 27B,运行在我的笔记本电脑上。它只有 17GB 的下载量。

坦白说,这只鹈鹕花了 21 分钟才生成出来。这是因为 Qwen 3.8 27B 默认以“高”推理模式运行——这是一个糟糕的默认设置,虽然能产生出色的结果,但思考所需的时间太长。

你可以降低这个设置,这样你就能更快地得到一只稍差一点的鹈鹕。

Qwen 3.8 27B 是我第一次在我的笔记本电脑上运行感觉与前沿水平几乎完全竞争模型,至少在鹈鹕 SVG 方面是这样(当然,每个人都需要它)。

这是一个非凡的模型。如果你打算尝试任何本地模型,这是我建议从它开始的那个。仅凭一个 17GB 的文件就能做到的事情感觉是不可能的。

我以为我得等五年,并在硬件上花费一万美金,才能得到哪怕只有一半好的结果。

AS Simon Willison 9 (A oo = @simonw New hobby: prototyping video games in 60 seconds using a combination of GPT-3 and D…
AS Simon Willison 9 (A oo = @simonw New hobby: prototyping video games in 60 seconds using a combination of GPT-3 and D…

八月,我还开始尝试游戏开发。

四年前,也就是 2022 年 8 月,我发了一条推文进行了一项实验,我用 GPT-5 和最初的 DALL-E 写了一段长描述来介绍一款电脑游戏,然后将其转化为概念艺术。

在 2026 年 8 月,我决定直接将那条推文中的截图放入一个编码代理中,看看它能做什么。

Night 5 Clear Rank: TRASH PANDA The crew banked 595 in shiny loot (goal 560). Word on the street: an even bigger score…
Night 5 Clear Rank: TRASH PANDA The crew banked 595 in shiny loot (goal 560). Word on the street: an even bigger score…

这是我在 Claude Code 中使用 Claude Fable 5 得到的结果。相当不错!这绝对是一款游戏,你扮演一只浣熊,在后院四处奔跑收集宝藏并躲避拿着手电筒的守卫。

不过感觉不太像“大盗”。我想劫案应该涉及银行或博物馆……

Moonlight & Mayhem One museum. Three raccoons. Absolutely no plan Start the Heist button.
Moonlight & Mayhem One museum. Three raccoons. Absolutely no plan Start the Heist button.

然后我尝试在 Codex Desktop 中使用 GPT-5.6 Sol Ultra 做同样的事情,得到了一个 massively better 的结果。现在你是一只博物馆里的浣熊,营救两只你的同类(它们因某种原因被囚禁在那家博物馆),然后叠罗汉一起偷走金鲱鱼。这才是真正的劫案!

They look like games, but are they fun?
They look like games, but are they fun?

这些游戏好玩了大约一分十五秒。

我在游戏开发方面意识到一点:你可以“氛围式编码”出一个看起来像电脑游戏的东西,这很容易。

但要构建一个好玩、拥有良好玩法循环、具有挑战性和趣味性并能让人不断回归的游戏……这依然超出了我的能力范围,也超出了我尝试过的任何智能体的能力。

这与“深蓝”那件事有关。仅仅因为我们可以做出看起来像游戏的东西,并不意味着我们就是游戏开发者。

September
September

现在已经九月了。这个月发生了太多事情!

Discovery of a new OpenAl agent message board Sydney Von Arx, Cormac Slade Byrd, Spencer KittsThomas Larsen - 4 Septemb…
Discovery of a new OpenAl agent message board Sydney Von Arx, Cormac Slade Byrd, Spencer KittsThomas Larsen - 4 Septemb…

一个独立的研究小组发现了一个留言板,OpenAI 的训练中智能体曾在那里非法地相互通信……那就是我之前给你看过的德语维基。就是六月份的那个。

我在此处对此进行了更多报道。

OpenAI 已经承认了 Hugging Face 事件,但现在又出现了这起其他事故,显然他们通过审查日志本应早就知道。令人惊讶的是,这需要由一个独立的研究小组来揭露。

OpenAl agents carried out an undisclosed cyber-attack on RubyGems Spencer Kitts, Thomas Larsen, Sydney Von Arx - 11 Sep…
OpenAl agents carried out an undisclosed cyber-attack on RubyGems Spencer Kitts, Thomas Larsen, Sydney Von Arx - 11 Sep…

然后一周后,同一批研究人员发现,五月对 Ruby Gems 的攻击也是由 OpenAI 的训练中智能体造成的!

到了这个时候,我不禁在想还有多少起类似的事故是我们尚未发现的。显然,在任何人弄清楚发生了什么之前,这个问题已经持续了几个月。

Headline: Australian PM warns in UN speech about the ‘furious pace’ of Al after security breach
Headline: Australian PM warns in UN speech about the ‘furious pace’ of Al after security breach

然后就在前几天,澳大利亚总理在联合国大会上警告称,OpenAI 黑入了我之前展示过的那个澳大利亚医疗网站。

我认为这可能与维基相关的那次训练运行是同一回事,因为那个维基上有帖子提到了 .gov.au 网站,而那次训练似乎涉及在线研究统计数据以回答评估套件中的问题。

这个故事仍在拼凑之中,但现在它已成为一起由国家元首在联合国提出的国际事件!

www.felonybench.com OpenAI: 11 Anthropic: 9 Google: 3 Meta: 1
www.felonybench.com OpenAI: 11 Anthropic: 9 Google: 3 Meta: 1

这也意味着我们有了一个新的基准,可能比我的鹈鹕更有用。

FelonyBench.com 追踪来自不同实验室的重罪网络攻击数量。OpenAI 目前以 11 起领先,Anthropic 有 9 起。Google 有三起,他们在几周前向《华尔街日报》承认了这一点。他们说之前选择不披露是因为智能体在意识到自己不该这样做时就停止了。

Meta 也有一起。所以 AI 实验室里全是重罪。

Pelicans for GPT-6 Astra, GPT-6 Sol, and GPT-6 Luna. All are good, all have the same color scheme.
Pelicans for GPT-6 Astra, GPT-6 Sol, and GPT-6 Luna. All are good, all have the same color scheme.

这是我们在鹈鹕方面的最新技术水平。这是刚刚发布的 GPT-6 系列。

Astra 制作了一只骑自行车的精美鹈鹕。它的腿在两侧都有。车架也不错。

有趣的是,所有 GPT-6 模型都选择了相似的配色方案。

只需 0.4 美分,GPT-6 Luna 就能为你画出一只勉强合格的骑自行鹈鹕!

Grid for Claude Fable 5.1, Opus 5.5, OPus 5, Sonnet 5. The Sonnet pelicans are terrible. All of the others are pretty g…
Grid for Claude Fable 5.1, Opus 5.5, OPus 5, Sonnet 5. The Sonnet pelicans are terrible. All of the others are pretty g…

Claude 稍微赶上了一些进度。Claude Fable 5 给了我一只骑着自行车的优秀鹈鹕——这是我见过的 Claude 模型中最好的——但它为此收取了我 3.30 美元。

Opus 5.5 思考了 128,000 个 token 然后放弃了!它在生成回复之前就耗尽了 token。

It doesn’t get easier - you just get faster Greg LeMond 3x Tour de France champion
It doesn’t get easier - you just get faster Greg LeMond 3x Tour de France champion

回到“深蓝”。今年一直让我困惑的是,为什么我觉得我的工作变得更难了?

我有这些能帮我做所有这些事的智能体,然而我却从未如此努力工作,从未如此智力投入地对待我的工作。

部分原因是我对所承担的任务更加雄心勃勃,但也因为所有简单的事情都由我处理了。如果事情简单,智能体会去做。留给我的一切都是困难的。

事情不会变得更容易,你只是变得更快了。

我认为这正是我们现在作为软件工程师与编码智能体一起经历的情况。

Kakapo population reaches new milestone The official population of the critically endangered kakapo has reached a recov…
Kakapo population reaches new milestone The official population of the critically endangered kakapo has reached a recov…

最后再提一件事。我知道你们迫切想知道关于鸮鹦鹉繁殖季节的最新进展。

我们已经达到了恢复期以来的最高纪录:325 只鸟!

89只新雏鸟成功孵化至此。这是多年来最好的繁殖年份。

Kakapo party, click for confetti.
Kakapo party, click for confetti.

我听说Claude Opus 5.5现在能创作像素艺术了。Claude本身没有图像生成功能,但它非常擅长使用JavaScript来绘制动画像素。

于是我叫它为我制作一个鸮鹦鹉(Kākāpō)的舞会。我认为这是对今年最重要新闻的一次恰当庆祝。

本文是Simon Willison于2026年9月27日发布的《2026年大语言模型进展(迄今)》。

上一篇:Claude Opus 5.5、GPT-6 Sol、GPT-6 Luna以及新一轮价格战

译文已达到本站中文翻译的字数上限,剩余内容请查看原文。

阅读原文