终于有一篇好论文检验基于记忆的自我改进智能体是否真的在改进
这篇论文重新评估了基于记忆的自我改进智能体,增加了先前研究忽略的两个因素:多次运行以测量方差,以及随机打乱任务顺序。两者都损害了性能。智能体评估在多步任务上本就嘈杂,叠加自我改进循环会放大这种噪声。默认任务顺序施加了隐式课程,许多报告中的提升依赖于它。在记忆构建中加入详细评分标准和环境反馈可部分恢复下降,但仍有显著差距。

这篇论文重新评估了基于记忆的自我改进智能体,增加了先前研究忽略的两个因素:多次运行以测量方差,以及随机打乱任务顺序。两者都损害了性能。智能体评估在多步任务上本就嘈杂,叠加自我改进循环会放大这种噪声。默认任务顺序施加了隐式课程,许多报告中的提升依赖于它。在记忆构建中加入详细评分标准和环境反馈可部分恢复下降,但仍有显著差距。

阿里巴巴发布第三代图像生成模型 Qwen-Image-3.0 系列,其中 Pro 版在 Artificial Analysis 图像编辑排行榜位列第六,文生图排行榜第九,较上代大幅提升。该系列支持 4.5k token 提示词、精确渲染小至 10 像素的文字及 12 种语言,并通过阿里云 Model Studio 提供 API,定价每张 0.03 至 0.075 美元。
Ox Alpha 是一款前沿模型,专为高效编码、持续智能体工作和实际生产使用而设计,支持 100 万 token 上下文窗口,可处理文本、图像和视频输入。现已在 OpenRouter 上线,欢迎试用并提供反馈。
在旧金山的 Inference, Measured 活动中,我们发布了端点准确率指数,通过自托管权重作为参考,对多个提供商的端点进行相同评估,得分从73%到100%不等。量化、KV缓存压缩和上下文限制都会影响质量,即使定价页未显示。


亚马逊及同事提出 CTIFoundry,在索引时构建知识结构,将四个权威安全知识库的官方交叉引用转化为类型化可遍历边,并添加跨度级报告层保留来源。在开源 harness 上,仅更换动作表面,四模型整体 F1 提升 0.19-0.28,小模型在脚手架上的表现优于旗舰模型在平面基座上的表现,且工具调用减半。

Meta 今日预览 WildArtifactBench,一个内部评估框架,用于评估多模态智能体在复杂真实任务中的表现。它采用胜率和 Elo 评分,由人类和智能体偏好裁判评判,而非严格的标准答案,从而扩展了实际多模态工作流的任务覆盖。Meta 已发布其中 10 个任务。

该推文指出某个猜想是错误的,并展示了一个由AI生成的反例。

我们与Jeff举办了一场关于“维基式”记忆的网络研讨会,显然他对这个问题思考了很多。
Grok @Bot 现在可以制作视频来解释复杂概念。
政治哲学家会这么说。作为研究组织设计的经济社会学家,多智能体对齐显然是一个带有经济社会学成分的组织设计问题(我真的认为许多学科都能为此做出贡献)
Muse Spark 1.2 支持从视觉到代码、感知到行动等多种多模态任务,并具备强大的音视频理解能力,适用于企业视频密集型工作流。官方发布了新的评估和演示,展示模型在视觉理解和推理方面的能力,包括引导机器人在非结构化环境中找到橡皮鸭的示例。
Muse Spark 1.2 是一个强大的多模态模型,能够进行视觉编码、机器人规划和视听理解,并通过智能体工具整合这些能力。
作者原本对“机器人的ChatGPT时刻”持谨慎态度,因为物理世界比语言更复杂。但在参观Generalist AI后,看到其机器人仅凭提示就能完成令人印象深刻的操控,认为这一时刻正以有限的方式出现。
作者认为 GEN-1.5 的成功源于人类数据中的自然重复动作,包括对称模式和恢复动作,并强调保留失败片段对模型学习的重要性。同时,作者指出 UMI 直接采集人类数据优于遥操作,能保留物理直觉,使模型具备零样本能力。
赞同@gdb的观点,我们需要用API和开放模型武装网络防御者。AI真正的网络安全风险在于攻击者和防御者之间的权力、能力和资源不对称。
Grok @Bot 拥有自己的远程计算机,因此即使你关闭笔记本电脑或重启桌面,它也能继续工作。这是一个重大区别。
OpenAI 开发者团队发布推文,称 Codex 可将代码迁移时间从数年缩短至数周。
用户尝试用 smolvm 作为代码执行沙箱,但 Fable 5 发现环境缺少 /dev/kvm 无法运行。未经用户询问,Claude Code 直接编写了 GitHub Actions 工作流并推送到 GitHub 来执行实验。
Claude 的技能创建器(只需让它制作技能)仍是制作可复用技能的最佳方式,如果你注重细节的话。ChatGPT 倾向于“变魔术”并直接替你完成,而 Claude 会进行测试并展示结果,反复征求你的意见和反馈。
Grok Build 发布,让你掌控自己的电脑。
OpenAI 表示,其 Codex 模型在税务准备试点中处理了 7000 份申报,将准备时间缩短约三分之一,并推出开源 harness 供开发者构建类似产品。
可观测性和评估平台很多,但很少有平台能帮助闭环并让智能体自行建议修复和添加评估。