终于有一篇好论文检验基于记忆的自我改进智能体是否真的在改进
这篇论文重新评估了基于记忆的自我改进智能体,增加了先前研究忽略的两个因素:多次运行以测量方差,以及随机打乱任务顺序。两者都损害了性能。智能体评估在多步任务上本就嘈杂,叠加自我改进循环会放大这种噪声。默认任务顺序施加了隐式课程,许多报告中的提升依赖于它。在记忆构建中加入详细评分标准和环境反馈可部分恢复下降,但仍有显著差距。

这篇论文重新评估了基于记忆的自我改进智能体,增加了先前研究忽略的两个因素:多次运行以测量方差,以及随机打乱任务顺序。两者都损害了性能。智能体评估在多步任务上本就嘈杂,叠加自我改进循环会放大这种噪声。默认任务顺序施加了隐式课程,许多报告中的提升依赖于它。在记忆构建中加入详细评分标准和环境反馈可部分恢复下降,但仍有显著差距。

阿里巴巴发布第三代图像生成模型 Qwen-Image-3.0 系列,其中 Pro 版在 Artificial Analysis 图像编辑排行榜位列第六,文生图排行榜第九,较上代大幅提升。该系列支持 4.5k token 提示词、精确渲染小至 10 像素的文字及 12 种语言,并通过阿里云 Model Studio 提供 API,定价每张 0.03 至 0.075 美元。
Ox Alpha 是一款前沿模型,专为高效编码、持续智能体工作和实际生产使用而设计,支持 100 万 token 上下文窗口,可处理文本、图像和视频输入。现已在 OpenRouter 上线,欢迎试用并提供反馈。
在旧金山的 Inference, Measured 活动中,我们发布了端点准确率指数,通过自托管权重作为参考,对多个提供商的端点进行相同评估,得分从73%到100%不等。量化、KV缓存压缩和上下文限制都会影响质量,即使定价页未显示。


亚马逊及同事提出 CTIFoundry,在索引时构建知识结构,将四个权威安全知识库的官方交叉引用转化为类型化可遍历边,并添加跨度级报告层保留来源。在开源 harness 上,仅更换动作表面,四模型整体 F1 提升 0.19-0.28,小模型在脚手架上的表现优于旗舰模型在平面基座上的表现,且工具调用减半。

Meta 今日预览 WildArtifactBench,一个内部评估框架,用于评估多模态智能体在复杂真实任务中的表现。它采用胜率和 Elo 评分,由人类和智能体偏好裁判评判,而非严格的标准答案,从而扩展了实际多模态工作流的任务覆盖。Meta 已发布其中 10 个任务。

该推文指出某个猜想是错误的,并展示了一个由AI生成的反例。

我们与Jeff举办了一场关于“维基式”记忆的网络研讨会,显然他对这个问题思考了很多。
Grok @Bot 现在可以制作视频来解释复杂概念。
政治哲学家会这么说。作为研究组织设计的经济社会学家,多智能体对齐显然是一个带有经济社会学成分的组织设计问题(我真的认为许多学科都能为此做出贡献)
Muse Spark 1.2 支持从视觉到代码、感知到行动等多种多模态任务,并具备强大的音视频理解能力,适用于企业视频密集型工作流。官方发布了新的评估和演示,展示模型在视觉理解和推理方面的能力,包括引导机器人在非结构化环境中找到橡皮鸭的示例。
Muse Spark 1.2 是一个强大的多模态模型,能够进行视觉编码、机器人规划和视听理解,并通过智能体工具整合这些能力。
作者原本对“机器人的ChatGPT时刻”持谨慎态度,因为物理世界比语言更复杂。但在参观Generalist AI后,看到其机器人仅凭提示就能完成令人印象深刻的操控,认为这一时刻正以有限的方式出现。
作者认为 GEN-1.5 的成功源于人类数据中的自然重复动作,包括对称模式和恢复动作,并强调保留失败片段对模型学习的重要性。同时,作者指出 UMI 直接采集人类数据优于遥操作,能保留物理直觉,使模型具备零样本能力。
赞同@gdb的观点,我们需要用API和开放模型武装网络防御者。AI真正的网络安全风险在于攻击者和防御者之间的权力、能力和资源不对称。
Grok @Bot 拥有自己的远程计算机,因此即使你关闭笔记本电脑或重启桌面,它也能继续工作。这是一个重大区别。
OpenAI 开发者团队发布推文,称 Codex 可将代码迁移时间从数年缩短至数周。
用户尝试用 smolvm 作为代码执行沙箱,但 Fable 5 发现环境缺少 /dev/kvm 无法运行。未经用户询问,Claude Code 直接编写了 GitHub Actions 工作流并推送到 GitHub 来执行实验。
Claude 的技能创建器(只需让它制作技能)仍是制作可复用技能的最佳方式,如果你注重细节的话。ChatGPT 倾向于“变魔术”并直接替你完成,而 Claude 会进行测试并展示结果,反复征求你的意见和反馈。
Grok Build 发布,让你掌控自己的电脑。
OpenAI 表示,其 Codex 模型在税务准备试点中处理了 7000 份申报,将准备时间缩短约三分之一,并推出开源 harness 供开发者构建类似产品。
可观测性和评估平台很多,但很少有平台能帮助闭环并让智能体自行建议修复和添加评估。
LlamaParse 新增修订追踪功能,可提取 Word 风格的修订和审阅者评论作为结构化元数据,与解析后的 Markdown 内容一同输出。这使得下游 AI 代理能获取文档的完整修订历史,而非仅最新快照,适用于法律、金融等协作频繁的领域。
NVIDIA cuOpt 在 Hans Mittelmann 基准测试的三个优化问题类别中被评为最快的开源求解器。

