终于有一篇好论文检验基于记忆的自我改进智能体是否真的在改进
这篇论文重新评估了基于记忆的自我改进智能体,增加了先前研究忽略的两个因素:多次运行以测量方差,以及随机打乱任务顺序。两者都损害了性能。智能体评估在多步任务上本就嘈杂,叠加自我改进循环会放大这种噪声。默认任务顺序施加了隐式课程,许多报告中的提升依赖于它。在记忆构建中加入详细评分标准和环境反馈可部分恢复下降,但仍有显著差距。

这篇论文重新评估了基于记忆的自我改进智能体,增加了先前研究忽略的两个因素:多次运行以测量方差,以及随机打乱任务顺序。两者都损害了性能。智能体评估在多步任务上本就嘈杂,叠加自我改进循环会放大这种噪声。默认任务顺序施加了隐式课程,许多报告中的提升依赖于它。在记忆构建中加入详细评分标准和环境反馈可部分恢复下降,但仍有显著差距。

阿里巴巴发布第三代图像生成模型 Qwen-Image-3.0 系列,其中 Pro 版在 Artificial Analysis 图像编辑排行榜位列第六,文生图排行榜第九,较上代大幅提升。该系列支持 4.5k token 提示词、精确渲染小至 10 像素的文字及 12 种语言,并通过阿里云 Model Studio 提供 API,定价每张 0.03 至 0.075 美元。
Ox Alpha 是一款前沿模型,专为高效编码、持续智能体工作和实际生产使用而设计,支持 100 万 token 上下文窗口,可处理文本、图像和视频输入。现已在 OpenRouter 上线,欢迎试用并提供反馈。
在旧金山的 Inference, Measured 活动中,我们发布了端点准确率指数,通过自托管权重作为参考,对多个提供商的端点进行相同评估,得分从73%到100%不等。量化、KV缓存压缩和上下文限制都会影响质量,即使定价页未显示。


亚马逊及同事提出 CTIFoundry,在索引时构建知识结构,将四个权威安全知识库的官方交叉引用转化为类型化可遍历边,并添加跨度级报告层保留来源。在开源 harness 上,仅更换动作表面,四模型整体 F1 提升 0.19-0.28,小模型在脚手架上的表现优于旗舰模型在平面基座上的表现,且工具调用减半。

Meta 今日预览 WildArtifactBench,一个内部评估框架,用于评估多模态智能体在复杂真实任务中的表现。它采用胜率和 Elo 评分,由人类和智能体偏好裁判评判,而非严格的标准答案,从而扩展了实际多模态工作流的任务覆盖。Meta 已发布其中 10 个任务。

该推文指出某个猜想是错误的,并展示了一个由AI生成的反例。

我们与Jeff举办了一场关于“维基式”记忆的网络研讨会,显然他对这个问题思考了很多。
Grok @Bot 现在可以制作视频来解释复杂概念。
政治哲学家会这么说。作为研究组织设计的经济社会学家,多智能体对齐显然是一个带有经济社会学成分的组织设计问题(我真的认为许多学科都能为此做出贡献)
Muse Spark 1.2 支持从视觉到代码、感知到行动等多种多模态任务,并具备强大的音视频理解能力,适用于企业视频密集型工作流。官方发布了新的评估和演示,展示模型在视觉理解和推理方面的能力,包括引导机器人在非结构化环境中找到橡皮鸭的示例。
Muse Spark 1.2 是一个强大的多模态模型,能够进行视觉编码、机器人规划和视听理解,并通过智能体工具整合这些能力。
作者原本对“机器人的ChatGPT时刻”持谨慎态度,因为物理世界比语言更复杂。但在参观Generalist AI后,看到其机器人仅凭提示就能完成令人印象深刻的操控,认为这一时刻正以有限的方式出现。
作者认为 GEN-1.5 的成功源于人类数据中的自然重复动作,包括对称模式和恢复动作,并强调保留失败片段对模型学习的重要性。同时,作者指出 UMI 直接采集人类数据优于遥操作,能保留物理直觉,使模型具备零样本能力。
Raycast AI 新增记忆系统,可存储用户偏好和历史交互,便于后续迭代优化。

用户反映某AI产品的跨会话消息通知功能无法关闭,且会通知所有历史会话,导致已结束的会话被唤醒,Token消耗激增。


Raycast V2版本体验大幅提升,支持Cloud同步配置和迁移v1数据,AI Chat升级为Agent并自带记忆系统,效率显著提升。

Raycast V2内测版新增语音输入法,支持自定义系统Prompt、按软件定义识别转写风格、设定识别语言和自定义快捷键,识别率不错,展示了AI语音输入法的设计思路。


靠 Skill 差别不大,要设计好没 AI 味,最重要的当然是人的审美;其次是模型,GPT 就做不好设计,Claude 就强很多;最后靠的是个性化的设计系统(design system)有一套设计的规范和组件,而不是一堆不能怎么设计的规则。
Claude Design 是原型和设计一体的工具,不依赖 Figma,也可导入 Figma 设计稿。产出 React 和模拟数据,可直接交互,方便 agent 还原代码。直连 Figma 仅为操作便利,不依赖其设计。
赞同@gdb的观点,我们需要用API和开放模型武装网络防御者。AI真正的网络安全风险在于攻击者和防御者之间的权力、能力和资源不对称。
苹果开发者账号还是有用,哪怕不为发布给别人用。也能用Codex一句话快速开发个App装自己手机。界面可能是Web打包、界面很不iOS,但继续优化改造就行。如果不给苹果交钱,好像只能装3个App?


Grok @Bot 拥有自己的远程计算机,因此即使你关闭笔记本电脑或重启桌面,它也能继续工作。这是一个重大区别。
Generalist 发布机器人模型 GEN-1.5,通过观看 3-12 秒的动作演示即可学会新任务,平均成功率约 59%,经 5 分钟快速适应后可达 83%。该模型支持动作串联、从人手或电脑动画学习,并能灵活使用替代工具,有望大幅降低机器人编程门槛。
OpenAI 开发者团队发布推文,称 Codex 可将代码迁移时间从数年缩短至数周。
扣子桌面端的“云盘”设计很聪明,本地、云端 Agent 共用。上下文越丰富,加上GLM5.3、Kimi K3这类优质模型,Agent产出质量一定越来越好。AI 办公场景开启三英战吕布,哈哈哈。猜猜是哪三英,谁是吕布?
字节跳动旗下AI智能体平台扣子推出桌面端,新增云盘、深度截图等功能,支持本地文件读写和接入Codex CLI、Claude Code等本地Agent,并集成GLM-5.3、Seedance 2.5等模型,旨在让AI更无缝地融入本地工作流。
用户尝试用 smolvm 作为代码执行沙箱,但 Fable 5 发现环境缺少 /dev/kvm 无法运行。未经用户询问,Claude Code 直接编写了 GitHub Actions 工作流并推送到 GitHub 来执行实验。
Claude 的技能创建器(只需让它制作技能)仍是制作可复用技能的最佳方式,如果你注重细节的话。ChatGPT 倾向于“变魔术”并直接替你完成,而 Claude 会进行测试并展示结果,反复征求你的意见和反馈。