SHELL PULSE

8月21日 · 星期五14

  1. DAIR.AIby DAIR.AI · 推文AI评分:70/100

    终于有一篇好论文检验基于记忆的自我改进智能体是否真的在改进

    这篇论文重新评估了基于记忆的自我改进智能体,增加了先前研究忽略的两个因素:多次运行以测量方差,以及随机打乱任务顺序。两者都损害了性能。智能体评估在多步任务上本就嘈杂,叠加自我改进循环会放大这种噪声。默认任务顺序施加了隐式课程,许多报告中的提升依赖于它。在记忆构建中加入详细评分标准和环境反馈可部分恢复下降,但仍有显著差距。

    X @dair_ai论文原文
  2. Artificial Analysisby Artificial Analysis · 推文AI评分:70/100

    阿里 Qwen-Image-3.0-Pro 登顶图像编辑排行榜第六

    阿里巴巴发布第三代图像生成模型 Qwen-Image-3.0 系列,其中 Pro 版在 Artificial Analysis 图像编辑排行榜位列第六,文生图排行榜第九,较上代大幅提升。该系列支持 4.5k token 提示词、精确渲染小至 10 像素的文字及 12 种语言,并通过阿里云 Model Studio 提供 API,定价每张 0.03 至 0.075 美元。

    X @ArtificialAnlys模型评测原文
  3. OpenRouterby OpenRouter · 推文AI评分:50/100

    新隐身模型 Ox Alpha 发布

    Ox Alpha 是一款前沿模型,专为高效编码、持续智能体工作和实际生产使用而设计,支持 100 万 token 上下文窗口,可处理文本、图像和视频输入。现已在 OpenRouter 上线,欢迎试用并提供反馈。

    X @OpenRouter模型产品原文
  4. Artificial Analysisby Artificial Analysis · 推文AI评分:50/100

    推理实测活动:同一模型在不同端点表现差异显著

    在旧金山的 Inference, Measured 活动中,我们发布了端点准确率指数,通过自托管权重作为参考,对多个提供商的端点进行相同评估,得分从73%到100%不等。量化、KV缓存压缩和上下文限制都会影响质量,即使定价页未显示。

    X @ArtificialAnlys评测行业原文
  5. DAIR.AIby DAIR.AI · 推文AI评分:70/100

    亚马逊新工作:CTIFoundry 在索引时构建知识结构,提升智能体性能

    亚马逊及同事提出 CTIFoundry,在索引时构建知识结构,将四个权威安全知识库的官方交叉引用转化为类型化可遍历边,并添加跨度级报告层保留来源。在开源 harness 上,仅更换动作表面,四模型整体 F1 提升 0.19-0.28,小模型在脚手架上的表现优于旗舰模型在平面基座上的表现,且工具调用减半。

    X @dair_ai论文模型原文
  6. John Carmackby John Carmack · 长文AI评分:70/100

    策略更替现象

    作者提出,深度强化学习中的策略更替(policy churn)提供了隐式探索,其规模可能淹没显式探索方法,并导致泛化改进的假阴性结果。作者通过实验观察到,在Breakout中,样本动作因策略更替而在所有18个动作间跳变,且深度值函数的过度泛化导致所有样本变化幅度相似。作者认为,网络稀疏化可能减少策略更替,但需补充显式探索。

    X @ID_AA_Carmack观点论文原文
  7. Meta AIby Meta AI · 推文AI评分:70/100

    Meta 预览 WildArtifactBench 评估框架

    Meta 今日预览 WildArtifactBench,一个内部评估框架,用于评估多模态智能体在复杂真实任务中的表现。它采用胜率和 Elo 评分,由人类和智能体偏好裁判评判,而非严格的标准答案,从而扩展了实际多模态工作流的任务覆盖。Meta 已发布其中 10 个任务。

    X @AIatMeta评测模型原文
  8. Meta AIby Meta AI · 推文AI评分:70/100

    Muse Spark 1.2 支持广泛多模态任务

    Muse Spark 1.2 支持从视觉到代码、感知到行动等多种多模态任务,并具备强大的音视频理解能力,适用于企业视频密集型工作流。官方发布了新的评估和演示,展示模型在视觉理解和推理方面的能力,包括引导机器人在非结构化环境中找到橡皮鸭的示例。

    X @AIatMeta模型原文
  9. Alexandr Wangby Alexandr Wang · 推文AI评分:70/100

    Muse Spark 1.2 是强大的多模态模型

    Muse Spark 1.2 是一个强大的多模态模型,能够进行视觉编码、机器人规划和视听理解,并通过智能体工具整合这些能力。

    X @alexandr_wang模型原文

8月20日 · 星期四16

  1. Jim Fanby Jim Fan · 推文AI评分:70/100

    GEN-1.5 热潮背后的关键:数据中的自然重复与 UMI 数据采集

    作者认为 GEN-1.5 的成功源于人类数据中的自然重复动作,包括对称模式和恢复动作,并强调保留失败片段对模型学习的重要性。同时,作者指出 UMI 直接采集人类数据优于遥操作,能保留物理直觉,使模型具备零样本能力。

    X @DrJimFan观点模型原文
  2. 宝玉by 宝玉 · 推文AI评分:50/100

    设计没AI味的关键:审美、模型与个性化设计系统

    靠 Skill 差别不大,要设计好没 AI 味,最重要的当然是人的审美;其次是模型,GPT 就做不好设计,Claude 就强很多;最后靠的是个性化的设计系统(design system)有一套设计的规范和组件,而不是一堆不能怎么设计的规则。

    X @dotey观点原文
  3. 宝玉by 宝玉 · 推文AI评分:50/100

    Claude Design:一体化原型设计,不依赖Figma

    Claude Design 是原型和设计一体的工具,不依赖 Figma,也可导入 Figma 设计稿。产出 React 和模拟数据,可直接交互,方便 agent 还原代码。直连 Figma 仅为操作便利,不依赖其设计。

    X @dotey产品原文
  4. 向阳乔木by 向阳乔木 · 推文AI评分:30/100

    苹果开发者账号还是有用,哪怕不为发布给别人用

    苹果开发者账号还是有用,哪怕不为发布给别人用。也能用Codex一句话快速开发个App装自己手机。界面可能是Web打包、界面很不iOS,但继续优化改造就行。如果不给苹果交钱,好像只能装3个App?

    X @vista8教程原文
  5. Gorden Sunby Gorden Sun · 推文AI评分:70/100

    Generalist 发布机器人模型 GEN-1.5,看一眼演示即可学会新动作

    Generalist 发布机器人模型 GEN-1.5,通过观看 3-12 秒的动作演示即可学会新任务,平均成功率约 59%,经 5 分钟快速适应后可达 83%。该模型支持动作串联、从人手或电脑动画学习,并能灵活使用替代工具,有望大幅降低机器人编程门槛。

    X @Gorden_Sun模型产品原文
  6. 向阳乔木by 向阳乔木 · 推文AI评分:30/100

    扣子桌面端云盘设计聪明,AI办公三英战吕布

    扣子桌面端的“云盘”设计很聪明,本地、云端 Agent 共用。上下文越丰富,加上GLM5.3、Kimi K3这类优质模型,Agent产出质量一定越来越好。AI 办公场景开启三英战吕布,哈哈哈。猜猜是哪三英,谁是吕布?

    X @vista8产品行业原文
  7. 向阳乔木by 向阳乔木 · 长文AI评分:70/100

    字节扣子桌面端发布,让Agent直接“住进”你的电脑

    字节跳动旗下AI智能体平台扣子推出桌面端,新增云盘、深度截图等功能,支持本地文件读写和接入Codex CLI、Claude Code等本地Agent,并集成GLM-5.3、Seedance 2.5等模型,旨在让AI更无缝地融入本地工作流。

    X @vista8产品行业原文
  8. Ethan Mollickby Ethan Mollick · 推文AI评分:50/100

    Claude 的技能创建器仍是制作可复用技能的最佳方式

    Claude 的技能创建器(只需让它制作技能)仍是制作可复用技能的最佳方式,如果你注重细节的话。ChatGPT 倾向于“变魔术”并直接替你完成,而 Claude 会进行测试并展示结果,反复征求你的意见和反馈。

    X @emollick产品观点原文