SHELL PULSE

8月21日 · 星期五14

  1. DAIR.AIby DAIR.AI · 推文AI评分:70/100

    终于有一篇好论文检验基于记忆的自我改进智能体是否真的在改进

    这篇论文重新评估了基于记忆的自我改进智能体,增加了先前研究忽略的两个因素:多次运行以测量方差,以及随机打乱任务顺序。两者都损害了性能。智能体评估在多步任务上本就嘈杂,叠加自我改进循环会放大这种噪声。默认任务顺序施加了隐式课程,许多报告中的提升依赖于它。在记忆构建中加入详细评分标准和环境反馈可部分恢复下降,但仍有显著差距。

    X @dair_ai论文原文
  2. Artificial Analysisby Artificial Analysis · 推文AI评分:70/100

    阿里 Qwen-Image-3.0-Pro 登顶图像编辑排行榜第六

    阿里巴巴发布第三代图像生成模型 Qwen-Image-3.0 系列,其中 Pro 版在 Artificial Analysis 图像编辑排行榜位列第六,文生图排行榜第九,较上代大幅提升。该系列支持 4.5k token 提示词、精确渲染小至 10 像素的文字及 12 种语言,并通过阿里云 Model Studio 提供 API,定价每张 0.03 至 0.075 美元。

    X @ArtificialAnlys模型评测原文
  3. OpenRouterby OpenRouter · 推文AI评分:50/100

    新隐身模型 Ox Alpha 发布

    Ox Alpha 是一款前沿模型,专为高效编码、持续智能体工作和实际生产使用而设计,支持 100 万 token 上下文窗口,可处理文本、图像和视频输入。现已在 OpenRouter 上线,欢迎试用并提供反馈。

    X @OpenRouter模型产品原文
  4. Artificial Analysisby Artificial Analysis · 推文AI评分:50/100

    推理实测活动:同一模型在不同端点表现差异显著

    在旧金山的 Inference, Measured 活动中,我们发布了端点准确率指数,通过自托管权重作为参考,对多个提供商的端点进行相同评估,得分从73%到100%不等。量化、KV缓存压缩和上下文限制都会影响质量,即使定价页未显示。

    X @ArtificialAnlys评测行业原文
  5. DAIR.AIby DAIR.AI · 推文AI评分:70/100

    亚马逊新工作:CTIFoundry 在索引时构建知识结构,提升智能体性能

    亚马逊及同事提出 CTIFoundry,在索引时构建知识结构,将四个权威安全知识库的官方交叉引用转化为类型化可遍历边,并添加跨度级报告层保留来源。在开源 harness 上,仅更换动作表面,四模型整体 F1 提升 0.19-0.28,小模型在脚手架上的表现优于旗舰模型在平面基座上的表现,且工具调用减半。

    X @dair_ai论文模型原文
  6. John Carmackby John Carmack · 长文AI评分:70/100

    策略更替现象

    作者提出,深度强化学习中的策略更替(policy churn)提供了隐式探索,其规模可能淹没显式探索方法,并导致泛化改进的假阴性结果。作者通过实验观察到,在Breakout中,样本动作因策略更替而在所有18个动作间跳变,且深度值函数的过度泛化导致所有样本变化幅度相似。作者认为,网络稀疏化可能减少策略更替,但需补充显式探索。

    X @ID_AA_Carmack观点论文原文
  7. Meta AIby Meta AI · 推文AI评分:70/100

    Meta 预览 WildArtifactBench 评估框架

    Meta 今日预览 WildArtifactBench,一个内部评估框架,用于评估多模态智能体在复杂真实任务中的表现。它采用胜率和 Elo 评分,由人类和智能体偏好裁判评判,而非严格的标准答案,从而扩展了实际多模态工作流的任务覆盖。Meta 已发布其中 10 个任务。

    X @AIatMeta评测模型原文
  8. Meta AIby Meta AI · 推文AI评分:70/100

    Muse Spark 1.2 支持广泛多模态任务

    Muse Spark 1.2 支持从视觉到代码、感知到行动等多种多模态任务,并具备强大的音视频理解能力,适用于企业视频密集型工作流。官方发布了新的评估和演示,展示模型在视觉理解和推理方面的能力,包括引导机器人在非结构化环境中找到橡皮鸭的示例。

    X @AIatMeta模型原文
  9. Alexandr Wangby Alexandr Wang · 推文AI评分:70/100

    Muse Spark 1.2 是强大的多模态模型

    Muse Spark 1.2 是一个强大的多模态模型,能够进行视觉编码、机器人规划和视听理解,并通过智能体工具整合这些能力。

    X @alexandr_wang模型原文

8月20日 · 星期四11

  1. Jim Fanby Jim Fan · 推文AI评分:70/100

    GEN-1.5 热潮背后的关键:数据中的自然重复与 UMI 数据采集

    作者认为 GEN-1.5 的成功源于人类数据中的自然重复动作,包括对称模式和恢复动作,并强调保留失败片段对模型学习的重要性。同时,作者指出 UMI 直接采集人类数据优于遥操作,能保留物理直觉,使模型具备零样本能力。

    X @DrJimFan观点模型原文
  2. Ethan Mollickby Ethan Mollick · 推文AI评分:50/100

    Claude 的技能创建器仍是制作可复用技能的最佳方式

    Claude 的技能创建器(只需让它制作技能)仍是制作可复用技能的最佳方式,如果你注重细节的话。ChatGPT 倾向于“变魔术”并直接替你完成,而 Claude 会进行测试并展示结果,反复征求你的意见和反馈。

    X @emollick产品观点原文
  3. Jerry Liuby Jerry Liu · 推文AI评分:50/100

    LlamaParse 新增修订追踪功能

    LlamaParse 新增修订追踪功能,可提取 Word 风格的修订和审阅者评论作为结构化元数据,与解析后的 Markdown 内容一同输出。这使得下游 AI 代理能获取文档的完整修订历史,而非仅最新快照,适用于法律、金融等协作频繁的领域。

    X @jerryjliu0产品开源原文