SHELL PULSE

8月28日 · 星期五1 条

  1. DAIR.AIby DAIR.AI · 推文AI评分:70/100

    从智能体轨迹中提取自动机

    该研究提出从智能体轨迹中提取紧凑的有限状态机(FSM),以分析智能体行为中模型与外部框架的贡献。在12个公开数据集上,诱导出的FSM仅含7至43个状态,对保留数据的重放适应度达0.997,且跨分割拓扑几乎一致,构建时间仅需毫秒。FSM状态上下文在下一步预测上优于Agent Workflow Memory,基于状态的故障预测AUROC最高达0.94,在线监控可提前停止失败运行。作者认为行为拓扑更多由部署框架而非底层LLM塑造。

    X @dair_ai论文原文

8月27日 · 星期四1 条

  1. Ethan Mollickby Ethan Mollick · 推文AI评分:70/100

    智能体购物研究:AI选择难以预测

    该研究探讨智能体购物行为,发现即使页面浏览顺序、记忆等微小差异也会导致AI偏好发生不可预测的变化,表明营销难以稳定影响智能体决策。

    X @emollick论文原文

8月23日 · 星期日2 条

  1. DAIR.AIby DAIR.AI · 推文AI评分:70/100

    任务模型归纳:从被动记录中提取可复用的智能体技能

    本文提出任务模型归纳(TMI)方法,从用户工作的原始屏幕录制和鼠标键盘事件中,自动发现潜在任务并构建符号化任务模型。TMI 首先将多线程轨迹分离为独立任务,与人工标注分组的一致性达 0.974;随后为每个任务生成层次化目标模型和控制流程序模型,可重建 74.9% 的执行步骤。基于这些任务模型提取的技能,在保留任务上的准确率比最强基线提升 30.0%。该方法利用现有工作电脑上的被动记录,将其转化为可审计、可复用的技能。

    X @dair_ai论文原文
  2. DAIR.AIby DAIR.AI · 推文AI评分:90/100

    微软关于智能体在真实业务流程中可靠性的重磅论文

    微软提出Thinkingbox,一个用于评估AI智能体在真实业务流程中可靠性的沙箱环境,包含507个跨零售、酒店、汽车保险、新银行IT和咨询支持的政策条件工作流基准。每个尝试根据智能体留下的后端状态进行评分,可执行检查接受有效轨迹并拒绝错误、缺失或额外效果。最强模型达到65.36%的pass@1和25.25%的pass^20,许多失败尝试以有效的状态更改工具调用干净终止,仅观察响应或工具调用难以判断任务是否真正完成。

    X @dair_ai论文评测原文

8月21日 · 星期五1 条

  1. DAIR.AIby DAIR.AI · 推文AI评分:90/100

    谷歌DeepMind新论文:将模型路由形式化为潘多拉魔盒问题

    谷歌DeepMind提出潘多拉路由(Pandora's Router),将模型路由问题形式化为潘多拉魔盒问题,即检查成本高昂时的最优搜索问题。在高斯信号模型下,策略具有闭式解,可针对每个专家和输入判断细化估计是否值得。在多LLM基准、检索增强专家和可变推理时LLM上,该方法在匹配穷举估计质量的同时大幅减少昂贵估计器的调用次数。

    X @dair_ai论文模型原文