追踪 AI 智能体执行:分布式系统中的可观测性与证据
该研究探讨在分布式系统中对 AI 智能体(AI Agent)执行过程的可观测性问题。文章定义了追踪、跨度与会话等基础概念,分析了可观测性信号与工程实践中的方法局限。重点讨论了 OpenTelemetry GenAI 这一开放标准,对比了厂商平台与独立平台的差异,并指出了当前技术栈中的差距、风险及概念影响。


该研究探讨在分布式系统中对 AI 智能体(AI Agent)执行过程的可观测性问题。文章定义了追踪、跨度与会话等基础概念,分析了可观测性信号与工程实践中的方法局限。重点讨论了 OpenTelemetry GenAI 这一开放标准,对比了厂商平台与独立平台的差异,并指出了当前技术栈中的差距、风险及概念影响。


论文提出MECo框架,旨在解决利用源任务反馈将启发式搜索泛化至新组合优化问题的挑战。该方法通过大语言模型自动化生成和优化启发式规则,无需针对每个新问题重新设计或依赖其专属评估反馈,实现了零样本跨问题泛化。
提出自适应可学习分层路由(ALHR)机制,利用静态二叉树和可学习函数最小化键读取量。在1024 token测试中,相比密集模型,ALHR将平均键读取量从512降至30,KV压缩比达35.3倍,峰值显存占用显著降低,同时Top-1准确率保持在92.1%(密集模型为94.9%)。
针对AI在给定明确指标下取得进展但自主开放式科学发现能力不明的现状,研究利用多智能体模拟生态系统的开放世界环境Station进行评估。为应对开放式任务挑战,提出引入监督者机制和周期性元反思机制以增强系统能力。
该论文针对大语言模型训练资源密集及部署场景多样的挑战,提出了一种名为 Stepped MoE 的新型架构。现有方法通常将弹性架构与稀疏激活独立处理,而本文提出的方法通过分段级路由机制,实现了计算复杂度与内存占用的灵活配置。该方法旨在解决端侧边缘设备在内存和算力限制下的推理难题,使模型能够适应不同计算约束的部署环境,平衡了性能与效率。
该论文提出 DLoop,一种针对大语言模型自回归生成的循环式投机解码(Speculative Decoding)新架构。研究指出,随着轻量级草稿模型能力增强,目标模型常一次性接受所有草稿 token,导致后续不必要的验证前向传播。DLoop 通过自适应调整草稿长度并允许在草稿阶段继续生成而非强制验证,减少了冗余计算,从而提升推理效率。
该论文针对 DeepSeek Engram 等条件记忆架构,探讨如何利用输入 n-gram 查找嵌入向量来扩展 LLM 容量。研究重点在于解决事实知识存储与通用计算解耦的挑战,旨在保持 Transformer 主干网络固定的前提下,实现高效的事实知识更新。
该论文指出,尽管使用可验证奖励强化学习(RLVR)能提升语言模型的推理能力,但因训练未显式考虑校准,常导致模型过度自信等校准退化问题。作者提出 RL-ARC 方法,将不确定性估计目标融入训练,在保持推理性能的同时显著改善模型校准效果。
该论文指出自然语言风格描述在LLM与可控TTS间存在信息压缩问题,导致描述保真度不等于合成控制有效性。作者通过实证研究表明候选指令的语音-文本对齐度对下游声学相似性预测能力较弱,并提出一种基于语音奖励的风格规划方法以解决此问题。
该论文旨在解释扩散模型为何能克服经典基于分数的采样器的瓶颈。研究利用高斯分布隔离这一现象,建立了优化超参数下的2-Wasserstein收敛界。结果表明,扩散过程实现的采样误差为O(sqrt(d*lambda_max)*log N/N),其中d为维度,N为采样步数。
该论文针对Koopman算子理论在非线性动力系统建模中的应用,解决了传统扩展动态模态分解(EDMD)需要预先指定字典的局限性。研究提出利用机器学习方法从数据中学习字典,并采用基于核函数的自编码器结合双层优化策略来学习Koopman嵌入,旨在提升数据驱动建模的效果。
该论文针对单细胞轨迹推断中存在的预测多义性问题,提出了一种名为FateMultiplicity的无标签框架。该方法通过构建统计可接受的模型集合(即拉什莫森集),利用交叉拟合的保留基因评估模型差异,并采用非劣效性检验校准随机种子变异,从而在不依赖谱系标签的情况下识别冲突的细胞命运分配,揭示了单细胞认证的局限性。
该论文指出,在可验证奖励强化学习(RLVR)中,模型对正确答案的具体形式不敏感,导致训练过程中出现“解模式坍缩”,即模型倾向于重复已知答案而丧失多样性。作者提出通过测量和缓解这一现象,使模型在训练中保留多种正确的解决方案,从而提升模型的泛化能力和鲁棒性。
针对自监督语音编码器中语言与副语言信息纠缠的问题,提出结合TopK稀疏自编码器、路由特定监督和跨因子对抗训练的方法。在冻结的SPEAR和WavLM编码器上验证,独立探针显示因子特异性保留与抑制:语言信息在语言路由中更强,而说话人身份等副语言因素被有效分离。
针对自动驾驶中现有世界模型主要依赖RGB外观预测、几何信息仅描述场景布局而缺乏驾驶相关性的问题,提出AffordDrive3D。该方法引入具身感知(Affordance-Aware)机制,联合学习未来场景预测与轨迹生成,通过聚焦与自车相关的空间区域提升自动驾驶的决策能力。
该论文提出一种用于深度图聚类的联合框架,旨在解决图神经网络(GNN)在利用节点属性和拓扑结构进行聚类时,难以通过局部消息传递捕捉节点间全局关系的问题。研究重点在于提升表示学习的紧凑性与一致性,以优化聚类分配效果。
该论文指出,尽管图神经网络(GNN)广泛用于回归任务(如预测神经架构准确率),但新的消息传递(MP)层几乎仅在分类任务上进行基准测试,且回归流程通常不消融单一MP层。作者通过固定架构、损失函数和训练配方,研究了四种现有模型的选择对图级回归性能的影响,旨在量化MP层设计对回归精度的实际贡献。
针对现代神经网络参数冗余导致的计算与内存开销问题,现有剪枝方法多依赖事后幅度阈值或静态初始化启发式规则,常需手动设定稀疏度或昂贵重训。本文提出动态活动依赖剪枝(DADP),这是一种受生物启发的结构可塑性机制,旨在通过动态调整实现更高效的模型压缩。
针对端侧大模型推理中预填充阶段因处理完整输入上下文导致的高成本问题,提出 SparKV 框架。该方法结合云端 KV 流式传输与端侧计算,通过建模单个 KV 块的成本,自适应决策各块的加载策略,旨在优化有限硬件资源下的推理效率。
该论文针对长期时间序列预测(LTSF)中传统基于patch的编码器将历史记忆映射到未来步骤时存在的隐式耦合问题,提出了一种名为SACQ的新方法。该方法通过结构化解码和记忆条件细化技术,改善了特定位置的历史-未来对齐效果,并降低了对输入噪声和极端监督噪声的敏感度。
该论文针对KV缓存压缩问题,指出传统方法通过模型重读上下文来评分并保留关键条目,假设重读越充分记忆越好。作者证明在预算受限下此策略并非最优,并提出Attic-KV方法,主张仅缓存未来会被读取的内容,而非盲目重读所有上下文,从而在有限资源下提升长文本处理的记忆效率与准确性。
该论文提出 DYSANOS,首个用于生成所有行权价和到期日平滑 SANOS 期权曲面的生成式市场模型,确保静态无套利。模型旨在生成未来多年的每日现货和期权价格路径,并提供了基于 AR(1) 的基线及训练流程。
该论文针对通用机器人执行多样化任务时,传统强化学习依赖大量工程化先验(如奖励塑形)的问题,提出一种基于多样化模拟器重置和大规模并行模拟的数据训练策略。旨在缓解探索瓶颈,减少对特定任务结构先验的依赖,提升Sim-to-Real迁移效率。
该论文系统评估了大型语言模型(LLM)在软件系统中作为组件的标记,如聊天机器人、Copilot、RAG和AI代理。研究指出这些标签具有架构含义,其中供应商使用的“Copilot”明确指代路由器-工作者架构。文章旨在厘清不同标签背后的真实技术形态与品牌营销的区别。
该论文针对大语言模型智能体在自主执行任务时缺乏规则保护导致的安全与成本问题,提出了一种名为 OnTrack 的实时监测与干预框架。不同于增加延迟的监控智能体或事后评估日志的方法,该方法利用流式结构感知最优传输技术,在智能体运行过程中实时分析其轨迹并进行干预,从而有效降低不可逆操作带来的风险。
该研究指出,利用心电图(ECG)向仅光电容积脉搏波(PPG)模型进行知识蒸馏时,主要学习的是受试者的个体特征(即“谁”),而非心血管状态变化(即“如何”)。研究发现,单次记录的均值这一固定效应占据了冻结ECG教师模型目标的40-59%,导致学生模型在未见数据上泛化能力差。原始对齐余弦相似度无法捕捉此问题,因为常数预测器也能获得高分。
针对现有Text-to-SQL系统多轮交互中执行反馈利用不足的问题,提出SERL-SQL框架。该方法采用选择性执行感知的强化学习,通过蒸馏技术优化轨迹级奖励,更精准地识别导致SQL生成成功或失败的关键决策步骤,提升智能体在复杂查询中的表现。
该研究探讨大语言模型(LLM)科学智能体在神经算子适配任务中,是仅依赖初始任务上下文,还是根据实验反馈调整决策。研究设定LLM在有限试验预算下选择微调配置,结果显示其在偏微分方程(PDE)族内及跨族的迁移中,其测试nRMSE低于随机搜索和贝叶斯优化。
提出 SciTBERT 系列预训练 Transformer 模型,旨在解决现有科学/技术领域编码器在研究时间依赖或档案属性时的局限性。通过消除前瞻偏差并增强领域适应性,该模型族在科学文献与专利文本的分类、回归及邻近度任务上表现优于通用模型,特别适用于分析科技进步的时序特征。
该研究针对检索证据与智能体先验信念冲突的场景,提出评估“认知谦逊”(Epistemic Humility)的新指标。现有评测多关注任务成功率,忽视了智能体处理冲突时的表现。作者通过实验考察智能体在面临矛盾信息时,是修正答案、承认不确定性还是坚持错误结论,旨在填补对智能体不确定性与自我修正能力的评估空白。