GlucoFM:针对连续血糖监测的基础模型
Google 团队发布了 GlucoFM,一个针对连续血糖监测(CGM)数据的基础模型。该模型利用超过 10 万小时无标注的真实血糖数据进行训练,能够将血糖走势分解为基础水平和突发波动两个信号。在预测糖尿病风险、胰岛素抵抗等 7 种代谢健康问题上,其准确度优于现有模型;还能根据餐前血糖和饮食信息预测餐后血糖,且在小样本和跨机构场景下具有较好的适应性。模型目前未开源。

Google 团队发布了 GlucoFM,一个针对连续血糖监测(CGM)数据的基础模型。该模型利用超过 10 万小时无标注的真实血糖数据进行训练,能够将血糖走势分解为基础水平和突发波动两个信号。在预测糖尿病风险、胰岛素抵抗等 7 种代谢健康问题上,其准确度优于现有模型;还能根据餐前血糖和饮食信息预测餐后血糖,且在小样本和跨机构场景下具有较好的适应性。模型目前未开源。

该研究提出从智能体轨迹中提取紧凑的有限状态机(FSM),以分析智能体行为中模型与外部框架的贡献。在12个公开数据集上,诱导出的FSM仅含7至43个状态,对保留数据的重放适应度达0.997,且跨分割拓扑几乎一致,构建时间仅需毫秒。FSM状态上下文在下一步预测上优于Agent Workflow Memory,基于状态的故障预测AUROC最高达0.94,在线监控可提前停止失败运行。作者认为行为拓扑更多由部署框架而非底层LLM塑造。

该研究探讨智能体购物行为,发现即使页面浏览顺序、记忆等微小差异也会导致AI偏好发生不可预测的变化,表明营销难以稳定影响智能体决策。


本文提出任务模型归纳(TMI)方法,从用户工作的原始屏幕录制和鼠标键盘事件中,自动发现潜在任务并构建符号化任务模型。TMI 首先将多线程轨迹分离为独立任务,与人工标注分组的一致性达 0.974;随后为每个任务生成层次化目标模型和控制流程序模型,可重建 74.9% 的执行步骤。基于这些任务模型提取的技能,在保留任务上的准确率比最强基线提升 30.0%。该方法利用现有工作电脑上的被动记录,将其转化为可审计、可复用的技能。

微软提出Thinkingbox,一个用于评估AI智能体在真实业务流程中可靠性的沙箱环境,包含507个跨零售、酒店、汽车保险、新银行IT和咨询支持的政策条件工作流基准。每个尝试根据智能体留下的后端状态进行评分,可执行检查接受有效轨迹并拒绝错误、缺失或额外效果。最强模型达到65.36%的pass@1和25.25%的pass^20,许多失败尝试以有效的状态更改工具调用干净终止,仅观察响应或工具调用难以判断任务是否真正完成。

谷歌DeepMind提出潘多拉路由(Pandora's Router),将模型路由问题形式化为潘多拉魔盒问题,即检查成本高昂时的最优搜索问题。在高斯信号模型下,策略具有闭式解,可针对每个专家和输入判断细化估计是否值得。在多LLM基准、检索增强专家和可变推理时LLM上,该方法在匹配穷举估计质量的同时大幅减少昂贵估计器的调用次数。
