精选
智东西by 毕 伟豪 · 论文AI评分:70/100
DeepSeek最新论文公开,首次系统发布Agent训练沙盒平台DSec技术细节
DeepSeek创始人梁文锋署名的最新论文公开,详细披露了Agent训练沙盒平台DSec的技术架构。该平台支撑了从V3.2到V4.1的RL训练,具备单日服务300万沙盒、峰值并发超38万及秒级创建能力,为大规模智能体训练提供基础设施保障。


DeepSeek创始人梁文锋署名的最新论文公开,详细披露了Agent训练沙盒平台DSec的技术架构。该平台支撑了从V3.2到V4.1的RL训练,具备单日服务300万沙盒、峰值并发超38万及秒级创建能力,为大规模智能体训练提供基础设施保障。


美图影像研究院提出BridgeRemoval框架,首次将视频目标移除定义为视频到视频的翻译任务,采用随机桥模型直接从源视频先验生成目标,避免扩散模型丢弃结构先验的问题。该方法在DAVIS和BridgeRemoval-Bench数据集上取得最优PSNR,并已落地于美图秀秀、Wink和开拍APP。论文被ICML 2026录用。


中国人民大学高瓴人工智能学院与至知创新研究院团队提出ClawGym II,一个面向复杂Agent Harness的黑盒强化学习框架。该框架无需修改Claude Code、OpenClaw等Harness内部实现,即可让模型通过真实执行过程进行强化学习,并支持多个异构Harness联合训练同一策略模型。实验表明,黑盒RL能稳定提升模型Agent能力,且共享策略模型可同时从多个Harness中学习。

