SHELL PULSE

9月23日 · 星期三1 条

  1. 精选智东西by 毕 伟豪 · 论文AI评分:70/100

    DeepSeek最新论文公开,首次系统发布Agent训练沙盒平台DSec技术细节

    DeepSeek创始人梁文锋署名的最新论文公开,详细披露了Agent训练沙盒平台DSec的技术架构。该平台支撑了从V3.2到V4.1的RL训练,具备单日服务300万沙盒、峰值并发超38万及秒级创建能力,为大规模智能体训练提供基础设施保障。

    zhidx.com论文模型原文

8月19日 · 星期三1 条

  1. 精选智东西by ZeR0 · 论文AI评分:70/100

    美图提出BridgeRemoval,让视频消除不再穿帮

    美图影像研究院提出BridgeRemoval框架,首次将视频目标移除定义为视频到视频的翻译任务,采用随机桥模型直接从源视频先验生成目标,避免扩散模型丢弃结构先验的问题。该方法在DAVIS和BridgeRemoval-Bench数据集上取得最优PSNR,并已落地于美图秀秀、Wink和开拍APP。论文被ICML 2026录用。

    zhidx.com论文产品原文

8月18日 · 星期二1 条

  1. 精选智东西by 陈 骏达 · 论文AI评分:70/100

    人大高瓴、IQuest团队提出ClawGym II:将OpenClaw、Claude Code接入黑盒强化学习

    中国人民大学高瓴人工智能学院与至知创新研究院团队提出ClawGym II,一个面向复杂Agent Harness的黑盒强化学习框架。该框架无需修改Claude Code、OpenClaw等Harness内部实现,即可让模型通过真实执行过程进行强化学习,并支持多个异构Harness联合训练同一策略模型。实验表明,黑盒RL能稳定提升模型Agent能力,且共享策略模型可同时从多个Harness中学习。

    zhidx.com论文模型原文