策略更替现象
作者提出,深度强化学习中的策略更替(policy churn)提供了隐式探索,其规模可能淹没显式探索方法,并导致泛化改进的假阴性结果。作者通过实验观察到,在Breakout中,样本动作因策略更替而在所有18个动作间跳变,且深度值函数的过度泛化导致所有样本变化幅度相似。作者认为,网络稀疏化可能减少策略更替,但需补充显式探索。
政治哲学家会这么说。作为研究组织设计的经济社会学家,多智能体对齐显然是一个带有经济社会学成分的组织设计问题(我真的认为许多学科都能为此做出贡献)
作者原本对“机器人的ChatGPT时刻”持谨慎态度,因为物理世界比语言更复杂。但在参观Generalist AI后,看到其机器人仅凭提示就能完成令人印象深刻的操控,认为这一时刻正以有限的方式出现。
作者认为 GEN-1.5 的成功源于人类数据中的自然重复动作,包括对称模式和恢复动作,并强调保留失败片段对模型学习的重要性。同时,作者指出 UMI 直接采集人类数据优于遥操作,能保留物理直觉,使模型具备零样本能力。
赞同@gdb的观点,我们需要用API和开放模型武装网络防御者。AI真正的网络安全风险在于攻击者和防御者之间的权力、能力和资源不对称。
可观测性和评估平台很多,但很少有平台能帮助闭环并让智能体自行建议修复和添加评估。