SHELL PULSE

8月21日 · 星期五3

  1. John Carmackby John Carmack · 长文AI评分:70/100

    策略更替现象

    作者提出,深度强化学习中的策略更替(policy churn)提供了隐式探索,其规模可能淹没显式探索方法,并导致泛化改进的假阴性结果。作者通过实验观察到,在Breakout中,样本动作因策略更替而在所有18个动作间跳变,且深度值函数的过度泛化导致所有样本变化幅度相似。作者认为,网络稀疏化可能减少策略更替,但需补充显式探索。

    X @ID_AA_Carmack观点论文原文

8月20日 · 星期四6

  1. Jim Fanby Jim Fan · 推文AI评分:70/100

    GEN-1.5 热潮背后的关键:数据中的自然重复与 UMI 数据采集

    作者认为 GEN-1.5 的成功源于人类数据中的自然重复动作,包括对称模式和恢复动作,并强调保留失败片段对模型学习的重要性。同时,作者指出 UMI 直接采集人类数据优于遥操作,能保留物理直觉,使模型具备零样本能力。

    X @DrJimFan观点模型原文
  2. 宝玉by 宝玉 · 推文AI评分:50/100

    设计没AI味的关键:审美、模型与个性化设计系统

    靠 Skill 差别不大,要设计好没 AI 味,最重要的当然是人的审美;其次是模型,GPT 就做不好设计,Claude 就强很多;最后靠的是个性化的设计系统(design system)有一套设计的规范和组件,而不是一堆不能怎么设计的规则。

    X @dotey观点原文
  3. Gorden Sunby Gorden Sun · 推文AI评分:70/100

    AI时代的数学

    陶哲轩在arXiv发表论文,探讨AI生成证明对数学的影响。他认为,当AI生成的证明经机器验证正确但无人能理解时,不应视为完整贡献;数学界需要能解释定理的人才,而非仅能证明定理的人。

    X @Gorden_Sun观点论文原文