SHELL PULSE

8月28日 · 星期五4 条

  1. François Cholletby François Chollet · 推文AI评分:50/100

    在可验证领域,模型能力扩展应保持无界

    作者主张在可验证领域,模型能力扩展应保持无界。论据是模型通过吸收越来越多的计算宇宙而持续改进,而计算宇宙在构造上是无限的。

    X @fchollet观点原文
  2. Google DeepMindby Google DeepMind · 推文AI评分:50/100

    从天气预报到机器人,智能决策依赖于理解未知

    DeepMind研究副总裁Zoubin Ghahramani与主持人探讨了不确定性在AI决策中的作用,强调教会系统自我怀疑和概率思维,可以带来更安全、更可靠的实际决策。视频涵盖不确定性角色、正确性与置信度、贝叶斯思维等主题。

    X @GoogleDeepMind观点原文

8月27日 · 星期四2 条

  1. Ethan Mollickby Ethan Mollick · 推文AI评分:50/100

    METR报告虽好,但人们过度拟人化智能体

    作者认为METR报告很有价值,但人们基于压力下的研究人员所做的思维链研究,过度赋予智能体人类动机和个性,这种拟人化会阻碍我们对AI的正确理解。

    X @emollick观点原文
  2. Ethan Mollickby Ethan Mollick · 推文AI评分:50/100

    AI生产力提升不必等30年:福特流水线3年见效

    作者常听到“电力花了30年才提升生产力”的说法,并以此类比AI。但他指出并非所有技术都如此:福特发明流水线后3年内全面部署,汽车制造时间缩短88%。

    X @emollick观点原文

8月25日 · 星期二5 条

  1. Jerry Liuby Jerry Liu · 推文AI评分:50/100

    不完全理解:我希望智能体使用 Slack,而不是让 Slack 变成智能体

    作者表示不完全理解某些观点,并阐述自己的看法:希望智能体使用 Slack,而不是让智能体构建新的 Slack,也不希望使用 Slack 的智能体。他认为每个软件或记录系统都需要成为智能体原生的,而不仅仅是人类原生的,因为智能体的消费量将远超人类。但这并不意味着它们本身要变成智能体。

    X @jerryjliu0观点原文

8月24日 · 星期一3 条

  1. Ethan Mollickby Ethan Mollick · 推文AI评分:50/100

    当人们问“我需要智能体处理什么个人任务?”

    当人们问“我需要智能体处理什么个人任务?”时,我认为这是因为他们把自动化想象成AI的简单常规任务。但前沿AI现在非常擅长处理不规则、耗神的任务:医疗账单、信用纠纷、繁琐表格……

    X @emollick观点原文
  2. Ethan Mollickby Ethan Mollick · 推文AI评分:30/100

    AI 机器人的烦人副作用

    AI 机器人的一个烦人副作用是,它们都“博览群书”,能对我的小众引用推文给出条理清晰的回复,而这些推文通常只会吸引一小群感兴趣的人。现在你无法区分以法莲人和基列人了。

    X @emollick观点原文
  3. Ethan Mollickby Ethan Mollick · 推文AI评分:50/100

    关于AI影响的研究:使用旧模型并非天生有害,但需谨慎讨论

    作者认为,使用旧模型(如GPT-4)研究AI影响并非天生有害,但需谨慎讨论。正面能力声明(如AI达到人类水平)具有持久性,而负面能力声明(如AI在某任务上失败)则需更小心,因为未来模型可能改进。作者提出几种可行框架:明确限定模型版本、测量趋势、论证固有局限、关注调节因素或聚焦人类反应。

    X @emollick观点论文原文

8月23日 · 星期日5 条

  1. Jerry Liuby Jerry Liu · 推文AI评分:50/100

    0-1模式与大公司团队的生产力差异

    作者认为,在0-1模式下,个人独自决策和实现,且处于80-20法则的前20%努力阶段,容易显得高效;而在大团队中共享决策、追求质量,效率提升更难。AI可能加剧这种对比,也解释了为何大公司最快产品常由小团队打造。

    X @jerryjliu0观点原文
  2. Jerry Liuby Jerry Liu · 推文AI评分:50/100

    关于AI编码工具切换成本的思考

    作者认为实验室有机会在Claude Code、Codex、Grok Bot等工具之间设置更高的切换成本。每当新模型发布时,用户因已有技能、习惯、系统指令和项目设置而难以切换。尽管作者维护外部wiki和工件,但对话历史的细微差别会丢失。若启用记忆功能,工具可索引并记住上下文,减少重复输入。核心痛点在于如何高效提供正确上下文,答案可能是构建良好的自改进上下文图。

    X @jerryjliu0观点产品原文

8月22日 · 星期六7 条

  1. Shawn Wangby Shawn Wang · 推文AI评分:50/100

    模拟是新的扩展定律:为什么我最终理解了 Smallville 和 Simile 的愿景

    作者起初认为“模拟是新的扩展定律”只是营销夸张,但在采访中逐渐认真起来。他意识到,当模型自动化了大部分 ML 研究和 AI 工程后,最后的障碍是模拟人类和人类反馈。Smallville 当时没有商业应用,但 Simile 团队正在做这件事,并已在财富 100 强中找到产品市场契合。作者很高兴自己错了。

    X @swyx观点行业原文
  2. Ethan Mollickby Ethan Mollick · 推文AI评分:50/100

    矛盾的时代:民意讨厌AI,私下却离不开

    未来将是一个充满矛盾的时代。民调显示人们普遍讨厌AI,但私下却都在使用AI。AI公司在舆论中处于劣势,但许多人却对自己钟爱的模型产生强烈依恋。

    X @emollick观点原文
  3. François Cholletby François Chollet · 推文AI评分:50/100

    跟随惊喜的梯度

    作者主张,在探索或决策中应遵循“惊喜梯度”,即优先选择那些能带来最大信息增益或意外感的路径。这一原则有助于避免陷入局部最优,促进创新和适应性。

    X @fchollet观点原文
  4. NVIDIA AIby NVIDIA AI · 推文AI评分:50/100

    AI代理承担更复杂工作时,安全应放在哪里?

    Anthropic的安全与安保团队分享了对AI代理栈安全性的思考:harness(引导代理尝试做什么)与基础设施(控制代理实际能做什么)共同决定安全边界。

    X @NVIDIAAI观点原文
  5. Andrew Ngby Andrew Ng · 长文AI评分:70/100

    AI 工程技能图谱:构建与部署 AI 应用

    作者基于招聘信息、专家访谈和调查,梳理了构建和部署 AI 应用所需的核心技能,包括 LLM 基础、数据接地、智能体系统、评估驱动开发、生产运维和机器学习基础。强调 AI 系统输出不确定性带来的迭代开发特点,以及评估驱动开发作为关键能力。

    X @AndrewYNg观点教程原文
  6. François Cholletby François Chollet · 推文AI评分:50/100

    NVIDIA 在 ARC-AGI-3 上的工作点评

    这是 NVIDIA 的出色工作。与 ARC-AGI-3 上所有高性能方法一样,它使用深度学习引导的即时符号世界模型合成,即通过生成程序来表示所知来导航世界。需要明确的是,与其他几个近期声明一样,在公开演示集上获得 100% 并不等同于在 ARC-AGI-3 基准上获得 100%。这就像说你通关了游戏,因为你完成了教程关卡。

    X @fchollet观点评测原文

8月21日 · 星期五4 条

  1. Emad Mostaqueby Emad Mostaque · 推文AI评分:50/100

    平台争夺你的注意力,智能体替你关注

    作者认为,过去平台通过算法争夺用户注意力,而未来智能体将代表用户进行关注,从而改变注意力经济的格局。这一转变意味着用户不再需要亲自筛选信息,而是由AI代理来执行,可能重塑数字广告和内容分发的模式。

    X @EMostaque观点行业原文
  2. Ethan Mollickby Ethan Mollick · 推文AI评分:50/100

    即使LLM写得好,风格缺乏多样性也是致命的

    作者认为,即使LLM能写出好文本,但风格单一的问题令人不适。从指令、社交媒体到广告、软件和PPT,千篇一律的散文让人反感。仅靠提示词无法解决,需要真正的风格多样性,而这一领域研究不足。

    X @emollick观点原文
  3. John Carmackby John Carmack · 长文AI评分:70/100

    策略更替现象

    作者提出,深度强化学习中的策略更替(policy churn)提供了隐式探索,其规模可能淹没显式探索方法,并导致泛化改进的假阴性结果。作者通过实验观察到,在Breakout中,样本动作因策略更替而在所有18个动作间跳变,且深度值函数的过度泛化导致所有样本变化幅度相似。作者认为,网络稀疏化可能减少策略更替,但需补充显式探索。

    X @ID_AA_Carmack观点论文原文