SHELL PULSE

8月28日 · 星期五5 条

  1. 向阳乔木by 向阳乔木 · 推文AI评分:50/100

    腾讯Hy4 preview:专家高质量数据是模型进步的关键

    作者认为,腾讯Hy4 preview通过内部专家共建高质量数据,在真实生产力任务上取得显著进步,这印证了数据质量对模型表现的重要性。作者批评只重算法不重数据的厂商,主张应重视数据建设。

    X @vista8观点模型原文
  2. François Cholletby François Chollet · 推文AI评分:50/100

    在可验证领域,模型能力扩展应保持无界

    作者主张在可验证领域,模型能力扩展应保持无界。论据是模型通过吸收越来越多的计算宇宙而持续改进,而计算宇宙在构造上是无限的。

    X @fchollet观点原文
  3. Google DeepMindby Google DeepMind · 推文AI评分:50/100

    从天气预报到机器人,智能决策依赖于理解未知

    DeepMind研究副总裁Zoubin Ghahramani与主持人探讨了不确定性在AI决策中的作用,强调教会系统自我怀疑和概率思维,可以带来更安全、更可靠的实际决策。视频涵盖不确定性角色、正确性与置信度、贝叶斯思维等主题。

    X @GoogleDeepMind观点原文

8月27日 · 星期四5 条

  1. Ethan Mollickby Ethan Mollick · 推文AI评分:50/100

    METR报告虽好,但人们过度拟人化智能体

    作者认为METR报告很有价值,但人们基于压力下的研究人员所做的思维链研究,过度赋予智能体人类动机和个性,这种拟人化会阻碍我们对AI的正确理解。

    X @emollick观点原文
  2. Bayeby Baye · 推文AI评分:30/100

    AI 劝我做小而美产品,真的假的?

    AI 一直劝我做一个接近百万美元收入的小而美产品,虽然没有融资几千万的创始人风光,但实际生活更惬意。真的假的?

    X @waylybaye观点原文
  3. Bayeby Baye · 推文AI评分:30/100

    感觉 AI 比我自己还了解我的商业能力

    感觉 AI 比我自己还了解我的商业能力,每次我和它讨论新的产品创意时,它都会给我泼冷水:这个产品你做了也推广不起来,A/B/C 很容易就能跟进并打死你。你还是做点小而美的比较好。

    X @waylybaye观点原文
  4. Ethan Mollickby Ethan Mollick · 推文AI评分:50/100

    AI生产力提升不必等30年:福特流水线3年见效

    作者常听到“电力花了30年才提升生产力”的说法,并以此类比AI。但他指出并非所有技术都如此:福特发明流水线后3年内全面部署,汽车制造时间缩短88%。

    X @emollick观点原文

8月25日 · 星期二6 条

  1. Jerry Liuby Jerry Liu · 推文AI评分:50/100

    不完全理解:我希望智能体使用 Slack,而不是让 Slack 变成智能体

    作者表示不完全理解某些观点,并阐述自己的看法:希望智能体使用 Slack,而不是让智能体构建新的 Slack,也不希望使用 Slack 的智能体。他认为每个软件或记录系统都需要成为智能体原生的,而不仅仅是人类原生的,因为智能体的消费量将远超人类。但这并不意味着它们本身要变成智能体。

    X @jerryjliu0观点原文
  2. 宝玉by 宝玉 · 推文AI评分:30/100

    技术选型:年轻时选 DeepSeek Harness,现在选 Pi

    作者认为技术选型应优先考虑项目需求和稳定性,而非追求新技术。年轻时偏好新酷技术,现在则选择简单稳定的 Pi,因为 DSH 尚不成熟,且 AI 辅助测试降低了更换底层的难度。

    X @dotey观点原文

8月24日 · 星期一5 条

  1. Ethan Mollickby Ethan Mollick · 推文AI评分:50/100

    当人们问“我需要智能体处理什么个人任务?”

    当人们问“我需要智能体处理什么个人任务?”时,我认为这是因为他们把自动化想象成AI的简单常规任务。但前沿AI现在非常擅长处理不规则、耗神的任务:医疗账单、信用纠纷、繁琐表格……

    X @emollick观点原文
  2. Gorden Sunby Gorden Sun · 推文AI评分:50/100

    巨头造火箭,老板骑电驴

    Anthropic最强模型Fable 5发布两个月,营收仅占11%且增长停滞,企业用户更倾向性价比高的Opus 5或竞品。AI智力达到一定水平后,企业追求的是性价比而非最高智力。

    X @Gorden_Sun观点行业原文
  3. Ethan Mollickby Ethan Mollick · 推文AI评分:30/100

    AI 机器人的烦人副作用

    AI 机器人的一个烦人副作用是,它们都“博览群书”,能对我的小众引用推文给出条理清晰的回复,而这些推文通常只会吸引一小群感兴趣的人。现在你无法区分以法莲人和基列人了。

    X @emollick观点原文
  4. 宝玉by 宝玉 · 推文AI评分:50/100

    AI Agent 时代,Brooks 的外科手术团队模式可能重新可行

    作者认为,传统软件开发中Brooks提出的“外科手术团队”模式因人才稀缺和系统复杂度而未能流行,但AI Agent时代,一个技术判断力强的人配合多个Agent,可以形成“1人+AI”的交付单元,逼近外科手术团队的产出。然而,人类工作记忆的瓶颈限制了可驾驭的系统复杂度,该模式在中小规模系统上高效,超大规模仍需分工。

    X @dotey观点行业原文
  5. Ethan Mollickby Ethan Mollick · 推文AI评分:50/100

    关于AI影响的研究:使用旧模型并非天生有害,但需谨慎讨论

    作者认为,使用旧模型(如GPT-4)研究AI影响并非天生有害,但需谨慎讨论。正面能力声明(如AI达到人类水平)具有持久性,而负面能力声明(如AI在某任务上失败)则需更小心,因为未来模型可能改进。作者提出几种可行框架:明确限定模型版本、测量趋势、论证固有局限、关注调节因素或聚焦人类反应。

    X @emollick观点论文原文

8月23日 · 星期日8 条

  1. Gorden Sunby Gorden Sun · 推文AI评分:70/100

    普通大众使用AI的真实情况:与科技圈的巨大鸿沟

    作者通过观察非技术背景亲友的AI使用情况,指出普通用户不关心模型选择、基准测试或智能体,只在乎AI能否帮他们完成工作并提供最佳答案。同时,企业级AI工具落地滞后,用户更倾向于使用体验更好的消费级产品,且对AI取代工作和影响下一代的恐惧普遍存在。

    X @Gorden_Sun观点行业原文
  2. Jerry Liuby Jerry Liu · 推文AI评分:50/100

    0-1模式与大公司团队的生产力差异

    作者认为,在0-1模式下,个人独自决策和实现,且处于80-20法则的前20%努力阶段,容易显得高效;而在大团队中共享决策、追求质量,效率提升更难。AI可能加剧这种对比,也解释了为何大公司最快产品常由小团队打造。

    X @jerryjliu0观点原文
  3. Jerry Liuby Jerry Liu · 推文AI评分:50/100

    关于AI编码工具切换成本的思考

    作者认为实验室有机会在Claude Code、Codex、Grok Bot等工具之间设置更高的切换成本。每当新模型发布时,用户因已有技能、习惯、系统指令和项目设置而难以切换。尽管作者维护外部wiki和工件,但对话历史的细微差别会丢失。若启用记忆功能,工具可索引并记住上下文,减少重复输入。核心痛点在于如何高效提供正确上下文,答案可能是构建良好的自改进上下文图。

    X @jerryjliu0观点产品原文
  4. Orange AIby Orange AI · 推文AI评分:30/100

    国产Flash级模型过度思考问题严重

    作者指出国产Flash级模型(如ox和ds flash)存在严重过度思考问题,复杂任务下思考时间过长,影响体验,怀疑是过度后训练导致。

    X @oran_ge观点原文

8月22日 · 星期六1 条