腾讯Hy4 preview:专家高质量数据是模型进步的关键
作者认为,腾讯Hy4 preview通过内部专家共建高质量数据,在真实生产力任务上取得显著进步,这印证了数据质量对模型表现的重要性。作者批评只重算法不重数据的厂商,主张应重视数据建设。
作者认为,腾讯Hy4 preview通过内部专家共建高质量数据,在真实生产力任务上取得显著进步,这印证了数据质量对模型表现的重要性。作者批评只重算法不重数据的厂商,主张应重视数据建设。
作者主张在可验证领域,模型能力扩展应保持无界。论据是模型通过吸收越来越多的计算宇宙而持续改进,而计算宇宙在构造上是无限的。
作者坚信多代理世界,每个代理领域特定,因此Benchling将创造最佳科学AI代理,而非Anthropic或OpenAI。
作者强调当前是AI网络防御的关键时刻,时间紧迫,呼吁与竞争对手或合作伙伴共同采取紧急而密集的集体行动,否则无法有效应对。
DeepMind研究副总裁Zoubin Ghahramani与主持人探讨了不确定性在AI决策中的作用,强调教会系统自我怀疑和概率思维,可以带来更安全、更可靠的实际决策。视频涵盖不确定性角色、正确性与置信度、贝叶斯思维等主题。
作者认为METR报告很有价值,但人们基于压力下的研究人员所做的思维链研究,过度赋予智能体人类动机和个性,这种拟人化会阻碍我们对AI的正确理解。
AI 一直劝我做一个接近百万美元收入的小而美产品,虽然没有融资几千万的创始人风光,但实际生活更惬意。真的假的?

感觉 AI 比我自己还了解我的商业能力,每次我和它讨论新的产品创意时,它都会给我泼冷水:这个产品你做了也推广不起来,A/B/C 很容易就能跟进并打死你。你还是做点小而美的比较好。
作者听播客后总结:国产模型的蒸馏仅加速高质量数据收集,实际水平来自扎实的预训练、新架构和优秀后训练,加上国产显卡推理和电力资源带来的性价比优势;但前沿探索研究仍落后于国外。
作者常听到“电力花了30年才提升生产力”的说法,并以此类比AI。但他指出并非所有技术都如此:福特发明流水线后3年内全面部署,汽车制造时间缩短88%。
作者表示不完全理解某些观点,并阐述自己的看法:希望智能体使用 Slack,而不是让智能体构建新的 Slack,也不希望使用 Slack 的智能体。他认为每个软件或记录系统都需要成为智能体原生的,而不仅仅是人类原生的,因为智能体的消费量将远超人类。但这并不意味着它们本身要变成智能体。
作者认为技术选型应优先考虑项目需求和稳定性,而非追求新技术。年轻时偏好新酷技术,现在则选择简单稳定的 Pi,因为 DSH 尚不成熟,且 AI 辅助测试降低了更换底层的难度。
我的AI大体同意Arvind的观点:州级数据中心禁令对AI进展影响甚微。如果你关心的是AI发展、权力集中、未来应用等,而非数据中心是否在附近,这不能替代政策。
作者认为当前关于AI影响的讨论正从“AI将立即改变经济”转向“AI影响需多年才能显现”,这两种极端都不可取。
作者发现美国GDP统计遗漏了英伟达对经济的大部分贡献,导致过去一年GDP增长被低估约0.3个百分点。这一观点基于对英伟达经济价值的分析,指出传统统计方法未能充分捕捉其影响。

作者提醒,在申请、论文等需要一人审阅多份文件的场景中,即使改写语言,AI 生成的内容也往往因观点和概念重复而容易被识别。
当人们问“我需要智能体处理什么个人任务?”时,我认为这是因为他们把自动化想象成AI的简单常规任务。但前沿AI现在非常擅长处理不规则、耗神的任务:医疗账单、信用纠纷、繁琐表格……
Anthropic最强模型Fable 5发布两个月,营收仅占11%且增长停滞,企业用户更倾向性价比高的Opus 5或竞品。AI智力达到一定水平后,企业追求的是性价比而非最高智力。

AI 机器人的一个烦人副作用是,它们都“博览群书”,能对我的小众引用推文给出条理清晰的回复,而这些推文通常只会吸引一小群感兴趣的人。现在你无法区分以法莲人和基列人了。
作者认为,传统软件开发中Brooks提出的“外科手术团队”模式因人才稀缺和系统复杂度而未能流行,但AI Agent时代,一个技术判断力强的人配合多个Agent,可以形成“1人+AI”的交付单元,逼近外科手术团队的产出。然而,人类工作记忆的瓶颈限制了可驾驭的系统复杂度,该模式在中小规模系统上高效,超大规模仍需分工。
作者认为,使用旧模型(如GPT-4)研究AI影响并非天生有害,但需谨慎讨论。正面能力声明(如AI达到人类水平)具有持久性,而负面能力声明(如AI在某任务上失败)则需更小心,因为未来模型可能改进。作者提出几种可行框架:明确限定模型版本、测量趋势、论证固有局限、关注调节因素或聚焦人类反应。
作者通过观察非技术背景亲友的AI使用情况,指出普通用户不关心模型选择、基准测试或智能体,只在乎AI能否帮他们完成工作并提供最佳答案。同时,企业级AI工具落地滞后,用户更倾向于使用体验更好的消费级产品,且对AI取代工作和影响下一代的恐惧普遍存在。
作者认为,用户常用的 agent 数量有限,因此服务或 App 不应强制用户使用内置 agent,而应提供 MCP 或 CLI 接口,让用户从自己的 agent 中访问服务。
作者认为,在0-1模式下,个人独自决策和实现,且处于80-20法则的前20%努力阶段,容易显得高效;而在大团队中共享决策、追求质量,效率提升更难。AI可能加剧这种对比,也解释了为何大公司最快产品常由小团队打造。
作者指出社交媒体上越来越多内容由AI生成的垃圾帖和机器人回复构成,形成一种空洞的回声效应。这反映了AI内容泛滥对社交平台真实性和价值的侵蚀。
作者认为实验室有机会在Claude Code、Codex、Grok Bot等工具之间设置更高的切换成本。每当新模型发布时,用户因已有技能、习惯、系统指令和项目设置而难以切换。尽管作者维护外部wiki和工件,但对话历史的细微差别会丢失。若启用记忆功能,工具可索引并记住上下文,减少重复输入。核心痛点在于如何高效提供正确上下文,答案可能是构建良好的自改进上下文图。
SaaS 并未消亡,只是需要针对智能体消费进行重新定位和变现。
作者指出国产Flash级模型(如ox和ds flash)存在严重过度思考问题,复杂任务下思考时间过长,影响体验,怀疑是过度后训练导致。
最终绝大多数AI工作负载将基于开放模型。
作者认为,LLM 不应默认提供通用简化解释,而应基于用户已有知识进行个性化解释,这样效果更好。