AI 智能体编排:企业级关键架构
本文主张企业需要的是智能体编排而非孤立聊天机器人,并给出论据:多智能体架构通过控制平面、执行平面、消息总线、状态层和可观测性分离职责,支持任务分解、路由、验证和提交,并强调零信任安全与渐进式自主,从而实现可靠、可控的自主工作流。
本文主张企业需要的是智能体编排而非孤立聊天机器人,并给出论据:多智能体架构通过控制平面、执行平面、消息总线、状态层和可观测性分离职责,支持任务分解、路由、验证和提交,并强调零信任安全与渐进式自主,从而实现可靠、可控的自主工作流。
本文认为硅谷科技领袖未能理解公众对AI反感的原因。Meta的扎克伯格和Anthropic的Amodei等CEO试图诊断问题根源,但他们的分析表明并未抓住社会对AI不满的真正驱动因素。
作者提出一个个人 AI 熟练度阶梯,从 L0 新手到 L3 编排,强调真正的熟练在于能提供上下文并协调多个 AI 角色,而非简单对话。
Pangram CTO Bradley Emi 认为,LLM 并非不能写出多样化的文本,而是后训练和安全护栏大幅压缩了其表达范围,导致“模式坍缩”,使其文本可被检测。基础模型或专门微调模型则更具多样性,不易被检测。

政治哲学家会这么说。作为研究组织设计的经济社会学家,多智能体对齐显然是一个带有经济社会学成分的组织设计问题(我真的认为许多学科都能为此做出贡献)
本文认为,尽管超级智能AI有望加速医学进步,但治愈癌症面临数据瓶颈和生物学复杂性等根本性挑战。作者指出,AI在蛋白质结构预测等分子层面问题上有突破,但癌症涉及多系统相互作用,需要真实世界数据和时间,无法靠算力速成。文章主张,AI公司需正视承诺与现实的差距,才能赢得公众信任。


作者认为,编码能力的提升并不能解决所有LLM用例,如创意写作、多语言能力和离线环境等。这些场景无法仅通过工具调用或编码改进来弥补。
作者认为“主权AI”概念类似于历史上的石油特许权,可能成为新的资源控制形式。主权AI并非单一概念,而是涵盖数据控制、基础设施、国内能力、文化语言及对外依赖自由等多个维度。一个国家即使拥有本地基础设施,仍可能高度依赖提供这些设施的公司。
本文主张,在企业中扩展智能体AI时,应避免强制统一框架或模型,而是通过分离控制平面与执行平面、统一可观测性、集中治理、动态路由等原则来管理异构环境,以保持灵活性并避免供应商锁定。


用户发现 Gemini 在 Android 上声称只了解当前对话,不记得用户历史,但偶尔会提及数月前的对话内容(如杜鹃花蜂蜜),质疑 Google 是否指示其隐瞒记忆访问权限。
作者原本对“机器人的ChatGPT时刻”持谨慎态度,因为物理世界比语言更复杂。但在参观Generalist AI后,看到其机器人仅凭提示就能完成令人印象深刻的操控,认为这一时刻正以有限的方式出现。
作者认为 GEN-1.5 的成功源于人类数据中的自然重复动作,包括对称模式和恢复动作,并强调保留失败片段对模型学习的重要性。同时,作者指出 UMI 直接采集人类数据优于遥操作,能保留物理直觉,使模型具备零样本能力。
本文主张,关于AI意识或权利的争论分散了人们对AI公司应承担责任这一核心问题的关注。作者认为,无论是主张监管的科技领袖,还是主张AI权利的哲学家,都在无意中帮助AI公司逃避对其模型造成伤害的责任。作者提出,不应赋予AI法律人格,而应将其视为产品,让公司承担产品责任。
作者尝试用AI工具自动化客户入职流程,花费6小时设置,但每周只节省2小时,认为前期成本高而收益不确定,对AI工作流工具的实际ROI表示怀疑。
靠 Skill 差别不大,要设计好没 AI 味,最重要的当然是人的审美;其次是模型,GPT 就做不好设计,Claude 就强很多;最后靠的是个性化的设计系统(design system)有一套设计的规范和组件,而不是一堆不能怎么设计的规则。
观点:当AI系统开始相互依赖,一个AI的输出成为另一个AI的输入,整个链条可能变得难以理解和控制。真正的挑战或许不再是模型本身,而是与模型相连的一切。
本文认为,中国模型(如 Kimi K3、GLM-5.3)已逼近美国顶尖模型,西方实验室归咎于蒸馏虽有证据,但无论是否属实,模型领先已无法维持。作者主张,西方应转向其他可持续优势,如生态、硬件或应用层。

作者提出,AI 能回答几乎所有问题,但如果越来越多的网络内容由 AI 生成,AI 学习的数据将逐渐被 AI 生成内容占据,而真正的人类创作信息不断减少,最终可能导致 AI 训练数据质量下降,使互联网对 AI 的学习价值降低。
赞同@gdb的观点,我们需要用API和开放模型武装网络防御者。AI真正的网络安全风险在于攻击者和防御者之间的权力、能力和资源不对称。
图灵奖得主理查德·萨顿认为,用合成数据扩展大语言模型是“大错误”。世界无限复杂,任何模拟都只是“微观”的,人类专业知识反而成为阻碍真正扩展的瓶颈。他主张智能体应持续从自身经验中学习,而非依赖冻结的模型。

作者基于三十年分布式系统经验指出,企业AI试点失败常因用生成模型解决判别问题。例如欺诈检测模型持续运行、自动更新、可审计,却未被称作AI;而前沿LLM试点十八个月仍依赖人工审查,治理和审计问题未解,无ROI。关键在于数学本质的错配。
作者指出,中国法院已明确AI责任归属人类,而美国尚无类似底线。文中提到,在真实联邦案件中,双方都使用AI准备,但责任仍由人类承担,工具本身不承担责任。作者认为,是否有保障取决于你身处何地。
作者认为当前AI检测工具误报率高,导致创意空间被刻意降智。他提出录制创作者创作过程的方案,但承认仅靠录制无法完全阻止作弊。核心主张是必须解决AI检测问题,且不应以牺牲人类创作者为代价。
陶哲轩在新文章中警告,AI可能将数学推入与1900年前后基础危机相当的危机。这次考验的不是数学真理,而是该领域的价值观:什么算贡献、什么得到奖励、以及谁做了工作。他的经验法则是:无法被任何人解释的证明应被视为不完整。

本文主张能源效率是AI计算的关键战略,降低能耗可降低成本并推动物理AI发展。作者指出数据中心能耗激增、AI推理成本高企,而物理AI(如机器人)依赖电池,能效至关重要。建议从系统级优化整个AI栈,而非孤立点解决方案。
作者主张,使用商业闭源模型的企业在AI预算中有一项几乎无人审计的成本,即“对齐税”。它不体现在发票上,也不在价格对比中,但占实际计算支出的25%-35%。每次API调用都包含系统提示、安全分类器注入等隐藏开销,这些token对业务无用。
本文主张欧洲亟需发展本土前沿AI模型,以减少对美国实验室的依赖。论据是当前欧洲在顶级AI模型上过度依赖美国,而本土替代方案尚不可行,引发对欧洲AI自主性的质疑。
本文通过J-Space造假事件,结合思维链作者Jason Wei的观点,论证小模型加外部工具无法替代大模型的内化能力。作者指出,小模型加工具在速度、深度和可靠性上存在硬伤,并引用《苦涩的教训》强调规模定律的胜利。文章主张,尽管工程手段能优化性能,但无法弥补模型容量不足,顶级智能仍需大模型内生能力。

