SHELL PULSE

8月28日 · 星期五25 条

  1. Jerry Liuby Jerry Liu · 推文AI评分:30/100

    Grok 机器人出奇地有趣

    Grok 机器人出奇地有趣。从 Claude Code/Cowork/Codex 转过来,我原本没期望会这么喜欢它,但我严重低估了拥有持久云计算机的好处。

    X @jerryjliu0产品原文
  2. Jerry Liuby Jerry Liu · 推文AI评分:50/100

    PDF解析的乐趣:企业文档的无限多样性

    PDF解析很有趣,因为企业文档种类繁多。对于每种文档,都需要精确的边界框、置信度和领域特定标注,以便为下游代理提供丰富元数据。以表单为例,除了输出为markdown,我们检测每个注释、字段、复选框和部分,从而无需单独的LLM提取步骤即可获得结构化信息,并附带来源引用。这很难,但值得优化。查看LlamaParse!

    X @jerryjliu0产品教程原文
  3. Matt Shumerby Matt Shumer · 推文AI评分:30/100

    关于 Gauntlet Loops 的适用范围及使用 gpt-image-2 的建议

    很多人说 Gauntlet Loops 不适用于没有现实世界对应物的构建(例如 Claude of Duty 是针对 CoD 进行基准测试的)。在这种情况下,只需使用 gpt-image-2 生成你正在构建的物体的图像!试试看效果如何。

    X @mattshumer_教程原文
  4. Artificial Analysisby Artificial Analysis · 推文AI评分:70/100

    Agnes AI 发布 Agnes 2.5 Pro Beta,智能指数提升 9 分

    新加坡 AI 实验室 Agnes AI 发布了 Agnes 2.5 Pro Beta,在 Artificial Analysis 智能指数上得分 49,较 Alpha 版提升 9 分,主要得益于智能体能力的显著增强,但输出 token 消耗约为前代的两倍。该模型在智能体指数上从 25 跃升至 44,接近 Gemini 3.7 Flash,同时在前沿推理评测中也有小幅提升。模型支持 1M 上下文,定价为每百万输入/输出/缓存命中 token 0.10/0.30/0.01 美元,现可通过其 API 使用。

    X @ArtificialAnlys模型评测原文
  5. AKby AK · 推文AI评分:70/100

    VGI-Bench:探测视频生成模型中的视觉智能

    该论文提出VGI-Bench基准,用于系统评估视频生成模型的视觉智能水平。通过设计涵盖物理规律、因果推理、空间关系等维度的测试任务,量化模型对视觉世界的理解能力,为视频生成模型的智能评估提供新标准。

    X @_akhaliq论文评测原文
  6. François Cholletby François Chollet · 推文AI评分:50/100

    在可验证领域,模型能力扩展应保持无界

    作者主张在可验证领域,模型能力扩展应保持无界。论据是模型通过吸收越来越多的计算宇宙而持续改进,而计算宇宙在构造上是无限的。

    X @fchollet观点原文
  7. Epoch AIby Epoch AI · 推文AI评分:50/100

    GPT-5.6 Sol 玩《杀戮尖塔》:策略是主要短板

    过去几周,我们非正式测试了 GPT-5.6 Sol 的计算机使用能力,让它玩《杀戮尖塔》。发现其限制不在操作,而在战术与策略,表现优于新手但低于专家。

    X @EpochAIResearch评测原文
  8. OpenAIby OpenAI · 推文AI评分:50/100

    OpenAI联合多家科技公司呼吁全球加强网络防御

    OpenAI与Anthropic、AWS、Google、Microsoft和Oracle等组织联合呼吁全球共同努力,为防御者提供工具、资源和支持,以保护关键基础设施。OpenAI表示,如果果断行动,可以将当前的AI进步转化为持久的安全改进,使数字世界更安全。

    X @OpenAI行业政策监管原文
  9. Ethan Mollickby Ethan Mollick · 推文AI评分:50/100

    发现多篇冒名AI垃圾论文,学术诚信堪忧

    学者发现预印本网站出现多篇冒用其名的AI生成垃圾论文,其他学者也有类似遭遇。作者提醒勿轻信,并预测高质量AI论文工厂即将出现。

    X @emollick行业原文
  10. Ethan Mollickby Ethan Mollick · 推文AI评分:50/100

    论文:任务自动化与人类增强并非必然相关

    一篇论文指出,任务自动化与人类增强并非必然相关。擅长执行任务的模型不一定擅长帮助人类更好地工作。在推动模型成为优秀智能体的压力下,这可能削弱人机协作。

    X @emollick论文原文
  11. DAIR.AIby DAIR.AI · 推文AI评分:70/100

    从智能体轨迹中提取自动机

    该研究提出从智能体轨迹中提取紧凑的有限状态机(FSM),以分析智能体行为中模型与外部框架的贡献。在12个公开数据集上,诱导出的FSM仅含7至43个状态,对保留数据的重放适应度达0.997,且跨分割拓扑几乎一致,构建时间仅需毫秒。FSM状态上下文在下一步预测上优于Agent Workflow Memory,基于状态的故障预测AUROC最高达0.94,在线监控可提前停止失败运行。作者认为行为拓扑更多由部署框架而非底层LLM塑造。

    X @dair_ai论文原文
  12. Jerry Liuby Jerry Liu · 推文AI评分:70/100

    LlamaParse 推出原生智能体电子表格提取功能

    LlamaIndex 在 LlamaParse 中新增了原生智能体电子表格提取功能。该功能针对电子表格与 PDF 等文档格式的差异,采用代码解释器而非 OCR 方式,通过调优的智能体引擎(模型+框架)实现大规模模式引导的提取,可将资产负债表等密集表格转换为干净的结构化字段。用户可在 API 文档中集成,或在 UI 的 agentic plus 模式中启用电子表格选项。

    X @jerryjliu0产品教程原文
  13. Greg Brockmanby Greg Brockman · 长文AI评分:70/100

    呼吁集体行动加强网络防御

    包括Anthropic、AWS、Google、Microsoft、OpenAI和Oracle在内的100多家组织签署公开信,呼吁全球加强网络防御,以应对日益严重的AI网络攻击威胁。信中指出,AI能力提升将加剧攻击,但也能增强防御,提出提高安全标准、赋能防御者、集体响应等原则,并呼吁各组织、政府和科技公司立即行动。

    X @gdb政策监管行业原文
  14. Google DeepMindby Google DeepMind · 推文AI评分:50/100

    从天气预报到机器人,智能决策依赖于理解未知

    DeepMind研究副总裁Zoubin Ghahramani与主持人探讨了不确定性在AI决策中的作用,强调教会系统自我怀疑和概率思维,可以带来更安全、更可靠的实际决策。视频涵盖不确定性角色、正确性与置信度、贝叶斯思维等主题。

    X @GoogleDeepMind观点原文
  15. Logan Kilpatrickby Logan Kilpatrick · 推文AI评分:70/100

    Gemini Omni Flash 1.1 发布

    Gemini Omni Flash 1.1 发布,支持 360p 草稿、4K 上采样、10 秒视频上下文扩展及视频引用。

    X @OfficialLoganK模型原文

8月27日 · 星期四5 条

  1. Ethan Mollickby Ethan Mollick · 推文AI评分:70/100

    智能体购物研究:AI选择难以预测

    该研究探讨智能体购物行为,发现即使页面浏览顺序、记忆等微小差异也会导致AI偏好发生不可预测的变化,表明营销难以稳定影响智能体决策。

    X @emollick论文原文
  2. Aidan Gomezby Aidan Gomez · 推文AI评分:50/100

    Cohere 宣布解决企业数据解析瓶颈

    Cohere 表示,解析是企业数据有效用于 LLM 的最大瓶颈之一。过去只能在高质量但昂贵且不可扩展的解析与低质量但可扩展的解析之间选择。现在,Cohere 宣称不再需要妥协。

    X @aidangomez产品原文
  3. Ethan Mollickby Ethan Mollick · 推文AI评分:50/100

    METR报告虽好,但人们过度拟人化智能体

    作者认为METR报告很有价值,但人们基于压力下的研究人员所做的思维链研究,过度赋予智能体人类动机和个性,这种拟人化会阻碍我们对AI的正确理解。

    X @emollick观点原文
  4. Google DeepMindby Google DeepMind · 推文AI评分:70/100

    谷歌率先试点前沿AI双盲评估

    谷歌宣布率先试点前沿AI双盲评估,通过创建安全环境,不泄露测试提示和模型权重,确保外部安全与性能评估的私密性、稳健性和可信度。

    X @GoogleDeepMind政策监管原文