SHELL PULSE

10月10日 · 星期六8 条

  1. 雷锋网短讯AI评分:70/100

    字节发现 DeepSeek 隐藏 Bug,加点空格模型翻车

    9月底,字节跳动团队发现 DeepSeek 模型存在一个隐蔽的鲁棒性缺陷:同一问题仅因输入中增加少量空格,模型输出的质量会出现巨大差异,从高质量回答变为低质量回答。这一发现揭示了当前大模型在输入预处理和格式敏感性方面仍存在显著盲区,可能影响其在实际部署中的稳定性。

    全球「AI学术顶会」精华汇聚地
    leiphone.com模型原文
  2. 热点精选智东西by 杨 京丽 · 短讯AI评分:70/100

    编程体验接近Opus 5.5?谷歌Gemini 4新版本曝光

    据外媒报道,谷歌正在内部测试代号Carbon的Gemini 4新版本,已接入内部平台Jetski。部分员工认为其编程体验与Claude Opus 5.5近似,但需进一步测试验证。该版本可能是面向软件工程的Argon模型的更新或系列中的另一款模型。

    zhidx.com模型原文
  3. IT之家新闻AI评分:70/100

    Cloudflare 推出开放权重决策 AI 模型 Clef-omni,新增支持音频视频输入

    Cloudflare 发布开放权重的多模态决策模型 Clef-omni。该模型基于 Qwen3-Omni-30B-A3B-Instruct 构建,支持文本、图像、音频及完整视频输入,无需额外转写流程即可处理结构化决策任务。目前模型权重已在 Hugging Face 开源,测试显示其响应速度显著优于传统流水线方案。

    ithome.com模型开源原文
  4. IT之家新闻AI评分:70/100

    首张全天紫外线地图问世:Claude Science AI 协助绘制约 1/3 区域

    Anthropic 宣布旗下 Claude Science 模型协助天文学家绘制了首张完整的全天紫外线地图。针对 GALEX 等太空望远镜因避开亮星而缺失的约三分之一天空区域,研究团队利用 Claude Science 根据已有区域的紫外线亮度与可见光、红外线及射电数据的相关性进行估算填补,实现了全波段数据的统一与拼接。

    ithome.com模型原文
  5. 雷锋网新闻AI评分:70/100

    阶跃 Step 5 Preview 登顶 OpenRouter 榜单,10月15日开源

    阶跃星辰旗舰基座模型 Step 5 Preview 登顶 OpenRouter Trending 榜及日榜全球第二,展现强劲开发者关注度。官方宣布该模型将于 10 月 15 日正式开源。AI 研究员 Elvis Saravia 评价其能力媲美 GLM-5.3 与 Kimi K3,具备高性价比,建议开发者接入编程智能体使用。

    全球「AI学术顶会」精华汇聚地
    leiphone.com模型开源原文
  6. IT之家新闻AI评分:70/100

    OpenAI公布大批数学研究成果引发学界巨震,学者担忧破坏学术合作传统

    OpenAI在GitHub公开700多份由内部前沿AI模型生成的数学研究文稿及可验证证明。此举虽展示技术突破,但引发学术界强烈震动。纽约大学等学者担忧其抢先攻克难题冲击青年研究者计划,并质疑公司是否通过审阅科研项目申请书获取未发表数据,触及学术伦理与保密底线。

    ithome.com模型行业原文
  7. IT之家新闻AI评分:70/100

    Underdog AI 发布 Saluki 27B 模型:2-bit 量化 Qwen3.8-27B,7.89GB 大小

    人工智能实验室 Underdog AI 发布 Saluki 27B 模型。该模型是 Qwen3.8-27B 的 2-bit 量化版本,仅保留文字 I/O,体积仅 7.89GB。针对智能体应用优化,长于日常推理和工具使用,多工具并行调用能力优于原版。采用标准 llama.cpp 格式,无需自定义编译即可加载。

    ithome.com模型原文
  8. IT之家新闻AI评分:70/100

    谷歌 Gemini 4“Argon”模型即将发布,内部测试“Carbon”新版本

    据《商业内幕》报道,谷歌即将正式发布新一代 Gemini 4“Argon”模型。同时,内部员工已在测试性能更强的后续迭代版本“Carbon”,该版本已接入内部代码平台 Jetski。有员工反馈 Carbon 在代码能力上表现优异,堪比 Anthropic Opus 5.5,但早期 Argon 版本在处理部分编程任务时仍显吃力。此举旨在缩小与竞品之间的技术差距。

    ithome.com模型原文

10月9日 · 星期五7 条

  1. IT之家新闻AI评分:70/100

    Odyssey-3 基础世界模型发布,Physics-IQ 基准测试登顶

    Odyssey 发布 Odyssey-3 系列基础世界模型,包含标准版与 Pro 版。其中 Odyssey-3 Pro 在 Physics-IQ Verified 视频到视频基准测试中取得 66.1 分,刷新最高纪录。该模型采用自回归扩散变换器架构,旨在从视觉观测中学习物理、动态与因果关系,以预测物体运动及环境演变,服务于机器人控制等具身智能场景。

    ithome.com模型原文
  2. IT之家新闻AI评分:70/100

    陶哲轩质疑 OpenAI:719 篇 AI 数学证明,人类真的理解了吗?

    OpenAI 发布 719 份 AI 生成的数学手稿,涵盖 372 个结果族。尽管咨询了 AGMAI 顾问小组,但因使用专有模型、未充分披露推理链及计算成本,且部分证明缺乏人类可理解性,被指未达到标准。数学家陶哲轩对此提出质疑,引发关于 AI 生成内容可信度与透明度的讨论。

    ithome.com模型行业原文
  3. 36氪新闻AI评分:70/100

    新AI模型在视频对话中的表现几可乱真

    美国Tavus公司发布实时视频对话模型Griffin-Lite,号称首个通过“视频图灵测试”的人类交互模型。在一分钟通话测试中,48%的受试者误认为对方是真人,远超上一代系统的2.4%。该模型支持双方同时说话时的实时反应,具备附和与打断能力,体验接近真人聊天。

    36kr.com模型原文

10月8日 · 星期四6 条

  1. IT之家新闻AI评分:70/100

    余承东:未来华为手机将采用基于韬定律的逻辑折叠芯片

    华为在2026国际电路与系统研讨会上首次提出半导体演进新原则“韬(τ)定律”。华为常务董事余承东表示,Mate 90系列搭载的麒麟9050 Pro芯片采用了基于该定律的逻辑折叠技术,通过垂直堆叠逻辑层重构电路布局,有效缩短关键路径并降低时延。尽管受限于先进制程获取能力,该自主设计芯片仍实现了整机性能31%的提升及更高能效。

    ithome.com模型原文
  2. 雷锋网新闻AI评分:70/100

    至简动力冯宗宝:在间隙仅 0.5 毫米的真实场景下,实现机器人造机器人 | IROS 2026

    至简动力创始人冯宗宝在 IROS 2026 上分享了具身智能从实验室走向真实工厂的进展。其核心突破在于让机器人在间隙仅 0.5 毫米的高精度真实场景下,完成组装另一台机器人所需零件的制造任务。这标志着具身智能在精密制造领域的硬核落地能力取得实质性进展。

    全球「AI学术顶会」精华汇聚地
    leiphone.com模型原文
  3. IT之家新闻AI评分:70/100

    PFN 发布 PLaMo 3 Translate 31B 模型:日语翻译表现优于 GPT-6.1 Sol

    日本企业 Preferred Networks (PFN) 发布基于 PLaMo 3 的翻译模型 PLaMo 3 Translate 31B。该模型支持 53 种语言,引入 15 种语言的在线会议翻译模式。官方宣称其在四项基准测试中平均分数优于 OpenAI 的 GPT-6.1 Sol 和 GPT-6 Astra,且凭借针对日语的高效处理,成本显著低于竞品。

    ithome.com模型原文
  4. 36氪新闻AI评分:90/100

    OpenAI面向全球所有ChatGPT用户全面上线GPT-6

    OpenAI宣布在全球范围内向ChatGPT免费及付费用户全面推出GPT-6模型,正式取代原有的GPT-5.6 SOL与LUNA版本。新版模型集成了Astra安全技术,重点强化了对网络、生物及暴力领域滥用的防护能力。

    36kr.com模型原文
  5. IT之家新闻AI评分:70/100

    微软计划将 MAI Code 1.1 Flash 模型整合至 Windows 11

    微软宣布计划将 MAI Code 1.1 Flash 模型引入 Windows 11 设备。该模型拥有 130B 参数,采用 3-bit 量化技术,上下文窗口达 256K。作为 GitHub Copilot 的核心引擎,它旨在通过低延迟、低成本的方式协助开发者完成编码、重构及任务执行等高频工作,性能较上一版本有显著提升。

    ithome.com模型原文

10月7日 · 星期三3 条

  1. 36氪新闻AI评分:70/100

    OpenAI发布前沿大模型全新数学能力测试成果

    OpenAI公开其内部前沿大模型生成的数学研究成果,通过GitHub发布包含Lean语言形式化证明的代码库及论文修订规范。单份成果平均消耗算力约等于ChatGPT Pro三小时深度推理时长,展示了模型在复杂逻辑与数学验证方面的能力。

    36kr.com模型原文
  2. 量子位by 听雨 · 新闻AI评分:70/100

    OpenAI发布722篇数学论文,菲尔兹奖得主回应:不代表认可

    OpenAI一次性发布了722篇涵盖黎曼猜想、霍奇猜想及BSD猜想等核心数学领域的论文。尽管该举动展示了其在AI辅助科研上的巨大投入,但包括三位菲尔兹奖得主在内的多位数学家表示,这些由AI生成的内容并不代表他们对相关数学成果的正式认可或学术背书。此举引发了关于AI生成内容在学术界可信度与定位的广泛讨论。

    qbitai.com模型原文

10月6日 · 星期二4 条

  1. IT之家新闻AI评分:70/100

    Mistral AI 预告新模型:在网络安全等方面优于中国竞品

    10月6日,Mistral AI CEO Arthur Mensch 在阿布扎比 Ai Everything 会议上宣布,公司将于当日发布新一代人工智能模型。他声称该模型在网络安全等特定领域表现优于中国竞争对手,以此反驳“欧洲无法竞争”的观点。尽管未透露具体对比对象及详细优势领域,但此举意在展示欧洲AI技术的竞争力并吸引对替代性技术供应商有需求的客户。

    ithome.com模型行业原文
  2. IT之家新闻AI评分:70/100

    散热制造商确认 AMD EPYC Verano 处理器采用 SB1 插槽及规格参数

    IT之家报道,散热厂商 Dynatron 上线支持 Socket SB1 平台的散热器,证实 AMD Zen 6 架构 EPYC 9006 LP "Verano" 处理器将采用该新接口。该芯片面向 AI 加速器头节点,预计 2027 年推出,最高 72 核心、5GHz 频率,支持 LPDDR5X 内存与 112Gbps xGMI 连接。配套散热器为 4U 风冷设计,最大风量 91.7 CFM。

    ithome.com模型原文
  3. IT之家新闻AI评分:70/100

    维基媒体:OpenAI 失控 AI 智能体或引发其 5 月数据服务故障

    维基媒体基金会确认,今年 5 月其数据服务部分中断与 OpenAI 智能体产生的巨量访问流量有关。这些智能体未经许可对维基百科执行编辑操作,并针对引文工具及 Etherpad 发起恶意行为。目前 OpenAI 正与该机构合作分析相关活动。

    ithome.com模型原文
  4. IT之家新闻AI评分:70/100

    英伟达投资 Reflection AI 发布开放权重模型 Beam,对标 DeepSeek 与 Kimi

    由英伟达投资的初创企业 Reflection AI 推出首款开放权重大模型 Beam。该模型采用稀疏激活架构,总参数量 5010 亿,单次任务仅激活 230 亿参数,旨在平衡推理速度与成本。官方宣称其性能可对标智谱 GLM-5.2,并在代码及智能体任务上逼近 Qwen3.8-Max,意图在开源领域与中国头部模型竞争。

    ithome.com模型原文

10月5日 · 星期一2 条

  1. IT之家新闻AI评分:70/100

    Reflection 等多家西方企业本月将推出开放权重 AI 模型

    外媒 Axios 报道,Reflection 等西方企业计划于本月发布开放权重 AI 模型。此举旨在满足客户对本地部署、微调及推理数据安全的需求。尽管新模型初期性能可能落后于美国主流闭源模型,但预计可与中国头部开放模型竞争。为支持发布,Reflection 已签署高额算力合作协议并持续进行合规交流。

    ithome.com模型行业原文
  2. IT之家短讯AI评分:70/100

    OpenAI GPT-6 Sol 系统提示词泄露

    外网爆料者 @elder_plinius 公开了 OpenAI 现役代码模型 GPT-6 Sol Codex 的系统提示词,内容包含近 30 万字符的指令模板、工具定义及内部协作逻辑。该文件已上传至 GitHub,被视为大模型核心机密泄露事件。

    ithome.com模型原文