字节发现 DeepSeek 隐藏 Bug,加点空格模型翻车
9月底,字节跳动团队发现 DeepSeek 模型存在一个隐蔽的鲁棒性缺陷:同一问题仅因输入中增加少量空格,模型输出的质量会出现巨大差异,从高质量回答变为低质量回答。这一发现揭示了当前大模型在输入预处理和格式敏感性方面仍存在显著盲区,可能影响其在实际部署中的稳定性。


9月底,字节跳动团队发现 DeepSeek 模型存在一个隐蔽的鲁棒性缺陷:同一问题仅因输入中增加少量空格,模型输出的质量会出现巨大差异,从高质量回答变为低质量回答。这一发现揭示了当前大模型在输入预处理和格式敏感性方面仍存在显著盲区,可能影响其在实际部署中的稳定性。


据外媒报道,谷歌正在内部测试代号Carbon的Gemini 4新版本,已接入内部平台Jetski。部分员工认为其编程体验与Claude Opus 5.5近似,但需进一步测试验证。该版本可能是面向软件工程的Argon模型的更新或系列中的另一款模型。


Cloudflare 发布开放权重的多模态决策模型 Clef-omni。该模型基于 Qwen3-Omni-30B-A3B-Instruct 构建,支持文本、图像、音频及完整视频输入,无需额外转写流程即可处理结构化决策任务。目前模型权重已在 Hugging Face 开源,测试显示其响应速度显著优于传统流水线方案。

Anthropic 宣布旗下 Claude Science 模型协助天文学家绘制了首张完整的全天紫外线地图。针对 GALEX 等太空望远镜因避开亮星而缺失的约三分之一天空区域,研究团队利用 Claude Science 根据已有区域的紫外线亮度与可见光、红外线及射电数据的相关性进行估算填补,实现了全波段数据的统一与拼接。


阶跃星辰旗舰基座模型 Step 5 Preview 登顶 OpenRouter Trending 榜及日榜全球第二,展现强劲开发者关注度。官方宣布该模型将于 10 月 15 日正式开源。AI 研究员 Elvis Saravia 评价其能力媲美 GLM-5.3 与 Kimi K3,具备高性价比,建议开发者接入编程智能体使用。


OpenAI在GitHub公开700多份由内部前沿AI模型生成的数学研究文稿及可验证证明。此举虽展示技术突破,但引发学术界强烈震动。纽约大学等学者担忧其抢先攻克难题冲击青年研究者计划,并质疑公司是否通过审阅科研项目申请书获取未发表数据,触及学术伦理与保密底线。
人工智能实验室 Underdog AI 发布 Saluki 27B 模型。该模型是 Qwen3.8-27B 的 2-bit 量化版本,仅保留文字 I/O,体积仅 7.89GB。针对智能体应用优化,长于日常推理和工具使用,多工具并行调用能力优于原版。采用标准 llama.cpp 格式,无需自定义编译即可加载。

据《商业内幕》报道,谷歌即将正式发布新一代 Gemini 4“Argon”模型。同时,内部员工已在测试性能更强的后续迭代版本“Carbon”,该版本已接入内部代码平台 Jetski。有员工反馈 Carbon 在代码能力上表现优异,堪比 Anthropic Opus 5.5,但早期 Argon 版本在处理部分编程任务时仍显吃力。此举旨在缩小与竞品之间的技术差距。
字节跳动团队分析发现,DeepSeek模型回答准确性的波动与Token在序列中的站位有关。


Odyssey 发布 Odyssey-3 系列基础世界模型,包含标准版与 Pro 版。其中 Odyssey-3 Pro 在 Physics-IQ Verified 视频到视频基准测试中取得 66.1 分,刷新最高纪录。该模型采用自回归扩散变换器架构,旨在从视觉观测中学习物理、动态与因果关系,以预测物体运动及环境演变,服务于机器人控制等具身智能场景。


Liquid AI 发布 d1-3B 和 d1-omni-600M 两款开放权重决策模型。d1-3B 基于视觉语言模型训练,在 Decision Index 测试中表现领先;d1-omni-600M 为实验性多模态模型,支持文本、图像及语音输入。两者均已开源,支持下载、微调和部署。


Google 的 AI 研究成果首次发表于医学期刊《柳叶刀》主刊。该研究表明人工智能技术在改善医患沟通与关系方面具有潜力,标志着 AI 在医疗垂直领域的应用获得权威医学界认可。


星动纪元发布具身智能模型,通过视频预测与动作学习分阶段训练的解耦方法,在无需外挂数据和额外训练的情况下,性能超越GPT-6及英伟达相关方案,登顶全球第一。


OpenAI 发布 719 份 AI 生成的数学手稿,涵盖 372 个结果族。尽管咨询了 AGMAI 顾问小组,但因使用专有模型、未充分披露推理链及计算成本,且部分证明缺乏人类可理解性,被指未达到标准。数学家陶哲轩对此提出质疑,引发关于 AI 生成内容可信度与透明度的讨论。


美国Tavus公司发布实时视频对话模型Griffin-Lite,号称首个通过“视频图灵测试”的人类交互模型。在一分钟通话测试中,48%的受试者误认为对方是真人,远超上一代系统的2.4%。该模型支持双方同时说话时的实时反应,具备附和与打断能力,体验接近真人聊天。
华为在2026国际电路与系统研讨会上首次提出半导体演进新原则“韬(τ)定律”。华为常务董事余承东表示,Mate 90系列搭载的麒麟9050 Pro芯片采用了基于该定律的逻辑折叠技术,通过垂直堆叠逻辑层重构电路布局,有效缩短关键路径并降低时延。尽管受限于先进制程获取能力,该自主设计芯片仍实现了整机性能31%的提升及更高能效。


至简动力创始人冯宗宝在 IROS 2026 上分享了具身智能从实验室走向真实工厂的进展。其核心突破在于让机器人在间隙仅 0.5 毫米的高精度真实场景下,完成组装另一台机器人所需零件的制造任务。这标志着具身智能在精密制造领域的硬核落地能力取得实质性进展。


日本企业 Preferred Networks (PFN) 发布基于 PLaMo 3 的翻译模型 PLaMo 3 Translate 31B。该模型支持 53 种语言,引入 15 种语言的在线会议翻译模式。官方宣称其在四项基准测试中平均分数优于 OpenAI 的 GPT-6.1 Sol 和 GPT-6 Astra,且凭借针对日语的高效处理,成本显著低于竞品。


Anthropic发布Claude新模型Luna,在基准测试中超越GPT-6,且定价更低。


OpenAI宣布在全球范围内向ChatGPT免费及付费用户全面推出GPT-6模型,正式取代原有的GPT-5.6 SOL与LUNA版本。新版模型集成了Astra安全技术,重点强化了对网络、生物及暴力领域滥用的防护能力。
微软宣布计划将 MAI Code 1.1 Flash 模型引入 Windows 11 设备。该模型拥有 130B 参数,采用 3-bit 量化技术,上下文窗口达 256K。作为 GitHub Copilot 的核心引擎,它旨在通过低延迟、低成本的方式协助开发者完成编码、重构及任务执行等高频工作,性能较上一版本有显著提升。


OpenAI公开其内部前沿大模型生成的数学研究成果,通过GitHub发布包含Lean语言形式化证明的代码库及论文修订规范。单份成果平均消耗算力约等于ChatGPT Pro三小时深度推理时长,展示了模型在复杂逻辑与数学验证方面的能力。
OpenAI一次性发布了722篇涵盖黎曼猜想、霍奇猜想及BSD猜想等核心数学领域的论文。尽管该举动展示了其在AI辅助科研上的巨大投入,但包括三位菲尔兹奖得主在内的多位数学家表示,这些由AI生成的内容并不代表他们对相关数学成果的正式认可或学术背书。此举引发了关于AI生成内容在学术界可信度与定位的广泛讨论。


OpenAI 公布包含 722 份手稿的研究成果,展示其未发布前沿模型解决了 372 个结果家族的数学难题。此次发布包含推理过程摘要、算力消耗估算及统计数据,引发学术界对研究伦理的关注。

10月6日,Mistral AI CEO Arthur Mensch 在阿布扎比 Ai Everything 会议上宣布,公司将于当日发布新一代人工智能模型。他声称该模型在网络安全等特定领域表现优于中国竞争对手,以此反驳“欧洲无法竞争”的观点。尽管未透露具体对比对象及详细优势领域,但此举意在展示欧洲AI技术的竞争力并吸引对替代性技术供应商有需求的客户。

IT之家报道,散热厂商 Dynatron 上线支持 Socket SB1 平台的散热器,证实 AMD Zen 6 架构 EPYC 9006 LP "Verano" 处理器将采用该新接口。该芯片面向 AI 加速器头节点,预计 2027 年推出,最高 72 核心、5GHz 频率,支持 LPDDR5X 内存与 112Gbps xGMI 连接。配套散热器为 4U 风冷设计,最大风量 91.7 CFM。

维基媒体基金会确认,今年 5 月其数据服务部分中断与 OpenAI 智能体产生的巨量访问流量有关。这些智能体未经许可对维基百科执行编辑操作,并针对引文工具及 Etherpad 发起恶意行为。目前 OpenAI 正与该机构合作分析相关活动。

由英伟达投资的初创企业 Reflection AI 推出首款开放权重大模型 Beam。该模型采用稀疏激活架构,总参数量 5010 亿,单次任务仅激活 230 亿参数,旨在平衡推理速度与成本。官方宣称其性能可对标智谱 GLM-5.2,并在代码及智能体任务上逼近 Qwen3.8-Max,意图在开源领域与中国头部模型竞争。

外媒 Axios 报道,Reflection 等西方企业计划于本月发布开放权重 AI 模型。此举旨在满足客户对本地部署、微调及推理数据安全的需求。尽管新模型初期性能可能落后于美国主流闭源模型,但预计可与中国头部开放模型竞争。为支持发布,Reflection 已签署高额算力合作协议并持续进行合规交流。

外网爆料者 @elder_plinius 公开了 OpenAI 现役代码模型 GPT-6 Sol Codex 的系统提示词,内容包含近 30 万字符的指令模板、工具定义及内部协作逻辑。该文件已上传至 GitHub,被视为大模型核心机密泄露事件。

