阿里 Qwen-Image-3.0-Pro 登顶图像编辑排行榜第六
阿里巴巴发布第三代图像生成模型 Qwen-Image-3.0 系列,其中 Pro 版在 Artificial Analysis 图像编辑排行榜位列第六,文生图排行榜第九,较上代大幅提升。该系列支持 4.5k token 提示词、精确渲染小至 10 像素的文字及 12 种语言,并通过阿里云 Model Studio 提供 API,定价每张 0.03 至 0.075 美元。
阿里巴巴发布第三代图像生成模型 Qwen-Image-3.0 系列,其中 Pro 版在 Artificial Analysis 图像编辑排行榜位列第六,文生图排行榜第九,较上代大幅提升。该系列支持 4.5k token 提示词、精确渲染小至 10 像素的文字及 12 种语言,并通过阿里云 Model Studio 提供 API,定价每张 0.03 至 0.075 美元。
Google 正式发布 Gemini 3.7 Flash 模型,并已全面覆盖 Gemini API、Google AI Studio、Vertex AI、Gemini Enterprise、Gemini 应用及搜索 AI 模式。该模型支持 100 万 token 上下文,输出可达 64,000 token,并具备可调思考级别。Google 强调其指令遵循和意图理解能力提升,适合编码、智能体工作流和多步任务。开发者可通过多个平台访问,企业需关注定价和治理问题。
Ox Alpha 是一款前沿模型,专为高效编码、持续智能体工作和实际生产使用而设计,支持 100 万 token 上下文窗口,可处理文本、图像和视频输入。现已在 OpenRouter 上线,欢迎试用并提供反馈。
Cactus公司Henry在LocalLlama社区发帖称,训练Needle 2时严格避免接触基准测试数据,以防过拟合。他们提供了playground供用户测试,并支持通过Python库进行微调,在约束问题空间下可达到DeepSeek v4的水平。
HuggingFace 帖子作者发现 Ornith-1.5-35B-A3B 模型目前附带的 MTP 头从未经过训练,只是随机初始化,这解释了其速度缓慢的原因。
Liquid AI 发布了 LFM2.5 系列三个模型的 DSpark 草稿检查点,通过投机解码实现最高 3.18 倍(H100)和 2.87 倍(M4 Max)的解码加速,且贪心输出与原始模型完全一致。草稿模型约 300M 参数,支持 llama.cpp 和 SGLang,权重以 Safetensors 和 GGUF 格式提供,但需自托管。
AntLing 发布了 Ling-3.0 基础模型的完整六检查点矩阵,包括 tiny 和 flash 两种尺寸,每种尺寸包含预训练、中期训练和 WSM 合并三个阶段。所有检查点均为基础版本,未经过后训练,适用于继续预训练、微调和研究。各仓库均以 MIT 许可公开,且无门控访问。
Muse Spark 1.2 支持从视觉到代码、感知到行动等多种多模态任务,并具备强大的音视频理解能力,适用于企业视频密集型工作流。官方发布了新的评估和演示,展示模型在视觉理解和推理方面的能力,包括引导机器人在非结构化环境中找到橡皮鸭的示例。
Muse Spark 1.2 是一个强大的多模态模型,能够进行视觉编码、机器人规划和视听理解,并通过智能体工具整合这些能力。
Liquid AI 发布 LFM2.5-DSpark 投机解码草案模型,针对 LFM2.5 系列实现最高 3.2 倍推理加速。该方案结合 DFlash 风格并行主干、马尔可夫链顺序头和置信度调度验证器,在 H100 上平均提速 2.67 倍,在 M4 Max MacBook 上平均提速 2.27 倍,并将函数调用延迟降低 57%。草案模型约 3 亿参数,已开源并支持 llama.cpp 和 SGLang。


微软研究院发布Skala 1.1,这是其深度学习交换关联泛函的更新版本,训练数据量增加2.5倍,在热化学、反应动力学和分子结构预测等关键模拟任务上精度显著提升。Skala现已集成到CP2K,并正在整合到Psi4、FHI-aims、ORCA和VASP中,使更多计算化学社区能够使用。同时,微软推出了实时基准测试,以跟踪Skala后续版本的性能,推动计算化学向预测性和可及性发展。


SupraLabs发布了Supra2-Medium-Base,这是一个基于Qwen3架构、参数量仅25M的模型,完全从零训练,在基准测试中与之前50M参数的模型竞争。该模型为基座模型,指令微调版本可能后续推出。
用户测试 Qwen3.8 27B 的 SVG 生成能力,提示词为“创建包含猫骑斑马、斑马骑大象的 SVG 的单个 HTML 文件”。模型思考 12 分钟后生成,结果令人惊艳。共消耗 46,436 tokens,速度约 40 tokens/s。
机器人初创公司Generalist AI发布了GEN-1.5模型,该模型能从3-12秒的演示中学习新任务,无需额外训练。在十项测试中平均成功率为59%,经过少量微调后提升至83%。模型还能串联多个提示、利用仿真演示,并部分模仿人类手部动作。公司声称这些能力是预训练中自发涌现的,但结果未经独立验证。
据《商业内幕》报道,OpenAI 接近实现让 AI 智能体熟练操作电脑的目标,已开始向客户逐步开放相关功能。团队通过加入屏幕截图、真人示范数据和强化学习提升模型能力,并改进信息获取方式。该技术有望改变人机交互方式,但速度和泛化能力仍有待提升。
我推出了Aurora-80K,一个仅有8万参数的微型语言模型,采用分解的4096词表。基准测试:Wikitext-2 BPB 3.2902,BLiMP 52.31%,Arc-Easy 26.05%。模型已在Huggingface上发布,欢迎提问。
腾讯开始灰度测试其新旗舰模型混元 Hy4。据用户截图,Hy4 已在腾讯元宝 App 的模型选择列表中出现,被标记为“专家级模型”,定位高于 Hy3 和 DeepSeek。Hy3 则被标记为“全新升级”,定位为全新通用模型。
作者以250美元成本预训练了一个10.2亿参数的Kimi K3复刻模型,激活参数1.45亿,训练数据50亿token。该模型采用K3架构(如Kimi Delta注意力、门控MLA、注意力残差、LatentMoE等),未经过指令微调,仅进行下一个词预测,但性能已超越GPT-2 (124M)。
Generalist 发布机器人模型 GEN-1.5,通过观看 3-12 秒的动作演示即可学会新任务,平均成功率约 59%,经 5 分钟快速适应后可达 83%。该模型支持动作串联、从人手或电脑动画学习,并能灵活使用替代工具,有望大幅降低机器人编程门槛。
智谱发布新一代模型GLM 5.3,在Coding能力上刷新国产模型纪录,与Kimi K3并列开源第一,接近闭源旗舰。API上线推迟引发客户抢购,反映市场对智谱模型的热情。文章回顾智谱从GLM 5到5.3的迭代,探讨其背后的公司战略。
感谢 Unsloth 的杰出工作,这对社区来说是个好消息!Qwen3.8-27B 比以往更小更锐利,让我们试试吧!
作者用个人基准测试发现,Qwen3.8-27B 在离线知识问答上表现不如 Qwen3.6,即使调整量化级别和采样设置,仍无法回答 3.6 能答对的问题。
用户仅凭一条提示和学校凭据,Qwen3.8-27b 自主执行了 80 次工具调用,成功从复杂的大学网站抓取课表,无需人工干预。另一次,它自主调查社交媒体用户,下载视频、抽帧、安装 Whisper 转写,并局部放大提亮画面。展现了本地模型强大的自主规划和工具使用能力。
智谱联合创始人唐杰透露,GLM-5.3 未更换基座,基于 GLM-5.2(743B MoE,激活 40B)通过一个月长周期强化学习,编码能力提升 50%。他强调总参数量决定知识量,激活参数与有效深度决定推理深度,并指出后训练仍有巨大潜力,模型扩展不止堆参数一条路。
Cartesia 发布了流式文本转语音模型 Sonic-3.6,基于状态空间模型而非 Transformer,在 Artificial Analysis 语音竞技场中排名第一(Provider Voice 1283 Elo,Controlled Voice 1123 Elo)。该模型支持亚 90 毫秒首音频延迟,提供内联表情标签、即时声音克隆等功能,现以 beta 版通过 API 提供。
智谱AI发布GLM-5.3,在CyberGym漏洞发现基准上以84.5%略超Anthropic和OpenAI模型,但其他安全基准仍落后。模型在编码效率上优于对手,计划月底开源权重。


Z.ai发布了最新AI模型,该模型既能帮助企业加固系统安全,也可能被黑客利用来发现和利用漏洞。专家对此表示担忧。
智象未来(HiDream.ai)发布原生全模态交互式世界模型HiDream-O1-World,支持文本、图像及交互输入,具备漫游、编辑和交互功能。在WBench评测中,该模型以平均分80.9登顶Navi分榜,物理维度73.3分位列第一。模型采用自研UiT架构,通过3D先验注入Memory和测试时训练维持时空一致性,计划用于AI互动影游、具身智能仿真和3D场景生产。

