微软扩大Skala访问范围,加速预测性DFT进程
微软研究院发布Skala 1.1,这是其深度学习交换关联泛函的更新版本,训练数据量增加2.5倍,在热化学、反应动力学和分子结构预测等关键模拟任务上精度显著提升。Skala现已集成到CP2K,并正在整合到Psi4、FHI-aims、ORCA和VASP中,使更多计算化学社区能够使用。同时,微软推出了实时基准测试,以跟踪Skala后续版本的性能,推动计算化学向预测性和可及性发展。


微软研究院发布Skala 1.1,这是其深度学习交换关联泛函的更新版本,训练数据量增加2.5倍,在热化学、反应动力学和分子结构预测等关键模拟任务上精度显著提升。Skala现已集成到CP2K,并正在整合到Psi4、FHI-aims、ORCA和VASP中,使更多计算化学社区能够使用。同时,微软推出了实时基准测试,以跟踪Skala后续版本的性能,推动计算化学向预测性和可及性发展。


Liquid AI 发布 LFM2.5-DSpark 投机解码草案模型,针对 LFM2.5 系列实现最高 3.2 倍推理加速。该方案结合 DFlash 风格并行主干、马尔可夫链顺序头和置信度调度验证器,在 H100 上平均提速 2.67 倍,在 M4 Max MacBook 上平均提速 2.27 倍,并将函数调用延迟降低 57%。草案模型约 3 亿参数,已开源并支持 llama.cpp 和 SGLang。


机器人初创公司Generalist AI发布了GEN-1.5模型,该模型能从3-12秒的演示中学习新任务,无需额外训练。在十项测试中平均成功率为59%,经过少量微调后提升至83%。模型还能串联多个提示、利用仿真演示,并部分模仿人类手部动作。公司声称这些能力是预训练中自发涌现的,但结果未经独立验证。
Superwhisper 发布了 S1 系列模型,其中 S1-mini 是 0.6B 参数的开源文本规范化模型,用于将 ASR 原始转录转换为干净书面文本,去除填充词、修正自我纠正、添加标点等。该模型基于 Qwen3-0.6B 微调,仅支持英文,以 Apache 2.0 许可发布,Q4_K_M GGUF 文件仅 462 MB,可在笔记本电脑 CPU 上运行。官方报告在 7,519 个案例上达到 94.8% 的 token 准确率。


Liquid AI 发布了 LFM2.5 系列三个模型的 DSpark 草稿检查点,通过投机解码实现最高 3.18 倍(H100)和 2.87 倍(M4 Max)的解码加速,且贪心输出与原始模型完全一致。草稿模型约 300M 参数,支持 llama.cpp 和 SGLang,权重以 Safetensors 和 GGUF 格式提供,但需自托管。
AntLing 发布了 Ling-3.0 基础模型的完整六检查点矩阵,包括 tiny 和 flash 两种尺寸,每种尺寸包含预训练、中期训练和 WSM 合并三个阶段。所有检查点均为基础版本,未经过后训练,适用于继续预训练、微调和研究。各仓库均以 MIT 许可公开,且无门控访问。
Google 正式发布 Gemini 3.7 Flash 模型,并已全面覆盖 Gemini API、Google AI Studio、Vertex AI、Gemini Enterprise、Gemini 应用及搜索 AI 模式。该模型支持 100 万 token 上下文,输出可达 64,000 token,并具备可调思考级别。Google 强调其指令遵循和意图理解能力提升,适合编码、智能体工作流和多步任务。开发者可通过多个平台访问,企业需关注定价和治理问题。
腾讯开始灰度测试其新旗舰模型混元 Hy4。据用户截图,Hy4 已在腾讯元宝 App 的模型选择列表中出现,被标记为“专家级模型”,定位高于 Hy3 和 DeepSeek。Hy3 则被标记为“全新升级”,定位为全新通用模型。
作者以250美元成本预训练了一个10.2亿参数的Kimi K3复刻模型,激活参数1.45亿,训练数据50亿token。该模型采用K3架构(如Kimi Delta注意力、门控MLA、注意力残差、LatentMoE等),未经过指令微调,仅进行下一个词预测,但性能已超越GPT-2 (124M)。
Cactus公司Henry在LocalLlama社区发帖称,训练Needle 2时严格避免接触基准测试数据,以防过拟合。他们提供了playground供用户测试,并支持通过Python库进行微调,在约束问题空间下可达到DeepSeek v4的水平。
HuggingFace 帖子作者发现 Ornith-1.5-35B-A3B 模型目前附带的 MTP 头从未经过训练,只是随机初始化,这解释了其速度缓慢的原因。
用户仅凭一条提示和学校凭据,Qwen3.8-27b 自主执行了 80 次工具调用,成功从复杂的大学网站抓取课表,无需人工干预。另一次,它自主调查社交媒体用户,下载视频、抽帧、安装 Whisper 转写,并局部放大提亮画面。展现了本地模型强大的自主规划和工具使用能力。
SupraLabs发布了Supra2-Medium-Base,这是一个基于Qwen3架构、参数量仅25M的模型,完全从零训练,在基准测试中与之前50M参数的模型竞争。该模型为基座模型,指令微调版本可能后续推出。
用户测试 Qwen3.8 27B 的 SVG 生成能力,提示词为“创建包含猫骑斑马、斑马骑大象的 SVG 的单个 HTML 文件”。模型思考 12 分钟后生成,结果令人惊艳。共消耗 46,436 tokens,速度约 40 tokens/s。
我推出了Aurora-80K,一个仅有8万参数的微型语言模型,采用分解的4096词表。基准测试:Wikitext-2 BPB 3.2902,BLiMP 52.31%,Arc-Easy 26.05%。模型已在Huggingface上发布,欢迎提问。
作者用个人基准测试发现,Qwen3.8-27B 在离线知识问答上表现不如 Qwen3.6,即使调整量化级别和采样设置,仍无法回答 3.6 能答对的问题。