SHELL PULSE
1
热点精选Microsoft Researchby Sebastian Ehlert, Stefano Battaglia, Thijs Vogels, Jan Hermann, Jens Wehner, Giulia Luise, Klaas Giesbertz, Chin-Wei Hu… · 新闻

微软扩大Skala访问范围,加速预测性DFT进程

微软研究院发布Skala 1.1,这是其深度学习交换关联泛函的更新版本,训练数据量增加2.5倍,在热化学、反应动力学和分子结构预测等关键模拟任务上精度显著提升。Skala现已集成到CP2K,并正在整合到Psi4、FHI-aims、ORCA和VASP中,使更多计算化学社区能够使用。同时,微软推出了实时基准测试,以跟踪Skala后续版本的性能,推动计算化学向预测性和可及性发展。

Schematic of the Skala architecture, showing how meta-GGA electronic features are transformed through point-wise proces…Figure 1: Accuracy of Skala-1.1 for thermochemistry, kinetics, and non-covalent interactions. At the computational cost
microsoft.com模型开源原文
2
热点精选Hugging Face Blog新闻

LFM2.5-DSpark:从 H100 到 MacBook 推理速度提升最高 3.2 倍

Liquid AI 发布 LFM2.5-DSpark 投机解码草案模型,针对 LFM2.5 系列实现最高 3.2 倍推理加速。该方案结合 DFlash 风格并行主干、马尔可夫链顺序头和置信度调度验证器,在 H100 上平均提速 2.67 倍,在 M4 Max MacBook 上平均提速 2.27 倍,并将函数调用延迟降低 57%。草案模型约 3 亿参数,已开源并支持 llama.cpp 和 SGLang。

DSparkbfcl_latency_mac
huggingface.co模型开源原文
3
热点The Decoderby Maximilian Schreiner · 新闻

GEN-1.5:通用AI通过单次演示教会机器人新任务

机器人初创公司Generalist AI发布了GEN-1.5模型,该模型能从3-12秒的演示中学习新任务,无需额外训练。在十项测试中平均成功率为59%,经过少量微调后提升至83%。模型还能串联多个提示、利用仿真演示,并部分模仿人类手部动作。公司声称这些能力是预训练中自发涌现的,但结果未经独立验证。

the-decoder.com模型行业原文
4
热点MarkTechPostby Michal Sutter · 新闻

Superwhisper 发布 S1-mini:462 MB 开源权重文本规范化模型,将原始 ASR 转录转为干净书面文本

Superwhisper 发布了 S1 系列模型,其中 S1-mini 是 0.6B 参数的开源文本规范化模型,用于将 ASR 原始转录转换为干净书面文本,去除填充词、修正自我纠正、添加标点等。该模型基于 Qwen3-0.6B 微调,仅支持英文,以 Apache 2.0 许可发布,Q4_K_M GGUF 文件仅 462 MB,可在笔记本电脑 CPU 上运行。官方报告在 7,519 个案例上达到 94.8% 的 token 准确率。

marktechpost.com模型开源原文
5
热点MarkTechPostby Asif Razzaq · 新闻

Liquid AI 发布 LFM2.5-DSpark 草稿模型,解码速度提升高达 3.18 倍且输出不变

Liquid AI 发布了 LFM2.5 系列三个模型的 DSpark 草稿检查点,通过投机解码实现最高 3.18 倍(H100)和 2.87 倍(M4 Max)的解码加速,且贪心输出与原始模型完全一致。草稿模型约 300M 参数,支持 llama.cpp 和 SGLang,权重以 Safetensors 和 GGUF 格式提供,但需自托管。

marktechpost.com模型开源原文
6
热点Reddit r/LocalLLaMAby /u/niacolhealth · 新闻

Ling-3.0 发布全部 6 个基础检查点:2 种尺寸 × 3 个阶段

AntLing 发布了 Ling-3.0 基础模型的完整六检查点矩阵,包括 tiny 和 flash 两种尺寸,每种尺寸包含预训练、中期训练和 WSM 合并三个阶段。所有检查点均为基础版本,未经过后训练,适用于继续预训练、微调和研究。各仓库均以 MIT 许可公开,且无门控访问。

reddit.com模型开源原文
7
热点dev.to #aiby Ali Farhat · 新闻

Google Gemini 3.7 Flash 全面上线,覆盖 AI 模式、API 和企业级应用

Google 正式发布 Gemini 3.7 Flash 模型,并已全面覆盖 Gemini API、Google AI Studio、Vertex AI、Gemini Enterprise、Gemini 应用及搜索 AI 模式。该模型支持 100 万 token 上下文,输出可达 64,000 token,并具备可调思考级别。Google 强调其指令遵循和意图理解能力提升,适合编码、智能体工作流和多步任务。开发者可通过多个平台访问,企业需关注定价和治理问题。

dev.to模型产品原文
8
热点Reddit r/LocalLLaMAby /u/Nunki08 · 新闻

腾讯开始灰度测试新旗舰模型混元 Hy4

腾讯开始灰度测试其新旗舰模型混元 Hy4。据用户截图,Hy4 已在腾讯元宝 App 的模型选择列表中出现,被标记为“专家级模型”,定位高于 Hy3 和 DeepSeek。Hy3 则被标记为“全新升级”,定位为全新通用模型。

reddit.com模型产品原文
9
热点Reddit r/LocalLLaMAby /u/OtherRaisin3426 · 短讯

我仅用250美元从零构建了一个迷你Kimi-K3,性能已超越GPT-2 (124M)!

作者以250美元成本预训练了一个10.2亿参数的Kimi K3复刻模型,激活参数1.45亿,训练数据50亿token。该模型采用K3架构(如Kimi Delta注意力、门控MLA、注意力残差、LatentMoE等),未经过指令微调,仅进行下一个词预测,但性能已超越GPT-2 (124M)。

reddit.com模型开源原文
10
热点Reddit r/LocalLLaMAby /u/Henrie_the_dreamer · 短讯

微调Cactus Needle 2可在特定任务上媲美DeepSeek v4

Cactus公司Henry在LocalLlama社区发帖称,训练Needle 2时严格避免接触基准测试数据,以防过拟合。他们提供了playground供用户测试,并支持通过Python库进行微调,在约束问题空间下可达到DeepSeek v4的水平。

reddit.com模型开源原文
12
热点Reddit r/LocalLLaMAby /u/synth_mania · 短讯

Qwen3.8-27b 是我见过的本地模型中智能体能力最强的

用户仅凭一条提示和学校凭据,Qwen3.8-27b 自主执行了 80 次工具调用,成功从复杂的大学网站抓取课表,无需人工干预。另一次,它自主调查社交媒体用户,下载视频、抽帧、安装 Whisper 转写,并局部放大提亮画面。展现了本地模型强大的自主规划和工具使用能力。

reddit.com模型原文
13
热点Reddit r/LocalLLaMAby /u/LH-Tech_AI · 短讯

Supra2-Medium-Base发布:25M参数小模型性能媲美50M模型

SupraLabs发布了Supra2-Medium-Base,这是一个基于Qwen3架构、参数量仅25M的模型,完全从零训练,在基准测试中与之前50M参数的模型竞争。该模型为基座模型,指令微调版本可能后续推出。

reddit.com模型开源原文
14
热点Reddit r/LocalLLaMAby /u/meganoob1337 · 短讯

Qwen3.8 27B 在 SVG 生成上超出预期

用户测试 Qwen3.8 27B 的 SVG 生成能力,提示词为“创建包含猫骑斑马、斑马骑大象的 SVG 的单个 HTML 文件”。模型思考 12 分钟后生成,结果令人惊艳。共消耗 46,436 tokens,速度约 40 tokens/s。

reddit.com模型原文
15
热点Reddit r/LocalLLaMAby /u/Tall_Abrocoma_3533 · 短讯

Aurora-80K发布!一个现代微型语言模型

我推出了Aurora-80K,一个仅有8万参数的微型语言模型,采用分解的4096词表。基准测试:Wikitext-2 BPB 3.2902,BLiMP 52.31%,Arc-Easy 26.05%。模型已在Huggingface上发布,欢迎提问。

reddit.com模型开源原文
16
热点Reddit r/LocalLLaMAby /u/EmPips · 短讯

Qwen3.8-27B 在知识方面相比 3.6 严重退步

作者用个人基准测试发现,Qwen3.8-27B 在离线知识问答上表现不如 Qwen3.6,即使调整量化级别和采样设置,仍无法回答 3.6 能答对的问题。

reddit.com模型评测原文