SHELL PULSE

8月21日 · 星期五12

  1. MarkTechPostby Michal Sutter · 新闻AI评分:70/100

    Superwhisper 发布 S1-mini:462 MB 开源权重文本规范化模型,将原始 ASR 转录转为干净书面文本

    Superwhisper 发布了 S1 系列模型,其中 S1-mini 是 0.6B 参数的开源文本规范化模型,用于将 ASR 原始转录转换为干净书面文本,去除填充词、修正自我纠正、添加标点等。该模型基于 Qwen3-0.6B 微调,仅支持英文,以 Apache 2.0 许可发布,Q4_K_M GGUF 文件仅 462 MB,可在笔记本电脑 CPU 上运行。官方报告在 7,519 个案例上达到 94.8% 的 token 准确率。

    marktechpost.com模型开源原文
  2. Artificial Analysisby Artificial Analysis · 推文AI评分:70/100

    阿里 Qwen-Image-3.0-Pro 登顶图像编辑排行榜第六

    阿里巴巴发布第三代图像生成模型 Qwen-Image-3.0 系列,其中 Pro 版在 Artificial Analysis 图像编辑排行榜位列第六,文生图排行榜第九,较上代大幅提升。该系列支持 4.5k token 提示词、精确渲染小至 10 像素的文字及 12 种语言,并通过阿里云 Model Studio 提供 API,定价每张 0.03 至 0.075 美元。

    X @ArtificialAnlys模型评测原文
  3. dev.to #aiby Ali Farhat · 新闻AI评分:70/100

    Google Gemini 3.7 Flash 全面上线,覆盖 AI 模式、API 和企业级应用

    Google 正式发布 Gemini 3.7 Flash 模型,并已全面覆盖 Gemini API、Google AI Studio、Vertex AI、Gemini Enterprise、Gemini 应用及搜索 AI 模式。该模型支持 100 万 token 上下文,输出可达 64,000 token,并具备可调思考级别。Google 强调其指令遵循和意图理解能力提升,适合编码、智能体工作流和多步任务。开发者可通过多个平台访问,企业需关注定价和治理问题。

    dev.to模型产品原文
  4. OpenRouterby OpenRouter · 推文AI评分:50/100

    新隐身模型 Ox Alpha 发布

    Ox Alpha 是一款前沿模型,专为高效编码、持续智能体工作和实际生产使用而设计,支持 100 万 token 上下文窗口,可处理文本、图像和视频输入。现已在 OpenRouter 上线,欢迎试用并提供反馈。

    X @OpenRouter模型产品原文
  5. Reddit r/LocalLLaMAby /u/Henrie_the_dreamer · 短讯AI评分:50/100

    微调Cactus Needle 2可在特定任务上媲美DeepSeek v4

    Cactus公司Henry在LocalLlama社区发帖称,训练Needle 2时严格避免接触基准测试数据,以防过拟合。他们提供了playground供用户测试,并支持通过Python库进行微调,在约束问题空间下可达到DeepSeek v4的水平。

    reddit.com模型开源原文
  6. MarkTechPostby Asif Razzaq · 新闻AI评分:70/100

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,解码速度提升高达 3.18 倍且输出不变

    Liquid AI 发布了 LFM2.5 系列三个模型的 DSpark 草稿检查点,通过投机解码实现最高 3.18 倍(H100)和 2.87 倍(M4 Max)的解码加速,且贪心输出与原始模型完全一致。草稿模型约 300M 参数,支持 llama.cpp 和 SGLang,权重以 Safetensors 和 GGUF 格式提供,但需自托管。

    marktechpost.com模型开源原文
  7. Reddit r/LocalLLaMAby /u/niacolhealth · 新闻AI评分:70/100

    Ling-3.0 发布全部 6 个基础检查点:2 种尺寸 × 3 个阶段

    AntLing 发布了 Ling-3.0 基础模型的完整六检查点矩阵,包括 tiny 和 flash 两种尺寸,每种尺寸包含预训练、中期训练和 WSM 合并三个阶段。所有检查点均为基础版本,未经过后训练,适用于继续预训练、微调和研究。各仓库均以 MIT 许可公开,且无门控访问。

    reddit.com模型开源原文
  8. Meta AIby Meta AI · 推文AI评分:70/100

    Muse Spark 1.2 支持广泛多模态任务

    Muse Spark 1.2 支持从视觉到代码、感知到行动等多种多模态任务,并具备强大的音视频理解能力,适用于企业视频密集型工作流。官方发布了新的评估和演示,展示模型在视觉理解和推理方面的能力,包括引导机器人在非结构化环境中找到橡皮鸭的示例。

    X @AIatMeta模型原文
  9. Alexandr Wangby Alexandr Wang · 推文AI评分:70/100

    Muse Spark 1.2 是强大的多模态模型

    Muse Spark 1.2 是一个强大的多模态模型,能够进行视觉编码、机器人规划和视听理解,并通过智能体工具整合这些能力。

    X @alexandr_wang模型原文
  10. 热点精选Hugging Face Blog新闻AI评分:70/100

    LFM2.5-DSpark:从 H100 到 MacBook 推理速度提升最高 3.2 倍

    Liquid AI 发布 LFM2.5-DSpark 投机解码草案模型,针对 LFM2.5 系列实现最高 3.2 倍推理加速。该方案结合 DFlash 风格并行主干、马尔可夫链顺序头和置信度调度验证器,在 H100 上平均提速 2.67 倍,在 M4 Max MacBook 上平均提速 2.27 倍,并将函数调用延迟降低 57%。草案模型约 3 亿参数,已开源并支持 llama.cpp 和 SGLang。

    DSparkbfcl_latency_mac
    huggingface.co模型开源原文
  11. 热点精选Microsoft Researchby Sebastian Ehlert, Stefano Battaglia, Thijs Vogels, Jan Hermann, Jens Wehner, Giulia Luise, Klaas Giesbertz, Chin-Wei Hu… · 新闻AI评分:70/100

    微软扩大Skala访问范围,加速预测性DFT进程

    微软研究院发布Skala 1.1,这是其深度学习交换关联泛函的更新版本,训练数据量增加2.5倍,在热化学、反应动力学和分子结构预测等关键模拟任务上精度显著提升。Skala现已集成到CP2K,并正在整合到Psi4、FHI-aims、ORCA和VASP中,使更多计算化学社区能够使用。同时,微软推出了实时基准测试,以跟踪Skala后续版本的性能,推动计算化学向预测性和可及性发展。

    Schematic of the Skala architecture, showing how meta-GGA electronic features are transformed through point-wise proces…Figure 1: Accuracy of Skala-1.1 for thermochemistry, kinetics, and non-covalent interactions. At the computational cost
    microsoft.com模型开源原文

8月20日 · 星期四8

  1. Reddit r/LocalLLaMAby /u/LH-Tech_AI · 短讯AI评分:50/100

    Supra2-Medium-Base发布:25M参数小模型性能媲美50M模型

    SupraLabs发布了Supra2-Medium-Base,这是一个基于Qwen3架构、参数量仅25M的模型,完全从零训练,在基准测试中与之前50M参数的模型竞争。该模型为基座模型,指令微调版本可能后续推出。

    reddit.com模型开源原文
  2. Reddit r/LocalLLaMAby /u/meganoob1337 · 短讯AI评分:50/100

    Qwen3.8 27B 在 SVG 生成上超出预期

    用户测试 Qwen3.8 27B 的 SVG 生成能力,提示词为“创建包含猫骑斑马、斑马骑大象的 SVG 的单个 HTML 文件”。模型思考 12 分钟后生成,结果令人惊艳。共消耗 46,436 tokens,速度约 40 tokens/s。

    reddit.com模型原文
  3. The Decoderby Maximilian Schreiner · 新闻AI评分:70/100

    GEN-1.5:通用AI通过单次演示教会机器人新任务

    机器人初创公司Generalist AI发布了GEN-1.5模型,该模型能从3-12秒的演示中学习新任务,无需额外训练。在十项测试中平均成功率为59%,经过少量微调后提升至83%。模型还能串联多个提示、利用仿真演示,并部分模仿人类手部动作。公司声称这些能力是预训练中自发涌现的,但结果未经独立验证。

    the-decoder.com模型行业原文
  4. Reddit r/LocalLLaMAby /u/Tall_Abrocoma_3533 · 短讯AI评分:50/100

    Aurora-80K发布!一个现代微型语言模型

    我推出了Aurora-80K,一个仅有8万参数的微型语言模型,采用分解的4096词表。基准测试:Wikitext-2 BPB 3.2902,BLiMP 52.31%,Arc-Easy 26.05%。模型已在Huggingface上发布,欢迎提问。

    reddit.com模型开源原文
  5. Reddit r/LocalLLaMAby /u/Nunki08 · 新闻AI评分:70/100

    腾讯开始灰度测试新旗舰模型混元 Hy4

    腾讯开始灰度测试其新旗舰模型混元 Hy4。据用户截图,Hy4 已在腾讯元宝 App 的模型选择列表中出现,被标记为“专家级模型”,定位高于 Hy3 和 DeepSeek。Hy3 则被标记为“全新升级”,定位为全新通用模型。

    reddit.com模型产品原文
  6. Reddit r/LocalLLaMAby /u/OtherRaisin3426 · 短讯AI评分:70/100

    我仅用250美元从零构建了一个迷你Kimi-K3,性能已超越GPT-2 (124M)!

    作者以250美元成本预训练了一个10.2亿参数的Kimi K3复刻模型,激活参数1.45亿,训练数据50亿token。该模型采用K3架构(如Kimi Delta注意力、门控MLA、注意力残差、LatentMoE等),未经过指令微调,仅进行下一个词预测,但性能已超越GPT-2 (124M)。

    reddit.com模型开源原文
  7. Reddit r/LocalLLaMAby /u/EmPips · 短讯AI评分:50/100

    Qwen3.8-27B 在知识方面相比 3.6 严重退步

    作者用个人基准测试发现,Qwen3.8-27B 在离线知识问答上表现不如 Qwen3.6,即使调整量化级别和采样设置,仍无法回答 3.6 能答对的问题。

    reddit.com模型评测原文
  8. Reddit r/LocalLLaMAby /u/synth_mania · 短讯AI评分:70/100

    Qwen3.8-27b 是我见过的本地模型中智能体能力最强的

    用户仅凭一条提示和学校凭据,Qwen3.8-27b 自主执行了 80 次工具调用,成功从复杂的大学网站抓取课表,无需人工干预。另一次,它自主调查社交媒体用户,下载视频、抽帧、安装 Whisper 转写,并局部放大提亮画面。展现了本地模型强大的自主规划和工具使用能力。

    reddit.com模型原文

8月19日 · 星期三1

8月18日 · 星期二3

  1. MarkTechPostby Asif Razzaq · 新闻AI评分:70/100

    Cartesia 发布 Sonic-3.6:流式 TTS 模型登顶两大语音竞技场

    Cartesia 发布了流式文本转语音模型 Sonic-3.6,基于状态空间模型而非 Transformer,在 Artificial Analysis 语音竞技场中排名第一(Provider Voice 1283 Elo,Controlled Voice 1123 Elo)。该模型支持亚 90 毫秒首音频延迟,提供内联表情标签、即时声音克隆等功能,现以 beta 版通过 API 提供。

    marktechpost.com模型评测原文
  2. Artificial Intelligence Newsby Dashveenjit Kaur · 新闻AI评分:70/100

    解读智谱GLM-5.3结果:超越头条数字之外

    智谱AI发布GLM-5.3,在CyberGym漏洞发现基准上以84.5%略超Anthropic和OpenAI模型,但其他安全基准仍落后。模型在编码效率上优于对手,计划月底开源权重。

    Bar chart from Zhipu's GLM-5.3 release comparing five AI models across three cybersecurity benchmarksZhipu’s own comparison across the three cybersecurity benchmarks. GLM-5.3 leads on CyberGym, the vulnerability discovery
    artificialintelligence-news.com模型评测原文
  3. Wired AIby Will Knight · 新闻AI评分:70/100

    专家警告的中国强大AI模型已问世

    Z.ai发布了最新AI模型,该模型既能帮助企业加固系统安全,也可能被黑客利用来发现和利用漏洞。专家对此表示担忧。

    wired.com模型行业原文