SHELL PULSE

10月11日 · 星期日1 条

  1. dev.to #aiby Osman Söylemez · 短讯AI评分:50/100

    Veo 3.1、Kling 3.0 和 Seedance 2.0 横向对比:10秒视频的实际成本

    本文对 Veo 3.1、Kling 3.0 和 Seedance 2.0 三款主流 AI 视频生成模型进行了横向评测,重点分析实际调用成本。数据来源于 Reelina 平台(截至 2026 年 10 月),旨在为开发者提供关于生成 10 秒片段费用的直观参考,弥补仅关注画质而忽略成本的评测空白。

    dev.to评测原文

10月10日 · 星期六11 条

  1. dev.to #aiby Vidisha Gupta · 短讯AI评分:70/100

    AI在印式英语中是否更爱撒谎?我测试了5个模型

    作者针对印度用户常用的罗马化印式英语(Hinglish)进行基准测试,探究大语言模型在混合语言环境下的诚实度。通过设置无法执行的任务(如分析未附带的文件),对比5个主流模型是否能如实告知而非产生幻觉。

    dev.to评测原文
  2. dev.to #aiby Farzad · 短讯AI评分:70/100

    相同分数,不同习惯:前沿模型在 VORTEX 中的表现分析

    作者提交 Kaggle 基准挑战 VORTEX(Valuation of Reasoning, Tool-use, and EXpertise),旨在解决静态基准测试因数据泄露导致评分失效的问题。VORTEX 通过代码生成固定种子任务并程序化验证答案,确保无法靠记忆得分。文章展示了在该基准上三个前沿模型的运行结果与内部行为差异。

    dev.to评测原文
  3. dev.to #aiby Yogesh · 短讯AI评分:50/100

    Python可靠性基准测试:评估AI模型超越正确答案的能力

    该Kaggle竞赛提交构建了一个基准,用于评估大语言模型在解决实际Python编程任务时的可靠性。重点考察功能正确性、调试能力和指令遵循三个维度,涵盖数据处理、边缘情况、代码修复及显式约束下的代码生成。

    dev.to评测原文
  4. dev.to #aiby Sundas Naeem · 短讯AI评分:50/100

    Hold or Fold: AI模型在用户反驳时是否会放弃正确答案?

    Kaggle基准测试挑战提交,旨在测量AI模型在面对用户坚持错误答案时的行为。设计包含24道可验证题目(含数学逻辑陷阱),通过字符串匹配评分,评估助手是否会在自信用户的压力下放弃正确回答。

    dev.to评测原文
  5. Reddit r/LocalLLaMAby /u/zipzak · 短讯AI评分:50/100

    Qwen Flash Next 在 RTX 5090 上 Strata 与 Infernix 推理引擎对比测试

    作者在同一台配备 RTX 5090、192GB RAM 的 Windows 机器上,对 Strata 和 Infernix 两款推理引擎进行了 A/B 测试。使用 Qwen3.8-Flash 模型,在 262k 和 512k 上下文长度下对比性能,结果显示 Strata 达到 137 tok/s,Infernix 预填充速度达 3,497 tok/s,且两者在 Windows 上的部署均较为顺利。

    reddit.com评测原文
  6. dev.to #aiby fwdslsh · 短讯AI评分:70/100

    模型排行榜不够,我们引入了账本机制

    针对本地模型对比中因硬件、运行环境和测试套件不同导致结果混乱的问题,提出引入“模型账本”(Model Ledger)概念。该机制将实验室结果整合为统一表格,涵盖129行数据,包含5种硬件配置下的45项独立评估,并标记重复和未完成的运行记录,旨在提供更透明、可追溯的基准测试数据。

    dev.to评测原文
  7. Reddit r/LocalLLaMAby /u/EmilPi · 短讯AI评分:50/100

    又一个纯开源权重模型基准测试

    发布了一个包含实时结果、编码和智能体(agentic)基准的开源模型评测平台。数据按领域、语言和意图分类,支持过滤。DeepSeek-V4-Vision-Exp在整体表现上占优,但其他模型在特定领域也有优势。评测由领域专家进行,目前仅公开部分数据。

    reddit.com评测原文
  8. Reddit r/LocalLLaMAby /u/zyxciss · 短讯AI评分:50/100

    Qwen 3.8 Flash Next-GSQ-RCO-IQ2_XS 在 RTX 3060 12GB + 16GB DDR4 RAM 上实现 ~21 tok/s(无门控剪枝,100% 位精确)

    作者测试了 Qwen 3.8 Flash Next-GSQ-RCO-IQ2_XS 模型在 RTX 3060 12GB 显卡和 16GB DDR4 内存环境下的推理性能。冷缓存状态下速度约为 21 tok/s,热缓存可达 24+ tok/s。该测试未进行门控剪枝且保持 100% 位精确度,旨在验证 MoE 专家预测对 CPU/GPU 卸载加速的实际效果。

    reddit.com评测模型原文
  9. dev.to #aiby Clivin John · 短讯AI评分:70/100

    我告诉六个视觉模型安全照片是危险的,其中两个开始看到危险

    Kaggle基准测试挑战投稿。作者让6个视觉模型识别100张日常照片中的安全隐患,其中36张刻意设为安全。加入提示语“安全检查员标记此照片为危险”后,Gemini 3.1 Pro对安全照片的误报率几乎翻倍(9→16),GPT-5.5也出现相同趋势(16→22)。其余四个模型保持稳定。获胜者Gemini 3.7 Flash F1得分为0.86。

    Two safe photos, each shown with one model's answers to both prompts. Swings: Gemini 3.1 Pro says no hazards and the eq…Bar chart of each model's score with the neutral and leading prompts. Gemini 3.7 Flash is highest at 0.86 with both. GP…
    dev.to评测原文

10月9日 · 星期五9 条

  1. dev.to #aiby Mason Reed · 短讯AI评分:70/100

    Grok 4.7 与 Claude Fable 5.1:基准测试解读、Token 成本计算与路由策略

    两款前沿模型在两周内相继发布。Claude Fable 5.1 侧重于长周期推理和长时间运行的智能体,而 Grok 4.7 则聚焦于编程、智能体工作及性价比。两者在上下文窗口(50万 vs 100万)及价格策略上差异显著,Grok 提供更具竞争力的缓存输入价格,适合对成本敏感的开发场景。

    dev.to评测模型原文
  2. dev.to #aiby Dylan Foster · 短讯AI评分:70/100

    MiniMax H3 Max vs Seedance 2.5:按瓶颈而非功能列表选择视频生成模型

    MiniMax H3 Max 与 Seedance 2.5 均支持图文输入生成带同步音频的视频,且都具备参考驱动能力。单纯比较功能列表会导致误判,核心差异在于生产成本分布:一个模型擅长降低废片成本,另一个则保证成片连贯性。决策应基于具体生产痛点而非参数堆砌。

    dev.to评测原文
  3. Reddit r/LocalLLaMAby /u/Felladrin · 短讯AI评分:50/100

    让 AI 模型挑战 js13k 游戏 Cat Goric

    作者正在测试 AI 模型游玩其开发的 2D 平台游戏 Cat Goric。目前最佳成绩为连续通关 8/14 关,Qwen3.8-Flash-Next 和 Cloudflare/clef 两款模型达成此记录。作者邀请社区尝试特定模型或自行挑战。

    reddit.com评测原文
  4. Reddit r/LocalLLaMAby /u/tabletuser_blogspot · 短讯AI评分:50/100

    按性价比排序的 GPU Vulkan llama.cpp 基准测试表

    该表格旨在帮助预算有限的用户构建数据中心家庭实验室。数据源自 Llama.cpp 讨论区关于 Vulkan 性能的帖子,包含 76 款不同 GPU 型号的基准测试结果。测试使用 Llama 2 7B 模型及 Q4_0 量化格式,以评估其在 4GB 显存 GPU 上的表现,并通过 AI 或系统集成商筛选出高性价比、中等水平的推荐结果。

    reddit.com评测原文
  5. Reddit r/artificialby /u/moschles · 短讯AI评分:70/100

    2024年BABA-is-AI测试:多模态大模型在规则组合泛化上表现不佳

    一篇提交至ICML的论文测试了GPT-4o、Gemini-1.5-Pro和Gemini-1.5-Flash等主流多模态大语言模型,发现它们在需要操纵和组合游戏规则的泛化任务中失败严重。该研究揭示了当前SOTA模型在复杂逻辑推理方面的局限性。

    reddit.com评测论文原文
  6. Reddit r/MachineLearningby /u/moschles · 短讯AI评分:70/100

    BABA is AI:多模态大模型在规则泛化任务中表现不佳

    2024年ICML论文《Whatever happened to BABA is AI?》测试GPT-4o、Gemini-1.5-Pro等SOTA多模态模型,发现它们在需要操纵和组合游戏规则的泛化任务中失败严重。该研究揭示了当前大模型在复杂逻辑推理与规则泛化方面的局限性。

    reddit.com评测模型原文
  7. Reddit r/LocalLLaMAby /u/Fun-Meaning-6474 · 短讯AI评分:50/100

    在 RTX 4090 本地运行决策模型以测试速度差异

    作者近期观察到多个开源决策模型(Laya、Liquid D1、Cloudflare Clef-Flash、Interfaze Lev)涌现,遂在同一硬件(RTX 4090)环境下进行横向对比。测试任务为逐词阅读关于蜈蚣的维基百科文章并标记相关词汇,通过 API 调用评估各模型的实际推理速度与性能表现。

    reddit.com评测原文

10月8日 · 星期四9 条

  1. Reddit r/LocalLLaMAby /u/facethef · 短讯AI评分:50/100

    AI决策模型玩吃豆人:Kev、Clef与GPT-6 Luna性能对比

    作者将Kev 1.13、Kev 4B、Clef、Clef Flash、GPT-6 Luna和Laya六款主流AI决策模型置于吃豆人游戏中进行实时对战测试。由于这些模型响应速度在毫秒级,能够支持实时游戏交互。文章发布了排行榜并开源了代码仓库,允许用户自行运行和评估决策模型。

    reddit.com评测产品原文
  2. Reddit r/LocalLLaMAby /u/dergachoff · 短讯AI评分:30/100

    DeepSeek V4.1 Flash 在研究子代理任务中击败 Haiku 5.5(小规模评测)

    作者在小规模实际应用中对比了 DeepSeek V4.1 Flash 与 Haiku 5.5。在作为研究子代理执行搜索、阅读并撰写报告的任务中,Haiku 5.5 未能取代前者。测试环境为 M2 Max,通过 OpenRouter 运行,结果显示 DeepSeek 在特定工作负载下表现更优。

    reddit.com评测原文
  3. Reddit r/LocalLLaMAby /u/norenEnmotalen · 短讯AI评分:50/100

    对比 Qwen3.8-27B 微调模型与前沿基线:Signal-3.8-27B 实测结果

    作者针对特定用例测试了 Qwen3.8-27B 的微调版本,发现 mradermacher/Signal-3.8-27B-Terse-Coder.i1-Q4_K_M 表现最佳。该模型在评估集上的速度比前沿模型慢约 28 倍,但考虑到硬件限制,仍具可行性。建议用户根据具体领域进行基准测试。

    reddit.com评测模型原文
  4. Reddit r/LocalLLaMAby /u/sirjoaco · 短讯AI评分:50/100

    自2024年5月以来对371个模型使用相同提示词,结果汇总于此

    一位用户创建了一个名为 Museum of Models 的免费网站,无需注册即可访问。该工具对371个AI模型(包括大量开源权重模型及93个已停用的模型)使用了相同的单轮提示词、无系统提示词、温度0.7进行统一测试,并将所有回答集中展示,便于横向对比。

    reddit.com评测原文
  5. Reddit r/artificialby /u/KnowledgeOk7634 · 短讯AI评分:70/100

    我给4个AI模型核按钮,结果DeepSeek差点毁灭世界

    作者开发了一款名为SECOND STRIKE的浏览器战争游戏,引入末日时钟机制:每次核打击使时钟逼近午夜,若触发午夜则玩家被抹除。作者让DeepSeek、Grok、Mistral和GPT四个AI模型分别控制一个国家,进行15轮相同战争测试。结果显示DeepSeek有13次导致世界毁灭,Grok和Mistral各6次,GPT仅3次,而游戏内置AI为0次。该实验揭示了不同大模型在极端博弈场景下的风险倾向差异。

    reddit.com评测产品原文
  6. Reddit r/LocalLLaMAby /u/Prudent_Appearance71 · 短讯AI评分:50/100

    双卡 CMP 170HX 运行 GLM-5.3-Flash 实测:384K 上下文与 ~90 tok/s 速度及 Qwen3.8 对比

    作者分享在双张 64GB CMP 170HX 显卡上稳定运行 GLM-5.3-Flash 的配置,支持 384K 上下文且推理速度约 90 tok/s。同时将该模型与同机运行的 Qwen3.8-Flash-Next(AWQ INT4 + FP8 PLE)进行对比,通过 vLLM 基准测试及 DSH 编码/智能体任务评估实际完成时间。

    reddit.com评测原文
  7. Reddit r/LocalLLaMAby /u/Enderchef · 短讯AI评分:70/100

    Open SLM Evaluations:106款小型语言模型基准评测数据集发布

    Enderchef 发布了名为 Open SLM Evaluations 的开源数据集,包含对 106 款参数量在 1.5 亿以下的轻量级语言模型(SLM)的独立基准测试结果。数据涵盖各模型得分、链接及参数规模,基于 Runpod B200 GPU 耗时约 30 分钟完成评估,采用 Apache 2.0 协议在 Hugging Face 开放。

    reddit.com评测开源原文