SHELL PULSE

10月10日 · 星期六1 条

10月9日 · 星期五1 条

10月8日 · 星期四1 条

10月5日 · 星期一1 条

  1. IT之家新闻AI评分:70/100

    DeepSeek V4.1 Flash 发力,中美顶尖模型 LiveBench 跑分差距缩至 3%

    彭博行业研究指出,随着 DeepSeek 发布 V4.1 Flash,中国顶尖 AI 模型在 LiveBench 基准测试中与美国竞争对手的性能差距已缩小至 3%,创历史新低。此前该差距为 9% 至 15%。报告认为,得益于对国产硬件的优化及专业能力深化,中国模型正扩大市场份额,引发对美国 AI 科技主导地位长期性的质疑。

    DeepSeek
    ithome.com评测模型原文

10月2日 · 星期五1 条

  1. 36氪新闻AI评分:70/100

    Utopai Studios视频生成模型跻身文生视频榜单全球第二

    独立AI影视公司Utopai Studios的定制视频生成模型Utopai X在Artificial Analysis的全球文生视频排行榜中排名升至第二,位列全美第一。该榜单采用盲评机制,由观众对同一提示词生成的视频进行偏好评价,这是首次有影视公司定制模型取得如此佳绩。

    36kr.com评测产品原文

9月30日 · 星期三2 条

9月26日 · 星期六1 条

  1. IT之家新闻AI评分:70/100

    OpenAI GPT-6 Astra 在家具组装基准测试中准确率达 80%

    Epoch AI 发布家具组装基准测试(FAB),评估多模态 AI 结合说明书与照片识别装配错误的能力。OpenAI GPT-6 Astra 在该测试中准确率达 80%,较此前提升近三倍,展现了强大的视觉与空间推理能力。

    ithome.com评测模型原文

9月24日 · 星期四1 条

  1. IT之家新闻AI评分:70/100

    OpenAI 发布 MentalHealthBench:1215 段对话评估 AI 心理健康应对能力

    OpenAI 推出 MentalHealthBench,这是一个包含 1215 段合成心理健康对话的开放式基准测试。该数据集由来自 22 个国家和地区的 80 多名持证心理学家参与制定,覆盖 19 种语言和近 20 个专业领域,旨在评估 AI 系统在从日常话题到紧急事件等不同场景下的应对能力。此举旨在填补现有评估多集中于紧急情况的空白,并邀请研究人员进行独立审查与进一步研究。

    ithome.com评测模型原文

9月21日 · 星期一4 条

  1. 量子位by 量子位的朋友们 · 短讯AI评分:50/100

    OceanBase登顶国际Data Agent榜单

    OceanBase团队提交的Data Agent方案在国际数据智能体基准测试Data Agent Benchmark中登顶。

    qbitai.com评测原文
  2. 雷锋网新闻AI评分:70/100

    OceanBase Data Agent方案登顶国际DAB榜单,准确率超90%超越GPT与Claude方案

    OceanBase团队基于国产大模型GLM-5.2构建的Data Agent方案Scout,在国际数据智能体基准DAB中以90.62%的准确率位列第一,成为首个突破90%的方案。该评测由UC Berkeley EPIC Data Lab推出,覆盖多领域及多种数据库。OceanBase方案超越了多项基于GPT、Claude Opus等海外模型的参评方案,相关能力将融入OceanBase DataPilot产品。

    全球「AI学术顶会」精华汇聚地登顶国际Data Agent榜单登顶国际Data Agent榜单,OceanBase超过多项GPT、Claude方案
    leiphone.com评测产品原文
  3. 极客公园短讯AI评分:70/100

    B站上线AI无限竞技场测评榜:GPT-6 Astra居首,国产模型占前三席

    9月20日,B站宣布上线「AI无限竞技场」大模型测评榜。该榜单汇集UP主对上百个大模型的真实场景实测,涵盖代码、推理等主题,不设固定维度限制,排名实时更新。首轮测评中,GPT-6 Astra在10位UP主测试中拿下榜首,打败GLM-5.3;前5名中国产大模型占据3席,包括DeepSeek、Kimi、千问等主流模型均参与对比。

    geekpark.net评测原文

9月17日 · 星期四2 条

  1. IT之家新闻AI评分:70/100

    AI 推理 MLPerf 6.1 发布:AMD 以 512 个 MI355X 刷新纪录、英伟达 Vera Rubin 首次现身

    MLCommons 发布 MLPerf Inference v6.1,重点考察 AI 推理吞吐、扩展效率与不同 GPU 配置表现。AMD 提交迄今最大规模结果:512 个 Instinct MI355X 在 DeepSeek R1 测试中离线吞吐 290 万 tokens/s、服务器场景 240 万 tokens/s,并称以 575 万 tokens/s 创下新纪录。英伟达同场提交,Vera Rubin 平台首次现身。

    ithome.com评测行业原文
  2. 极客公园新闻AI评分:70/100

    IDC 发布企业级 Agent 评估报告,中国电信 TeleAgent 综合跻身国内第一梯队

    IDC 发布《中国企业级通用 Agent 产品技术评估》报告,在统一仿真环境中从任务表现、成本效率、交互体验、安全可控、生态开放性等九大维度实测国内主流通用智能体,并加入脏数据、权限约束、模糊指令等干扰条件。中国电信星辰超级智能体 TeleAgent 综合得分 6.85 分,成本效率、安全可控、任务表现等维度高于行业普遍水平,Token 消耗优于同类产品,常规办公任务能力进入国内第一梯队。其背后是中国电信在算力、平台、数据、模型、应用上的全栈布局,星辰实验室基于国产算力与框架自研十亿至千亿参数语义大模型并开源,Hugging Face 等社区总下载量已破百万。

    geekpark.net评测行业原文

9月16日 · 星期三1 条

9月15日 · 星期二1 条

  1. IT之家短讯AI评分:50/100

    测试阿里 Qwen3.8-27B AI 模型极限:网友约 5 小时 RTX 3090 开发僵尸射击游戏

    IT之家 9 月 15 日消息,网友 u/EcstaticDentist 昨日(9 月 14 日)在 Reddit 社区发帖,在单张超频 RTX 3090 显卡上,耗时约 5 小时,通过 2 套 Harness 方案,调用 Q4KM 量化版 Qwen3.8-27B 模型,成功打造出可玩的第一人称僵尸射击游戏。IT之家曾于 8 月报道,阿里开源 Qwen3.8-27B 模型,较 Qwen3.6-27B,新模型在编程和办公场景的性能大幅提升,表现甚至超越了 Qwen3.7-Plus;同时,模型还新增了 reasoning_effort 功能,根据任务难度控制思考深度,更省资源。该网友表示为了测试 Qwen3.8-27B 模型的性能极限,耗时约 5 小时成功打造出可玩的第一人称僵尸射击游戏。在硬件配置方面,消息源只透露采用单张 RTX 3090 显卡,并使用微星的 MSI Afterburner 工具超频,性能提升约 12%。在模型方面,本次测试的是 Q4KM 量化版本,通常是指 GGUF 格式模型中的一种 4-bit 混合量化档位。

    ithome.com评测开源原文

9月13日 · 星期日1 条

  1. IT之家新闻AI评分:70/100

    A20 Pro 芯片 AI 跑分曝光:苹果 iPhone 18 Pro NPU 最高增幅 51.53%

    GeekBench AI 平台出现苹果 iPhone 18 Pro(iPhone19,2)跑分记录,搭载 A20 Pro 芯片。Core ML 调用 GPU 得分为 12,775 / 24,077 / 26,951,Neural Engine 为 7,002 / 55,720 / 75,810,单精度 5,144 分,NPU 最高增幅 51.53%。这是端侧 AI 算力架构的实测数据,反映苹果新一代神经引擎性能提升。

    ithome.com评测产品原文

9月12日 · 星期六1 条

  1. IT之家新闻AI评分:50/100

    英伟达 DLSS 5 混合精度 Mod 测试:RTX 50 系列显卡性能仅提升 1% 至 2%

    Mod 开发者将 FP8 与 NVFP4 混合精度应用于英伟达 DLSS 5 神经渲染模型,在 RTX 50 系列(Blackwell)显卡上测试。结果显示 4K 分辨率下神经渲染阶段耗时仅降低约 1% 至 2%,开发者称改进非常有限;该数据并非整款游戏帧率提升。实验由 OptiScaler-DLSSNR-PreSR-Multipass 项目 0.7.1 版本引入,不支持的模型形状仍回退至 FP8。

    ithome.com评测产品原文

9月11日 · 星期五1 条

  1. 36氪新闻AI评分:70/100

    蚂蚁集团AI安全实验室登顶CyberGym榜单,漏洞验证成功率达98.5%

    蚂蚁集团AI安全实验室的天工Cyber模型与天工Harness在AI安全评测基准CyberGym上以98.5%的漏洞验证成功率位列全球第一。天工Harness融合自研天工Cyber模型及DeepSeek V4 Pro、Qwen 3.8 Max等国产大模型,可完成漏洞分析、PoC构造与结果验证的端到端流程。

    36kr.com评测行业原文

9月7日 · 星期一2 条

  1. IT之家新闻AI评分:50/100

    AI大模型周榜:国产多模型扎堆入榜前端开发榜,阿里wan3.0冲进视频榜前三

    Arena平台发布第36周AI大模型盲测排名,国产模型在细分榜单表现亮眼。前端开发榜中,阿里qwen3.8-max-0902首次入榜即位列第4,腾讯hy4-preview、智谱glm-5.3-flash等也首次入榜。AI视频榜中,阿里wan3.0首次入榜即冲进前三。头部格局仍以海外模型为主,但国产模型进步速度值得关注。

    ithome.com评测原文
  2. 36氪新闻AI评分:50/100

    中国信通院启动“方升”智能体基准测试任务征集工作

    中国信通院启动“方升”智能体基准测试任务征集,该基准围绕基础能力、典型场景和复杂综合任务构建分层测试框架,旨在推动智能体测试向综合能力测量、过程分析和问题诊断拓展。现面向社会公开征集测试任务,以完善测试任务、环境和评价方法。

    36kr.com评测政策监管原文

9月5日 · 星期六1 条

  1. IT之家新闻AI评分:50/100

    外媒测试英伟达 DLSS 5:显卡越强功耗增幅越大,4K 分辨率 RTX 5090 增幅 34%

    德国科技媒体 ComputerBase 通过首款支持 DLSS 5 的《NBA 2K27》游戏测试发现,开启 DLSS 5 后显卡功耗显著增加,且显卡越强增幅越大。RTX 5090 在 4K 下功耗从 417 瓦升至 561 瓦,增幅 34%;WQHD 下增幅达 66%。RTX 5080 等型号也有类似增长。该测试揭示了 DLSS 5 在提升画质的同时可能带来更高的功耗。

    DLSS 5 Ein DownloadDLSS 5 Aus Download
    ithome.com评测产品原文

9月4日 · 星期五1 条

  1. 36氪新闻AI评分:70/100

    海致AtlasGraphRAG登顶GraphRAG-Bench两大赛道

    海致科技自研的AtlasGraphRAG在GraphRAG-Bench评测基准的Novel和Medical两大赛道中均获第一名,超越微软MS-GraphRAG和HippoRAG2等国际主流框架。GraphRAG-Bench是学术界首个系统性验证图检索增强生成有效性的基准,涵盖事实检索、复杂推理、上下文摘要和创意生成四大任务。

    36kr.com评测行业原文

9月2日 · 星期三2 条

  1. 36氪新闻AI评分:70/100

    OPPO联合OpenKG推出首个端侧AI记忆评测基准MobileMem

    OPPO与OpenKG社区联合推出行业首个端侧AI记忆评测基准MobileMem,携手浙江大学等高校共同建设。该基准包含累计百万词元的评测数据集,模拟真实用户长期使用,聚焦端侧AI真实场景与长期个性化需求。

    36kr.com评测行业原文

8月31日 · 星期一2 条

  1. 雷锋网新闻AI评分:50/100

    没有全科优秀,具身模型别想进入百万小时

    原力灵机在机器人评测基准RoboDojo中登顶,该基准旨在去除机器人演示中的“化妆”成分,测试真实能力。文章指出,尽管机器人运动会和展会展示了各种技能,但具身模型需在全面能力上优秀,才能实现百万小时级别的实际应用。

    全球「AI学术顶会」精华汇聚地
    leiphone.com评测模型原文

8月30日 · 星期日1 条

  1. 极客公园新闻AI评分:70/100

    OpenAI 芯片实测跑分揭晓,推理性能超越英伟达 Blackwell

    在 Hot Chips 大会上,OpenAI 硬件负责人 Richard Ho 公布了其与博通联合打造的推理芯片 Jalapeño 的首份公开跑分。在 SemiAnalysis 的 InferenceX 基准测试中,该芯片在每用户 token 数和每千瓦吞吐量上均超越英伟达 Blackwell,峰值每瓦吞吐量是后者的 1.5 至 1.9 倍,低延迟场景下优势更大。

    geekpark.net评测行业原文

8月27日 · 星期四1 条