Reddit r/LocalLLaMA短讯中文原文又一个纯开源权重模型基准测试1 天前reddit.com作者:/u/EmilPi评测AI评分:50/100发布了一个包含实时结果、编码和智能体(agentic)基准的开源模型评测平台。数据按领域、语言和意图分类,支持过滤。DeepSeek-V4-Vision-Exp在整体表现上占优,但其他模型在特定领域也有优势。评测由领域专家进行,目前仅公开部分数据。阅读原文