基因表达上升,AI能准确判断我们到底知道了什么吗?
作者提交Kaggle基准测试挑战,构建CellCaution模型以测试AI在细胞混合样本中推断基因表达变化的能力。小型控制研究显示Gemma模型表现良好。


作者提交Kaggle基准测试挑战,构建CellCaution模型以测试AI在细胞混合样本中推断基因表达变化的能力。小型控制研究显示Gemma模型表现良好。


作者为确定本地部署首选模型,在 RTX 5060 Ti 16GB 硬件上对比了 Swift、Next IQ3_S 和 llama.cpp 下的 Qwen 3.8 系列模型。通过运行 AtCoder 编程题并遍历四种思考深度(无、低、中、极高),评估不同量化格式与推理引擎下的性能差异及思考机制对解题准确率的影响。
本文对 Veo 3.1、Kling 3.0 和 Seedance 2.0 三款主流 AI 视频生成模型进行了横向评测,重点分析实际调用成本。数据来源于 Reelina 平台(截至 2026 年 10 月),旨在为开发者提供关于生成 10 秒片段费用的直观参考,弥补仅关注画质而忽略成本的评测空白。
作者针对印度用户常用的罗马化印式英语(Hinglish)进行基准测试,探究大语言模型在混合语言环境下的诚实度。通过设置无法执行的任务(如分析未附带的文件),对比5个主流模型是否能如实告知而非产生幻觉。

作者提交 Kaggle 基准挑战 VORTEX(Valuation of Reasoning, Tool-use, and EXpertise),旨在解决静态基准测试因数据泄露导致评分失效的问题。VORTEX 通过代码生成固定种子任务并程序化验证答案,确保无法靠记忆得分。文章展示了在该基准上三个前沿模型的运行结果与内部行为差异。
该Kaggle竞赛提交构建了一个基准,用于评估大语言模型在解决实际Python编程任务时的可靠性。重点考察功能正确性、调试能力和指令遵循三个维度,涵盖数据处理、边缘情况、代码修复及显式约束下的代码生成。
Kaggle基准测试挑战提交,旨在测量AI模型在面对用户坚持错误答案时的行为。设计包含24道可验证题目(含数学逻辑陷阱),通过字符串匹配评分,评估助手是否会在自信用户的压力下放弃正确回答。

作者将开源编码智能体基准测试 cli-bench 的六个任务移植至 Kaggle Benchmarking Challenge。该基准测试通过终端仓库中的修复、构建或加速任务及验证脚本进行自动评估,不依赖其他模型打分。作者在移植过程中发现了自身存在的错误。
作者在同一台配备 RTX 5090、192GB RAM 的 Windows 机器上,对 Strata 和 Infernix 两款推理引擎进行了 A/B 测试。使用 Qwen3.8-Flash 模型,在 262k 和 512k 上下文长度下对比性能,结果显示 Strata 达到 137 tok/s,Infernix 预填充速度达 3,497 tok/s,且两者在 Windows 上的部署均较为顺利。
针对本地模型对比中因硬件、运行环境和测试套件不同导致结果混乱的问题,提出引入“模型账本”(Model Ledger)概念。该机制将实验室结果整合为统一表格,涵盖129行数据,包含5种硬件配置下的45项独立评估,并标记重复和未完成的运行记录,旨在提供更透明、可追溯的基准测试数据。