← 返回信息流

精选TechCrunch AI新闻

Vals AI 获 Andreessen Horowitz 支持,致力成为 AI 基准测试的权威标准

techcrunch.com作者:Lucas Ropek评测融资AI评分:70/100

Vals AI 获得 Andreessen Horowitz 投资,旨在建立一个中立且可信的 AI 模型基准测试平台。在 AI 模型泛滥的背景下,该组织致力于解决评测市场缺乏统一标准和信任度的问题,试图确立行业基准测试的黄金标准。

基准测试已成为人工智能行业验证模型能力、在指标对其有利时脱颖而出并宣传自身优势的常态。换言之,优秀的基准测试几乎总是意味着良好的公关效果。

不幸的是,企业也找到了规避传统基准测试系统的方法——其中许多系统年代久远,并非为衡量现代模型的能力而设计。

Vals 是一家成立于 2024 年的初创公司,声称其使命正是修复这一极不完善的体系。在不到两年的时间里,该公司已在科技行业中确立了显著地位,并于去年成功获得由 8VC 和 Bloomberg Beta 领投的种子轮融资。随后在上个月,经过一段快速增长期,它又完成了由 Andreessen Horowitz 领投的 4000 万美元 A 轮融资。

该公司 25 岁的联合创始人 Rayan Krishnan 此前曾在 Palantir 实习,并在斯坦福大学就读本科期间,为微软以及该校备受赞誉的人工智能实验室工作过。Krishnan 表示,Vals 的诞生源于他自身的观察:他发现基准测试正落后于其所要衡量的行业的进步速度。

“我们看到大量新的高性能模型迅速进入市场,而学术界的基准测试未能跟上这一前沿进展,”Krishnan 分享道。他表示,随着人工智能融入社会的方方面面,基准测试的真正意义在于验证模型是否真如公司所宣称的那样具备相应能力。

上周,这位年轻的创始人带我参观了他公司在旧金山 Folsom 街的两层办公楼——这是一栋百年前的旧砖楼,曾是一家大型啤酒厂的所在地。如今,这座历史建筑不再产出工业啤酒,而是容纳了多家旨在推动科技行业未来的初创公司。

“从历史上看,我认为评估一直是以一种非常抽象的方式来衡量智能,”Krishnan 告诉我。“比如,模型是否掌握了足够的信息以通过类似律师资格考试类型的测试?”

在此方面,Vals 力求与众不同。虽然许多基准测试系统提供公开可用的测试(这允许公司针对这些测试训练其模型,从而在某种程度上构成作弊),但 Vals 并不公开披露其具体的测试材料。除了衡量 AI 模型的通用知识外,Vals 还评估模型完成与法律、金融和编程等特定行业相关的复杂任务的能力。

“我们实际上是在考察模型产生的真实影响,”Krishnan 说。“它们能否在每个领域内完成产生与人类同等质量产品的工作?”

他表示,这种理念不仅关注积极结果,也关注消极结果。他希望分析“如果这些模型在世界上失控运行,会产生哪些负面后果”。

Vals 正在衡量的能力不断增长。除了更多传统行业外,该初创公司还在不断拓展更独特的领域。“我们有一个关于递归自我改进的基准测试。我们在心理健康、网络安全、生物安全甚至武装冲突法方面也在开展工作,以了解如何向模型应用《日内瓦公约》,”Krishnan 分享道。

企业付费让 Vals 测试其模型,这一概念可能令人难以理解。为什么一家公司要花钱去了解其模型表现不佳?但有效的测量有助于企业随时间推移进行故障排除和改进。Krishnan 将他们的收入模式比作学生付费参加由 College Board 举办的 SAT 考试。

反过来,这些评估正成为寻求收购新 AI 模型的企业做出关键决策的重要因素。

这家初创公司最近透露,其目前的收入是去年的八倍。员工人数也在增长。Vals 年初仅有 8 名员工,如今团队已扩大三倍至 25 人。Krishnan 表示,随着公司的发展,计划搬迁到规模更大的办公室,并再招聘 10 至 15 名员工。该公司最近还启动了一个以向联邦机构提供模型评估为中心的项目。

Krishnan 认为,他的公司的基准测试系统是 AI 公司思考如何发展业务和建立公众信任的未来方向。

“AI 公司开始上市了。SpaceX 已经上市。Anthropic 计划在今年晚些时候上市。我怀疑 OpenAI 很快也会上市。我认为,随着 AI 模型成为经济的核心组成部分并更广泛地扩散,我们所进行的基准测试和评估类型将推动其使用,并成为这些公司在提交公开文件或谈论其在 AI 方面的预期投资时的核心部分,”他说。

译文已达到本站中文翻译的字数上限,剩余内容请查看原文。

阅读原文