精选TechCrunch AI新闻
AI评测平台LMSYS估值翻倍至31亿美元,完成2亿美元融资
LMSYS组织(Chatbot Arena运营方)完成2亿美元融资,由Lightspeed和Khosla Ventures领投,估值达31亿美元。该平台正扩展对大模型的对齐能力评估,涵盖说谎等伦理问题。
Arena 于周四宣布,其已完成 2 亿美元 B 轮融资,估值达 31 亿美元。该项目起源于 2023 年加州大学伯克利分校的一项研究计划,通过众包方式对 AI 模型进行排名。
此前,该公司曾宣布在 6 月实现了年化收入 1 亿美元。
本轮融资由 Lightspeed Venture Partners 和 Khosla Ventures 领投,Salesforce Ventures、01 Advisors、Dell Technologies Capital、Endeavor Catalyst、a16z、Felicis 等机构跟投。Arena 此前于今年 1 月宣布完成 1.5 亿美元的 A 轮融资,投后估值为 17 亿美元。当时其年化收入为 3000 万美元。这意味着其估值在约 10 个月内几乎翻了一番。
Arena 提供了一个供消费者免费使用的众包平台。用户输入提示词或请求生成“氛围编码”项目,然后对哪个模型表现更好进行评分。Arena 声称其拥有数千万月度活跃访客。
去年 9 月,Arena 推出了其商业产品“AI 评估”(AI Evaluations),该服务基于社区反馈,为模型实验室和企业提供详细的性能分析。这一时机恰到好处。今年,AI 实验室意识到它们的模型正在操纵基准测试,寻找在不真正取得优异成绩的情况下刷高分的方法。与此同时,企业希望获得帮助,以确定哪些模型最适合其内部需求,而不是仅依赖标准化基准。
“AI 的发展速度超过了我们的评估能力,一旦模型意识到自己正在接受测试,静态基准就会失效。”该公司在融资公告中表示。“世界需要一个中立的第三方来衡量 AI 在普通人手中时的实际安全性和对齐程度。Arena 今日正承担起这一角色。”它补充道。
为此,Arena 还在其排行榜中新增了一个类别:对齐性(alignment)。在该类别中,它根据未经授权的行动(执行未被要求采取的行动)、错误归因(将陈述或事实错误地归因于错误的来源)以及所谓的“欺骗性完成”(谎称完成了未执行的任务)等问题对模型进行排名。
目前,OpenAI 的一系列模型在其初步的对齐性排行榜上名列前茅,Claude Opus 5.5 和 Claude Fable 分别位列第六和第九。