Vals,由 Andreessen Horowitz 支持,正寻求成为 AI 评测的行业标杆
摘要
Vals,这家由 Andreessen Horowitz 支持的初创公司,正在通过评估模型在复杂真实任务上的表现来确立 AI 评测的行业标准,防止作弊并确保评估的准确性。
Vals AI 希望在 AI 模型日益泛滥的世界中,使 AI 评测变得更加中立和可信。
查看缓存全文
缓存时间: 2026/09/19 15:26
# 获Andreessen Horowitz投资的Vals,立志成为AI基准测试的黄金标准 | TechCrunch
来源:https://techcrunch.com/2026/09/19/vals-backed-by-andreessen-horowitz-is-looking-to-become-the-gold-standard-for-ai-benchmarking/
基准测试已成为AI行业验证模型能力的标准流程,当指标表现优异时,企业不仅能脱颖而出,更能宣传自身优势。简言之,优秀的基准测试几乎总能转化为出色的公关效应。
然而,企业也逐渐发现如何规避传统基准测试体系——其中许多已显老旧(https://www.technologyreview.com/2026/03/31/1134833/ai-benchmarks-are-broken-heres-what-we-need-instead/),且并未针对现代模型能力量身设计。
成立于2024年的初创公司Vals(https://www.bloomberg.com/news/newsletters/2024-04-11/this-startup-is-trying-to-test-how-well-ai-models-actually-work)表示,其使命正是修正这一并不完善的体系。不到两年间,该公司已在科技行业确立重要地位,并于去年获得由8VC和Bloomberg Beta领投的种子轮融资。随后在上月经历快速增长后,Vals完成了由Andreessen Horowitz领投的4000万美元A轮融资(https://www.citybiz.co/article/890247/vals-ai-raises-40m-to-expand-independent-ai-benchmarking/)。
公司25岁的联合创始人瑞安·克里希南(Rayan Krishnan)曾于帕兰提尔(Palantir)实习,本科就读斯坦福大学期间曾在微软及该校备受赞誉的人工智能实验室工作。克里希南表示,Vals的诞生源于他对基准测试发展滞后于行业进步的观察。
“我们看到许多高性能新模型快速进入市场,而学术基准测试却未能跟上这种前沿进展,”克里希南分享道。他认为,随着AI融入社会各领域,基准测试应当真正用于验证模型是否具备企业宣称的能力。
上周,这位年轻创始人带领我参观了公司在旧金山福尔瑟姆街的两层办公室——这座砖砌老建筑百年前曾是大型啤酒厂(https://noehill.com/sf/landmarks/sf199.asp)所在地。如今这座历史建筑不再生产工业啤酒,而是汇聚了多家致力于推动科技未来的初创企业。
“传统评估往往以抽象方式检验智能,例如模型是否掌握足够知识通过司法考试,”克里希南向我说明。而Vals正试图在此实现差异化。许多基准测试采用公开试题(这可能导致企业针对性训练模型,变相作弊(https://www.nytimes.com/2024/04/15/technology/ai-models-measurement.html)),但Vals从不公开具体测试内容。除了评估模型的通用知识,Vals更注重检验模型在法律、金融、编程等特定行业完成复杂任务的能力。
“我们实际考察的是模型的真实影响,”克里希南表示,“它们能否在不同领域完成达到人类同等质量的工作?”
他强调,这套评估体系不仅关注积极成果,也检测潜在风险。“我们希望分析如果这些模型在世界范围内自由应用,可能产生哪些负面影响。”
Vals的评估范畴正在扩展。除传统行业外,这家初创公司持续开拓独特领域。“我们设有递归自我改进基准测试,还在心理健康、网络安全、生物安全甚至武装冲突法领域开展研究,以检验模型对日内瓦公约的应用能力,”克里希南介绍道。
企业需付费委托Vals测试其模型——这种模式或许令人费解:为何要花钱证明自身模型表现不佳?但有效测量能帮助企业逐步调试改进。克里希南将此盈利模式比作学生向美国大学理事会(College Board)付费参加SAT考试。
反过来,这些评估已成为企业采购新AI模型的关键决策依据。
该公司近期披露(https://x.com/ValsAI/status/2087917239966290168),其当前收入已达去年同期的八倍。团队规模也在扩张:年初仅有8人的Vals现已增至25人。克里希南表示,随着公司发展,计划搬迁至更大办公室,并将增聘10至15名员工。该公司最近还启动了面向联邦机构提供模型评估的专项计划(https://www.youtube.com/watch?v=iUZ6c1YkFPc)。
克里希南认为,其公司的基准测试体系将成为AI企业思考业务增长与公众信任建设的未来方向。
“AI企业正陆续上市。SpaceX已上市,Anthropic计划今年晚些时候上市,我推测OpenAI也将很快公开交易。随着AI模型成为经济核心并更广泛普及,我们开展的基准测试类型将驱动其应用,并成为这些企业提交公开文件或讨论AI投资规划时的核心要素,”他说道。
*当您通过文章中的链接购买商品时,我们可能获得小额佣金(https://techcrunch.com/techcrunch-affiliate-monetization-standards/)。这不影响我们的编辑独立性。*
卢卡斯是TechCrunch资深撰稿人,负责报道人工智能、消费科技与初创公司领域。此前曾在Gizmodo从事AI与网络安全报道。您可通过邮箱[email protected]联系卢卡斯。
查看个人主页(https://techcrunch.com/author/lucas-ropek/)
相似文章
新评测标准的时机
本文讨论了在AI领域引入新评测标准的必要性,以更好地评估模型性能并解决现有标准的局限性。
@svpino: 我不信任基准测试。我们都看过这样的戏码:新模型在基准测试中击败所有人。人们热议它。然后…
这条推文批判了传统的AI基准测试,并介绍了TRACES,这是一个新的基准测试,专注于评估模型如何得出答案的过程,包括工具使用、错误纠正和证据追踪。
一家孵化其他初创公司的企业获1亿美元融资,全力押注物理AI
Vantora(前身为UP.Labs)从Silversmith Capital Partners获得了1亿美元融资,并将重心转向为企业客户构建专有物理AI初创公司。
大型AI企业实验室提供的模型,按FTC定义构成欺诈
文章指出,AI实验室在广告中宣传理想模型版本的高基准分数,但实际向用户交付严重降级版本(如量化、叠加安全层),性能下降50%-60%以上,这构成欺诈。作者提议强制性第三方重新基准测试作为解决方案。
AI模型构建者的不稳定指标与基准测试文化
本文介绍了Benchmarking-Cultures-25数据集,该数据集分析了AI模型构建者如何在新闻稿中选择性突出基准测试。研究发现评估格局碎片化,跨模型可比性有限,并指出基准测试更多被用作市场定位的叙事工具,而非标准化的科学测量手段。