大模型的能力曲线还在陡峭爬升,但衡量这条曲线的尺子已经不够用了。当一家前沿实验室发布新模型时,技术报告里的跑分表越来越长,可开发者把模型接入真实支付系统、医疗问诊流程或代码仓库后,却常常发现榜单上的高分并不能兑现为生产环境里的可靠表现。公开基准测试的分数与真实任务完成度之间的裂缝,正在成为整个行业最尴尬的公开秘密。

问题不在于模型不够强,而在于“考试”本身正在失效。许多公开基准的测试题早已被混入训练数据,模型可以靠记忆而非推理拿到高分;厂商也学会了针对特定榜单做优化,让分数在发布当天好看,却在用户的真实场景里露怯。一个独立的“裁判”角色,开始变得比又一个新模型更稀缺。

2026年8月13日,旧金山AI模型评测公司Vals AI宣布完成4000万美元A轮融资,估值达到4亿美元。本轮由a16z领投,老股东8VC、Pear VC、Bloomberg Beta继续参投,新投资方包括HRT Ventures和Next Ladder Ventures。这家由Rayan Krishnan和Langston Nashold创立的公司,试图用一套基于真实专业任务的评测体系,替代那些越来越容易被“刷分”的公开榜单。上述融资、估值、投资方和创始人信息均来自公司及投资方披露,RecodeX未在本次采集材料中找到独立审计或第三方验证。

字段 内容
公司 Vals AI
轮次 A轮
金额 4000万美元
投资方 a16z领投;8VC、Pear VC、Bloomberg Beta、HRT Ventures、Next Ladder Ventures参投
总部 旧金山
创始人 Rayan Krishnan、Langston Nashold
官网 https://www.vals.ai

当“自己出题自己考”成为行业惯例,第三方评测的真空地带

Vals AI切入的是一个微妙而敏感的环节。据公司披露,其评测结果已被OpenAI、Anthropic、Google、Meta和xAI的模型卡引用。这意味着,那些彼此竞争最激烈的模型厂商,至少在“被谁打分”这件事上,选择了同一个外部参照系。这在过去的AI竞争格局中并不常见——厂商通常倾向于引用对自己最有利的测试结果,而不是一个统一的、可能暴露短板的第三方评测。需要说明的是,上述“被模型卡引用”仅来自公司披露,公开材料中未提供这些引用是否属于付费合作、是否覆盖完整评测结果或仅选择性引用的独立验证。

这种选择背后,反映的是模型发布流程中的一个结构性变化。过去,模型能力的证明主要依赖厂商自己发布的基准分数,辅以学术论文中的消融实验。但随着模型规模扩大、训练数据来源复杂化,单一厂商的自我报告越来越难以让下游开发者和企业采购方信服。一个被多家前沿实验室共同引用的外部评测,可能意味着行业内部开始形成一种非正式的“互认机制”:即便厂商之间在产品层面竞争激烈,但在评测层面,它们可能都意识到,一个相对独立的参照系有助于降低整个生态的沟通成本。这是基于已披露引用关系的编辑分析,而非已证实事实。

据投资方声明,a16z看中的正是这层“第三方裁判”价值。公开Benchmark越来越容易被刷分、混入训练数据,甚至被厂商针对性优化,榜单高分未必等于真实好用。这一判断与行业现状吻合:当模型能力趋同,评测的独立性就变成了比模型本身更稀缺的资产。但需要指出的是,目前尚无独立第三方机构对Vals AI的评测方法论本身进行过系统性审计;其“被前沿模型卡引用”这一事实,只能说明厂商认可其存在价值,不能直接等同于其评测结果的准确性和不可操纵性。

据公司披露,Vals AI的私有测试集仅限量运行,以避免模型被“训练在测试集上”和榜单刷分。公开材料未提供该限量运行机制是否经过独立验证的信息。这与公开基准的开放逻辑形成对比:公开基准为了透明性牺牲了防作弊能力,而Vals AI选择了相反的方向——用不透明换取可信度。但这也带来了一个内在张力:如果测试集完全不公开,外界如何验证评测的公正性?如果测试集部分公开,又如何防止被污染?这个矛盾目前没有公开的解决方案。

从产业链角度看,私有测试集的存在本身可能构成一种“信任代理”机制。企业客户未必需要理解测试集的具体内容,它们可能只需要一个可重复、可比较、且被认为难以操纵的分数。但这一机制的成立,依赖于评测方长期积累的声誉。对于一家成立时间未披露、方法论细节未公开的初创公司而言,这种声誉的建立可能比技术能力本身更困难。

用真实任务替代选择题:编程、金融、法律、医疗的“统考”逻辑

Vals AI的产品思路,是把模型评测从“做卷子”推向“干活”。据公司披露,Vals用编程、金融、法律、医疗等真实任务统一测试不同模型,通过与法律、金融、医疗、编程等领域的专家合作,在真实业务场景中为模型输出打分。这与传统基准测试中常见的多项选择题、固定答案问答题有本质区别——真实任务的评价标准更模糊,但更接近企业实际部署时面临的判断。

这种“统考”逻辑的潜在价值在于跨模型的可比性。当企业需要在多个前沿模型之间做选型时,一个统一的真实任务测试框架可能比分散的内部试错更高效。但真实任务的评分天然带有主观性:一份法律意见书的优劣、一段医疗建议的稳妥程度、一个金融分析框架的严谨性,都难以用完全客观的标准衡量。据公司披露,Vals AI依赖专家网络来为这些输出打分,但公开材料未提供专家网络规模、资质门槛或评分者间一致性指标,因此这一环节的可靠性目前无法从外部验证。

以编程任务为例,Vals AI此次同步推出的Vals Smith工具,据公司称可以直接把任意GitHub仓库做成编程基准测试。系统会从历史Pull Request中提取真实开发任务,再用隐藏测试检查模型能不能完成。这意味着企业可以针对自己的代码库生成定制化测试,而不是依赖通用编程榜单。据公司披露,该工具已全面开放。

这一产品的实际约束在于:从历史PR中提取的任务质量高度依赖仓库本身的规范程度。一个提交历史混乱、PR描述缺失的仓库,能否生成有效的测试用例,公司未披露具体的技术处理方式。此外,隐藏测试的覆盖率和难度设定,直接决定了评测结果的可比性——如果不同企业生成的基准难度差异过大,横向比较的意义就会打折扣。这些技术细节目前均未公开。

更深一层的问题在于,Vals Smith生成的基准测试是否能够真正反映“真实开发任务”的复杂度。历史PR往往只记录了已经解决的问题,而模型在真实开发中面临的困难更多来自未定义的需求、不完整的上下文和跨文件的隐性依赖。从PR中提取的任务可能天然偏向那些边界清晰、可自动验证的改动,而这类任务可能恰好是当前模型已经比较擅长的部分。这是基于产品机制的编辑推测,公开材料未提供企业用户反馈或独立测试来验证这一推测。

收入增长8倍背后的客户结构:前沿实验室与企业客户的非对称依赖

据公司披露,Vals AI在2025年收入同比增长8倍,客户数量翻倍,团队规模在半年内增长三倍。这三个数字放在一起看,勾勒出一家高速扩张的早期公司画像。但收入增长8倍这一表述需要被谨慎解读:它比较的是“今年收入”与“2025年全年收入”,而融资发生在2026年8月,这意味着比较窗口并不对称。如果2025年基数较低,8倍增长的实际金额可能仍然有限。公司未披露绝对收入数字,因此无法判断其商业化规模的真实量级。上述增长数据均来自公司披露,未经过独立核实。

客户结构是另一个值得关注的维度。据公司披露,其客户包括OpenAI、Anthropic、Google、Meta、xAI等前沿模型厂商,以及企业客户。公开材料未说明这些前沿实验室是付费客户还是仅引用评测结果,也未提供客户关系的具体证据。这种“既评测模型厂商、又服务企业客户”的双边模式,理论上可以形成正反馈:模型厂商需要独立背书,企业客户需要选型依据。但这也带来了利益冲突的潜在风险——如果一家模型厂商同时是Vals AI的重要付费客户,其评测结果是否还能保持中立?公司未披露各客户贡献的收入占比,也未说明是否存在针对模型厂商客户的隔离机制。

从商业模式角度看,这种非对称依赖可能比表面看起来更复杂。前沿模型厂商的付费意愿可能来自两个方向:一是将Vals AI的评测作为对外沟通的信用背书,二是将其作为内部模型迭代的对照工具。企业客户的付费意愿则更直接——它们需要选型依据和部署前的风险评估。但这两类客户对评测的诉求并不完全一致:模型厂商可能希望评测突出自身优势,企业客户则希望评测暴露潜在短板。Vals AI如何在同一套评测体系中平衡这两类诉求,公司未披露具体机制。

团队成员主要来自Nvidia、Meta和Palantir,据公司披露。这一背景在工程能力和企业服务经验上提供了可信度,但并不能直接转化为评测方法论的权威性。评测公司的核心竞争力在于测试设计的科学性和防作弊机制的严密性,而非单纯的工程履历。Nvidia和Meta的背景可能意味着团队在大规模系统和模型训练方面有经验,Palantir的背景可能意味着企业级数据产品的交付能力,但这些经验如何迁移到评测方法论的设计上,目前没有公开信息可以佐证。

a16z的“裁判”押注:从投资模型到投资衡量模型的尺子

a16z在AI领域的投资组合已经涵盖了从基础模型到应用层的多个环节,包括OpenAI、Anduril、Databricks和Stripe。领投Vals AI的A轮,意味着这家风投机构开始押注AI产业链中一个更隐蔽的层:评测与标准。如果模型能力继续分化,评测公司可能成为事实上的“信用中介”;如果模型能力趋同,评测公司则可能演变为“合规基础设施”。无论哪种路径,a16z的这笔投资都带有明显的平台型布局色彩。这是基于投资组合公开信息的编辑分析。

从投资组合的协同角度看,a16z同时持有OpenAI的股份和Vals AI的股份,这构成了一种微妙的三角关系。公开材料显示a16z曾投资OpenAI,但未提供当前持股状态或具体比例。一方面,a16z投资的模型厂商可能成为Vals AI的客户;另一方面,Vals AI的评测结果可能影响市场对a16z所投模型厂商的判断。这种关联是否会影响Vals AI的独立性,目前没有公开信息表明存在任何防火墙安排。对于一家以“第三方裁判”为核心定位的公司而言,其领投方与被评测对象之间的资本关联,可能成为未来被追问的治理问题。

从资本结构看,本轮融资中老股东8VC、Pear VC、Bloomberg Beta全部回归,新投资方HRT Ventures和Next Ladder Ventures加入。这种“老股东全跟、新股东进场”的组合,通常意味着公司上一轮后的发展轨迹得到了既有投资人的认可,同时吸引了新的资金类型。但4000万美元的A轮规模在当前的AI基础设施赛道中并不算大——考虑到评测需要持续的专家网络维护、测试集更新和防作弊技术投入,这笔资金能支撑多久的烧钱周期,取决于公司的收入增速能否持续。

一个值得注意的细节是:本轮融资的估值达到4亿美元,而公司未披露任何关于毛利率、客户留存率或合同金额的数据。在缺乏这些指标的情况下,4亿美元估值更多反映的是投资人对“第三方评测”这一赛道稀缺性的定价,而非对公司当前商业表现的定价。这种定价逻辑在AI基础设施领域并不罕见,但它意味着后续轮次的估值支撑需要更扎实的收入数据来兑现。如果Vals AI无法在下一轮融资前证明其评测服务具有持续付费的黏性,4亿美元的估值可能成为一个难以跨越的锚点。

Vals Smith与Vals Index 2.0:产品扩张还是评测边界模糊?

与融资同步,Vals AI推出了三项产品更新:Vals Smith、前沿风险基准和Vals Index 2.0。据公司披露,Vals Smith允许用户从GitHub仓库创建自定义编程基准;前沿风险基准覆盖网络安全、心理健康和AI安全等领域;Vals Index 2.0则扩展了对更广泛经济领域的覆盖。这三项更新指向同一个方向:从单纯的模型能力评测,向风险评测和经济影响测量延伸。

这一扩张的逻辑是清晰的——企业客户不仅想知道“哪个模型更强”,还想知道“哪个模型更安全、更值得长期部署”。但产品线的快速扩张也带来了聚焦风险。编程基准、前沿风险评测、经济测量,这三个方向各自都需要不同的专家网络和测试方法论。一家成立时间不长的初创公司同时推进三条产品线,能否在每个方向上都达到足以建立行业标准的深度,是一个尚未被验证的假设。

尤其值得关注的是前沿风险基准。网络安全、心理健康和AI安全领域的评测,涉及敏感的伦理和安全判断,其测试集的设计和评分标准远比编程任务更主观。公司未披露这些基准的具体设计者、测试样本量或验证方式。在缺乏这些信息的情况下,外界很难判断这些风险基准是真正可操作的评测工具,还是更多停留在概念验证阶段。

从产品策略的角度看,Vals Index 2.0对“更广泛经济领域”的覆盖,可能意味着Vals AI试图从技术评测向经济影响评估延伸。这一延伸的潜在客户可能包括政府和监管机构,它们关心的不只是模型能力强弱,还有模型部署对就业、产业结构和公共安全的影响。但经济影响评估的方法论远比技术评测复杂,涉及宏观数据、因果推断和长期追踪。Vals AI是否具备这一领域的方法论积累,公司未披露任何相关信息。如果这一产品线无法在短期内形成可验证的评测框架,它可能分散团队对核心评测业务的注意力。

资金用途与团队扩张:评测基础设施的“军备竞赛”

据公司披露,本轮资金将用于扩展评测基础设施,推出基于企业GitHub代码仓库生成编程基准的测试工具,并扩大团队。这三个方向中,评测基础设施的扩展是最核心的投入——它直接决定了Vals AI能否在客户数量和测试规模增长的同时,保持测试集的安全性和评测结果的一致性。

评测基础设施的特殊性在于,它不像普通的SaaS服务那样可以通过增加服务器来线性扩展。私有测试集的安全存储、限量运行的调度机制、专家评分流程的标准化,这些环节都需要专门的技术投入和流程设计。一旦测试集泄露或被逆向工程,Vals AI的核心资产——防作弊能力——就会迅速贬值。因此,基础设施投入的优先级可能高于团队扩张和产品线延伸。但公司未披露基础设施投入的具体方向和规模,外界无法判断这笔资金在安全性和扩展性之间的分配比例。

团队规模在半年内增长三倍,这一速度在初创公司中属于激进扩张。快速扩张带来的管理挑战、文化稀释和招聘质量下降,是早期公司常见的风险。Vals AI未披露团队的具体规模和构成,因此无法判断这种扩张是集中在工程团队还是专家网络。如果扩张主要集中在工程团队,而专家网络的扩展速度跟不上,评测质量可能成为瓶颈;反之,如果专家网络扩张过快,成本结构可能恶化。

从已披露的信息看,Vals AI的资金用途与产品路线图是匹配的:Vals Smith需要工程投入来支持任意GitHub仓库的解析和测试生成;前沿风险基准需要专家网络来设计测试集;Vals Index 2.0需要数据基础设施来覆盖更广泛的经济领域。但匹配不等于充分——4000万美元能否同时支撑这三条线,取决于每条线的实际成本,而公司未披露任何成本结构数据。在AI基础设施赛道中,4000万美元的A轮融资通常只能支撑12到24个月的运营,如果三条产品线同时推进,资金消耗速度可能比单一产品线快得多。

风险与待验证假设:独立评测的“独立性”如何自证?

Vals AI面临的核心风险,不是技术风险,而是信任风险。一家评测公司最大的资产是公信力,而公信力的建立需要时间、透明度和可验证的记录。Vals AI目前在这三个维度上都还处于早期阶段:公司成立年份未披露,评测方法论的细节未公开,私有测试集的防作弊机制未经过独立审计。

更棘手的结构性挑战在于:Vals AI的客户包括它正在评测的模型厂商。据公司披露,OpenAI、Anthropic、Google、Meta和xAI的模型卡引用了Vals AI的评测结果。如果这些厂商同时也是付费客户,那么“既当裁判又收参赛者的钱”的质疑就难以回避。公司未披露模型厂商客户与企业客户之间的收入占比,也未说明是否存在针对模型厂商客户的评测隔离政策。这是Vals AI必须回答的问题,也是其“第三方裁判”定位能否成立的关键。

从治理结构的角度看,评测公司的独立性通常需要制度化的保障,例如独立的评测委员会、公开的方法论文档、定期的第三方审计。Vals AI目前没有披露任何此类机制。这并不意味着这些机制不存在,但在缺乏公开信息的情况下,市场只能基于有限的事实做出判断。对于一家估值4亿美元、客户包括全球最主要AI实验室的公司而言,治理透明度的缺失本身就是一个值得关注的风险信号。

另一个待验证的假设是:企业客户是否真的愿意为独立评测持续付费。目前,企业选择生产模型时,往往依赖内部团队的试错和公开基准的参考。Vals AI的价值主张是“帮企业选模型”,但这一价值能否转化为持续的订阅收入,取决于企业是否认为外部评测比内部试错更高效、更可靠。公司披露客户数量翻倍,但未披露客户留存率、合同金额或续约情况。在没有这些数据的情况下,收入增长8倍更多反映的是低基数效应,而非商业模式的验证。

从已披露的融资规模、客户结构和产品路线图看,Vals AI正在试图建立一个AI时代的“评测标准层”。这一层如果成立,其价值将远超4000万美元的估值;但如果公信力无法建立,或者评测结果被证明可以被操纵,这家公司的核心资产将迅速贬值。结论的边界在于:目前所有关于Vals AI的正面信息——收入增长、客户引用、产品能力——均来自公司披露或投资方声明,尚无独立第三方验证。在评测公司自身被独立评测之前,市场对其“裁判”角色的信任,仍然建立在一层薄薄的、未经审计的承诺之上。

验证边界与可复核指标

本文涉及的“首个、唯一、最大、领先”、订单、出货、性能等表述,如无另行说明,均是公司、创始人或投资方在现有公开材料中的披露口径;RecodeX未在本次采集材料中找到独立审计或第三方测试结论,因而不将其视为已经独立确认的事实。文中的产业协同、竞争位置和商业路径属于基于已披露产品与融资用途的编辑分析,不代表相关结果已经实现。

  • 技术侧应核验第三方测试条件、样本规模、良率、稳定性及与可比方案一致口径的结果;
  • 商业侧应核验去重后的付费客户、可执行合同、收入确认、复购率以及订单转化;
  • 资本与产业协同应以工商股权、关联交易、联合开发、采购或量产文件为准。

RecodeX 极客视:当模型厂商自己出题自己考成为常态,第三方评测的稀缺性毋庸置疑。但稀缺性不等于可信度——Vals AI用私有测试集对抗刷分,却同时把“如何验证裁判”的问题留给了市场。一家评测公司最终能否成为行业标准,不取决于它评测了多少前沿模型,而取决于它能否承受住被评测的审视。在那一天到来之前,4000万美元买下的,只是一张进入信任游戏的门票。

信息来源

本文在采集与核验阶段引用了以下公开来源,按站点去重列出;来源内容归原发布方所有,其口径不代表 RecodeX 的核实结论。