稳定时代:训练后阶段的模块化发展
稳定接口 -> 模块化创新
稳定时代
在刘慈欣的《三体》中,三体星系会在混乱时代与稳定时代之间交替——在混乱时代,三颗太阳的运动毫无规律,人类文明根本无法生存;而在稳定时代,恒星的轨道变得固定,人们才能开始建设各种设施。居民们无法控制自己处于哪种时代,他们只能察觉到时代的转变并据此采取行动。
Together AI 的首席执行官 Vipul Ved Prakash 撰写了一篇观点鲜明的文章,指出我们现已进入 AI 的“稳定时代”,并列举了三种已经实现标准化的接口:最底层的 Transformer 架构,其上层的与 OpenAI 兼容的推理 API,以及最顶层的代理框架(以 MCP 作为其工具协议)。
Carliss Baldwin 与 Kim Clark 认为,科技行业中最重要的经济事件往往并非新产品的发明,而是拥有稳定接口的模块化架构的诞生。
但或许较少有人意识到的是,与以往的平台市场一样,标准化接口的出现正在推动人工智能生态系统的专业化发展、自主创新以及模块化重组。
人工智能领域早已形成了三种强大且标准化的接口:
- Transformer 架构
- 推理 API(兼容 OpenAI)
- 基于这些 API 运行的智能代理工具
正如蒸汽机、标准零部件以及集装箱将零散的手工工艺转变为工业体系一样,Transformer 架构也成为了人工智能领域的通用工业基础。
注意力算法、优化器、内核库、推理引擎以及训练框架的每一次改进,都会同时推动几乎所有模型的发展,由此形成了一个涵盖软件框架、芯片及模型在内的完整供应商生态系统。
他援引鲍德温与克拉克的模块化理论指出,技术行业中最重要的经济事件往往并非某种产品,而是稳定接口的出现——因为正是这些稳定接口使得生态系统能够实现专业化分工,同时在不同层面获得提升。
个人电脑并非因为某个单一组件更优秀而能在与垂直整合型电脑公司的竞争中取得创新优势,它的胜出得益于 Intel、Microsoft 以及数千家外设供应商能够在统一的规范下各自开展创新。而 Sun Microsystems 则是因为 Linux 以及普通的 x86 架构,而非更强大的整合型竞争对手,最终走向衰落。
稳定化带来的影响
在九个月内,Together 的 API 使用量增长了近 1 万倍,从每月 300 亿个令牌上升至 400 万亿个令牌,其中大部分用于支持代理型任务的开放权重模型。
更重要的是,开放领域的架构已不再是封闭领域架构的简化版本:现代 Transformer 模块是由多个可独立组合使用的组件(如 RoPE、RMSNorm、SwiGLU、GQA、MoE)构成的,训练方法也是如此——DeepSeek 推出的 GRPO 技术在发布后仅数周便已在整个行业生态中得到广泛应用。
目前,开放架构模型对应的代币价格比其替代的封闭架构模型代币低一个数量级;一旦某种开放架构模型能够满足某项工作负载的需求,该工作负载所需要支付的封闭架构模型溢价就会降至接近零的水平。
廉价、功能强大且可无缝替代的开放权重是基础。真正有趣的是构建在它们之上的那一层。
构建智能系统的经济模型

塑造人工智能能力的边际成本持续下降。
Bridge 旗下的 AIA Labs 最近公布了其与 Thinking Machines Lab 合作的研究成果。该研究的任务是像经验丰富的投资者那样对金融文件进行筛选与分类。在采用简单提示词的情况下,最先进的模型准确率仅约为 50%,即便经过专业的提示词优化,其准确率也难以超过 80%,远未达到投资者在日常工作中所能接受的标准。值得注意的是,这些最先进模型的性能提升趋势正在放缓:为了获得微小的准确率提升,GPT 5.4 的成本要比 GPT 5.2 高出 43%。实际上,决定性的限制因素并非模型的原始智能水平。
跨链桥通过 Thinking Machines 的训练 API Tinker,利用专家标注的数据对 Qwen3-235B 进行了训练。在测试中,该模型的平均准确率达到了 84.7%,而最先进的同类模型仅为 78.2%,错误率降低了 29.8%,同时每项任务的推理成本还降低了 13.8 倍。

这一效果在六种已公布的内部任务之外,也展现出了广泛的适用性。他们将这种现象称为“差异化智能”:即针对特定组织需求而定制的模型,其在处理这些需求时的表现优于最先进的模型(Applied Compute 将此称作“特定智能”)。
反对训练后优化策略的最有力论据是:每当 35 天就会有新的最先进模型出现,此时该策略的迁移性便不复存在。
无论是全量微调还是 LoRA 微调,都受制于某一基础模型的权重结构。如今新模型推出的速度极快,因此最先进的模型平均只能保持在公开排行榜的榜首约 35 天。每次新模型发布后都面临着一个选择:要么放弃更新、更强大的基础模型,要么付费从头开始进行微调。维护多种微调后的模型组合所需的成本,会随着新模型发布间隔的缩短而降低。按照这样的计算方式,模型适配其实属于一次性投入,而“只需等待下一个更先进的模型问世”便成了一种理性的采购策略。
由 Ramp Labs 发布的 PorTAL 是首个从成本结构而非成本数值角度对这一机制发起的有力挑战。其核心思路在于:以与特定基础模型无关的形式一次性学习任务适配方法,然后仅通过在一个小型校准数据集上调整针对每个基础模型的简易转换器,即可将该适配方法应用到所有新的冻结模型中。
其效果十分出色。
在 Qwen3-1.7B 和 4B 模型上学习得到的任务表示,在不同模型系列中,都能在未见过的数据集 Qwen3-8B 上实现与从零开始训练的 LoRA 相同~98%的精度提升效果,在 Gemma-3-4B 上则能达到~94%的提升率。而此前常用的 Cross-LoRA 方法仅能实现~14%的提升效果。此外,采用这种方法进行微调所需的校准数据量大约仅为从零开始训练所需量的一半。
如果任务适配能力能够在不同模型基础上通用,那么微调就不再是需要为每个新模型版本都投入的成本,而会变成一种能够持续发挥作用的资产。一旦被编码进去,该组织积累的认知能力就会随着底层技术的进步而不断提升。此时,拥有此类适配能力的成本效益分析就不再取决于技术进展放缓这一一直以来都是最薄弱的环节。
与基础模型无关的任务隐层,实际上是对容器与云工作负载之间关系的进一步优化:这种抽象方式将你所拥有的模型与其运行环境分离开来,从而使运行环境变成一种可随意使用的资源,而非需要担心的依赖项。
如今作为平台差异化优势的食谱类技术,也和该生态系统中的其他元素一样会被广泛传播:Bridgewater 甚至公开了其所有的食谱,包括各种实验对比结果。方法类技术并不能构成有效的竞争壁垒,而专有数据与积累的洞察力则不然。
训练后优化阶段尚未经历模块化变革,但这次或许就是转折点。