模型路由正在取代模型本身,成为 AI 基础设施的新战场

发布时间:2026/8/6 9:32:56
模型路由正在取代模型本身,成为 AI 基础设施的新战场 四个路由产品AI 圈的关键词不是某个新模型,而是「路由」。7 月 21 日,vLLM 社区发布 Semantic Router 新篇章,正式提出 Mixture-of-Models(MoM)架构;7 月 22 日,Cursor 上线 Cursor Router,把智能模型路由做成团队级产品;7 月 23 日,Merge 发布 Fusion,用「多模型面板 裁判模型」合成单一答案;同日,Runway 推出 Media Router,把路由思路搬进了图像/视频/音频生成领域。四家公司,四个赛道,同一个判断:当模型迭代快到没有人能押注单一供应商时,「选哪个模型」正在从一次性架构决策,变成每个请求级别的动态决策。为什么是现在?一笔算得清的账Cursor 公布的数据很能说明问题:约 60% 的开发者日常只使用一个固定模型作为「主力驾驶」。这意味着大量常规任务——改个 UI、写个单测、格式化文档——都在按前沿模型的价格计费。Cursor Router 用 60 万条真实请求训练了一个请求分类器,在数百万请求的在线 A/B 测试中验证:模式效果成本变化Auto Intelligence用户满意度接近 Fable 5成本降低约 60%Auto Balance满意度高于 Opus 4.8成本降低约 36%早期企业客户实测质量无下降单请求节省 30%–50%按单次 commit 计算,Intelligence 模式成本 $$6.76,Balance 模式$$4.63,而全程使用 Fable 5 是 $$12.69、Opus 4.8 是$$7.34。路由的本质,是把「成本-智能」的帕累托前沿变成一个可调参数。与此同时,模型侧的价格战还在加剧:7 月 21 日 Google 发布的 Gemini 3.6 Flash 定价 $$1.50$$7.50(每百万输入/输出 token),输出 token 用量比 3.5 Flash 少 17%;7 月 16 日发布的 Grok 4.5 定价 $$2$$6,号称 2 倍 token 效率。模型每两周换一轮性价比排名,任何硬编码单一模型的架构都会在下一次发布后立刻「过时」。三种路由范式:分类器、面板、系统这一波产品其实代表了三种不同的技术路线:1. 分类器路由(Cursor Router):在请求进入模型之前,用一个轻量分类器分析 query、上下文、任务复杂度和领域,再结合各模型的行为画像做匹配——简单任务走高性价比模型,UI 修改走「品味最好」的模型,长程复杂问题走前沿推理模型。关键设计是为「模型频繁更新」的世界准备的:新模型发布后只需更新分类器,而不是重写应用。2. 面板合成(Merge Fusion):一次 API 调用把 prompt 并行发给至少 2 个分析模型,再由一个独立的裁判模型(judge)评估各候选答案并合成最终输出。代价也很直白:3 模型面板约产生 4 次计费调用,且不支持流式输出。适合研究、分析这类「质量优先于延迟」的场景。3. 系统级 MoM(vLLM Semantic Router):走得最远的一条路——把多个独立模型、路由策略、偏好、评估套件打包成一个带版本号的复合模型工件,可以像单一模型一样被训练、评估、导出、部署和调用。与 MoE 在单次前向传播内路由 token 不同,MoM 协调的是架构、许可证、模态、硬件都可能不同的独立模型。对开发者来说,好消息是这三种范式共享同一个前提:OpenAI 兼容的统一接口。切换模型只需要改一个字段:from openai import OpenAI client OpenAI(base_urlhttps://wrouter.ai/v1, api_keyxx-...) # 简单任务:高性价比模型 resp client.chat.completions.create( modelgemini-3.6-flash, messages[{role: user, content: 把这段 JSON 转成 CSV}], ) # 复杂推理:切到前沿模型,只改 model 字段 resp client.chat.completions.create( modelclaude-opus-4-8, messages[{role: user, content: 审查这个分布式锁实现的竞态条件}], )多模型架构的第一步是统一接入层路由策略可以慢慢调,但所有路由的前提是:你得先有一个能稳定访问所有模型的接入层。这恰恰是国内开发者最大的痛点——OpenAI、Anthropic、Google 的 API 各有各的协议、计费和网络门槛,自己维护多套 SDK 和密钥,等于把 Cursor 用分类器解决的问题,用人肉运维又做了一遍。这也是 wrouter.ai 这类模型中转站的价值所在:把 GPT、Claude、Gemini 等主流模型收敛到一个 OpenAI 兼容端点后面,开发者拿一个 key 就能实现上面代码里的「改一个字段换模型」。具体到选型,三点值得关注:稳定:生产流量最怕单一上游抖动,统一接入层自带冗余价值——上游波动时应用层无感;模型完整:路由策略的上限取决于模型池的广度,主流前沿模型齐全,新模型跟进快,分类器才有的可选;合规:以合规方式提供服务、账单透明,这在「路由即采购」(每个请求都是一次购买决策)的时代,是审计链路的基础。一个务实的演进路径:先用统一接口把应用和具体供应商解耦(一天内可完成),再逐步引入分层策略——比如 80% 常规请求走 Flash 级模型、20% 复杂任务升级到前沿模型,最后才考虑引入自动分类器。Cursor 的数据说明,哪怕只做到第二步,30% 以上的成本节省就已经到手了。结语2026 年上半年,行业还在争论「哪个模型最强」;这个七月,Cursor、Merge、Runway、vLLM 用产品给出了另一个答案:没有永远最强的模型,只有始终在线的路由。当推理成本占到头部实验室收入的一半以上,当模型排名每两周洗一次牌,把模型选择权从架构图里拿出来、放进每一次请求里,是所有认真做 AI 应用的团队迟早要走的一步。不妨从统一接入层开始,今天就把第一行base_url改掉。来源Cursor: Introducing Cursor Router — https://cursor.com/blog/routervLLM Blog: Beyond a Single Model — Mixture-of-Models — https://vllm.ai/blog/2026-07-21-vllm-sr-new-chapter-momRuntimeWire: Merge launches Fusion — https://runtimewire.com/article/merge-launches-fusion-multiple-ai-models-one-answerTechCrunch: Runway launches AI model router — https://techcrunch.com/2026/07/23/runway-bets-on-ai-model-routing-as-generative-media-gets-crowded/Google Blog: Gemini 3.6 Flash — https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/