作者:班壮(旭山),邵丹(营火)
阿里云 AI 网关 Serverless 新版正式开启免费公测。全新架构、0 元起步,Agent 管理升级为一张拓扑图,AI fallback 能在主模型限流或异常时保障业务连续性。公测期间,网关自身费用全免。
AI 应用开发者面临的三个真实难题
如果你正在开发 AI 应用、LLM 应用或 Agent 系统,大概率都遇到过这些常见问题:
这些问题背后的根源其实一致:AI 应用缺少一个统一、稳定、可治理的流量入口。
这正是 AI 网关要解决的核心问题——统一接入 LLM API、Agent API、MCP Server,统一完成路由、认证、限流、安全防护以及用量观测等关键能力。
在完整的 AI 应用架构链路中,AI 网关通常位于两个关键位置:一是外部流量进入 Agent 时的统一入口,二是 Agent 调用模型服务时的统一出口。

AI 应用整体架构中 AI 网关的位置示意
全新 Serverless 架构:0 元起步,按实际用量计费
过去,使用 AI 网关往往需要先支付一笔起步费用,这让很多刚开始建设、流量规模不大的 AI 业务望而却步。
本次公测的 AI 网关 Serverless 新版完成了整体架构升级:基于全新 Serverless 架构重构,资源利用率更高,开通速度更快,并支持按实际用量付费。新版提供两种实例形态:
标准版可以帮助你以零成本快速跑起小规模业务,不必为闲置资源额外付费;当业务规模扩大后,则可以选择企业版,获得独立访问入口、自定义域名、更高 QPS 以及更高服务等级。后续还规划支持标准版一键升级到企业版,无需迁移资源。
相比原 Serverless 版本,新版有哪些升级
0 元起步: 标准版取消了起步费用,完全按照实际调用量计费,让小规模 AI 应用和初创业务的成本更加可控。版本分层: 新增标准版与企业版两种形态,分别面向小规模生产场景和规模化生产场景,企业可以根据业务阶段灵活选择,无需为暂时用不到的规格买单。插件体系: 新版支持平台提供的插件体系,可扩展认证鉴权、安全防护、流量治理以及观测分析等能力。能力演进: LLM API、Agent 管理、MCP Server、观测分析等核心能力统一由新版承载,后续新增功能也会优先在新版持续落地。已有的原 Serverless 实例仍可继续使用,不会强制迁移;但对于新开通业务,建议优先选择新版。
AI Fallback:主模型异常时,请求自动切换到备用模型
回到开头提到的第二个难题。模型服务限速、抖动和不稳定是常态,而这类问题可以直接在 AI 网关层处理——对应的能力就是 AI Fallback。
它的工作机制并不复杂:当主模型服务因为异常、故障或高负载而无法正常响应时,网关会自动切换到你事先配置好的备用模型;只要调用成功,就立即把结果返回给业务侧。应用本身几乎感知不到这次抖动,终端用户也不会轻易看到报错。
一个 Model API 不必只绑定单一模型,它可以同时挂载一个或多个 Fallback 模型,网关会按照预设顺序依次尝试调用。这样一来,就能把调用链设计成“主模型 → 同能力备用模型 → 轻量兜底模型”的分层容灾结构:当上游失败时,先切换到能力接近的候选模型,再逐步降级到更轻量的兜底方案,而不是在第一次调用异常时就直接把错误返回给用户。除此之外,同一个服务还可以在多条策略链路中复用,无需为每个 API 单独重复创建一套服务配置。
什么情况下会触发切换,主要覆盖三类场景:
配置方式同样无需改造应用——只需在 Model API 上开启 Fallback 开关,再从服务列表中选择一个备用服务即可。模型名称默认透传;如果主备模型名称不一致,也可以单独指定具体模型名。
从此,稳定性策略可以与业务代码彻底解耦。 无论是更换备用模型、调整切换顺序,还是修改超时阈值,都只需要在控制台完成一次配置变更,无需每个应用各自编写重试逻辑,也不必为了更新兜底策略而重新发版。
Agent 管理升级:一张拓扑图统一管理所有 Agent
在 Agent 时代,流量通常有两个方向:一是外部业务如何访问你的 Agent,二是 Agent 自身如何访问底层模型。过去,这两侧的配置往往分散在不同入口;而这次新版则将它们统一收敛为一个资源:Agent。
在控制台的「Agent管理」中,创建 Agent 只需要两步:填写名称,然后选择类型——目前支持百炼、AgentTeams、Dify、Claude Code 以及自定义等多种 Agent 类型。
创建完成后进入 Agent 拓扑页面,以你的 Agent 为中心:

Agent 资源将 Agent 访问与模型访问收敛到同一个资源下管理
调用量、错误数、Token 消耗以及请求日志,都会按 Agent 维度统一聚合展示。你的每一个 Agent,流量从哪里来、经过什么链路、最终去了哪里,都能通过一张拓扑图看得清清楚楚。
公测权益与开放范围
公测时间: 7 月 31 日至 8 月 31 日。
公测地域: 北京、上海、杭州、深圳、香港。
公测优惠: 公测期间,AI 网关 Serverless 新版的网关自身费用全部免费,仅公网流量按照 CDT(云数据传输)规则计费。模型服务、日志服务等其他云产品费用,仍按对应产品计费规则收取。
重磅新能力预告:智能路由
上线节奏说明:智能路由功能将先在实例型独享版(专享实例)上线,Serverless 版本随后推出,敬请期待。
智能路由要解决的事情同样很直接:在满足任务能力需求的前提下,自动为每个请求选择更省成本、更快响应或更强能力的模型。简单任务走轻量模型,复杂任务再调用旗舰模型,让大模型调用成本随着任务结构自然下降。

智能路由根据任务在候选模型中自动选择
使用方式也足够简单——无需额外接入 SDK,也无需改造现有应用,只要把模型名替换为 auto/<模式> 即可。系统提供四种开箱即用的路由模式:
新版智能路由还进一步解决了两个真实业务场景中的难点:
多轮对话和 Agent 工具链不会“中途换脑”。 继续同一个任务时,系统会保持模型稳定,Agent 的工具调用链路全程绑定同一个执行模型;只有明确切换到新任务时,才会重新做模型选择。从单次请求、多轮聊天到 Agent 工具链场景,一次接入即可覆盖。
平台模型与自有模型可以统一决策。 候选池既支持一键启用平台内置的不同档位模型,也支持纳入你已经配置好的自有模型服务。自有模型仍然走你自己的服务链路和凭据体系,账单归属保持不变——路由更智能,但边界依然清晰。
结语
从 0 元起步的标准版开始,你无需重写应用,也不需要迁移已有模型服务,就可以快速搭建统一的 AI 流量入口。
你的 AI 应用,现在是时候拥有一个真正统一、稳定、可治理的流量入口了。
立即体验: 在阿里云控制台搜索「AI 网关」,或访问产品官网了解更多详情。
注:本文所述功能可用范围、地域、价格、服务等级、Agent 类型、模型档位和实例规格,均以产品控制台、官网价格页和相关公告展示为准。公测期间,部分能力可能会分阶段陆续开放。
