现状
企业领导者在大型语言模型方面面临一个持续的挑战:推理的成本和延迟是扩展应用的主要障碍。尽管前沿模型的能力令人印象深刻,但每次对强大的云托管模型进行API调用都会产生直接成本和时间延迟,这可能会降低用户体验。这种经济上的摩擦限制了AI的采用范围,使许多有前景的用例停留在试点阶段。最近的一篇研究论文 Pro-Router:具有自适应边云协作的令牌感知渐进式模型路由,用于高效多模态LLM推理 介绍了一种复杂的技术,为我们指明了一个更具可持续性的解决方案。该系统在边缘设备上的小型快速模型和云端的大型强大模型之间动态路由请求,仅在必要时才升级到能力更强的模型。
这预示着什么 我们正在从单一庞大的模型处理所有任务的单体式方法,转向智能的、多层次的分层式AI系统。这种架构上的转变旨在实时优化成本和性能,使AI在更大规模上具有经济可行性。
真正的挑战
企业面临的主要障碍不是缺乏强大的模型,而是缺少一个能够高效管理它们的智能架构。大多数组织仍然围绕着单一模型的思维模式构建,将精力集中在选择和微调一个大型基础模型上。这种方法虽然简单,但效率极低,就像用超级计算机进行基本算术一样。真正的挑战在于构建一个能够智能地在一系列模型(从本地运行的小型专用模型到公有云中的前沿模型)之间路由任务的编排层。
向分层式AI系统的过渡带来了新的复杂性。它需要复杂的监控来跟踪分布式系统中的性能和成本。它要求稳健的治理,以确保即使单个用户提示由多个模型级联处理时,安全护栏和合规规则也能得到一致应用。正如麦肯锡关于扩展AI的研究所指出的,AI应用的最大障碍通常是组织和架构上的,而非技术上的。团队需要在异构环境的MLOps方面发展新技能,并设计能够应对任何单一模型组件故障的弹性系统。
成功驾驭这一转变需要一个深思熟虑的计划。这与其说是挑选一个成功的模型,不如说是构建一个成功的系统。这是制定具有前瞻性的AI战略与路线图的核心组成部分,该路线图将技术选择与可持续的商业价值相结合。
企业行动手册
采用分层式AI架构是一个循序渐进的过程,而非一蹴而就。我们建议采取一种务实的方法,专注于逐步构建能力。目标是从静态的单一模型部署转向动态的多模型生态系统,该系统能够持续优化成本、延迟和准确性。这涉及到创建一个行动手册,定义如何对工作负载进行分类、选择合适的模型以及管理它们之间的路由逻辑。
企业不应等待一个完美的、包罗万象的路由解决方案,而应从盘点其AI用例并根据复杂性和性能要求对其进行分类开始。简单、高容量的任务是小型、更高效模型的首选,而复杂、细致的请求可以留给更强大的模型。关键在于开始构建管理多样化模型组合所需的操作能力,从简单的路由规则开始,随着组织成熟度的提高,逐步增加更复杂、自适应的逻辑。
| 场景 | 推荐方法 | 主要风险 | 时间线 |
|---|---|---|---|
| 高容量、低复杂度的任务(例如,客户服务分流) | 在本地/边缘部署一个经过微调的小型模型,并使用一个云模型作为未处理查询的备用方案。 | 升级到云模型期间的延迟峰值可能会影响用户体验。 | 3-6个月 |
| 复杂、创造性的任务(例如,营销文案生成) | 使用一个强大的云模型作为主要模型,并用一个较小的模型进行初步起草或构思。 | 基线成本高;如果路由逻辑过于保守,可能会导致小型模型利用不足。 | 6-9个月 |
| 混合工作负载的内部工具(例如,知识库搜索) | 根据关键字或意图,实现一个基于提示的路由器,将请求路由到模型组合(小型、中型、大型)。 | 路由器逻辑成为单点故障和潜在的维护瓶颈。 | 9-12个月 |
| 受监管或敏感数据处理 | 在任何可能升级到外部云模型之前,利用一系列本地模型并进行严格的数据匿名化处理。 | 本地硬件和MLOps的基础设施复杂性和成本增加。 | 12-18个月 |
各角色:本季度行动要点
| 角色 | 本季度优先事项 |
|---|---|
| 首席信息官 (CIO) | 针对一个关键用例,启动总拥有成本(TCO)分析,比较当前的单一模型架构与提议的分层式系统。指派企业架构团队为简单的模型路由器开发一个概念验证(PoC)。 |
| 首席技术官 (CTO) | 评估当前的MLOps和可观测性工具,看其是否能够管理和监控跨混合环境的异构模型集群。开始对边缘计算能力和需求进行正式评估。 |
| 首席数据官 (CDO) | 为在边缘和云模型之间流动的信息建立明确的数据治理协议,确保在升级过程中维护隐私和安全。为多模型系统定义数据血缘和审计追踪要求。 |
压力测试您战略的问题
- 我们目前如何衡量AI应用的“每次查询成本”?分层模型将如何影响该指标?
- 我们当前的MLOps平台是否支持在不同基础设施(边缘 vs. 云)上部署、监控和更新不同大小的模型?
- 当单个用户请求可能由多个模型处理时,我们有什么策略来确保一致的安全和治理护栏?
- 对于这个系统核心的模型路由和编排层,我们将如何决定是自建还是购买?
- 我们的工程和数据科学团队需要哪些新技能,才能有效管理一个模型组合,而不是一个单一的大型模型?
结语
依赖单一、庞大的LLM来处理所有企业任务的时代即将结束。这种方式在经济上不可持续,在架构上也很脆弱。可扩展、高性能的企业AI的未来在于构建智能的分层式AI系统,实时地将适当规模的模型匹配到适当的任务上。对于企业领导者来说,正确的做法不是等待一个现成的完美解决方案,而是从今天开始构建管理多样化模型组合的架构和运营能力。这代表了企业AI战略中一次根本性的、也是必要的演进。
