我们的观察

在过去几年中,企业 AI 领域的主流论调一直是规模竞赛。普遍的看法认为,更大、更强的单体模型是解决复杂业务问题的必然路径。而现在,我们正从业界看到清晰的量化证据,表明这一假设不仅受到了挑战,甚至被颠覆。一种新模式正在兴起:企业正通过从单一巨型模型转向基于智能体编排原则构建的、更小型的协同系统,来取得更优异的成果。

这一转变的有力证据来自一家大型住宿预订平台的研究人员最近发表的一篇论文,其中详细介绍了他们用于客户支持的生产级 AI。这篇题为《从单体融合到智能体编排:对话助手的大规模动态响应》的论文,记录了他们从一个大型一体化模型迁移到智能体架构的过程。这个新系统使用一个较小的编排模型来智能地调用一组专门且可靠的工具。其带来的业务影响并非渐进式的,而是性能和可靠性上的一次阶跃式提升。

改变一切的数字

45%

在用一个更小、使用工具的智能体系统取代大型单体 AI 后,关键客户支持问题上报给人工处理的比例减少了 45%。


谁在领先,为何领先

市场正在出现分化。一方是仍然专注于最大型基础模型原始能力的组织,他们常常困于试点阶段,因为不可预测的输出和幻觉使其无法在关键业务流程中部署。另一方则是领导者,他们已经认识到,对于大多数企业任务而言,可靠性和可控性胜过原始的对话能力。这些有远见的团队之所以能够胜出,是因为他们构建的是体系化的系统,而不仅仅是更大的黑箱。

智能体方法之所以逐渐受到青睐,是因为它直接解决了单体模型在商业环境中的核心弱点。它不再要求一个模型无所不知、无所不能,而是让一个更小、更高效的编排模型做好一件事:理解用户意图,并将任务路由到正确的、确定性的工具。这可能是一次对 CRM 的 API 调用,一次查询订单状态的数据库请求,或是一个处理退款的函数。由于每个工具都是专门化且可验证的,整个系统因此变得更可预测、可审计,并且不易捏造事实。正如最近一份关于 AI 采纳的麦肯锡报告所记录的,AI 的价值在于它被可靠地嵌入核心业务流程中,而智能体系统远比单体模型更适合这项任务。


大多数团队忽视的差距

许多企业 AI 项目之所以停滞不前,是因为他们误判了核心挑战。他们将问题视为 LLM 的失败——相信一个更好的模型或一个更巧妙的提示词就能解决问题。因此,他们投入巨资评估下一代基础模型,希望能找到灵丹妙药。然而,真正的差距不在于模型,而在于架构。根本性的挑战是系统工程问题,而不仅仅是应用 AI。

大多数团队忽视的差距,是模型的能力与系统的可靠性之间的区别。一个大型模型或许能够通过单次提示完成起草邮件、分析合同和查询客户记录等任务,但它无法以核心业务流程所要求的 99.9% 的可靠性来完成这些工作。那些艰巨且通常枯燥乏味的工作,在于构建一个智能体可以使用的、强大且文档齐全的工具库。这涉及到 API 设计、数据治理、访问控制和可观测性——这些都是企业软件开发的基础要素,现在必须进行调整以适应 AI 驱动的世界。

这就是为什么我们看到令人印象深刻的演示与生产级系统之间存在显著差异。演示展示的是模型;生产系统展示的是架构。弥合这一差距需要一次战略转向,从以模型为中心的探索转向以系统为中心的工程。Thinkia 的 智能体 AI 实施方案 专注于构建这个强大的工具和编排层,确保 AI 系统能够安全、可靠地交付可衡量的商业价值。


如何弥合差距

从单体思维过渡到智能体思维需要一种审慎、结构化的方法。这既是技术上的转变,也是战略上的转变。首先,团队必须停止问“这个模型能做什么?”,而应开始问“我们可以将哪个业务流程分解为一系列可靠、基于工具的步骤?”这种观念的重新定位是关键的第一步。

其次,投资重点必须转移。与其将大部分预算用于 LLM 推理成本和提示工程,不如将资源重新分配到构建和维护一个高质量的内部和外部工具库上。这是智能体系统的核心知识产权。一个有效的 AI 战略与路线图 会将这个工具生态系统的发展作为企业的基础资产来优先考虑。

最后,成功需要一套新的技能。团队不仅需要 AI 专家,还需要强大的软件架构师、API 设计师和 DevOps 工程师,他们能够构建和管理这些复杂的分布式系统。目标是创建一个有弹性的系统,在这个系统中,编排器可能会失败,工具可以更新,或者可以添加新功能,而不会导致整个流程中断。

成熟度级别当前状态下一步行动时间线
探索阶段使用公共网页界面(如 ChatGPT)执行临时的、孤立的任务。确定一个高价值、结构化的业务流程作为试点目标。1-2 个月
试点阶段使用单个大型单体模型和复杂提示词构建概念验证(PoC)。将目标流程分解为离散步骤,并将其映射到潜在的 API/工具调用。3-6 个月
扩展阶段单体模型已在狭窄用例中投入生产,但在准确性和成本方面遇到困难。开始开发一个正式的、版本控制的工具库和一个基础的编排层。6-12 个月
优化阶段智能体系统已投入生产,为核心流程提供可靠的结果。实施高级可观测性以监控工具性能并自动进行错误恢复。持续进行

关注这些信号

随着这一趋势的加速,企业领导者应监控几个关键指标以保持领先:

  • 工具使用基准的兴起: 关注行业基准从纯粹的知识测试(如 MMLU)向量化模型推理能力和可靠使用复杂工具集完成任务能力的评估(如 ToolBench)的转变。
  • 编排框架的成熟: 密切关注用于构建、测试和部署智能体系统的开源和商业框架的企业级成熟度。对安全性、治理和可观测性的日益关注将是成熟的标志。
  • 更小、更专业化模型的性能表现: 用于编排任务的大型通用模型的效用将会下降。跟踪那些为编排者角色提供更优性价比的、更小的微调模型的函数调用和推理能力。

我们的观点

我们相信,证据已经很明确:对于绝大多数企业用例而言,AI 的未来不在于更大的模型,而在于更智能的系统。研究中详述的智能体架构的成功并非偶然现象,而是高绩效组织将如何构建和部署 AI 的一个根本性转变的先行指标。追求单体式、超人类的 AI 是一项迷人的研究课题,但通往直接且可持续商业价值的道路,在于严谨的智能体编排工程实践。

这一转型需要一套新的行动指南,它优先考虑的是可控性、可靠性和架构的严谨性,而非原始的模型能力。那些掌握了分解复杂流程和构建强大工具集的组织,将创造出持久的竞争优势。正如我们的《2025 年企业 AI 采纳指南》所概述的,实现这一转变是从零散的试点项目迈向可扩展、能创造价值的 AI 项目的核心。Thinkia 帮助企业领导者驾驭这一转型,为下一代可靠、高影响力的 AI 系统构建战略和技术基础。