随着企业人工智能从回答问题的助手发展成为能够规划、检索信息、调用工具、验证结果和采取行动的代理,代币经济变得更加复杂,因此也更加需要管理。
传统的聊天机器人可能只会处理提示并生成回复。然而,智能体工作流可能需要多次模型调用才能完成单个任务。在每个步骤中,模型都可能接收到先前的对话历史记录、检索到的数据、工具描述和输出、中间结果以及错误消息。如果不必要的上下文信息过早进入工作流,其中一些信息可能会被保留下来并重复处理。
这意味着令牌消耗并非总是以简单的线性方式增长。在多步骤任务开始时少量的过度检索,到任务结束时可能会造成巨大的成本增加。解决之道并非剥夺智能体对上下文的感知。智能体需要充足、及时且可信的信息才能可靠地行动。目标是在恰当的时间,以尽可能简洁且可控的方式提供恰当的上下文信息。
令牌效率始于提示符之前
关于人工智能成本的讨论大多集中在模型选择、提示长度、缓存、摘要和压缩等方面。这些固然重要,但它们的主要作用是在人工智能应用构建上下文之后对其进行管理。
企业还应该审视这种环境是如何形成的。
大多数组织的数据分布在湖仓、数据仓库、运营系统、SaaS 应用、文档、矢量存储、API 和第三方数据源中,并且它们使用不同的模式、业务定义、访问方法和安全策略。当代理逐个访问这些数据源时,在回答业务问题之前,它们可能已经承担了相当可观的“令牌税”。
该税项通常以四种形式出现:
- 重复发现:代理搜索多个目录,评估众多工具定义,检查模式,并尝试不同的访问路径来访问重叠的数据集,从而不必要地消耗令牌。
- 上下文计算:原始记录被导入模型,以便LLM能够对它们进行比较、连接、过滤或聚合。这项工作会消耗大量令牌,更适合由确定性数据引擎执行,而且几乎无需额外资源。
- 重试循环:模糊的模式和不一致的业务定义导致查询失败、更正和重复检索,每次重试都会消耗额外的令牌。
- 过度检索:无关的、受限的或不必要的详细数据进入上下文窗口,既增加了令牌成本,也增加了潜在的安全和监管风险。
模型上下文协议 (MCP) 可以规范代理与工具和数据的交互方式,但它本身并不能消除这种架构问题。如果每个数据源或域都暴露一个独立的 MCP 服务器,组织可能会在代理层重现集成蔓延的问题。这些服务器必须得到安全保护、管控、文档记录、监控,并向代理进行解释——而且它们的工具和模式描述本身也会消耗上下文信息。
给代理商提供答案,而不是原始的企业数据
Denodo 平台从源头上解决代币经济问题,减少了 AI 模型在其上下文窗口中需要处理的工作量和原始数据量。
该平台为分布式企业数据环境提供了一个主动的上下文层。它无需代理为每个任务独立地发现、检索、协调和管理数据,而是提供了一个逻辑层,通过一致的接口提供简洁、可直接用于业务且符合策略的答案。
四项能力共同作用,使这一切成为可能:
通用连接减少了重复发现
代理程序可以通过一个逻辑层发现和访问分布式数据,而无需分别访问每个平台、目录、API 和存储。这减少了特定于数据源的工具上下文、冗余的模式检查和探测失败,同时避免了为每个用例编写硬编码的访问逻辑。
零拷贝实时数据访问将计算下推
过滤、连接和聚合操作通常应由查询引擎确定性地执行,而不是在逻辑层模型 (LLM) 内部以概率方式执行。Denodo 可以将这些工作推送到底层系统或在逻辑层执行,从而返回简洁的结果,而不是庞大的原始数据。智能体无需将每个数据集复制到单独的 AI 存储库中,即可获得实时态势感知。
统一语义减少了重试次数
诸如“客户”、“活跃账户”、“净收入”或“风险敞口”之类的术语在不同的系统中往往含义不同。上述同一逻辑层支持的共享业务定义、关系和权威逻辑,有助于代理首次就能生成正确的查询,从而减少反复试错检索和自我纠错循环。
集中式治理在交付前过滤上下文
治理不仅是一种风险控制手段,它还可以控制成本。行级和列级安全、数据脱敏和策略执行可以在无关或未经授权的信息进入模型上下文之前将其排除在外,而 Denodo 的设计本身就支持所有这些功能。最安全的令牌是永远不会到达提示符的令牌,同时它的成本也最低。
这四项能力相辅相成。缺乏语义的连接可能只会暴露更多令人困惑的数据。缺乏实时访问的语义可能提供正确的定义,但信息却可能过时。缺乏治理的访问会增加风险和过度检索。因此,令牌优化是一个架构结果,而非单一的产品功能。
代币消费的经济模型
为了使这一讨论切实可行,企业需要的不仅仅是“更好的数据架构应该降低人工智能成本”这一笼统的说法。他们需要一种方法来识别可避免的开销源自何处,并评估架构变更将如何影响开销。
我们的新白皮书提出了一种针对智能体人工智能工作负载数据访问部分的定向经济模型。该模型首先列出了核心工作负载输入,例如每月智能体任务数、检索到的上下文信息持续存在的后续轮次数以及混合代币价格。然后,它分析了每个活跃上下文支柱的代币贡献:
- 代理需要搜索多少个信息源?每个信息源需要多少发现背景信息?
- 检索到的原始数据量与精简优化后的答案大小相比如何?
- 模糊请求触发重试的频率及其造成的成本
- 检索到的无关或未经授权的数据量与策略过滤后剩余的数据量相比如何?
该模型将分散的、逐源访问模式与统一的、受控的方法进行比较。其目的并非承诺普遍适用的节省百分比。实际结果取决于代理设计、数据量、模型选择、缓存、提示策略、检索行为以及其他实现细节。相反,它为数据和人工智能领域的领导者提供了一种结构化的方法,用于制定假设、针对自身工作负载进行测试,并将优化工作集中在最关键的方面。
更广泛的经济转变显而易见:如果没有通用的数据和上下文层,令牌消耗中用于数据访问的部分会随着代理、任务、数据源、检索记录和重试次数的增加而增长。而采用统一的方法,则可以使其规模与交付的有用且可用于业务的答案数量更加紧密地匹配。
信任与效率共享同一架构
减少不必要的令牌消耗的实践也能提高智能体的可靠性。实时访问增强了态势感知能力。共享语义提高了解释能力。下推计算产生精确、简洁的结果。集中式治理确保答案符合策略。
因此,最有用的问题可能不是“我们如何才能降低代理商消耗代币的成本?”,而是“这些代币最初为什么要产生?”
如需更深入的技术讨论以及估算代币对您自己的代理工作负载影响的实用模型,请下载白皮书《更低成本,更高信任:代理 AI 的新经济学》 。