随着AI逐渐渗透到企业的每个角落,必须有人挺身而出,提供必要的工具来发现、追踪和监控所有的智能体与LLM,并确保它们在各自的工作流中高效运转。值得庆幸的是,DevOps领域响应了这一需求,在一个被称为“AIOps”、“AgentOps”或“智能体可观测性”的互换性新兴子学科中,构建了支持这些“新主宰”的工具。
AgentOps面临的许多挑战与传统DevOps工具和流程所解决的挑战类似,毕竟从本质上讲,LLM只是在某些硬件上运行的软件。在智能体世界中,涉及内存和磁盘空间的典型问题同样至关重要,甚至由于AI运行比常规软件更贪婪地消耗存储空间,这些问题反而变得更加棘手。
许多支持智能体可观测性的公司都是DevOps界的知名企业,它们通过调整自身的技术栈来应对现代LLM的特性。维护企业智能体的IT团队可以将LLM视为庞大图拓扑中的一个节点,该图充满了不断交换数据包并触发软件任务的服务。由于最终用户并不关心是LLM、数据库还是普通的Python脚本出了故障导致工作停滞,因此必须对延迟和资源限制进行妥善管理。
然而,AI特有的新挑战正为初创企业打开大门,这些企业在构建工具时充分考虑了LLM的特殊性——例如,保存包含提示词记录的更深层日志,此外,LLM在设计上往往具有高度的非确定性,这使得精准定位故障模式变得更加困难。更不用说,一个智能体可能这一分钟还在给出极其智能的回答,下一分钟就会出现幻觉。
由于依赖许多与DevOps工具相同的方法,AgentOps工具会监控异常行为,并标记任何反常现象以进行更深入的分析,这可能简单到修复慢响应,但也可能包括AI幻觉以及由LLM非确定性引起的其他问题。
在选择最适合其应用场景的智能体可观测性工具时,团队应该评估其智能体系统和项目的规模与性质,他们是在为现有的产品或应用程序添加AI智能体功能,还是从头开始构建智能体系统?他们是更专注于维持稳定的LLM运行,还是在不断迭代新方法?AI是关注的中心,还是仅仅用于改进现有技术栈的附加组件?
下面列出的AgentOps和智能体可观测性方案具有许多相同的特性,但在侧重点以及对待企业将智能体融入其技术栈时所遇挑战的关注度上有所不同。对于想要开始了解如何维护生产环境中日益增加的AI资产的企业来说,每个工具都提供了一个极具价值的起点。
AgentOps.ai
当多个智能体团队协同工作时,追踪它们之间的对话对于理解和调试发生的事情至关重要。AgentOps.ai的SDK可以记录事件,以便开发者回放过去的行为,从而追踪Token数量、费用支出、延迟等详细信息,支持SaaS和本地化部署。
定价:每月40美元起,外加每1M个Token收费0.20美元的使用成本
主打特性:带有“时空穿梭调试”功能的回放分析
最适合:复杂的智能体调试
Arize Phoenix
调试提示词和LLM响应需要对正在发生的事情有细致入微的了解,部分原因在于该过程中经常出现非确定性。来自Arize的Phoenix通过强大的追踪功能以及对结果进行评分的能力来支持这一流程,从而实现更精准的迭代,他们的系统可以追踪由各大框架(LangChain、LlamaIndex、DSPy等)发起的、来自各大主流平台(Anthropic、AWS、OpenAI等)的结果和工具调用,其结果是让企业能够深入洞察什么数据触发了什么样的响应链。
定价:有小规模免费档,专业版每月50美元起,外加与事件挂钩的费用
主打特性:用于追踪质量的LLM-as-a-Judge(大模型作为裁判)指标
最适合:专注于通过迭代提高准确性和质量的团队
BigPanda
BigPanda一直致力于提供追踪复杂系统性能的解决方案,现在,该公司正在深入钻研如何检测并解决因模型失控而带来的问题。BigPanda的核心系统依赖历史数据和机器学习算法来标记问题,它自身的智能体层连接了问题节点和异常模型,同时将告警发送给正确的团队成员。
定价:根据具体需求提供“基于价值”的定制报价单
主打特性:自动分诊以实现更快响应
最适合:旨在减少因庞大客户群带来告警疲劳的大型团队
Braintrust
为AI智能体建立有效的改进周期,需要一个从生产数据到下一代智能体的强大反馈闭环。Braintrust监控生产工作负载并创建测试向量,以揭示智能体可能在何处发生漂移、回退或偏离路线,该工具使大部分测试和评分反馈闭环实现自动化,从而可以发现并解决有问题的模式,其核心产品之一是一个专业的专用数据存储库,可以追踪大型且有时深度嵌套的测试集及其结果。他们的方法可以用其标语之一来概括:“追踪一切”。
定价:免费入门档,专业版每月249美元起,包含部分基于使用量的成本
主打特性:高度可扩展的追踪摄取
最适合:通过持续测试开发强大护栏的团队
Chronicle Labs
当需要向野外发布新版本的智能体时,来自Chronicle Labs的平台专注于对其进行暂存,并使用一系列使用测试和回退案例对其进行测试,这些工具在开发周期中也很有帮助。“根据现实对你的智能体进行回溯测试,”他们的销售材料如此承诺,该工具利用一组工具挖掘生产遥测数据以获取可靠的测试向量,通过智能体在离开安全的实验室后将会遇到的提示词和挑战,来对智能体的每个部分进行压力测试。
定价:根据具体需求提供
主打特性:适用于复杂测试方案的回溯测试选项
最适合:追求高逼真度现实表现的强大模型的团队
Comet Opik
构建一个用于追踪智能体每次流入和流出的仪表盘,是监控和解决问题的一种方式,来自Comet的Opik正是这样一款工具。DevOps团队可以追踪每次调用,并添加自己的自动化程序来检查结果,根据30多个指标对其进行评分,如果需要,还可以将其发送给另一个LLM来评估结果,经常失败的智能体在其中一目了然。DevOps团队还可以提出诸如“谁在使用这个模型并产生了所有这些账单?”之类的问题。对于机能协调协议技能以及机器中的其他齿轮也是如此。
定价:针对开源和小项目提供免费档,专业版每月19美元起(含使用限制)
主打特性:拥有30多个评估追踪指标的自动评分功能
最适合:专注于RAG(检索增强生成)和智能体工作流的团队
Datadog
依靠Datadog追踪跨服务日志的DevOps团队也可以使用它来追踪LLM的运行,当然,LLM只是数据的另一个来源和去处,它将追踪诸如首个Token生成时间之类的性能,并提供对可能导致问题的原因(如内存不足)的洞察,然后,结果会被插入到相同的成本追踪机制中,以便财务人员能够预测预算何时耗尽,毕竟,CFO可能并不关心账单是来自LLM还是老式的S3存储桶。Datadog通过将这些模型视为另一种数据源,将AI整合到其工具中。
定价:小规模免费档,另有多个针对不同企业监控级别的付费档
主打特性:庞大的装机用户群,广泛关注LLM之外的领域
最适合:使用成熟基础设施的大型企业团队
Dynatrace
20多年来,Dynatrace一直致力于提供追踪全栈数据流的工具。现在,随着AI在这一复杂图拓扑的许多节点中找到角色,他们正在扩展业务以追踪各种AI智能体如何进行交互。他们希望构建一个平台,帮助追踪根本原因,并且现在通常能够自主部署解决方案。他们希望专注于做好准备,以支持复杂的智能体网络,这些网络可以检测性能或安全方面的问题,然后在定义的护栏内运行以修复它们,确定其自身AI驱动的智能体的正确角色是该产品的核心部分。
定价:每月7美元起,另有专为全面企业监控设计的大型方案
主打特性:专为大型设施设计的高水平自主监控
最适合:将LLM与传统服务相结合的复杂混合环境
Galileo
将某些AI系统投入生产往往是一次令人揪心的经历,因为即使经过最严格的测试,实际性能也无法预测。Galileo提供了追踪性能的护栏,并监控任何偏离真实基准的行为,他们的“LLM-as-judge”系统被浓缩成紧凑的模型,可以在本地运行,从而降低成本并提高性能。
定价:小规模免费档,专业版每月50美元起(含基于使用量的限制和成本)
主打特性:为已部署智能体提供实时护栏
最适合:需要防御幻觉和数据泄露的安全意识型设施
Grafana Labs
作为开源遥测领域的长期首选,Grafana Labs现在开始追踪服务群中AI模型的性能。Grafana追踪智能体网络中答案的演变,以识别微小的变化或幻觉如何失控,它将其系统宣传为“真正有用的AI”,甚至已经注册了商标。它的云助手可以配置和重新配置Grafana仪表盘,以提供合适级别的可观测性,其系统包括AI级别的分析,可以标记那些响应迅速但由于模型漂移或上下文降级等问题而提供糟糕答案的模型。
定价:基础免费档,专业版每月19美元起,包括更好的数据留存和一些基于使用量的费用
主打特性:集成完整LLM工具的全栈工具
最适合:正在添加AI的大型企业级系统
Helicone
有时,在链条中强行嵌入另一个工具可能会很棘手。Helicone被设计为一个智能网络代理,它将路由所有的模型请求,同时对经过的数据保存完备的调试记录,它捕获的数据可以转化成精美的图表,使发现延迟问题或模型故障变得轻而易举。当然,随着账单持续飙升,追踪AI支出也是一项需求极高的功能。
定价:小规模免费档,专业版每月79美元起,包括团队协作和改进查询等特性
主打特性:基于代理的集成
最适合:希望快速添加更好监控功能的开发团队
Laminar
在开发和生产环境中追踪智能体意味着建立强大的数据库,以枚举发生的事情。Laminar与OpenTelemetry紧密合作,跟踪在生产环境中运行的智能体,以便通过其自身压缩方案高效存储的日志文件来理解缺陷和故障模式。开发者可以使用类似SQL的语言检索追踪记录,并且Laminar的转录视图阐明了发生的事情。必要时,追踪记录可以使开发者在时间上回溯并重新播放相同的输入进行调试,其目标是提供深度的洞察,并对智能体满足业务目标的程度提供高水平的可见性。
定价:小规模免费档,增加更多特性的“Hobby”档为30美元,专业版级别每月150美元起
主打特性:开源许可证使自托管成为可行的方案
最适合:完全有能力承担开源责任的团队
LangChain LangSmith
来自智能体的实时数据对于管理生产环境中的任何多智能体系统都至关重要,来自LangChain的LangSmith使用针对Python、TypeScript、Go和Java的SDK,为广泛的智能体追踪成本、工具以及走向解决方案的进度,该基于OpenTelemetry的解决方案监测异常情况,通过仪表盘和诸如PagerDuty之类的通信渠道发布警告和告警,更深层的分析可以揭示诸如主题聚类或怪异故障模式等问题。与LangGraph和deepagents等智能体部署平台的协同,确保了能更专注于成功解决分配的任务。
定价:对个人开发者免费,专业团队每月每人39美元起
主打特性:对提示词进行回退测试的系统化方法
最适合:依赖LangChain和LangGraph框架来支持复杂智能体行为的团队
Lunary
监测用户体验对于构建聊天机器人和助手等AI应用程序至关重要,Lunary提供了一个追踪所有交互的代理,然后构建分析仪表盘以衡量用户满意度或模型成本等指标。一个常见的用途是查找高频主题并查看响应以确保它们成功交付。当提示词不够完美时,Lunary允许团队对提示词文本进行迭代,直到输出正确的答案,其代理结构和通用API格式使Lunary能够承诺与“任何LLM、任何框架”协同工作。
定价:免费档,专业版每月20美元起
主打特性:与人工深度集成,用于审查和优化结果
最适合:专注于快速提示词创新的初创公司
NewRelic
这个最初用于追踪某些Web应用程序性能的平台,现在已经强大到足以追踪通过复杂智能体生态系统的数据流。NewRelic由AI驱动的监控旨在寻找黄金信号,这些信号可以指示在整个生命周期中发生的异常行为或更糟的情况,它通过MCP等协议追踪交互的每个细节,然后将其提供给负责性能的AI工程师,该仪表盘提供了监控有害行为、明显偏见、漂移和夸大幻觉所需的见解。随着Token经济学变得与响应时间同样重要,预测甚至控制成本也成为其日益重要的角色。
定价:免费档,专业版费用可通过官方网站获取
主打特性:全栈支持,具有与数百种其他工具的集成能力
最适合:融入了AI的成熟企业团队
Nova AI Ops
Nova AI Ops的目标是交付一个能够守护云端并使其实现(至少部分)自愈的智能体团队。每个智能体都结合使用预测性AI和机器学习来监控云遥测报告中的异常,然后他们计算“爆炸半径”,并决定这是可以在“你睡觉时”自动修复的问题,还是留给人工主管解决的问题,这些工具不仅针对LLM的运行,而且针对整个技术栈。
定价:小规模免费档,标准定价每月每用户40美元起,按使用量计费
主打特性:专注于软件可靠性工程(SRE),帮助团队交付稳定的技术栈
最适合:希望将LLM整合到事件响应和稳定性管理中的团队
Splunk
这个最初提供智能日志记录的平台现在已完全具备AI能力,提供的解决方案能够以追踪微服务的相同方式来守护智能体。Splunk现在包含了相当大量的预测性AI,用于从日志信息中学习,然后将这种学习转化为快速的解决方案。这个AI助手可以追踪通过MCP等协议连接的已部署AI模型,并监控其行为,同时让用户能够深入探索哪些在正常工作、哪些在发生故障,他们的AI Canvas旨在提供一个中心枢纽,AI科学家可以在其中追踪模型的本地行为以及它们在更大数据生态系统中的角色。
定价:基于活动的定价,追踪LLM后端和存储的使用情况
主打特性:易于扩展到大型企业级技术栈
最适合:融入了智能体选项的传统系统团队
SuperPenguin
AI服务中最重要的部分之一就是账单,SuperPenguin是一款旨在追踪消耗并做出预测的产品,这样CFO就不会感到意外。其目标是通过将成本分配给客户、功能和团队,来提供关于每个产品总成本的可靠估计。如果发生突然变化,“浪涌检测器”将会发出警报,以便开发团队能够确保AI支出的物有所值。
定价:用于实验的小规模免费档,适合团队的Growth档每月30美元起,专业版提供更深层的选项,每月200美元起
主打特性:强大的会计功能,具有发票核对和公关级使用情况追踪
最适合:需要精确成本核算的团队
Vellum
提示词工程师花费大量时间来琢磨微调、改进和增强引导LLM话术的细节。Vellum最初是一家提供流水线的公司,以便你可以管理和改进反复运行的提示词。现在该系统正变得更加强大,提供了更高级别的自动化,让你能够对提示词链进行元管理,他们也开始将其作为一种个人助手形式进行营销,预置了与Gmail等许多主要服务的连接,它的llm-cost-optimizer(LLM成本优化器)可以权衡多个选项,同时寻找更便宜的方式来执行提示词,该公司表示该流程可以节省60%或更多的成本。
定价:开源免费档,专业版每月35美元起
主打特性:专注于用于真正智能体解决方案的多模型流水线
最适合:具有复杂提示词工程工作流的产品团队


