AI News · AI新情报

可观测平台把AI工作台做成运维入口:从告警代写到Agent调用可追溯

腾讯云可观测平台产品动态显示,其AI工作台自2026年3月起持续迭代:开放自定义Skill与MCP、预设场景扩展至9个、告警配置支持AI代写、PromQL助手上线AI辅助编写,并在7月发布Agent可观测能力新版,强调每一次Agent调用可追溯、可度量、可优化。同期可观测数字分身Skill上架WorkBuddy,AI工作台支持多云管理并上线11个核心场景演示案例。来源未披露具体客户与量化效果。

可观测平台把AI工作台做成运维入口:从告警代写到Agent调用可追溯

核心摘要: 腾讯云可观测平台产品动态显示,其AI工作台自2026年3月起持续迭代:开放自定义Skill与MCP、预设场景扩展至9个、告警配置支持AI代写、PromQL助手上线AI辅助编写,并在7月发布Agent可观测能力新版,强调每一次Agent调用可追溯、可度量、可优化。同期可观测数字分身Skill上架WorkBuddy,AI工作台支持多云管理并上线11个核心场景演示案例。来源未披露具体客户与量化效果。

业务背景:监控数据越来越多,消费方式却没变

随着云上资源、应用与前端体验的监控面不断扩张,可观测平台积累的指标、日志、链路与拨测数据持续增长。腾讯云可观测平台的产品动态显示,其功能更新覆盖Prometheus监控、应用性能监控、前端性能监控、云拨测与云监控等多个方向,仅2026年上半年就密集发布了大量功能项。

数据变多并不自动等于问题变少。传统方式下,运维人员需要在多个控制台之间切换,手工编写告警规则、逐条筛选告警、再回到大盘定位异常。这一过程的瓶颈不在数据量,而在“从数据到判断”的中间环节。

问题:告警配置与根因定位消耗了大量判断力

产品动态中反复出现的更新方向,指向同一类痛点:告警策略治理、告警根因分析、Dashboard分析、前端异常排查与网络质量分析。这些场景在2026年6月被扩展为AI探索的预设场景,说明它们是用户高频且耗时的环节。

另一类痛点是成本与责任不清。2026年6月,Prometheus监控服务新增按Job维度展示每个采集目标的采集速率、预估用量与预估费用,官方描述为让用户一眼看清“谁在花钱、花了多少”。这从侧面说明,监控成本此前缺乏细粒度归属。

AI怎么落地:把能力收进一个工作台

从动态看,腾讯云的路径是把AI能力集中到“AI工作台”这一入口。2026年5月AI工作台全面升级为新版本(内测中);7月开放自定义Skill与MCP,AI探索预设场景升级至9个,覆盖可观测全线核心场景;8月进一步支持多云管理,可观测数字分身Skill上架到WorkBuddy,并上线11个核心场景演示案例。

具体能力上,2026年7月告警配置支持AI代写,一句话描述即可自动生成规则并回填;PromQL助手上线AI辅助编写,帮助改写、优化与逐句读懂查询语句。更早的2026年4月,SRE数字分身已支持健康巡检任务类型,Dashboard也支持智能化分析能力。

关键一步:让Agent调用本身可被观测

2026年7月,该平台发布Agent可观测能力新版,官方描述为让每一次Agent调用都可追溯、可度量、可优化。这一动作的意义在于,AI不只是分析监控数据的工具,其自身行为也进入被监控范围。

对企业而言,这补齐了AI进入运维流程的前置条件。只有当调用轨迹、资源范围与执行结果可被记录和回溯,AI参与告警处理与巡检才可能被纳入既有的值班、审计与责任体系,而不是停留在演示阶段。

实施步骤与边界:来源未披露的部分

从公开动态可归纳的推进节奏是:先做单点能力(告警代写、PromQL助手、AI诊断),再扩展预设场景,随后开放自定义Skill与MCP,最后把数字分身与多云管理纳入统一工作台。这一顺序体现了从辅助到可编排的渐进路径。

需要明确的是,来源未披露具体客户名称、部署规模、使用量以及效率或成本改善的量化数据,也未披露AI生成规则的实际采纳率与误报情况。因此上述能力的效果不能外推,企业应以自身试点数据为准。

可复制动作:从一条链路开始

对多数企业而言,可复制的第一步不是全面铺开,而是选择一条高频、低风险、结果可验证的链路,例如告警规则代写或告警根因分析,并要求AI输出必须经人工确认后才生效。

第二步是同步建立Agent调用的记录与审计字段,把调用范围、资源边界与责任人纳入现有流程。第三步再考虑扩展场景与多云统一入口,避免在治理能力尚未就位时先放大AI的访问权限。

关键依据

  • 来源为腾讯云可观测平台产品动态页面,最近更新时间2026-09-22。
  • AI工作台相关能力按月份列出,含自定义Skill与MCP、预设场景、告警代写、PromQL助手等。
  • Agent可观测能力新版发布于2026年7月,描述为可追溯、可度量、可优化。
  • 来源未披露具体客户名称、部署规模与量化效果。

企业今天可以做什么

建议企业先选一条高频、低风险的运维链路试点,例如告警规则代写或告警根因分析,明确AI输出必须人工确认后再生效;同步梳理Agent调用的可追溯字段,把调用记录、资源范围与责任人纳入现有值班与审计流程;在推广前先划定AI可访问的监控资源边界,避免一次性开放全部生产数据。

资料来源

公众号原题:腾讯云可观测平台 产品动态_腾讯云 · 查看公众号原文

你的企业,AI最该先改哪一段?

带着一个真实业务问题,先做一次增长诊断。

获取增长诊断