应用运维智能体解决方案

App-Ops Agent Solution Architecture

2026.06 V1.0

方案概述

面向应用运维场景的AI智能体解决方案,通过日志、指标、链路追踪、火焰图等多维数据分析, 自动诊断应用故障与性能瓶颈,输出根因分析与优化建议。核心设计理念:CLI松耦合 + 多数据源适配 + 多维数据交叉分析 + 0成本跨平台部署

CLI松耦合
与监控平台解耦
多源适配
ACP保底+用户平台
智能诊断
多维数据交叉分析
0成本部署
任意智能体平台
MTTR缩短

从小时级降至分钟级,AI自动完成日志/指标/链路的关联分析,快速定位根因

零改造接入

CLI协议对接现有监控平台,无需改造应用代码;无监控环境可用文件上传兜底

平台无关

同一套Agent适配Claude Code、OpenCode、金蝶灵基等任意智能体平台,一处开发多端部署

1

应用运维智能体全景

规划 · 执行 · 验证 · 反思

智能体作为应用运维的中枢,通过标准化协议接入外部系统,构建统一上下文,形成 “规划 → 执行 → 验证 → 反思” 的持续优化闭环,实现从问题发现到效果反馈的全链路自动化。

监控系统
Monitoring Platform
采集应用日志、指标、链路、火焰图
接收告警事件与异常通知
构建应用运行态上下文
管理平台(如ACP)
Management Platform
管理应用运行环境与中间件
执行配置变更与巡检任务
提供环境级优化与治理能力
测试平台
Testing Platform
发起压测与性能回归验证
反馈性能基线与瓶颈数据
验证优化建议的实际效果
1
规划
分析监控/日志/告警,识别性能瓶颈与优化目标
结合环境配置与运行约束,制定优化方案
输出可执行的优化动作清单与验证标准
2
执行
调整应用/中间件配置参数
调用测试平台执行压测、回归测试
执行代码级优化建议或资源调度
3
验证
对比优化前后指标与链路表现
评估压测结果是否满足预期基线
确认告警消除与稳定性恢复
4
反思
沉淀优化案例与知识库
分析未达预期原因,调整优化策略
反馈至下一轮规划,形成持续改进
反思结果反馈至“规划”,驱动下一轮优化
2

整体架构

四层架构
接入层 · ACCESS LAYER 多渠道统一接入
Web UI
浏览器控制台
桌面客户端
本地IDE集成
微信 ClawBot
移动端随时诊断
CLI / API
自动化流水线集成
智能体层 · AGENT LAYER 0成本跨平台部署
应用性能优化
JVM GC 诊断
慢链路定位
线程池健康分析
热点代码 Profiling
SQL 慢查询分析
运维巡检
集群健康巡检
日志异常巡检
证书与过期巡检
容量趋势预测
配置合规检查
中间件管理
消息积压诊断
中间件集群拓扑管理
中间件性能基线对比
故障自愈与切换
Topic/资源治理
数据适配层 · ADAPTER LAYER CLI协议 + 多源适配
用户监控平台
Prometheus / Grafana /
OpenSearch / 自研平台
CLI对接
ACP管理平台
中间件监控数据保底
Kafka / Pulsar / ES / RMQ
内置CLI
文件上传
日志文件 / 导出的指标 /
火焰图快照
离线分析
数据源层 · DATA SOURCE LAYER
应用日志
性能指标
链路追踪
火焰图
中间件状态
告警事件
3

CLI松耦合设计

核心设计

智能体不直接调用监控平台的API,而是通过标准化的CLI命令间接获取数据。这样无论底层监控平台如何变化,只需适配CLI插件即可,智能体逻辑不受影响。

标准CLI接口定义
# 日志查询
$ acp log search --app=order \
  --level=ERROR --since=1h
# 指标拉取
$ acp metric query --app=order \
  --metric=cpu,memory,gc \
  --range=30m
# 链路追踪
$ acp trace search --app=order \
  --latency>500ms --limit=10
# 火焰图
$ acp flame capture --app=order \
  --duration=30s --type=cpu
适配器插件机制
prometheus-adapter 已启用
PromQL → acp metric 命令映射
opensearch-adapter 已启用
OpenSearch DSL → acp log 命令映射
jaeger-adapter 已启用
Jaeger API → acp trace 命令映射
自定义适配器
标准化输出格式
// CLI输出统一JSON Schema
{
  "type": "metric",
  "app": "order-service",
  "data": [
    {
      "name": "cpu_usage",
      "value": 87.5,
      "unit": "percent",
      "timestamp": "..."
    }
  ],
  "source": "prometheus"
}
无论数据来自哪个平台,智能体只认标准格式
数据获取流程
智能体发起诊断
"帮我分析order服务卡顿"
调用CLI命令
acp log / metric / trace
适配器转换
平台API → 标准JSON
智能体分析
多维数据交叉诊断
输出诊断报告
根因 + 优化建议
4

多数据源适配策略

三级兜底
推荐方案
方案A:用户监控平台
有完善的监控基础设施
通过CLI适配器对接用户已有的Prometheus/ES/Jaeger等
支持日志、指标、链路、火焰图全量数据
实时数据获取,支持时间范围回溯
用户无需更换现有监控体系
适用场景
已有Prometheus+Grafana、ELK、SkyWalking等监控栈的企业用户
方案B:ACP管理平台
保底方案 · 开箱即用
ACP内置中间件监控能力,无需额外部署
覆盖Kafka/Pulsar/ES/RMQ 4款中间件
提供应用层+中间件层联合分析
当用户无监控平台时自动启用
适用场景
中小团队、无监控基础设施、快速体验智能体能力的用户
方案C:文件上传
离线分析 · 最低门槛
支持上传日志文件(.log/.txt/.gz)
支持导出的指标快照(JSON/CSV)
支持火焰图SVG/PNG截图分析
完全离线,适合安全隔离环境
适用场景
无法联网、安全合规要求高、一次性问题排查的用户
数据源自动路由策略
初始化检测
发现用户监控平台 → 方案A
无监控平台但有ACP → 方案B
均无 → 方案C(引导上传)
5

0成本跨平台部署

一处开发 · 多端部署

智能体基于标准化协议构建,不依赖特定平台的专有能力。同一套Agent代码,可以直接部署到任意支持智能体运行的平台,无需重新开发。

Claude Code
Anthropic Agent
✓ 已验证
OpenCode
开源Agent框架
✓ 已验证
Hermes/龙虾
开源智能体平台
✓ 已验证
金蝶灵基
企业级Agent平台
✓ 已验证
0成本部署的技术基础
标准化Prompt协议

Agent逻辑以Prompt + Tool Definition描述,不依赖平台SDK,符合OpenAI Function Calling / MCP等通用协议

CLI即工具

所有数据获取能力封装为CLI命令,任何平台只要能执行Shell命令即可调用,无需额外集成

Git仓库分发

Agent配置+CLI工具以Git仓库形式分发,用户clone即可使用,版本更新通过git pull完成

6

典型应用场景

场景一:应用突然卡顿,RT飙升 高频
数据输入: 指标(RT/QPS/CPU)+ 日志(ERROR)+ 链路(慢Span)
分析过程: RT飙升时刻 → 关联CPU/GC指标 → 查链路瓶颈Span → 提取对应时段ERROR日志
输出结果: 根因:下游DB连接池耗尽导致线程阻塞 → 建议:调整maxPoolSize + 增加连接超时监控
场景二:CPU持续高位,排查热点 常见
数据输入: 火焰图(CPU Profile)+ 指标(CPU/线程)+ 日志
分析过程: 火焰图热点函数 → 关联业务代码 → 检查是否存在死循环/正则回溯/大量GC
输出结果: 根因:JSON序列化使用了低效库 + 频繁创建临时对象 → 建议:替换为高效序列化库 + 对象池复用
场景三:消息中间件积压,消费延迟 ACP特色
数据输入: ACP中间件监控 + 应用日志 + 消费端指标
分析过程: 消息堆积趋势 → 消费端吞吐 → 消费日志异常 → 是否下游处理慢/消费失败重试
输出结果: 根因:消费端批量处理SQL超时导致消费速率下降 → 建议:优化批量大小 + 增加消费并发数
场景四:无监控环境,上传日志离线分析 兜底
数据输入: 用户上传 application.log + gc.log
分析过程: 解析日志模式 → 统计ERROR频率 → GC停顿分析 → 时间线关联
输出结果: 根因:Full GC频繁导致STW停顿 → 建议:调整堆大小 + 切换G1/ZGC + 排查内存泄漏
7

方案优势总结

松耦合 · 高适配
CLI协议隔离平台差异

智能体通过标准化CLI命令与监控平台交互,不硬编码任何平台API。新增监控平台只需开发适配器插件,Agent核心逻辑零修改。

三级兜底 · 全覆盖
确保任何环境都能用

用户监控平台 → ACP保底 → 文件上传,三级数据源策略确保无论用户的运维成熟度如何,都能获得智能诊断能力。

0成本 · 跨平台
一处开发多端部署

基于标准协议构建,不绑定任何智能体平台。同一套Agent可直接运行在Claude Code、Coze、金蝶灵基等平台,迁移成本为零。

多维交叉 · 深度诊断
不止看单一维度

将日志、指标、链路、火焰图四类数据交叉分析,构建完整故障因果链,而非简单罗列告警信息,真正帮运维人员理解"为什么出问题"。

客户实战案例 · GC 诊断智能体

以下为某客户项目中的真实实战总结。基于 Harness 工程方法论,构建了以 gc-man GC分析专家智能体为核心的 JVM 垃圾回收诊断体系, 覆盖日志分析、CPU Profiling、内存分配模式、阻塞扫描、综合编排等全链路能力。

gc-man 专家智能体
SOP驱动 · 证据链闭环
ys-cli 原子化工具
DeepFlow API封装
6大专家Skill
可编排 · 可回归验证
8

Harness 工程分层架构

实战架构

智能体 Harness 是为 LLM 打造的"专家大脑 + 灵巧双手"增强系统。以 GC 诊断智能体为例, 展示了从模型接入到回归验证的完整工程化开发流程。

用户交互层
对话界面
CLI
API
智能体层
gc-man · GC分析专家
System Prompt: "你是一个GC分析专家"
SOP化分析流程
领域知识体系
证据链闭环
启动期识别
能力层
专家技能 Skill
gc-log-analyzer
deepflow-profile-query
deepflow-gc-thread
deepflow-mem-pattern
deepflow-block-scan
deepflow-gc-diagnose
原子化 CLI 工具
# ys-cli · DeepFlow API封装
$ ys-cli profile query \
  --tag-filter "..." \
  --time-start ... --time-end ...
  -o json
配置三层优先级
管道兼容输出
模型接入层
deepseek_v4_flash
主模型
qwen3.5_35b_a3b
轻量模型
qwen3.5_35b_agent
专用模型
9

gc-man · GC分析专家智能体

核心Agent
SOP五步分析法
1
全局扫描
GC日志结构化解析
建立压力画像
2
异常发现
识别长暂停事件
检测异常模式
3
深入分析
按小时分布分析
Top长暂停事件
4
根因推理
证据链推导
现象→机制→根因
5
建议输出
标准诊断报告
优先级优化建议
真实诊断执行流程(IP: 172.253.168.169 · 2026-06-09)
Step 1
接收任务 → 用户请求分析某台机器的GC问题,指定时间范围和日志路径
Step 2
加载技能 → 自动加载 gc-log-analyzer 技能,获取专业GC分析SOP
Step 3
日志扫描 → 使用 gc_log_parser.py 对 191K行+255K行 超大日志进行全局扫描
Step 4
确定范围 → 发现2个日志文件,识别pid1648450覆盖6月9日,pid1786123截止到6月8日
Step 5
深层分析 → 提取异常窗口,按小时分布分析,定位Top 3长暂停事件(Object Copy耗时、CPU利用率、Survivor阈值)
Step 6
根因推理 → 结合Object Copy时长 + CPU利用率 + Survivor Threshold=1 等证据链推导根因
Step 7
报告生成 → 按标准模板输出完整诊断报告(GC算法、健康度、P50/P95/P99、异常事件根因、优化建议)
1,795
GC总次数
99.89%
吞吐量
760ms
最大暂停
0
Full GC次数 ✓
10

专家 Skill 能力矩阵

6大技能
gc-log-analyzer
GC日志分析器
JDK 8 Legacy + JDK 9+ Unified Logging 双格式
双阶段分析:全局扫描 → 异常深挖 核心
启动期自动识别(前3-5分钟) 智能
辅助脚本: gc_log_parser.py 工具
deepflow-profile-query
DeepFlow数据查询
大时间范围自动分段时间窗切割 核心
多段查询结果自动合并 核心
JSON管道输出 · 下游技能直接消费 管道
辅助脚本: batch-query.js 工具
deepflow-gc-thread
GC线程CPU分析
on-cpu Profile GC线程过滤 核心
各GC线程CPU占用百分比 核心
风险判定: <2%正常 / 2-5%关注 / >5%偏高 阈值
G1 Concurrent R 占比监控 G1GC
deepflow-mem-pattern
内存分配模式分析
对象分类: 字符串/集合/日期/APM探针 核心
日期格式化对象重复创建检测(>10%) 严重
HashMap频繁扩容 / 异常栈生成检测 关注
--deep 模式扩展检测规则 增强
deepflow-block-scan
阻塞等待分析
off-cpu Profile 阻塞原因分类 核心
锁竞争(>20%) / 网络I/O(>40%)检测 异常
连接池耗尽(>5%) / 单线程瓶颈(5x) 告警
识别关键词: park/synchronized/socketRead0 规则
deepflow-gc-diagnose
GC综合诊断编排
自动调度5个原子技能按序执行 编排
交叉关联: GC线程CPU + 内存分配模式 交叉
多模式: --quick / 标准 / --deep / --no-block 灵活
Markdown/JSON双格式诊断报告 输出
deepflow-gc-diagnose 编排架构
diagnose-orchestrator.js
主入口 · 模式选择
batch-query.js
基础查询层 · 分段+合并
analyze-gc-thread.js
on-cpu → GC线程
analyze-mem-pattern.js
mem-alloc → 内存模式
analyze-block-scan.js
off-cpu → 阻塞扫描
交叉关联分析
报告渲染(MD / JSON)
--quick
仅 mem-pattern
1次查询
标准(默认)
thread+mem+block
3次查询
--deep
标准+扩展检测
3次查询
--no-block
thread+mem
2次查询
--no-mem
thread+block
2次查询
11

智能体能力回归验证

质量保障

基于真实客户项目的历史会话数据,建立了多维度的智能体能力回归验证体系,确保智能体在真实场景中稳定可靠。

验证维度 验证方法 通过标准 实战验证
专一能力 对单个Skill运行预设测试用例 输出指标与人工分析一致
编排能力 运行编排型Skill,检查子任务执行和结果整合 所有子任务正确执行,报告完整
日志处理 超大日志(>10万行),观察处理方式 使用脚本提取摘要,不直接读入
时间窗口 要求分析非当前时间范围的数据 正确确定覆盖文件,提取目标窗口
边界容错 模拟部分数据缺失或无数据场景 标注错误信息,不终止整体流程
多文件场景 提供多个日志文件 逐文件分析时间范围,过滤无关文件
报告规范性 检查输出报告结构 遵循标准模板,包含根因推理
根因准确性 已知问题的历史数据测试 推理链完整,根因判断与已知结论一致
Harness 工程开发路线图
1
模型接入
配置Provider
验证API连通
2
CLI工具
开发领域CLI
输出结构化数据
3
Skill开发
SKILL.md知识
+辅助脚本
4
Agent配置
关联Skill
领域专家就绪
5
编排层
组合子技能
一键综合诊断
6
回归验证
历史数据测试
能力达标交付

应用运维智能体解决方案 V1.1 · 2026.06 · 基于CLI松耦合 + 多源适配 + 0成本跨平台部署 · 含客户实战案例