DataBuff 是一款面向云原生与微服务场景的开源 AI Native OpenTelemetry APM,采用 OTLP 标准接入、Apache Doris 统一存储,Web 端提供拓扑 / Trace / 指标与多 Agent 排障。项目已在 OSCHINA 软件库收录:https://www.oschina.net/p/databuff
今天,DataBuff 正式发布 v0.1.7。相对 v0.1.6 共 31 个提交,含 Schema 迁移 V007(新增 metric_platform 表承载平台自监控分钟级指标)。这版最大的变化是平台能「看自己」:收数、查数、写 Doris 哪里堵了、哪里在丢,页面上直接看;说不清就让产品答疑专家帮你巡检、顺着链路查原因,还能按建议登录改配置。
本版本亮点摘要
-
平台自监控与自排障:新增部署状态页(安装部署 → 部署状态),总览入站 TPS、写出失败、Doris 磁盘、查询失败;ingest / web / Doris 分 tab;每个指标标题可点开看计算口径与可调环境变量。
-
AI 一键巡检与修复:产品答疑专家可读指标清单、查平台自监控数据,输出 HTML 巡检报告;发现写出丢弃等问题可沿链路诊断,v0.1.7 起还可按建议执行登录、改参数、重启 ingest 并复查。
-
答疑专家 Doris 只读查询:platform.queryDoris 与 Web API,平台配置与遥测只读核验,无需手工连库。
-
非 HTTP 接口分析完善:resourceInfo / resourceRelation 支持非 HTTP componentTypes;接口下钻的资源筛选、慢调用与错误路径覆盖 DB / MQ / RPC 等。
-
服务分类与拓扑:应用服务按 span/componentId 识别 web 与虚拟中间件;全局拓扑在无调用边时仍展示孤立服务。
-
多 FE / 多 BE:DORIS_FE_HOST / DORIS_BE_HTTP_HOST 支持逗号分隔地址列表;查询走多 FE(JDBC loadbalance),写入 Stream Load 直连多 BE 并健康轮询。
-
链路查询加速:span 查询按分钟键裁剪并跳过 call_spans COUNT;按 TraceID 过滤时 Trace 图从 span 聚合。
-
告警与 MCP:监控规则支持 lt / lte / gte 比较符与 warning 阈值;远程 MCP headers 修正;AI 对话 Mermaid 按节点渲染并带语法修复兜底。
怎么用:平台自监控
在 AI 平台对产品答疑专家说「对 DataBuff 平台进行巡检,并出一份 html 巡检报告」,可得到可转发的 HTML 报告;继续追问可沿写出丢弃链路查根因并给出参数调整建议。
完整案例见仓库 docs/运维参考/平台自监控与自排障.md。
怎么用:配置多 FE / 多 BE
-
生产多节点 Doris:查询配 DORIS_FE_HOST=fe1,fe2(默认 JDBC 9030),写入配 DORIS_BE_HTTP_HOST=be1,be2 + DORIS_BE_HTTP_PORT=8040(Stream Load 直连 BE,健康轮询)。也可写成 be1:8040,be2:8041。Web 与 Ingest 的 FE 地址都要改;BE 只配在 Ingest。Docker 写 docker-compose.override.yml 后重启 web/ingest;K8s 改 ConfigMap ai-apm-config 后 rollout。详见 docs/运维参考/参数配置.md §3。
安装与升级
curl -fsSL https://databuff.ai/databuff/ai-apm-install.sh | bash
curl -fsSL https://databuff.ai/databuff/ai-apm-update.sh | bash
本版含 V007 Schema 迁移,升级脚本自动执行。K8s 本版不支持原地升级。详见 deploy/docker/UPGRADE.md。
链接