DataBuff 是一款面向云原生与微服务场景的开源 AI Native OpenTelemetry APM,采用 OTLP 标准接入、Apache Doris 统一存储,Web 端提供拓扑 / Trace / 指标与多 Agent 排障。项目已在 OSCHINA 软件库收录:https://www.oschina.net/p/databuff
今天,DataBuff 正式发布 v0.1.6。相对 v0.1.5 共 20 个提交,本版无 Schema 迁移,升级即替换镜像并重启。这版我们主要改了查询性能、告警准确性和 AI 稳定性,并把工作区文件预览的后缀限制放开了;另外完善了 databuff-proxy 双写迁移路径,已有 SkyWalking 的团队业务零改动就能并跑 DataBuff。需要上手操作的两项(databuff-proxy 双写、接口耗时分解)下面展开说,其余列在末尾。
本版本亮点摘要
- databuff-proxy 双写迁移:v0.1.6 完善了 SkyWalking→DataBuff 双写迁移路径与稳定性验证,业务零改动(Agent 不换、配置不改、Pod 不重启),平台侧接
databuff-proxy 即可让同一批 Trace 同时进 OAP 和 DataBuff Ingest。
- 接口耗时分解:接口分析新增「接口自身耗时」维度,把接口自身耗时从下游调用(DB / Redis / MQ / HTTP / RPC)拆出来,慢在自身逻辑还是下游依赖一眼能分。
- Span 列表查询加速:接口分析 / 链路追踪的 span 列表改用 exact URL 精确匹配、不再单独 count 总数、并对
startTime 做 30 分钟分区裁剪,列表响应更快。
- 告警同环比检测修正:mutation(同环比)告警尊重
comparePeriod 与 fluctuate 方向(valUp / valDown / yoyUp / yoyDown),不再误判方向。
- 告警取值与表达式:
listTagValues 跳过未知 metric tag;eval SQL 覆盖 filter operators。
- AI 稳定性:brain 多步 handoff 提示改进、剥离 protocol coaching;session 列表/计数 DB-first,Doris 错误时 fail-closed 到内存;model failure 上抛给用户;修复 brain dispatch bug;更新 brain routing 提示词。
- AI 稳定性测试:5 套 AI 集成测试全部并行(chat/formats/memory/brain + 新增 modelfail),新增专家交互契约测试,修复记忆隔离、模型失败上抛、brain 调度等缺陷。
- 工作区文件预览:AI 对话工作区在线预览扩展到所有非二进制文件(不再限于 txt/log/csv/json)。
- 部署与构建:compose health wait 超时提升至 300s;新增
ai-apm-web-base 镜像,web release 跳过 apt 重装。
怎么用:databuff-proxy 双写(SkyWalking 平滑过渡)
已有 SkyWalking 的团队想试 DataBuff,业务侧零改动就能并跑:只在原 OAP 宿主机部署 databuff-proxy 占住 :11800,同一批流量对称抄送两路后端。

图 1 · databuff-proxy 管理页:同一批流量对称双写两路后端,发送成功约为入站的两倍、丢弃为 0,可随时开关某路写入
迁移步骤与稳定性结论见 docs/迁移指南/from-skywalking-to-databuff.md(方案 B)与 docs/迁移指南/proxy-dual-write-stability.md。
怎么用:接口耗时分解
路径:应用性能 → 接口分析。选中一个 HTTP / RPC / MQ 接口,耗时分解图按时间桶把耗时拆成「接口自身耗时」与各下游组件(DB / Redis / MQ / HTTP / RPC / 远程调用),下游再按对端 service 细分。
- 接口自身耗时:接口总耗时减去所有下游调用耗时之和。
- 下游按组件 + 对端 service 拆:例如
HTTP service-b、DB [mysql]demo_apm、Redis [redis]redis:6379、MQ [kafka]order-events。
- 定位瓶颈更直接:响应时间涨,看是自身涨还是某个下游涨,无需逐条翻 Trace。
![接口分析耗时分解图:响应时间 240ms,按时间桶拆为接口自身耗时与下游 HTTP/RPC/DB[mysql]/DB[elasticsearch]/Redis/MQ[kafka] 各组件耗时](https://static.oschina.net/uploads/space/2026/0803/092334_8rED_2287728.png)
图 2 · 接口耗时分解:响应时间 240ms,按时间桶拆出接口自身耗时与下游各组件(HTTP / RPC / MySQL / Elasticsearch / Redis / Kafka),自身逻辑和下游依赖各占多少看图即知
怎么用:工作区文件在线预览扩展
路径:AI 平台 → AI 对话。专家执行工具时产出的中间文件会落到工作区,点击即可在右侧在线预览,不用下载到本地。
v0.1.6 把可预览的后缀放开了:除二进制(图片、压缩包、.class、.parquet 等)外,.py、.sh、.yml、.sql、Dockerfile、.md 等文本/代码类文件都能直接看,.md 按 markdown 渲染。交互和 v0.1.5 一样,升级即生效。
重点:AI 稳定性测试
v0.1.6 强化 AI 稳定性测试:新增「模型失败可见性」套件与专家交互契约测试,修复记忆隔离、模型失败上抛、brain 调度等缺陷。5 套全部并行:
- chat 工具参数校验:4 题,覆盖服务/拓扑/慢请求 trace/告警四类工具调用,校验选工具与参数。
- formats 接入格式:OpenAI Completions + Anthropic Messages 两种接入格式,3 题,验证接入一致。
- memory 会话记忆:5 用例:巡检多轮记忆/同会话跨专家隔离/问数多轮记忆/大脑多轮记忆/巡检追问生成。
- brain 大脑异步路由:10 用例:单专家调度/并行调度/专家失败/跨会话隔离/多轮调度/多步巡检-报告/多步延迟巡检-报告/并行巡检+运维/数据→运维/数据+问答。
- modelfail 模型失败可见性(v0.1.6 新增):3 用例:单专家运维/单专家数据/多专家级联,失败上抛给用户而非静默吞掉。
Java 侧新增专家交互契约测试(BuiltInExpertInteractionContractIntegrationTest 486 行、ExpertMessageContractTest 183 行)。
安装与升级
新用户安装(全新安装,会清理旧安装目录与 data/):
curl -fsSL https://databuff.ai/databuff/ai-apm-install.sh | bash
现有用户升级(就地升级,保留 data/ 观测数据):
curl -fsSL https://databuff.ai/databuff/ai-apm-update.sh | bash
本版无 Schema 迁移,升级即替换镜像并重启。K8s 本版不支持原地升级,需卸载后重装。更多细节见 deploy/docker/UPGRADE.md。
获取项目
欢迎试用 v0.1.6,在 GitHub 给我们一个 Star,并在软件主页留言交流部署与迁移复现体验。