HeteroFlow v2 推理服务的解决方案正式上线
HeteroFlow v2 是一款开源的异构算力调度平台,本次发布的推理服务功能针对上述三大痛点提供完整解决方案:
-
**> 一句话总结:**用一套 OpenAI 兼容 API,统一调度 9 种厂商 GPU × 5 种推理引擎,原生支持多租户、计费、扩缩容、热加载。
三、核心能力详解1. OpenAI API 100% 兼容,迁移零成本完全兼容 OpenAI 官方 API 协议:原 OpenAI 调用curl https://api.openai.com/v1/chat/completions-H “Authorization: Bearer sk-xxx”-d ‘{“model”: “gpt-4”, “messages”: […]}’HeteroFlow v2 调用(只改 URL 和 Key)curl http://your-heteroflow:3333/v1/chat/completions-H “Authorization: Bearer sk-tenant-xxx”-d ‘{“model”: “qwen2.5-7b”, “messages”: […]}’支持端点:POST /v1/chat/completions(对话补全,支持流式 SSE)POST /v1/completions(文本补全)POST /v1/embeddings(向量嵌入)GET /v1/models(模型列表)
-
迁移收益:**原有基于 OpenAI SDK 的代码(Python / JavaScript / Go / Java 等)零改动即可切换到 HeteroFlow v2 后端。
2. 9 种 GPU 厂商统一纳管厂商代表型号通信库/SDK推理引擎NVIDIAA100 / H100 / H20 / T4 / P4NCCL / NVMLvLLM、SGLang、llama.cpp华为昇腾310 / 910 / 910BCANNMINDIE海光 DCUZ100 / Z100LROCmvLLM(ROCm 版)摩尔线程MTT S30 / S80 / S4000MUSAvLLM-MTT寒武纪思元 290 / 370 / 590NeuWarevMLU 容器化壁仞BR106 / BR104BREIDGEvLLM 兼容**燧原Enflame
vLLM 兼容
沐曦
曦云 C500 / N100
MXMACA
vLLM 兼容
天数智芯
天垓 100 / 智铠 100
Iloc
vLLM 兼容
核心价值:
同一 endpoint 后端可混合部署(如 NVIDIA + 昇腾各 4 张卡共同服务一个模型)
故障自动切换(某厂商 GPU 故障时,流量自动切到其他厂商)
国产化平滑替代(先在 NVIDIA 跑通,再逐步切到国产 GPU,业务无感)
3. 5 种推理引擎智能路由不同 GPU 型号适配不同引擎,HeteroFlow v2 根据硬件自动选择最优引擎:GPU 类型推荐引擎原因NVIDIA CC ≥ 8.0(A100/H100)vLLMPagedAttention,吞吐最高NVIDIA CC ≥ 7.5(T4)SGLangRadixAttention,continuous batchingNVIDIA CC = 6.0(P100)llama.cpp兼容老 GPU(vLLM 不支持)华为昇腾 910MINDIE厂商专用,性能最优摩尔线程 MTTvLLM-MTT厂商专用其他(兜底)**Transformersdevice_map=‘auto’,通用
4. 模型热加载 + 滚动更新,业务零中断模型热加载(基于 vLLM 原生 sleep/wake_up):
-
休眠机制:**模型空闲超阈值(默认 30 分钟)自动休眠,释放 GPU 显存
-
唤醒机制:**新请求到达时毫秒级唤醒,重新加载到显存
-
滚动更新:**strategy=rolling 模式下逐个替换副本,新旧版本并行服务,零中断切换
适用场景:
模型版本升级(Qwen2 → Qwen2.5)
灰度发布(新版本先承接 10% 流量,验证后再 100%)
故障回滚(新版本异常,1 秒切回旧版本)
5. 多维自动扩缩容6 种扩缩容指标(可任意组合):指标适用场景gpu_utilizationGPU 利用率,最常用cpuCPU 使用率request_queue请求队列深度concurrent_requests并发请求数vllm_pending_requestsvLLM 等待中请求数vllm_running_requestsvLLM 运行中请求数
6. 多租户隔离与配额三层隔离:层级隔离内容数据隔离所有业务表加 tenant_id,中间件强制注入,跨租户不可见