SAM、CLIP...最近有哪些基于 RWKV 的多模态等研究?【第二期】
大家好,我们整理了近期 RWKV 生态中新增的一些多模态工作,包含:RWKV-SAM(图像分割模型)、RWKV-CLIP(视觉语言表示学习)、point-RWKV(3D 点云学习框架)…… RWKV-SAM 相关论文: Mamba or RWKV: Exploring High-Quality and High-Efficiency Segment Anything Model 论文地址:https://arxiv.org/abs/2406.19369 GitHub 仓库:https://github.com/HarborYuan/ovsam 论文设计了基于 RWKV 的图像分段切割方法“RWKV-SAM”(Segment Anything Model)。 下图为 RWKV-SAM 架构: 与 Transformer 模型相比,RWKV-SAM 实现了 2 倍以上的加速,且可以在各种数据集上实现更好的图像分割性能。 此外,RWKV-SAM 的分类和语义分割结果优于最新的视觉 Mamba 模型。 RWKV-CLIP 相关论文:RWKV-CLIP: A Robust Vision-Lang...