社区学习工具库休闲

简体中文

首页 > 科技周边 > 人工智能 > CLIP当RNN用入选CVPR：无需训练即可分割无数概念｜牛津大学&谷歌研究院

CLIP当RNN用入选CVPR：无需训练即可分割无数概念｜牛津大学&谷歌研究院

PHPz

发布： 2024-06-09 12:53:28

原创

415 人浏览过

循环调用CLIP，无需额外训练就有效分割无数概念。

包括电影动漫人物，地标，品牌，和普通类别在内的任意短语。

CLIP当RNN用入选CVPR：无需训练即可分割无数概念｜牛津大学&谷歌研究院

牛津大学与谷歌研究院联合团队的这项新成果，已被CVPR 2024接收，并开源了代码。

CLIP当RNN用入选CVPR：无需训练即可分割无数概念｜牛津大学&谷歌研究院

团队提出名为CLIP as RNN（简称CaR）的新技术，解决了开放词汇量图像分割领域中的几个关键问题：

无需训练数据：传统方法需要大量的掩膜注释或图像-文本数据集进行微调，CaR技术则无需任何额外的训练数据即可工作。
开放词汇量的限制：预训练的视觉-语言模型（VLMs）在经过微调后，其处理开放词汇量的能力受到限制。CaR技术保留了VLMs的广泛词汇空间。
对非图像中概念的文本查询处理：在没有微调的情况下，VLMs难以对图像中不存在的概念进行准确分割，CaR通过迭代过程逐步优化，提高了分割质量。

受RNN启发，循环调用CLIP

要理解CaR的原理，需要先回顾一下循环神经网络RNN。

RNN引入了隐藏状态（hidden state）的概念，就像是一个“记忆体”，存储了过去时间步的信息。而每个时间步共享同一组权重，可以很好地建模序列数据。

受RNN启发，CaR也设计成循环的框架，由两部分组成：

掩膜提议生成器：借助CLIP为每个文本查询生成一个mask。
掩膜分类器：再用一个CLIP模型，评估生成的每个mask和对应的文本查询的匹配度。如果匹配度低，就把那个文本查询剔除掉。

就这样反复迭代下去，文本查询会越来越精准，mask的质量也会越来越高。

最后当查询集合不再变化，就可以输出最终的分割结果了。

CLIP当RNN用入选CVPR：无需训练即可分割无数概念｜牛津大学&谷歌研究院

之所以要设计这个递归框架，是为了最大限度地保留CLIP预训练的”知识”。

CLIP预训练中见过的概念可是海量，涵盖了从名人、地标到动漫角色等方方面面。如果在分割数据集上微调，词汇量势必会大幅缩水。

例如“分割一切”SAM模型就只能认出一瓶可口可乐，百事可乐是一瓶也不认了。

CLIP当RNN用入选CVPR：无需训练即可分割无数概念｜牛津大学&谷歌研究院

但是直接拿CLIP做分割，效果又不尽如人意。

这是因为CLIP的预训练目标本来就不是为密集预测设计的。尤其是当图像中不存在某些文本查询时，CLIP很容易生成一些错误的mask。

CaR巧妙地通过RNN式的迭代来解决这个问题。通过反复评估、筛选查询，同时完善mask，最终实现了高质量的开放词汇分割。

最后再来跟随团队的解读，了解一下CaR框架的细节。

CaR技术细节

CLIP当RNN用入选CVPR：无需训练即可分割无数概念｜牛津大学&谷歌研究院

循环神经网络框架：CaR采用了一个新颖的循环框架，通过迭代过程不断优化文本查询与图像之间的对应关系。
两阶段分割器：由掩膜提议生成器和掩膜分类器组成，均基于预训练的CLIP模型构建，且权重在迭代过程中保持不变。
掩膜提议生成：使用gradCAM技术，基于图像和文本特征的相似度得分来生成掩膜提议。
视觉提示：应用如红圈、背景模糊等视觉提示，以增强模型对图像特定区域的关注。
阈值函数：通过设置相似度阈值，筛选出与文本查询对齐程度高的掩膜提议。
后处理：使用密集条件随机场（CRF）和可选的SAM模型进行掩膜细化。

通过这些技术手段，CaR技术在多个标准数据集上实现了显着的性能提升，超越了传统的零样本学习方法，并在与进行了大量数据微调的模型相比时也展现出了竞争力。如下表所示，尽管完全无需额外训练及微调，CaR在零样本语义分割的8个不同指标上表现出比之前在额外数据上进行微调过的方法更强的性能。

CLIP当RNN用入选CVPR：无需训练即可分割无数概念｜牛津大学&谷歌研究院

作者还测试了CaR在零样本Refering segmentation的效果，CaR也表现出了相较之前零样本的方法表现出更强的性能。

CLIP当RNN用入选CVPR：无需训练即可分割无数概念｜牛津大学&谷歌研究院

综上所述，CaR（CLIP as RNN）是一种创新的循环神经网络框架，能够在无需额外训练数据的情况下，有效地进行零样本语义和指代图像分割任务。它通过保留预训练视觉-语言模型的广泛词汇空间，并利用迭代过程不断优化文本查询与掩膜提议的对齐度，显着提升了分割质量。

CaR的优势在于其无需微调、处理复杂文本查询的能力和对视频领域的扩展性，为开放词汇量图像分割领域带来了突破性进展。

论文链接：https://arxiv.org/abs/2312.07661。
项目主页：https://torrvision.com/clip_as_rnn/。

以上是CLIP当RNN用入选CVPR：无需训练即可分割无数概念｜牛津大学&谷歌研究院的详细内容。更多信息请关注PHP中文网其他相关文章！

相关标签：

神经网络 clip CaR技术

来源：51cto.com

上一篇：支持合成一分钟高清视频，华科等提出人类跳舞视频生成新框架UniAnimate 下一篇：拿纱布、抓针头，英伟达与多所高校合作，开发手术机器人

本站声明

本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

作者最新文章

编码的关键：为初学者释放 C 的力量

2024-10-13 11:44:01
使用 PHP 和 MySQL 将您的网站连接到数据库

2024-10-13 09:56:31
使用 Python 解决问题：作为初学者，解锁强大的解决方案

2024-10-11 20:58:41
Python 的力量，简单：一种适合初学者的编程方法

2024-10-11 16:53:11
PHP 和社交媒体：将您的网站与世界融为一体

2024-10-11 11:54:51
使用 PHP 的动态图像画廊：在线展示您的作品

2024-10-10 16:21:01
使用 PHP 构建 API 和 Web 服务

2024-10-10 15:18:02
揭秘 Java：为新程序员提供一条清晰、简单的道路

2024-10-10 13:34:01
使用 C 创建游戏和图形：有趣且实用的介绍

2024-10-10 13:26:26
王者荣耀程咬金怎么玩？

2024-10-10 11:38:42

最新问题

在网络应用程序中显示版本信息的最佳实践是什么？我正在开发一个网络应用程序。在网络应用程序中显示版本信息的最佳实践是什么？我正在使用语义版本控制，并且我已经有了semver，例如1.2.0但我很好奇在哪里显示它的最佳方式以及如何...

来自于 2024-04-06 19:13:16

0

2

476

使用SCSS生成默认值和CSS变量我正在实现网站样式。出于遗留支持的原因，我需要支持IE11，至少一段时间。出于工作流程和我的理智原因，我想尽可能使用css变量。我已经研究过这个解决方案，它会生成一些有效的东西，但...

来自于 2024-04-06 17:46:54

0

1

355

为什么'Cookie”请求头中的cookie数量超过'set-cookie”响应头中设置的cookie数量？我是一个网络爬虫的新手，所以我对http请求的了解很浅。当我检查我发送到某个网站的某些请求时，比如添加到购物车，开发工具中显示请求的“Cookie”头中有更多的值，这些值是由“se...

来自于 2024-04-05 14:52:06

0

1

3571

推出一款透明浏览器，提升Web应用和PWA体验【支持静态HTML、CSS和JavaScript】【让用户在我们的Web应用/PWA中查看桌面壁纸】我是一个初级前端开发者和设计师，目前正在使用socket开发一个网络应用程序（聊天）。我和我的朋友使用的语言有：Scala，HTML，CSS，JavaScript。我正在处理HTM...

来自于 2024-04-05 13:50:12

0

1

1367

按钮点击时，JavaScript函数无效我已经在互联网上搜索并尝试了很多方法，但是在一个相对简单的问题上卡住了。下面的代码是我问题的全部范围<script>//Functiontoeventuallycopy...

来自于 2024-04-05 13:14:53

0

2

1433

相关专题

更多>

热门推荐

热门教程

更多>

相关教程

热门推荐

最新课程

最新ThinkPHP 5.1全球首发视频教程(60天成就PHP大牛线上培训班课)

1424505
php入门教程之一周学会PHP

4270940
JAVA 初级入门视频教程

2550338
小甲鱼零基础入门学习Python视频教程

508369
PHP 零基础入门教程

863882

最新下载

更多>

网站特效

网站源码

网站素材

前端模板