社区学习工具库休闲

简体中文

首页 > 科技周边 > 人工智能 > 阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

WBOY

发布： 2023-09-03 13:01:08

转载

692 人浏览过

阿里巴巴开源了一个新的大模型，非常令人兴奋~

继通义千问-7B（Qwen-7B）之后，阿里云又推出了大规模视觉语言模型Qwen-VL，并且一上线就直接开源。

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

Qwen-VL是一种基于通义千问-7B的多模态大模型，具体而言，它支持图像、文本和检测框等多种输入，并且不仅仅可以输出文本，还可以输出检测框

举个例子，我们输入一张阿尼亚的图片，通过问答的形式，Qwen-VL-Chat能够总结图片内容，并且能够准确地定位到图片中的阿尼亚

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

在测试任务中，Qwen-VL展现出了“六边形战士”的实力，在四大类多模态任务的标准英文测评中（Zero-shot Caption/VQA/DocVQA/Grounding）上，都取得了最先进的成果

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

一经开源消息传出，立刻引起了广泛关注

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

让我们一起来看看具体的表现如何吧！

首个支持中文开放域定位的通用模型

首先，让我们来整体看一下Qwen-VL系列模型的特点：

多语言对话：支持多语言对话，端到端支持图片里中英双语的长文本识别；
多图交错对话：支持多图输入和比较，指定图片问答，多图文学创作等；
首个支持中文开放域定位的通用模型：通过中文开放域语言表达进行检测框标注，也就是能在画面中精准地找到目标物体；
细粒度识别和理解：相比于目前其它开源LVLM（大规模视觉语言模型）使用的224分辨率，Qwen-VL是首个开源的448分辨率LVLM模型。更高分辨率可以提升细粒度的文字识别、文档问答和检测框标注。

在不改变原意的情况下，需要重写的内容是：Qwen-VL可以在知识问答、图像问答、文档问答、细粒度视觉定位等场景中使用

例如，有一个外国朋友不懂中文去医院看病，对着导览图感到困惑，不知道如何前往相应的科室，可以直接将图和问题交给Qwen-VL，让它根据图片信息充当翻译

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

再次进行多图输入和比较的测试

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

尽管没有认出阿尼亚，但情绪判断确实相当准确（手动狗头）

在视觉定位能力方面，即使图片非常复杂且人物众多，Qwen-VL仍然可以根据要求准确地找出绿巨人和蜘蛛侠

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

Qwen-VL在技术细节上以Qwen-7B为基座语言模型，并通过引入视觉编码器ViT和位置感知的视觉语言适配器，使得模型能够支持视觉信号输入

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

具体的训练过程分为三步：

预训练：只优化视觉编码器和视觉语言适配器，冻结语言模型。使用大规模图像-文本配对数据，输入图像分辨率为224x224。
多任务预训练：引入更高分辨率（448x448）的多任务视觉语言数据，如VQA、文本VQA、指称理解等，进行多任务联合预训练。
监督微调：冻结视觉编码器，优化语言模型和适配器。使用对话交互数据进行提示调优，得到最终的带交互能力的Qwen-VL-Chat模型。

在Qwen-VL的标准英文测评中，研究人员对四大类多模态任务（Zero-shot Caption/VQA/DocVQA/Grounding）进行了测试

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

根据结果显示，Qwen-VL在与同等尺寸的开源LVLM进行比较时取得了最佳效果

另外，研究人员构建了一套基于GPT-4打分机制的测试集TouchStone。

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

Qwen-VL-Chat在这项对比测试中取得了最先进技术水平（SOTA）

如果你对Qwen-VL感兴趣，你可以在魔搭社区和huggingface上找到demo来直接试玩。链接在文末提供

Qwen-VL支持研究人员和开发者进行二次开发，并且允许商业使用。但需要注意的是，如果要进行商业使用，需要先填写问卷申请

项目链接：https://modelscope.cn/models/qwen/Qwen-VL/summary
https://modelscope.cn/models/qwen/Qwen-VL-Chat/summary
https://huggingface.co/Qwen/Qwen-VL
https://huggingface.co/Qwen/Qwen-VL-Chat
https://github.com/QwenLM/Qwen-VL

请点击以下链接查看论文：https://arxiv.org/abs/2308.12966

以上是阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行的详细内容。更多信息请关注PHP中文网其他相关文章！

相关标签：

模型开源

来源：51cto.com

上一篇：华为云尤鹏：盘古大模型，共享智慧，服务行业下一篇：AI搜索功能正式加入，文心一言网页版全新上线

本站声明

本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

作者最新文章

什么是 NullPointerException，如何修复它？

2024-10-22 09:46:29
从新手到程序员：您的旅程从 C 基础知识开始

2024-10-13 13:53:41
使用PHP解锁网络开发：初学者指南

2024-10-12 12:15:51
揭秘 C：为新程序员提供一条清晰简单的道路

2024-10-11 22:47:31
释放您的编码潜力：绝对初学者的 C 编程

2024-10-11 19:36:51
释放你内心的程序员：C 绝对初学者

2024-10-11 15:50:41
使用 C 自动化您的生活：适合初学者的脚本和工具

2024-10-11 15:07:41
PHP 变得简单：Web 开发的第一步

2024-10-11 14:21:21
使用 Python 构建任何东西：释放创造力的初学者指南

2024-10-11 12:59:11
编码的关键：为初学者释放 Python 的力量

2024-10-11 12:17:31

最新问题

在多个路由中声明的workerpool是否仍然可以保持其cpu使用率而不关心阈值我希望找到一个带有workerpool的node.js系统来处理CPU密集型任务，但是对于多条路由中的cpu使用情况，我有些困惑。一个场景是这样的：route1.js:constw...

来自于 2024-04-06 19:54:23

0

1

444

使用MySQL SQL查询计算另一张表中字段的总和我有一个这样的模式：具有属性“user_id”和“username”的用户表以及具有属性“customer_id”（user_id的FK）和“finalPrice”的订单表数据库架...

来自于 2024-04-06 19:39:29

0

1

441

无法从网站获取输入元素所以我试图从Twitter获取一个输入元素，但当我运行它时，它不断在节点终端中给我一个这样的错误，结果，由此代码创建的浏览器窗口将自行关闭，因为它找不到正确的输入选择器。如何获取正...

来自于 2024-04-06 18:59:57

0

1

442

在模板中使用在方法中定义的变量这是我第一次使用Vue（v2而不是v3），并且我一直在尝试在模板内使用变量（在方法内定义）。我的简化代码：<template><divclass="co...

来自于 2024-04-06 18:10:25

0

2

513

使用SCSS生成默认值和CSS变量我正在实现网站样式。出于遗留支持的原因，我需要支持IE11，至少一段时间。出于工作流程和我的理智原因，我想尽可能使用css变量。我已经研究过这个解决方案，它会生成一些有效的东西，但...

来自于 2024-04-06 17:46:54

0

1

355

相关专题

更多>

热门推荐

热门教程

更多>

相关教程

热门推荐

最新课程

最新ThinkPHP 5.1全球首发视频教程(60天成就PHP大牛线上培训班课)

1422657
php入门教程之一周学会PHP

4267516
JAVA 初级入门视频教程

2530152
小甲鱼零基础入门学习Python视频教程

506997
PHP 零基础入门教程

862159

最新下载

更多>

网站特效

网站源码

网站素材

前端模板