讲师中心微信公众号

首页

文章

后端开发 web前端数据库开发工具 php框架常见问题科技 Java 系统教程电脑教程硬件教程手机教程软件教程游戏教程自媒体新闻

专题

后端开发 web前端数据库开发工具 php框架科技 Java 系统教程电脑教程硬件教程手机教程软件教程游戏教程新闻

AI工具

AI 聊天问答 Agent智能体 AI 文本写作 AI 绘画作图 AI 设计工具 AI 视频创作 AI 音频制作 AI 办公学习 AI 编程开发 Prompt指令

学习

大前端后端开发数据库移动端运维开发计算机基础

编程手册

大前端后端开发数据库移动端运维开发计算机基础

下载

js特效网站源码工具下载类库下载网站素材学习资源插件扩展手机游戏

最近更新

0

0

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

WBOY

发布时间：2023-09-03 13:01:08

|

986人浏览过

|

来源于51CTO.COM

转载

阿里巴巴开源了一个新的大模型，非常令人兴奋~

继通义千问-7B（Qwen-7B）之后，阿里云又推出了大规模视觉语言模型Qwen-VL，并且一上线就直接开源。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

Qwen-VL是一种基于通义千问-7B的多模态大模型，具体而言，它支持图像、文本和检测框等多种输入，并且不仅仅可以输出文本，还可以输出检测框

举个例子，我们输入一张阿尼亚的图片，通过问答的形式，Qwen-VL-Chat能够总结图片内容，并且能够准确地定位到图片中的阿尼亚

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

在测试任务中，Qwen-VL展现出了“六边形战士”的实力，在四大类多模态任务的标准英文测评中（Zero-shot Caption/VQA/DocVQA/Grounding）上，都取得了最先进的成果

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

一经开源消息传出，立刻引起了广泛关注

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

让我们一起来看看具体的表现如何吧！

首个支持中文开放域定位的通用模型

首先，让我们来整体看一下Qwen-VL系列模型的特点：

多语言对话：支持多语言对话，端到端支持图片里中英双语的长文本识别；
多图交错对话：支持多图输入和比较，指定图片问答，多图文学创作等；
首个支持中文开放域定位的通用模型：通过中文开放域语言表达进行检测框标注，也就是能在画面中精准地找到目标物体；
细粒度识别和理解：相比于目前其它开源LVLM（大规模视觉语言模型）使用的224分辨率，Qwen-VL是首个开源的448分辨率LVLM模型。更高分辨率可以提升细粒度的文字识别、文档问答和检测框标注。

在不改变原意的情况下，需要重写的内容是：Qwen-VL可以在知识问答、图像问答、文档问答、细粒度视觉定位等场景中使用

例如，有一个外国朋友不懂中文去医院看病，对着导览图感到困惑，不知道如何前往相应的科室，可以直接将图和问题交给Qwen-VL，让它根据图片信息充当翻译

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

再次进行多图输入和比较的测试

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

尽管没有认出阿尼亚，但情绪判断确实相当准确（手动狗头）

在视觉定位能力方面，即使图片非常复杂且人物众多，Qwen-VL仍然可以根据要求准确地找出绿巨人和蜘蛛侠

讯飞智作-讯飞配音

讯飞智作-讯飞配音

讯飞智作是一款集AI配音、虚拟人视频生成、PPT生成视频、虚拟人定制等多功能的AI音视频生产平台。已广泛应用于媒体、教育、短视频等领域。

下载

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

Qwen-VL在技术细节上以Qwen-7B为基座语言模型，并通过引入视觉编码器ViT和位置感知的视觉语言适配器，使得模型能够支持视觉信号输入

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

具体的训练过程分为三步：

预训练：只优化视觉编码器和视觉语言适配器，冻结语言模型。使用大规模图像-文本配对数据，输入图像分辨率为224x224。
多任务预训练：引入更高分辨率（448x448）的多任务视觉语言数据，如VQA、文本VQA、指称理解等，进行多任务联合预训练。
监督微调：冻结视觉编码器，优化语言模型和适配器。使用对话交互数据进行提示调优，得到最终的带交互能力的Qwen-VL-Chat模型。

在Qwen-VL的标准英文测评中，研究人员对四大类多模态任务（Zero-shot Caption/VQA/DocVQA/Grounding）进行了测试

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

根据结果显示，Qwen-VL在与同等尺寸的开源LVLM进行比较时取得了最佳效果

另外，研究人员构建了一套基于GPT-4打分机制的测试集TouchStone。

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

Qwen-VL-Chat在这项对比测试中取得了最先进技术水平（SOTA）

如果你对Qwen-VL感兴趣，你可以在魔搭社区和huggingface上找到demo来直接试玩。链接在文末提供

Qwen-VL支持研究人员和开发者进行二次开发，并且允许商业使用。但需要注意的是，如果要进行商业使用，需要先填写问卷申请

项目链接：https://modelscope.cn/models/qwen/Qwen-VL/summary
https://modelscope.cn/models/qwen/Qwen-VL-Chat/summary
https://huggingface.co/Qwen/Qwen-VL
https://huggingface.co/Qwen/Qwen-VL-Chat
https://github.com/QwenLM/Qwen-VL

请点击以下链接查看论文：https://arxiv.org/abs/2308.12966

相关文章

AI室内设计生成工具有哪些_一键生成装修效果图的AI工具推荐

ChatGPT求职指令大全：如何用AI通过大厂简历初筛

Gemini怎么用新功能图片理解_Gemini图片理解使用指南【方法】

lovemo怎么生成特定脸型 lovemo面部特征描述技巧【实用】

文心一言怎么制作PPT大纲快速生成演示文稿逻辑框架教程

相关标签:

通义千问 qwen

本站声明：本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

上一篇：华为云尤鹏：盘古大模型，共享智慧，服务行业下一篇：AI搜索功能正式加入，文心一言网页版全新上线

作者最新文章

提升效率的夸克浏览器AI搜索_夸克AI搜索高效使用秘籍

2025-10-17 16:12

夸克浏览器AI搜索功能详解_几个实用的夸克AI搜索技巧分享

2025-10-17 17:20

手机版夸克浏览器AI搜索设置_移动端夸克AI搜索使用全攻略

2025-10-17 23:58

夸克浏览器AI搜索深度体验_夸克AI搜索与其他AI的对比

2025-10-18 22:34

夸克浏览器AI搜索入口在哪_一文读懂夸克AI搜索如何激活

2025-10-19 09:25

夸克浏览器如何调用AI搜索_夸克AI搜索的快捷指令大全

2025-10-19 11:02

夸克浏览器一键启用AI搜索_带你体验夸克AI搜索的强大之处

2025-10-19 18:42

玩转夸克浏览器的AI搜索模式_夸克AI搜索新手入门操作指南

2025-10-20 09:50

夸克浏览器AI搜索最新版教学_探索夸克AI搜索的隐藏功能

2025-10-24 20:48

夸克浏览器怎么用AI搜索_夸克AI搜索正确提问方式教学

2025-10-25 23:12

热门AI工具

更多

DeepSeek

DeepSeek

幻方量化公司旗下的开源大模型平台

AI大模型

开放平台

豆包大模型

豆包大模型

字节跳动自主研发的一系列大型语言模型

AI大模型

通义千问

通义千问

阿里巴巴推出的全能AI助手

AI大模型

腾讯元宝

腾讯元宝

腾讯混元平台推出的AI助手

文档处理

Excel 表格

文心一言

文心一言

文心一言是百度开发的AI聊天机器人，通过对话可以生成各种形式的内容。

AI大模型

中文写作

讯飞写作

讯飞写作

基于讯飞星火大模型的AI写作工具，可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

中文写作

写作工具

即梦AI

即梦AI

一站式AI创作平台，免费AI图片和视频生成。

图片拼接

图画生成

ChatGPT

ChatGPT

最最强大的AI聊天机器人程序，ChatGPT不单是聊天机器人，还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

AI大模型

中文写作

智谱清言 - 免费全能的AI助手

智谱清言 - 免费全能的AI助手

智谱清言 - 免费全能的AI助手

AI大模型

PDF 文档

相关专题

更多

php源码安装教程大全

php源码安装教程大全

本专题整合了php源码安装教程，阅读专题下面的文章了解更多详细内容。

7

2025.12.31

php网站源码教程大全

php网站源码教程大全

本专题整合了php网站源码相关教程，阅读专题下面的文章了解更多详细内容。

4

2025.12.31

视频文件格式

视频文件格式

本专题整合了视频文件格式相关内容，阅读专题下面的文章了解更多详细内容。

7

2025.12.31

不受国内限制的浏览器大全

不受国内限制的浏览器大全

想找真正自由、无限制的上网体验？本合集精选2025年最开放、隐私强、访问无阻的浏览器App，涵盖Tor、Brave、Via、X浏览器、Mullvad等高自由度工具。支持自定义搜索引擎、广告拦截、隐身模式及全球网站无障碍访问，部分更具备防追踪、去谷歌化、双内核切换等高级功能。无论日常浏览、隐私保护还是突破地域限制，总有一款适合你！

7

2025.12.31

出现404解决方法大全

出现404解决方法大全

本专题整合了404错误解决方法大全，阅读专题下面的文章了解更多详细内容。

42

2025.12.31

html5怎么播放视频

html5怎么播放视频

想让网页流畅播放视频？本合集详解HTML5视频播放核心方法！涵盖<video>标签基础用法、多格式兼容（MP4/WebM/OGV）、自定义播放控件、响应式适配及常见浏览器兼容问题解决方案。无需插件，纯前端实现高清视频嵌入，助你快速打造现代化网页视频体验。

4

2025.12.31

关闭win10系统自动更新教程大全

关闭win10系统自动更新教程大全

本专题整合了关闭win10系统自动更新教程大全，阅读专题下面的文章了解更多详细内容。

3

2025.12.31

阻止电脑自动安装软件教程

阻止电脑自动安装软件教程

本专题整合了阻止电脑自动安装软件教程，阅读专题下面的文章了解更多详细教程。

3

2025.12.31

html5怎么使用

html5怎么使用

想快速上手HTML5开发？本合集为你整理最实用的HTML5使用指南！涵盖HTML5基础语法、主流框架（如Bootstrap、Vue、React）集成方法，以及无需安装、直接在线编辑运行的平台推荐（如CodePen、JSFiddle）。无论你是新手还是进阶开发者，都能轻松掌握HTML5网页制作、响应式布局与交互功能开发，零配置开启高效前端编程之旅！

2

2025.12.31

热门下载

更多

网站特效

/

网站源码

/

网站素材

/

前端模板

相关下载

更多

php商城系统

淘源码商城PHP淘宝查信誉

PHP房产程序[BBWPS]

PHP简约自动发卡平台个人版

ERMEB域名PHP离线网络授权系统

Difeye-敏捷的轻量级PHP框架

大泉州汽车网PHP整站程序

精品课程

更多

相关推荐

/

热门推荐

/

最新课程

Django 教程

Django 教程

共28课时 | 2.6万人学习

Go 教程

Go 教程

共32课时 | 3.2万人学习

TypeScript 教程

TypeScript 教程

共19课时 | 1.9万人学习

最新文章

更多

Lufe.ai：最佳AI翻译工具，快速、准确、免费

DaVinci Resolve 20：AI加持下的视频编辑新纪元

动物奇观：探索气球变身与动物认知乐趣

AI赋能客户服务：如何在不失人情味的情况下有效实施

Visual Studio 2026：AI 赋能的代码编写新纪元

企业营销新纪元：AI驱动的GTM团队构建与需求挖掘

AI 社交模拟：探索由 GPT 驱动的虚拟人生

AI情感分析管道：利用Blue Sky和Gemini预测股市趋势

AI Symptom Checker: 探索 Docas AI 在医疗健康领域的应用

Cursor AI代码编辑器：自动化测试与效率提升终极指南

关于我们免责申明举报中心意见反馈讲师合作广告合作最新更新: php中文网：公益在线php培训，帮助PHP学习者快速成长！; 关注服务号技术交流群

PHP中文网订阅号: 每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号

PHP学习

技术支持

返回顶部