搜索历史

清空

搜索热词

0

聊天消息
系统消息
评论与回复

查看更多

查看更多

查看更多

VIP于到期续费

登录后你可以

下载海量资料
学习在线课程
观看技术视频
写文章/发帖/加入社区

会员中心

创作中心

发布

创作活动

完善资料让更多小伙伴认识你，还能领取20积分哦，立即完善>

3天内不再提示

理解指向，说出坐标，Shikra开启多模态大模型参考对话新维度

在人类的日常交流中，经常会关注场景中不同的区域或物体，人们可以通过说话并指向这些区域来进行高效的信息交换。这种交互模式被称为参考对话（Referential Dialogue）。

如果 MLLM 擅长这项技能，它将带来许多令人兴奋的应用。例如，将其应用到 Apple Vision Pro 等混合现实 (XR) 眼镜中，用户可以使用视线注视指示任何内容与 AI 对话。同时 AI 也可以通过高亮等形式来指向某些区域，实现与用户的高效交流。

本文提出的Shikra 模型，就赋予了 MLLM 这样的参考对话能力，既可以理解位置输入，也可以产生位置输出。

论文地址：http://arxiv.org/abs/2306.15195
代码地址：https://github.com/shikras/shikra

核心亮点

Shikra 能够理解用户输入的 point/bounding box，并支持 point/bounding box 的输出，可以和人类无缝地进行参考对话。

Shikra 设计简单直接，采用非拼接式设计，不需要额外的位置编码器、前 / 后目标检测器或外部插件模块，甚至不需要额外的词汇表。

如上图所示，Shikra 能够精确理解用户输入的定位区域，并能在输出中引用与输入时不同的区域进行交流，像人类一样通过对话和定位进行高效交流。

如上图所示，Shikra 不仅具备 LLM 所有的基本常识，还能够基于位置信息做出推理。

如上图所示，Shikra 可以对图片中正在发生的事情产生详细的描述，并为参考的物体生成准确的定位。

尽管Shikra没有在 OCR 数据集上专门训练，但也具有基本的 OCR 能力。

更多例子

其他传统任务

方法

模型架构采用 CLIP ViT-L/14 作为视觉主干，Vicuna-7/13B 作为基语言模型，使用一层线性映射连接 CLIP 和 Vicuna 的特征空间。

Shikra 直接使用自然语言中的数字来表示物体位置，使用 [xmin, ymin, xmax, ymax] 表示边界框，使用 [xcenter, ycenter] 表示区域中心点，区域的 xy 坐标根据图像大小进行归一化。每个数字默认保留 3 位小数。这些坐标可以出现在模型的输入和输出序列中的任何位置。记录坐标的方括号也自然地出现在句子中。

实验结果

Shikra 在传统 REC、VQA、Caption 任务上都能取得优良表现。同时在 PointQA-Twice、Point-V7W 等需要理解位置输入的 VQA 任务上取得了 SOTA 结果。

本文使用 POPE benchmark 评估了 Shikra 产生幻觉的程度。Shikra 得到了和 InstrcutBLIP 相当的结果，并远超近期其他 MLLM。

思想链（CoT），旨在通过在最终答案前添加推理过程以帮助 LLM 回答复杂的 QA 问题。这一技术已被广泛应用到自然语言处理的各种任务中。然而如何在多模态场景下应用 CoT 则尚待研究。尤其因为目前的 MLLM 还存在严重的幻视问题，CoT 经常会产生幻觉，影响最终答案的正确性。通过在合成数据集 CLEVR 上的实验，研究发现，使用带有位置信息的 CoT 时，可以有效减少模型幻觉提高模型性能。

结论

本文介绍了一种名为 Shikra 的简单且统一的模型，以自然语言的方式理解并输出空间坐标，为 MLLM 增加了类似于人类的参考对话能力，且无需引入额外的词汇表、位置编码器或外部插件。

THE END

原文标题：理解指向，说出坐标，Shikra开启多模态大模型参考对话新维度

文章出处：【微信公众号：智能感知与物联网技术研究所】欢迎添加关注！文章转载请注明出处。

声明：本文内容及配图由入驻作者撰写或者入驻合作网站授权转载。文章观点仅代表作者本人，不代表电子发烧友网立场。文章及其配图仅供工程师学习之用，如有内容侵权或者其他违规问题，请联系本站处理。举报投诉

物联网

物联网

+关注

关注
2933

文章
46463

浏览量
395652

原文标题：理解指向，说出坐标，Shikra开启多模态大模型参考对话新维度

文章出处：【微信号：tyutcsplab，微信公众号：智能感知与物联网技术研究所】欢迎添加关注！文章转载请注明出处。

评论

智能感知与物联网技术研究所
专栏

0 文章 0 阅读 0 粉丝 0 点赞

关注个人主页

Hot 北斗导航真实的发展情况怎样？还面临哪些问题？
Hot 盘点北斗卫星导航系统在各行业的应用

New 一种基于正交与缩放变换的大模型量化方法
New 大模型的数学能力或许一直都在关键在于如何唤醒它

精选推荐
更多

文章

资料

帖子

断电 0 秒恐慌！树莓派 UPS 终极指南！

上海晶珩电子科技有限公司
19小时前

317 阅读

揭秘！基于RT-Thread探究“优先级反转”下的任务调度究竟是什么样的？| 技术集结

RT-Thread官方账号
20小时前

306 阅读

三种功率器件的区别解析

芯长征科技
1天前

865 阅读

理想i8的LPM功率模块设计解析

芯长征科技
1天前

1265 阅读

一文详解物理层编码技术NRZ和PAM4

是德科技KEYSIGHT
1天前

822 阅读

数字信号处理学习指南与习题讲解

66717737
3.06 MB

免费

0下载

印制电路板通孔的电镀技术

转角┛邂逅←
413 KB

免费

0下载

Hi3518EV300芯片驱动软件(媒体驱动子目录、用户态库子目录)

姚小熊27
8.81 MB

免费

1下载

Kruise Kubernetes应用负载管理

吴湛
17.80 MB

免费

0下载

M3U8-Downloader HLS视频流下载工具

李春梅
12.84 MB

2积分

1下载

【嘉楠堪智K230开发板试用体验】CanMV K230 环境监测

ouxiaolong
1天前

160 阅读

【嘉楠堪智K230开发板试用体验】CanMV K230 读取AHT10

ouxiaolong
2天前

171 阅读

【嘉楠堪智K230开发板试用体验】CanMV K230 MQTT通信

ouxiaolong
2天前

182 阅读

【「开关电源控制环路设计：Christophe Basso 的实战秘籍」阅读体验】+第三章三个补偿器

jf_35475674
1天前

227 阅读

【「开关电源控制环路设计：Christophe Basso 的实战秘籍」阅读体验】+第二章开环系统

jf_35475674
2天前

191 阅读

推荐专栏
更多

企业产品

资料

方案
更多

abg欧博（原“华强聚丰”）：

电子发烧友

abg欧博开发

abg欧博电路(原"华强PCB")

abg欧博商城(原"华强芯城")

abg欧博智造

My ElecFans

APP
网站地图

设计技术

可编程逻辑

电源/新能源

MEMS/传感技术

测量仪表

嵌入式技术

制造/封装

模拟技术

RF/无线

接口/总线/驱动

处理器/DSP

EDA/IC设计

存储技术

光电显示

EMC/EMI设计

连接器

行业应用

LEDs

汽车电子

音视频及家电

通信网络

医疗电子

人工智能

虚拟现实

可穿戴设备

机器人

安全设备/系统

军用/航空电子

移动通信

工业控制

便携设备

触控感测

物联网

智能电网

区块链

新科技

特色内容

专栏推荐

学院

设计资源

设计技术

电子百科

电子视频

元器件知识

工具箱

VIP会员

最新技术文章

产品地图

品牌地图

社区

小组

论坛

问答

评测试用

企业服务

产品

资料

文章

方案

企业

供应链服务

硬件开发

abg欧博电路

abg欧博商城

abg欧博智造

nextPCB

BOM配单

媒体服务

网站广告

在线研讨会

活动策划

新闻发布

新品发布

小测验

设计大赛

abg欧博

关于我们

投资关系

新闻动态

加入我们

联系我们

举报投诉

社交网络

微博

移动端

发烧友APP

硬声APP

WAP

联系我们

广告合作

王婉珠：wangwanzhu@elecfans.com

内容合作

黄晶晶：huangjingjing@elecfans.com

内容合作（海外）

张迎辉：mikezhang@elecfans.com

供应链服务 PCB/IC/PCBA

江良华：lanhu@huaqiu.com

投资合作

曾海银：zenghaiyin@huaqiu.com

社区合作

刘勇：liuyong@huaqiu.com

关注我们的微信

下载发烧友APP

电子发烧友观察

电子工程师社区

1-32层PCB打样·中小批量

元器件现货·全球代购·SmartBOM

SMT贴片·PCBA加工

PCB Manufacturer

abg欧博简介

企业动态

联系我们

企业文化

企业宣传片

加入我们

版权所有 ? 湖南abg欧博数字科技有限公司

长沙市望城经济技术开发区航空路6号手机智能终端产业园2号厂房3层（0731-88081133）
电子发烧友 （电路图） 湘公网安备43011202000918 工商网监湘ICP备2023018690号-1