文章主题:关键词:Stable Diffusion, 大脑视觉信号, 图像重建, AI技术

666AI工具大全,助力做AI时代先行者!

丰色 萧箫 发自 凹非寺

量子位 | 公众号 QbitAI

“现在Stable Diffusion已经能重建大脑视觉信号了!”

就在昨晚,一个听起来细思极恐的“AI读脑术”研究,在网上掀起轩然大波:

1701778318193.jpg

这项研究声称,只需用fMRI(功能磁共振成像技术,相比sMRI更关注功能性信息,如脑皮层激活情况等)扫描大脑特定部位获取信号,AI就能重建出我们看到的图像!

1701778318909.jpg

例如这是一系列人眼看到的图像,包括戴着蝴蝶结的小熊、飞机和白色钟楼:

1701778319470.jpg

AI看了眼人脑信号后,立马就给出这样的结果,属实把该抓的重点全都抓住了:

1701778320373.jpg

再发展一步,这不就约等于哈利波特里的读心术了吗??

1701778321140.jpg

更有网友感到惊叹:如果说ChatGPT开放API是件大事,那这简直称得上疯狂。

1701778321507.jpg

所以,这究竟是怎么一回事?

用Stable Diffusion可视化人脑信号

这项研究来自日本大阪大学,目前已经被CVPR 2023收录:

1701778321740.jpg

研究希望能从人类大脑活动中,重建高保真的真实感图像,来理解大脑、并解读计算机视觉模型和人类视觉系统之间的联系。

要知道,此前虽然有不少脑机接口研究,致力于从人类大脑活动中读取并重建信号,如意念打字等。

然而,从人类大脑活动中重建视觉信号——具有真实感的图像,仍然挑战极大。

在此之前,UC伯克利进行了一项相关研究。该研究试图复现一张人眼所看到的飞机片段,然而,计算机生成的图像却几乎无法辨认出飞机的特性。

1701778322227.jpg图源UC伯克利研究Reconstructing Visual Experiences from Brain Activity Evoked by Natural Movies

这次,研究人员重建信号选用的AI模型,是这一年多在图像生成领域地位飞升的扩散模型

当然,更准确地说是基于潜在扩散模型(LDM)——Stable Diffusion。

我们的整体研究思路是,依托于Stable Diffusion,构建一种依赖于人类思维活动信号的噪声消除可视化技术。

它不需要在复杂的深度学习模型上进行训练或做精细的微调,只需要做好fMRI(功能磁共振成像技术)成像到Stable Diffusion中潜在表征的简单线性映射关系就行。

它的概览框架是这样的,看起来也非常简单:

仅由1个图像编码器、1个图像解码器,外加1个语义解码器组成。

1701778322664.jpg

具体怎么work?

如下图所示,第一部分为本研究用到的LDM示意图。

其中ε代表图像编码器,D代表图像解码器,而τ是一个文本编码器(CLIP)

1701778323005.jpg

重点是解码分析,如下图所示,模型依次从大脑早期(蓝色)和较高(黄色)视觉皮层内的fMRI信号中,解码出重建图像(z)和相关文本c的潜在表征。

然后将这些潜在表征当作输入,就可以得到模型最终复现出来的图像Xzc。

1701778323374.jpg

最后还没有完,如编码分析示意图,作者还构建了一个编码模型,用来预测LDM不同组件(包括图像z、文本c和zc)所对应的fMRI信号,它可以用来理解Stable Diffusion的内部过程。

1701778323732.jpg

可以看到,采用了zc的编码模型在大脑后部视觉皮层产生的预测精确度是最高的。(zc是与c进行交叉注意的反向扩散后,z再添加噪声的潜在表征)

1701778324156.jpg

相比其它两者,它生成的图像既具有高语义保真度,分辨率也很高。

1701778324979.jpg

还有用GAN重建人脸图像的

看完这项研究,已经有网友想到了细思极恐的东西:

这个AI虽然只是复制了“眼睛”所看到的东西。

但是否会有一天,AI能直接从人脑的思维、甚至是记忆中重建出图像或文字?

1701778325703.jpg

“语言的用处不再存在了”

1701778326962.jpg

于是有网友进一步想到,如果能读取记忆的话,那么目击证人的证词似乎也会变得更可靠了:

1701778327201.jpg

还别说,就在去年真有一项研究基于GAN,通过fMRI收集到的大脑信号重建看到的人脸图像:

1701778327498.jpg

不过,重建出来的效果似乎不怎么样……

1701778327837.jpg

显然,在人脸这种比较精细的图像生成上,AI“读脑术”还有很长一段路要走。

对于这种大脑信号重建的研究,也有网友提出了质疑。

例如,是否只是AI从训练数据集中提取出了相似的数据?

1701778328049.jpg

对此有网友回复表示,论文中的训练数据集和测试集是分开的:

1701778328479.jpg

作者们也在项目主页中表示,代码很快会开源。可以先期待一下~

1701778328771.jpg

作者介绍

本研究仅两位作者。

Yu Takagi是一位新晋的大阪大学助理教授,自2021年起专注于计算神经科学和人工智能领域的交叉研究。

近期,他在牛津大学人类认知中心与东京大学心理学系共同应用机器学习技术,深入探讨了复杂决策过程中动态计算的本质。

大阪大学教授Shinji Nishimoto,同时担任日本脑信息通信融合研究中心首席研究员,是一位颇具影响力的专业人士。

研究方向为定量理解大脑中的视觉和认知处理,谷歌学术引用3000+次。

那么,你觉得这波AI重建图像的效果如何?

项目地址:https://sites.google.com/view/stablediffusion-with-brain/

参考链接:[1]https://twitter.com/SmokeAwayyy/status/1631474973243236354[2]https://twitter.com/blader/status/1631543565305405443[3]https://news.berkeley.edu/2011/09/22/brain-movies/[4]https://www.nature.com/articles/s41598-021-03938-w

「中国AIGC产业峰会」启动

邀您共襄盛举

「中国AIGC产业峰会」即将在今年3月举办,峰会将邀请AIGC产业相关领域的专家学者,共同探讨生成新世界的过去、现在和未来。

峰会上还将发布《中国AIGC产业全景报告暨AIGC 50》,全面立体描绘我国当前AIGC产业的竞争力图谱。点击链接或下方图片查看大会详情:

被ChatGPT带飞的AIGC如何在中国落地?量子位邀你共同参与中国AIGC产业峰会

点这里?关注我,记得标星哦~

一键三连「分享」、「点赞」和「在看」

科技前沿进展日日相见 ~ 

关键词:Stable Diffusion, 大脑视觉信号, 图像重建, AI技术

aigc666aigc999_0.jpg

AI时代,拥有个人微信机器人AI助手!AI时代不落人后!

免费ChatGPT问答,办公、写作、生活好得力助手!

搜索微信号aigc666aigc999或上边扫码,即可拥有个人AI助手!

Leave a Reply

Your email address will not be published. Required fields are marked *