大模型被偷家?CNN结合多模态!

embedded/2025/2/15 18:44:49/

2025深度学习发论文&模型涨点之—— CNN+多模态

卷积神经网络是一种特殊类型的神经网络,其主要结构包括卷积层、池化层、全连接层和输出层。卷积层通过卷积操作学习图像的特征,池化层通过下采样操作减少参数数量,全连接层和输出层通过分类或回归来完成任务。

多模态学习是指在不同类型数据之间学习共享表示的过程。多模态数据可以是图像、文本、音频等,每种模态都有其特定的表示和特征。因此,在多模态学习中,我们需要设计一种能够处理不同模态数据并在不同模态之间共享知识的算法。

我整理了一些 CNN+多模态论文+代码】合集,需要的同学公人人人号【AI创新工场】自取。

论文精选

论文1:

Change Detection between Multimodal Remote Sensing Data Using Siamese CNN

使用孪生卷积神经网络进行多模态遥感数据的变化检测

方法

多模态数据转换:将3D激光扫描点云和2D影像转换为2.5D数字表面模型(DSM),进一步转换为2D灰度图像块。

孪生卷积神经网络(Siamese CNN):使用S-CNN架构,通过比较两个输入图像块的特征向量来检测变化。

预处理和数据增强:对图像块进行数据增强(如翻转和旋转),以平衡正负样本数量。

对象级变化检测:将检测到的变化图像块分组并验证为单个对象的变化,利用点云分割和归一化植被指数(nEGI)进行验证。

图片

创新点

多模态数据融合:提出了一种将3D激光扫描和2D影像融合的框架,解决了多模态数据特性差异带来的挑战。

孪生卷积神经网络的应用:首次将S-CNN应用于多模态遥感数据变化检测,能够有效区分真实变化和由数据误差引起的虚假变化。

性能提升:实验结果表明,该方法在变化检测任务中能够正确分类86.4%的图像块对,显著优于传统方法。

图片

论文2:

CNN‑Siam: multimodal siamese CNN‑based deep learning approach for drug‒drug interaction prediction

CNN‑Siam:基于多模态孪生卷积神经网络的药物-药物相互作用预测深度学习方法

方法

多模态数据表示:将药物的化学结构、靶点和酶信息通过一热编码和Jaccard相似性转换为特征向量。

孪生卷积神经网络(Siamese CNN):使用S-CNN架构,通过两个共享权重的CNN分支分别学习药物对的特征表示,并将结果输入到多层感知机中进行分类。

优化算法:结合RAdam和LookAhead优化算法,提高模型训练的稳定性和收敛速度。

损失函数:采用Focal Loss,重点关注难以分类的样本,提升模型对不平衡数据集的分类能力。

图片

创新点

多模态数据融合:通过S-CNN架构同时学习药物对的多模态信息,提升了特征表示的准确性。

优化算法的改进:使用RAdam和LookAhead优化算法,显著提升了模型的训练效率和性能。

性能提升:在基准数据集上,CNN-Siam的AUPR分数达到0.96,准确率达到92%,相比现有最佳方法(准确率为86%)有显著提升。

图片

论文3:

Multimodal Convolutional Neural Networks for Matching Image and Sentence

用于匹配图像和句子的多模态卷积神经网络

方法

图像和句子的卷积神经网络(CNN):使用图像CNN编码图像内容,匹配CNN建模图像和句子的联合表示。

多模态匹配:通过不同层次(单词、短语、句子)的语义片段与图像的交互,学习图像和句子之间的匹配关系。

多层感知机(MLP):将匹配CNN生成的联合表示输入到MLP中,生成最终的匹配分数。

多模态卷积层:设计了多模态卷积层,使图像与句子的语义片段在不同层次上进行交互。

图片

创新点

多模态匹配的层次化处理:通过单词、短语和句子三个层次的匹配关系,全面捕捉图像和句子之间的语义关联。

性能提升:在Flickr8K和Flickr30K数据集上,m-CNN模型显著优于现有最佳方法。例如,在Flickr30K数据集上,m-CNNENS(使用VGG初始化)的R@10指标达到74.9%,相比其他方法有显著提升。

卷积架构的应用:首次将卷积架构应用于图像和句子匹配问题,为多模态匹配提供了更强大的表示能力。

图片


http://www.ppmy.cn/embedded/162478.html

相关文章

DeepSeek整理PDF文档以思维导图方式展示

目录 一、DeepSeek网页版将PDF文档整理成思维导图 二、将输出的markdown代码复制到文本文件中,将文本文件后缀名修改为.md 三、在思维导图中打开md文件 1、思维导图工具软件 2、新建思维导图文件 3、导入markdown的md文件 4、最终生成思维导图文件 5、思维导…

RunLoop 详解

概述: RunLoop 是一个核心的 iOS 机制,它是 事件循环机制 的实现,负责管理线程的执行和调度。RunLoop 能够持续监听输入事件(如用户触摸、定时器、网络请求等)并分发给相应的处理方法,从而保持应用程序持续…

c# sqlite 批量生成insert语句的函数

函数开始 using System; using System.Collections.Generic; using System.Text;public class SqliteHelper {public static List<string> GenerateInsertStatements(string tableName, List<string> columns, List<List<object>> data){List<stri…

vue星空背景组件

组件 <template><div class"starlit_sky"><div class"layer1"></div><div class"layer2"></div><div class"layer3"></div><slot name"contentmain"></slot>…

【工具】在idea运行go后端

场景&#xff1a;从gitee仓库下载一个go语言前后端分离项目&#xff0c;想跑通前后端 ---------------------------------------------------------------------------------------------------------------------- 后端 1.下载插件 在idea的setting里面输入go&#xff0c;…

如何实现对 ELK 各组件的监控?试试 Metricbea

上一章基于 Filebeat 的日志收集使用Filebeat收集文件中的日志&#xff0c;而Metricbeat则是收集服务器存活性监测和系统指标的指标。 1. Filebeat和Metricbeat的区别 特性FilebeatHeartbeat作用收集和转发日志监测服务可用性数据来源服务器上的日志文件远程主机、API、服务主…

21爬虫:使用playwright接管本地已经登录淘宝的浏览器并查找python相关店铺信息

1.playwright如何接管本地浏览器 &#xff08;1&#xff09;首先找到电脑上安装的Chrome浏览器可执行程序的完整路径&#xff1a; Mac电脑上可执行程序的完整路径为&#xff1a; /Applications/Google Chrome.app/Contents/MacOS/Google Chrome windows系统的电脑上查找可执行…

【C语言】C语言 停车场管理系统的设计与实现(源码)【独一无二】

&#x1f449;博__主&#x1f448;&#xff1a;米码收割机 &#x1f449;技__能&#x1f448;&#xff1a;C/Python语言 &#x1f449;专__注&#x1f448;&#xff1a;专注主流机器人、人工智能等相关领域的开发、测试技术。 系列文章目录 目录 系列文章目录一、设计要求二、设…