期刊文献+
共找到53篇文章
< 1 2 3 >
每页显示 20 50 100
面向多模态关联不确定性的视频描述方法 认领 引用
1
作者 姜文晖 官文彬 +3 位作者 黎海军 方承炀 方玉明 左一帆 《计算机学报》 EI CAS CSCD 北大核心 2026年第2期481-496,共16页
视频描述技术的核心在于构建输入视频到输出文本的映射关系。然而,受训练数据的标注噪声影响,视频与对应的文本描述之间存在关联的不确定性,具体体现在:1)对于视觉模态,视频中存在文本描述未涉及的视觉片段,且这些视觉片段在视频的时空... 视频描述技术的核心在于构建输入视频到输出文本的映射关系。然而,受训练数据的标注噪声影响,视频与对应的文本描述之间存在关联的不确定性,具体体现在:1)对于视觉模态,视频中存在文本描述未涉及的视觉片段,且这些视觉片段在视频的时空位置不确定;2)对于文本模态,局部文本错误地描述了视频中未出现的目标和事件,且这些错误在文本中出现的位置不确定。视频与文本描述的关联不确定性阻碍模型学习正确的跨模态语义关系,影响模型生成准确的视频描述。为解决以上挑战问题,本文提出一种多模态关联不确定性感知的视频描述方法。针对视觉模态的不确定性,提出一种文本内容感知的视频特征表达模型。通过帧聚类构建视频的场景原型,并基于场景原型与文本语义的相关性采样视频关键帧,形成与文本语义一致性高、冗余性低的关键帧序列,最终实现语义丰富、内容相关的视频表征。针对文本模态的不确定性,提出短语级质量感知的抗噪训练。联合建模文本标注的模态内语义关联性以及文本与视频内容的跨模态相关性,以无监督评估方式量化文本短语级标注的多维度质量,克服真值质量标签缺失条件下文本短语级质量评价的挑战。通过短语级质量指导视频描述模型的训练,抑制局部标注噪声的影响,充分利用了局部噪声数据的价值。所提方法可应用于大部分视频描述模型,在改善模型性能的同时不会增加测试时的计算量。本文以具有代表性的SwinBERT和VideoLLaMA2为基础模型,在MSR-VTT与MSVD数据集上开展实验。分析结果表明,该方法在多项评价指标上显著高于其他代表性方法。消融实验与定性分析也进一步佐证了本文方法可以有效克服多模态关联的不确定性。 展开更多
关键词 视频描述 多模态关联 场景原型 短语级质量评估 抗噪训练
暂未订购 下载PDF
YOLOv10-MTP:基于YOLOv10的自动驾驶多任务感知系统 认领 引用
2
作者 金彦亮 孙龙武 《工业控制计算机》 2026年第2期68-69,72,共2页
自动驾驶系统的核心在于高效、准确地感知环境。现有的多任务感知框架在目标检测、车道线检测和可行驶区域分割等任务中虽然取得了很好的性能指标,但在实时性和复杂场景理解方面仍存在局限。为此,提出了一种新型多任务感知模型——YOLOv... 自动驾驶系统的核心在于高效、准确地感知环境。现有的多任务感知框架在目标检测、车道线检测和可行驶区域分割等任务中虽然取得了很好的性能指标,但在实时性和复杂场景理解方面仍存在局限。为此,提出了一种新型多任务感知模型——YOLOv10-MTP(YOLOv10 Multi-Task Perception)。该模型基于YOLOv10骨干网络,并进一步引入稀疏自注意力模块(Sparse Self-attention,SSA),有效提升了实时性。YOLOv10-MTP还引入了图像字幕任务,进一步预训练YOLOv10,以增强其对复杂驾驶场景的理解能力,从而提升下游任务(目标检测、车道线检测和可行驶区域分割)的性能。实验结果表明,在BDD100K数据集上,YOLOv10-MTP在嵌入式设备上实现了40 fps的实时推理,且在各项任务中均取得了优异表现,Recall和mAP50得分显著提升,展示了模型在复杂场景下的理解能力和有效性。 展开更多
关键词 自动驾驶 多任务感知 目标检测 实例分割 图像字幕
暂未订购 下载PDF
基于场景概念引导特征融合的多波段图像描述生成方法 认领 引用
3
作者 明文超 蔺素珍 晋赞霞 《计算机应用》 CSCD 北大核心 2026年第5期1560-1567,共8页
现有的图像描述模型在处理复杂场景下的多波段图像时,由于多波段图像的特征在空间上存在显著差异,直接使用简单的交叉注意力难以有效地对齐和融合这些特征;而且多波段图像成像原理的不同以及场景的复杂性,导致模型难以捕捉关键的视觉语... 现有的图像描述模型在处理复杂场景下的多波段图像时,由于多波段图像的特征在空间上存在显著差异,直接使用简单的交叉注意力难以有效地对齐和融合这些特征;而且多波段图像成像原理的不同以及场景的复杂性,导致模型难以捕捉关键的视觉语义信息,生成的描述中会出现关键目标缺失、描述不完整的情况。针对上述问题,提出一种基于场景概念引导特征融合的多波段图像描述生成方法。首先,使用预训练的特征提取器Faster R-CNN(Faster Region-based Convolutional Neural Network)提取红外和可见光图像的区域特征,构建由场景概念引导的多波段特征对齐融合模块(FAFM);其次,为了提高模型对视觉语义信息的建模能力,设计概念引导模块(CGM)为图像检索场景概念并进行编码;最后,构建自适应的门控机制(AGM),当解码器在每个时间步生成单词时,模型可以根据不同情况动态调整多波段图像的融合特征与概念特征的权重,从而实现特征的融合。在可见光图像-红外图像描述数据集上的实验结果表明,所提方法在BLEU-4(BiLingual Evaluation Understudy with 4-grams)和CIDEr(Consensus-based Image Description Evaluation)指标上分别达到56.7%和119.5%,较次优方法分别提高了1.1个和2.9个百分点。可见,所提方法能有效提高多波段图像描述的准确度。 展开更多
关键词 图像描述生成 多波段图像 概念引导 特征融合 自适应门控
暂未订购 下载PDF
基于Transformer多特征融合的图像描述方法 认领 引用
4
作者 梁先达 曾上游 邱泓语 《计算机工程与应用》 EI CSCD 北大核心 2026年第6期184-193,共10页
现有的图像描述模型仅关注了网格特征或区域特征的单一应用,没有充分考虑图像中对象之间的空间相关性以及多特征融合对描述生成的重要性。针对这一问题,提出了一种基于Transformer多特征融合的图像描述方法。构建视觉特征提取器提取初... 现有的图像描述模型仅关注了网格特征或区域特征的单一应用,没有充分考虑图像中对象之间的空间相关性以及多特征融合对描述生成的重要性。针对这一问题,提出了一种基于Transformer多特征融合的图像描述方法。构建视觉特征提取器提取初级视觉特征,通过所构建空间增强注意力模块,实现网格视觉特征与空间信息有效结合,克服了在全局上下文中不能充分识别对象间空间关系的问题。为了解决多头注意力机制独立并行建模可能导致的图像元素语义关系特征遗漏问题,设计了多头关联注意力机制,有效地弥补了不同注意力通道间的元素语义关系。设计了多特征融合模块,通过动态调节不同特征对描述文本的影响,有效解决了多特征融合带来的语义噪声问题。通过在MSCOCO数据集上进行了广泛的实验,验证了所提出的改进方法的有效性。 展开更多
关键词 图像描述 Transformer 多特征融合 区域特征 网格特征 空间信息
暂未订购 下载PDF
基于深度特征多层融合的图像描述方法 认领 引用
5
作者 宋宇凡 钟志峰 +4 位作者 王惠芳 王君怡 黄培沛 彭宅琨 陈箫然 《湖北大学学报(自然科学版)》 CAS 2026年第4期487-496,共10页
针对图像描述任务中特征信息利用不充分、背景信息容易被忽视、区域细节特征描述不准确等问题,提出基于深度特征多层融合的图像描述方法DMFF-IC(deep multi-layer feature fusion for image captioning),旨在高效融合图像中的全局特征... 针对图像描述任务中特征信息利用不充分、背景信息容易被忽视、区域细节特征描述不准确等问题,提出基于深度特征多层融合的图像描述方法DMFF-IC(deep multi-layer feature fusion for image captioning),旨在高效融合图像中的全局特征和区域特征,提升图像语义表达的完整性与描述生成的准确性。首先,该方法引入深度特征融合模块,分别从全局到区域与区域到全局两个方向构建跨层级特征之间的依赖关系,实现信息的深度互补。然后,在Transformer编码器中设计了多层融合策略,融合不同尺度的细节信息,在解码端引入多头交叉注意力机制实现图像特征和文本特征的语义对齐。上述改进提升了图像语义表达的完整性和生成描述的准确性,并在MSCOCO数据集上进行了对比实验,与主流方法相比,DMFF-IC在BLEU、METEOR、ROUGE和CIDEr上均表现优异,尤其在CIDEr值上达到了137.1%,显著高于其他模型,展现出较强的语义建模能力和跨模态表达性能。 展开更多
关键词 图像描述 特征提取 深度融合 多层融合 Transformer
暂未订购 下载PDF
DGS-CapNet:基于空间-频率感知的SAR图像描述模型 认领 引用
6
作者 张金琪 庄迪 +5 位作者 张腊梅 邹斌 董洪伟 司凌宇 孟庆彪 吴有明 《雷达学报(中英文)》 EI CSCD 北大核心 2026年第2期441-462,共22页
合成孔径雷达(SAR)作为一种主动微波遥感系统,具有“全天时、全天候”的观测能力,在灾害监测、城市管理及军事侦察等领域发挥着重要应用价值。尽管深度学习技术已推动SAR图像解译取得了显著进展,但现有目标识别与检测方法多聚焦于局部... 合成孔径雷达(SAR)作为一种主动微波遥感系统,具有“全天时、全天候”的观测能力,在灾害监测、城市管理及军事侦察等领域发挥着重要应用价值。尽管深度学习技术已推动SAR图像解译取得了显著进展,但现有目标识别与检测方法多聚焦于局部特征提取与单一目标判别,难以全面刻画复杂场景的整体语义结构与多目标关系,且解译流程仍高度依赖专业人员,自动化水平有限。SAR图像描述旨在将视觉信息转化为自然语言,是从“感知目标”向“认知场景”跨越的关键技术,对于提升SAR图像解译的自动化与智能化水平具有重要意义。然而,SAR图像固有的相干斑噪声干扰、纹理细节匮乏、语义鸿沟显著进一步加剧了跨模态理解的难度。针对上述问题,该文提出一种基于空间-频率感知的SAR图像描述方法(DGS-CapNet)。首先,构建空间-频域感知模块,利用离散余弦变换(DCT)掩码注意力机制对频谱成分加权以抑制噪声并强化结构特征,同时结合Gabor多尺度纹理增强模块提升对方向与边缘细节的感知能力;其次,设计跨模态语义增强损失函数,通过双向对比损失与最大互信息损失,有效缩减视觉特征与自然语言间的语义鸿沟。此外,我们还构建了包含72400条高质量图文对的大规模细粒度SAR图像描述数据集FSAR-Cap。实验结果表明,该方法在SARLANG和FSAR-Cap数据集上的CIDEr指标分别达到151.00和95.14。定性分析表明,该模型有效抑制了幻觉,并准确捕捉了细粒度的空间纹理细节,显著优于主流方法。 展开更多
关键词 SAR图像描述 空间-频域感知 DCT掩码注意力 多尺度纹理增强 跨模态对齐 图像-文本数据集
暂未订购 下载PDF
面向智慧教育场景的异构融合图像描述模型 认领 引用
7
作者 何金 《伊犁师范大学学报(自然科学版)》 2026年第2期64-74,共11页
随着智慧教室和教育信息化的发展,图像描述技术在教学行为分析中呈现出重要研究和应用价值。然而,现有方法难以适应智慧课堂中多角色和多模态复杂动态视觉环境,存在检测不全、语义理解不足等问题。针对上述问题,本文提出了一种自适应异... 随着智慧教室和教育信息化的发展,图像描述技术在教学行为分析中呈现出重要研究和应用价值。然而,现有方法难以适应智慧课堂中多角色和多模态复杂动态视觉环境,存在检测不全、语义理解不足等问题。针对上述问题,本文提出了一种自适应异构融合图像描述模型,该模型通过场景感知机制动态融合区域、网格、分割与文本特征,采用多粒度门控融合与场景注入解码策略,实现教学场景下的精准描述生成。通用数据集上的实验结果表明所提模型可达主流模型的性能,自建数据集上的微调及现场应用进一步验证了其有效性。 展开更多
关键词 智慧教育 图像描述 异构特征 多视图特征 语义建模
暂未订购 下载PDF
WKCN:基于小波-KAN协同优化的自适应图像描述算法 认领 引用
8
作者 何世鹏 郑豪 《计算机应用研究》 CSCD 北大核心 2026年第3期696-703,共8页
针对图像描述任务中多尺度纹理表征不足、特征融合冗余及动态语义建模有限的核心挑战,提出一种基于小波-Kolmogorov-Arnold网络(KAN)协同优化的自适应图像描述算法WKCN。首先,设计小波-KAN多尺度非线性增强模块(WKMNE),通过Daubechies-... 针对图像描述任务中多尺度纹理表征不足、特征融合冗余及动态语义建模有限的核心挑战,提出一种基于小波-Kolmogorov-Arnold网络(KAN)协同优化的自适应图像描述算法WKCN。首先,设计小波-KAN多尺度非线性增强模块(WKMNE),通过Daubechies-4小波基对图像频带特征进行分解,并结合KAN网络的B样条插值实现纹理非线性增强;其次,提出基于KAN的自适应特征融合机制(KAN-AFF),动态生成空间与通道双权重,以融合ResNet50提取的全局特征与WKMNE输出的频域特征;最后,构建KAN增强动态解码器(KED),将Transformer中的静态前馈网络替换为可学习的KAN激活函数模块,增强语义映射能力。在MSCOCO数据集上的实验表明,WKCN在BLEU-1(81.1)、ROUGE-L(59.1)和CIDEr(133.6)等指标上均达到最优性能;消融实验验证了多尺度特征提取与动态解码的协同效应;超参数分析实验验证了各种超参数选取的合理性;跨数据集实验(Flickr30k、NoCaps)进一步证实了模型具有良好的泛化能力,可视化分析实验直观展现了WKCN的有效性。WKCN为跨模态语义生成任务提供了一种可验证的非线性优化范式。 展开更多
关键词 图像描述 小波卷积 Kolmogorov-Arnold 动态特征融合 多尺度建模 动态解码
暂未订购 下载PDF
A Survey on Enhancing Image Captioning with Advanced Strategies and Techniques 认领 引用 被引量:1
9
作者 Alaa Thobhani Beiji Zou +4 位作者 Xiaoyan Kui Amr Abdussalam Muhammad Asim Sajid Shah Mohammed ELAffendi 《Computer Modeling in Engineering & Sciences》 SCIE EI 2025年第3期2247-2280,共34页
Image captioning has seen significant research efforts over the last decade.The goal is to generate meaningful semantic sentences that describe visual content depicted in photographs and are syntactically accurate.Man... Image captioning has seen significant research efforts over the last decade.The goal is to generate meaningful semantic sentences that describe visual content depicted in photographs and are syntactically accurate.Many real-world applications rely on image captioning,such as helping people with visual impairments to see their surroundings.To formulate a coherent and relevant textual description,computer vision techniques are utilized to comprehend the visual content within an image,followed by natural language processing methods.Numerous approaches and models have been developed to deal with this multifaceted problem.Several models prove to be stateof-the-art solutions in this field.This work offers an exclusive perspective emphasizing the most critical strategies and techniques for enhancing image caption generation.Rather than reviewing all previous image captioning work,we analyze various techniques that significantly improve image caption generation and achieve significant performance improvements,including encompassing image captioning with visual attention methods,exploring semantic information types in captions,and employing multi-caption generation techniques.Further,advancements such as neural architecture search,few-shot learning,multi-phase learning,and cross-modal embedding within image caption networks are examined for their transformative effects.The comprehensive quantitative analysis conducted in this study identifies cutting-edgemethodologies and sheds light on their profound impact,driving forward the forefront of image captioning technology. 展开更多
关键词 Image captioning semantic attention multi-caption natural language processing visual attention methods
暂未订购 下载PDF
多尺度特征融合的图像描述算法 认领 引用 被引量:7
10
作者 白雪冰 车进 吴金蔓 《计算机工程与应用》 EI CSCD 北大核心 2025年第7期288-296,共9页
针对现有图像描述算法提取的图像特征信息不全面、编码器和解码器模型不统一的问题,提出了多尺度特征融合的图像描述算法。通过多尺度全局特征提取模块和区域特征提取模块分别得到图像的多尺度全局特征和区域特征,通过特征融合模块获得... 针对现有图像描述算法提取的图像特征信息不全面、编码器和解码器模型不统一的问题,提出了多尺度特征融合的图像描述算法。通过多尺度全局特征提取模块和区域特征提取模块分别得到图像的多尺度全局特征和区域特征,通过特征融合模块获得融合后的视觉特征,送入Transformer模型的编码器完成特征编码,通过Transformer模型的解码器生成图像描述内容。通过在MS-COCO数据集上进行实验,并且与当前的一些主流算法进行比较,实验结果表明,所提出的算法在CIDEr关键指标上得分为127.2%,比主流算法提高了3.5个百分点,其余指标也有不同程度的提高。同时,消融实验验证了算法的有效性,定性分析表明了所提出算法能够生成更准确更详细的图像描述。 展开更多
关键词 图像描述 多尺度全局特征 区域特征 Transformer
暂未订购 下载PDF
基于跨模态级联扩散模型的图像描述方法 认领 引用 被引量:1
11
作者 陈巧红 郭孟浩 +1 位作者 方贤 孙麒 《浙江大学学报(工学版)》 EI CAS CSCD 北大核心 2025年第4期787-794,共8页
现有文本扩散模型方法无法有效根据语义条件控制扩散过程,扩散模型训练过程的收敛较为困难,为此提出基于跨模态级联扩散模型的非自回归图像描述方法.引入跨模态语义对齐模块用于对齐视觉模态和文本模态之间的语义关系,将对齐后的语义特... 现有文本扩散模型方法无法有效根据语义条件控制扩散过程,扩散模型训练过程的收敛较为困难,为此提出基于跨模态级联扩散模型的非自回归图像描述方法.引入跨模态语义对齐模块用于对齐视觉模态和文本模态之间的语义关系,将对齐后的语义特征向量作为后续扩散模型的语义条件.通过设计级联式的扩散模型逐步引入丰富的语义信息,确保生成的图像描述贴近整体语境.增强文本扩散过程中的噪声计划以提升模型对文本信息的敏感性,充分训练模型以增强模型的整体性能.实验结果表明,所提方法能够生成比传统图像描述生成方法更准确和丰富的文本描述.所提方法在各项评价指标上均明显优于其他非自回归文本生成方法,展现了在图像描述任务中使用扩散模型的有效性和潜力. 展开更多
关键词 深度学习 图像描述 扩散模型 多模态编码器 级联结构
暂未订购 下载PDF
基于Swin Transformer与多尺度特征融合的图像描述方法 认领 引用 被引量:2
12
作者 王子怡 李卫军 +3 位作者 刘雪洋 丁建平 刘世侠 苏易礌 《计算机应用》 CSCD 北大核心 2025年第10期3154-3160,共7页
基于Transformer的图像描述方法通过多头注意力会在整个输入序列上计算注意力权重,缺乏层次化的特征提取能力,并且两阶段的图像描述方法限制了模型性能。针对上述问题,提出一种基于Swin Transformer与多尺度特征融合的图像描述方法(STM... 基于Transformer的图像描述方法通过多头注意力会在整个输入序列上计算注意力权重,缺乏层次化的特征提取能力,并且两阶段的图像描述方法限制了模型性能。针对上述问题,提出一种基于Swin Transformer与多尺度特征融合的图像描述方法(STMSF)。在编码器中通过Agent Attention保持全局上下文建模能力的同时,提高计算效率;在解码器中提出多尺度交叉注意力(MSCA),融合交叉注意力与深度可分离卷积,在得到多尺度特征的同时更充分地融合多模态特征。实验结果表明,在MSCOCO数据集上与SCD-Net(Semantic-Conditional Diffusion Network)方法相比,STMSF的BLEU4(BiLingual Evaluation Understudy with 4-grams)和CIDEr(Consensus-based Image Description Evaluation)指标分别提升了1.1和5.3个百分点。对比实验和消融实验的结果表明,所提的一阶段STMSF能够有效提高模型性能,生成高质量的图像描述语句。 展开更多
关键词 Swin Transformer 多尺度特征 特征融合 图像描述 深度可分离卷积
暂未订购 下载PDF
基于多级视觉与图文动态交互的图像中文描述方法 认领 引用 被引量:2
13
作者 张军燕 赵一鸣 +1 位作者 林兵 吴允平 《计算机应用》 CSCD 北大核心 2025年第5期1520-1527,共8页
图像文字描述技术可以帮助计算机更好地理解图像内容,实现跨模态交互。针对图像中文描述任务中存在的图像多粒度特征提取不全面以及图文关联性理解不充分等问题,提出一种基于多级视觉与图文动态交互的图像中文描述方法。首先,在编码器... 图像文字描述技术可以帮助计算机更好地理解图像内容,实现跨模态交互。针对图像中文描述任务中存在的图像多粒度特征提取不全面以及图文关联性理解不充分等问题,提出一种基于多级视觉与图文动态交互的图像中文描述方法。首先,在编码器端提取多级视觉特征,通过图像局部特征提取器的辅助引导模块获取多粒度特征。其次,设计图文交互模块对图文信息的语义关联进行动态关注;同时,设计特征动态融合解码器将带有图文信息动态权重的特征经过闭环动态融合并关注与解码,以保证信息增强且无缺失,从而获得语义关联性的输出。最后,生成语义通顺的图像中文描述语句。使用BLEU-n、Rouge、Meteor、CIDEr指标评估方法的有效性并与8种不同方法进行对比。实验结果显示,所提方法的语义相关性评价指标均有提升。具体而言,与基线模型NIC(Neural Image Caption)相比,所提方法在BLEU-1、BLEU-2、BLEU-3、BLEU-4、Rouge_L、Meteor、CIDEr分别提升了5.62%、7.25%、8.78%、10.85%、14.06%、5.14%、15.16%,表明该方法具有较好的准确性。 展开更多
关键词 图像中文描述 图像多级视觉特征 多粒度 图文交互 动态融合
暂未订购 下载PDF
基于多模态语义特征融合的遥感图像描述生成方法 认领 引用 被引量:1
14
作者 周得伟 刘海砚 +2 位作者 李静 李佳 孔凡铸 《信息工程大学学报》 2025年第4期423-430,437,共8页
利用图像分类等辅助任务的结果作为先验信息可以为遥感图像生成高质量的描述,然而这些方法采用的特征融合方式难以捕捉特征之间的复杂交互关系,无法充分描述遥感图像中的内容。为解决此问题,提出一种基于多模态语义特征融合的遥感图像... 利用图像分类等辅助任务的结果作为先验信息可以为遥感图像生成高质量的描述,然而这些方法采用的特征融合方式难以捕捉特征之间的复杂交互关系,无法充分描述遥感图像中的内容。为解决此问题,提出一种基于多模态语义特征融合的遥感图像描述生成方法。该方法首先利用预训练的ResNet50网络提取图像区域特征;其次,基于多层感知机网络预测图像的语义属性;再次,通过属性引导的交叉注意力子模块和文本引导的交叉注意力子模块,实现图像、属性和文本特征的交互与融合;最后,将融合后的特征输入解码器,生成目标图像的描述。实验结果表明,该方法在各项评价指标上与基线方法相比均有性能提升,能够生成更加准确的描述。 展开更多
关键词 遥感图像描述生成 多标签分类 特征融合 交叉注意力机制
暂未订购 下载PDF
基于预训练大模型的无监督图像字幕生成优化 认领 引用 被引量:1
15
作者 李炳楠 丁濛 《北京信息科技大学学报(自然科学版)》 2025年第1期11-19,共9页
图像字幕生成模型普遍依赖高质量的图像-文本对,且泛化能力较差。早期研究通过对比语言-图像预训练(contrastive language-imagepre-training,CLIP)模型的跨模态关联性,尝试利用无监督文本数据生成字幕,减少了对成对数据的依赖。然而,... 图像字幕生成模型普遍依赖高质量的图像-文本对,且泛化能力较差。早期研究通过对比语言-图像预训练(contrastive language-imagepre-training,CLIP)模型的跨模态关联性,尝试利用无监督文本数据生成字幕,减少了对成对数据的依赖。然而,这些方法未能有效缩小CLIP文本与图像嵌入之间的差距,也未充分利用图像和文本的局部特征。为解决上述挑战,提出了一种基于纯文本训练的图像字幕生成框架——FusionCap。结合噪声网络和投影网络策略,有效缩小了文本与图像模态之间的差距,并引入局部特征提取模块,提升了模型对细粒度特征的捕捉能力。实验结果表明,FusionCap模型在字幕生成的准确性和细节描述方面显著优于现有的纯文本训练方法。尤其是在零样本生成场景中,生成的字幕在细节捕捉和语义一致性方面表现出色,验证了其良好的泛化能力和生成效果。 展开更多
关键词 图像字幕生成 多模态 预训练模型 无监督学习算法 深度学习
暂未订购 下载PDF
结合多尺度与多层级聚合的卷轴画图像描述模型 认领 引用
16
作者 乐超洋 胡文瑾 张福军 《现代电子技术》 北大核心 2025年第17期41-47,共7页
针对卷轴画图像的尺度大小不一且具有一定的空间分布特性以及基于Transformer的编码层容易丢失图像关键信息的问题,文中提出一种结合多尺度与多层级聚合的卷轴画图像描述模型(MMA)。在编码阶段,通过引入非对称卷积和多尺度特征模块,可... 针对卷轴画图像的尺度大小不一且具有一定的空间分布特性以及基于Transformer的编码层容易丢失图像关键信息的问题,文中提出一种结合多尺度与多层级聚合的卷轴画图像描述模型(MMA)。在编码阶段,通过引入非对称卷积和多尺度特征模块,可以有效提高卷积层获取空间信息的能力并融合卷轴画图像全局和局部的多尺度上下文信息,从而得到具有丰富语义信息的特征表示。在解码阶段,设计了多层级聚合网络,通过聚合不同编码层的特征实现高层编码层语义信息和低层编码层内容信息的有效利用,从而有效缓解信息丢失的问题。实验结果表明,该模型在卷轴画数据集上取得了不错效果,较NIC模型在BLEU-4、METEOR上分别提高了26.7%、0.9%,并生成准确性更高的描述语句。 展开更多
关键词 图像描述 卷轴画图像 多尺度特征 非对称卷积 多层级聚合解码 Transformer
暂未订购 下载PDF
基于多模态特征融合的新闻故事单元分割 认领 引用 被引量:8
17
作者 刘嘉琦 封化民 闫建鹏 《计算机工程》 CAS CSCD 2012年第24期161-165,共5页
对新闻视频进行结构分析,提出一种基于多模态特征融合的新闻故事单元分割方法。将新闻视频分割成音频流和视频流,选择静音区间为音频候选点,将镜头边界切变点作为视频候选点,做主持人镜头和主题字幕的探测,挑选主持人镜头为候选区间,并... 对新闻视频进行结构分析,提出一种基于多模态特征融合的新闻故事单元分割方法。将新闻视频分割成音频流和视频流,选择静音区间为音频候选点,将镜头边界切变点作为视频候选点,做主持人镜头和主题字幕的探测,挑选主持人镜头为候选区间,并记录主题字幕的起始位置和结束位置,利用时间轴融合音频候选点、视频候选点、主持人镜头和主题字幕,对新闻视频进行故事单元分割。实验结果表明,该方法的查全率为83.18%,查准率为83.92%。 展开更多
关键词 新闻视频 多模态特征 字幕 音频 故事单元分割
暂未订购 下载PDF
基于多注意力多尺度特征融合的图像描述生成算法 认领 引用 被引量:18
18
作者 陈龙杰 张钰 +1 位作者 张玉梅 吴晓军 《计算机应用》 CSCD 北大核心 2019年第2期354-359,共6页
针对图像描述生成中对图像细节表述质量不高、图像特征利用不充分、循环神经网络层次单一等问题,提出基于多注意力、多尺度特征融合的图像描述生成算法。该算法使用经过预训练的目标检测网络来提取图像在卷积神经网络不同层上的特征,将... 针对图像描述生成中对图像细节表述质量不高、图像特征利用不充分、循环神经网络层次单一等问题,提出基于多注意力、多尺度特征融合的图像描述生成算法。该算法使用经过预训练的目标检测网络来提取图像在卷积神经网络不同层上的特征,将图像特征分层输入多注意力结构中,依次将多注意力结构与多层循环神经网络相连,构造出多层次的图像描述生成网络模型。在多层循环神经网络中加入残差连接来提高网络性能,并且可以有效避免因为网络加深导致的网络退化问题。在MSCOCO测试集中,所提算法的BLEU-1和CIDEr得分分别可以达到0. 804及1. 167,明显优于基于单一注意力结构的自上而下图像描述生成算法;通过人工观察对比可知,所提算法生成的图像描述可以表现出更好的图像细节。 展开更多
关键词 长短期记忆网络 图像描述 多注意力机制 多尺度特征融合 深度神经网络
暂未订购 下载PDF
基于多模态特征的视频密集描述生成方法 认领 引用 被引量:2
19
作者 马苗 陈小秋 田卓钰 《中文信息学报》 CSCD 北大核心 2022年第11期156-168,共13页
根据视频内容自动生成文本序列的密集描述生成融合了计算机视觉与自然语言处理技术。现有密集描述生成方法多强调视频中的视觉与运动信息而忽略了其中的音频信息,关注事件的局部信息或简单的事件级上下文信息而忽略了事件间的时序结构... 根据视频内容自动生成文本序列的密集描述生成融合了计算机视觉与自然语言处理技术。现有密集描述生成方法多强调视频中的视觉与运动信息而忽略了其中的音频信息,关注事件的局部信息或简单的事件级上下文信息而忽略了事件间的时序结构和语义关系。为此,该文提出一种基于多模态特征的视频密集描述生成方法。该方法首先在动作提议生成阶段使用Timeception层作为基础模块以更好适应动作片段时间跨度的多样性,其次在动作提议生成和描述生成两阶段均利用音频特征增强提议和描述生成效果,最后使用时序语义关系模块建模事件间的时序结构和语义信息以进一步增强描述生成的准确性。特别地,该文还构建了一个基于学习场景的视频密集描述数据集SDVC以探究该文所提方法在学习场景现实应用中的有效性。在ActivityNet Captions和SDVC数据集上的实验结果表明,动作提议生成AUC值分别提升0.8%和6.7%;使用真实动作提议进行描述生成时,BLEU_3值分别提升1.4%和4.7%,BLEU_4值分别提升0.9%和5.3%;使用生成的动作提议进行描述生成时,SDVC数据集BLEU_3、BLEU_4值分别提升2.3%和2.2%。 展开更多
关键词 密集描述生成 多模态特征 时序结构 语义关系
暂未订购 下载PDF
基于Transformer的多方面特征编码图像描述生成算法 认领 引用 被引量:9
20
作者 衡红军 范昱辰 王家亮 《计算机工程》 CAS CSCD 北大核心 2023年第2期199-205,共7页
由目标检测算法提取的目标特征在图像描述生成任务中发挥重要作用,但仅使用对图像进行目标检测的特征作为图像描述任务的输入会导致除关键目标信息以外的其余信息获取缺失,且生成的文本描述对图像内目标之间的关系缺乏准确表达。针对上... 由目标检测算法提取的目标特征在图像描述生成任务中发挥重要作用,但仅使用对图像进行目标检测的特征作为图像描述任务的输入会导致除关键目标信息以外的其余信息获取缺失,且生成的文本描述对图像内目标之间的关系缺乏准确表达。针对上述不足,提出用于编码图像内目标特征的目标Transformer编码器,以及用于编码图像内关系特征的转换窗口Transformer编码器,从不同角度对图像内不同方面的信息进行联合编码。通过拼接方法将目标Transformer编码的目标特征与转换窗口Transformer编码的关系特征相融合,达到图像内部关系特征和局部目标特征融合的目的,最终使用Transformer解码器将融合后的编码特征解码生成对应的图像描述。在MS-COCO数据集上进行实验,结果表明,所构建模型性能明显优于基线模型,BLEU-4、METEOR、ROUGE-L、CIDEr指标分别达到38.6%、28.7%、58.2%和127.4%,优于传统图像描述网络模型,能够生成更详细准确的图像描述。 展开更多
关键词 图像描述 转换窗口 多头注意力机制 多模态任务 Transformer编码器
暂未订购 下载PDF
上一页 1 2 3 下一页 到第
在线咨询 使用帮助 返回顶部 意见反馈