期刊文献+
共找到44篇文章
< 1 2 3 >
每页显示 20 50 100
基于OpenCL的图像灰度化并行算法研究 认领 引用 被引量:11
1
作者 肖汉 郭宝云 +1 位作者 李彩林 肖诗洋 《江西师范大学学报(自然科学版)》 CAS 北大核心 2020年第5期462-471,共10页
随着图像数据量的增加,传统单核处理器或多处理器结构的计算方式已无法满足图像灰度化实时处理需求.该文利用图像处理器(GPU)在异构并行计算的优势,提出了基于开放式计算语言(OpenCL)的图像灰度化并行算法.通过分析加权平均图像灰度化... 随着图像数据量的增加,传统单核处理器或多处理器结构的计算方式已无法满足图像灰度化实时处理需求.该文利用图像处理器(GPU)在异构并行计算的优势,提出了基于开放式计算语言(OpenCL)的图像灰度化并行算法.通过分析加权平均图像灰度化数据处理的并行性,对任务进行了层次化分解,设计了2级并行的并行算法并映射到“CPU+GPU”异构计算平台上.实验结果显示:图像灰度化并行算法在OpenCL架构下NVIDIA GPU计算平台上相比串行算法、多核CPU并行算法和CUDA并行算法的性能分别获得了27.04倍、4.96倍和1.21倍的加速比.该文提出的并行优化方法的有效性和性能可移植性得到了验证. 展开更多
关键词 图像灰度化 加权平均 图形处理器 开放式计算语言 并行算法
暂未订购 下载PDF
基于异构平台的图像中值滤波的OpenCL加速算法 认领 引用 被引量:10
2
作者 肖诗洋 王镭 +1 位作者 杜莹 肖汉 《河北大学学报(自然科学版)》 CAS 北大核心 2024年第1期92-103,共12页
图像噪声降低了图像信噪比和质量,去噪是图像处理工作的重要环节之一.本文提出了一种基于开放式计算语言(OpenCL)架构的图像中值滤波快速降噪并行算法.介绍了OpenCL体系结构特点和中值滤波处理流程.根据图形处理器(GPU)的并发结构特点,... 图像噪声降低了图像信噪比和质量,去噪是图像处理工作的重要环节之一.本文提出了一种基于开放式计算语言(OpenCL)架构的图像中值滤波快速降噪并行算法.介绍了OpenCL体系结构特点和中值滤波处理流程.根据图形处理器(GPU)的并发结构特点,对图像中值滤波功能模块进行了并行优化,降低了算法复杂度.通过充分激活NDRange索引空间中的工作组和工作项来提高数据访问效率,优化内核工作组配置参数,实现了中值滤波器的并行处理.实验结果表明,在图像质量保持不变的情况下,与基于CPU的串行算法、基于开放多处理(OpenMP)并行算法和基于统一计算设备架构(CUDA)并行算法性能相比,图像中值滤波并行算法在OpenCL架构下NVIDIA GPU计算平台上分别获得了29.74、17.29、1.15倍的加速比.验证了算法的有效性和平台的可移植性,基本满足应用的实时性处理要求. 展开更多
关键词 中值滤波 椒盐噪声 图形处理器 开放式计算语言 并行算法
暂未订购 下载PDF
异构平台上基于OpenCL的矩阵乘并行算法 认领 引用 被引量:3
3
作者 肖汉 肖诗洋 +1 位作者 李彩林 周清雷 《西南大学学报(自然科学版)》 CAS CSCD 北大核心 2020年第11期147-153,共7页
在分析开放式计算语言(OpenCL)平台底层硬件构架的基础上,从数据本地化、计算资源利用率和访存带宽利用率等多个不同角度优化了矩阵乘算法,并实现了矩阵乘算法在OpenCL架构下的加速.实验数据显示,与基于CPU的单线程算法、基于OpenMP多... 在分析开放式计算语言(OpenCL)平台底层硬件构架的基础上,从数据本地化、计算资源利用率和访存带宽利用率等多个不同角度优化了矩阵乘算法,并实现了矩阵乘算法在OpenCL架构下的加速.实验数据显示,与基于CPU的单线程算法、基于OpenMP多线程算法和基于统一计算设备架构(CUDA)并行算法相比,基于OpenCL架构的矩阵乘并行算法效率更高. 展开更多
关键词 矩阵乘 图形处理器 开放式计算语言 并行算法
暂未订购 下载PDF
面向OpenCL的GPGPU微基准测试程序集的研究与实现 认领 引用 被引量:2
4
作者 杨海燕 史晓华 +3 位作者 孙清越 晏望龙 严鑫 金茂忠 《系统工程与电子技术》 EI CSCD 北大核心 2013年第12期2631-2642,共12页
随着通用图形处理器(general-purpose graphics processing unit,GPGPU)的广泛应用,GPGPU成为当前实现计算并行化的主要硬件平台之一。开放计算语言(open computing language,OpenCL)是一个开放的、面向异构系统平台的并行计算标准,支... 随着通用图形处理器(general-purpose graphics processing unit,GPGPU)的广泛应用,GPGPU成为当前实现计算并行化的主要硬件平台之一。开放计算语言(open computing language,OpenCL)是一个开放的、面向异构系统平台的并行计算标准,支持在包括图形处理器(graphics processing unit,GPU)在内的多种微处理器架构上开发和运行并行程序。针对OpenCL平台开发了一套较完整的GPGPU微基准测试程序集,全面测试了GPU的单精浮点运算能力、GPU体系结构中各类存储单元的读写带宽及最佳访问模式等。这些面向OpenCL的GPGPU微基准测试程序,对OpenCL及GPGPU软件架构的设计者及使用者,均具有重要的实用和参考价值。 展开更多
关键词 计算机系统结构 微基准测试程序集 通用图形处理器 开放计算语言
暂未订购 下载PDF
基于OpenCL的尺度不变特征变换算法的并行设计与实现 认领 引用 被引量:3
5
作者 许川佩 王光 《计算机应用》 CSCD 北大核心 2016年第7期1801-1806,共6页
针对尺度不变特征变换(SIFT)算法实时性差的问题,提出了利用开放式计算语言(Open CL)并行优化的SIFT算法。首先,通过对原算法各步骤进行组合拆分、重构特征点在内存中的数据索引等方式对原算法进行并行化重构,使得算法的中间计算结... 针对尺度不变特征变换(SIFT)算法实时性差的问题,提出了利用开放式计算语言(Open CL)并行优化的SIFT算法。首先,通过对原算法各步骤进行组合拆分、重构特征点在内存中的数据索引等方式对原算法进行并行化重构,使得算法的中间计算结果能够完全在显存中完成交互;然后,采用复用全局内存对象、共享局部内存、优化内存读取等策略对原算法各步骤进行并行设计,提高数据读取效率,降低传输延时;最后,利用Open CL语言在图形处理单元(GPU)上实现了SIFT算法的细粒度并行加速,并在中央处理器(CPU)上完成了移植。与原SIFT算法配准效果相近时,并行化的算法在GPU和CPU平台上特征提取速度分别提升了10.51~19.33和2.34~4.74倍。实验结果表明,利用Open CL并行加速的SIFT算法能够有效提高图像配准的实时性,并能克服统一计算设备架构(CUDA)因移植困难而不能充分利用异构系统中多种计算核心的缺点。 展开更多
关键词 尺度不变特征变换算法 开放式计算语言 复用内存对象 细粒度并行 异构系统
暂未订购 下载PDF
基于OpenCL的累积汇流并行计算 认领 引用
6
作者 龙满生 罗文浪 《计算机工程与应用》 CSCD 2014年第3期22-29,116,共8页
大尺度、高分辨率数字地形数据应用需求的增长,给计算密集型的累积汇流等数字地形分析算法带来了新的挑战。针对CPU/GPU(Graphics Processing Unit)异构计算平台的特点,提出了一种基于OpenCL(Open Computing Language)的多流向累积汇流... 大尺度、高分辨率数字地形数据应用需求的增长,给计算密集型的累积汇流等数字地形分析算法带来了新的挑战。针对CPU/GPU(Graphics Processing Unit)异构计算平台的特点,提出了一种基于OpenCL(Open Computing Language)的多流向累积汇流算法的并行化策略,具有更好的平台独立性和可移植性,简化了CPU/GPU异构平台下的并行应用程序设计。累积汇流并行算法包括时空独立型的流量分配和空间依赖型的累积入流两个过程,均定义为OpenCL内核并交由OpenCL设备并行执行,其中累积入流过程借助流量转移矩阵由递归式转换为迭代式来实现并行计算。与基于流量转移矩阵的并行汇流算法相比,尽管基于单元入度矩阵的并行汇流算法可以降低迭代过程中的计算冗余,但需要采用具有较大延迟的原子操作以及需要更多的迭代次数,在有限的GPU计算资源下,两种算法性能差异不明显。实验结果表明,并行累积汇流算法在NVIDIA GeForce GT 650M GPU上获得了较好的加速比,加速性能随格网尺度增加而有所增加,其中流量分配获得了约50~70倍的加速比,累积入流获得了10~20倍的加速比,展示了利用OpenCL在GPU等并行计算设备上进行大规模数字地形分析的潜在优势。 展开更多
关键词 并行计算 累积汇流 图形处理器 开放计算语言
暂未订购 下载PDF
基于MPI和OpenCL多层次并行图像卷积算法设计 认领 引用
7
作者 王继刚 刘惠 姜滨 《中兴通讯技术》 2015年第2期53-55,62,共3页
通过对图像卷积算法的分析,发现算法在对图像处理的过程中具有很高的并行性。提出了一种结合异构开发框架开放运算语言(Open CL)和并行开发库消息传递接口(MPI)的算法,在支持图形处理器(GPU)的异构集群环境下设计并实现了图像卷积算法... 通过对图像卷积算法的分析,发现算法在对图像处理的过程中具有很高的并行性。提出了一种结合异构开发框架开放运算语言(Open CL)和并行开发库消息传递接口(MPI)的算法,在支持图形处理器(GPU)的异构集群环境下设计并实现了图像卷积算法的多层次并行实现,使得算法在处理速度上有了显著的提升。 展开更多
关键词 异构集群 消息传递接口 开放运算语言 图像卷积
暂未订购 下载PDF
基于OpenCL的MD5破解算法 认领 引用 被引量:5
8
作者 翁捷 吴强 杨灿群 《计算机工程》 EI CAS CSCD 北大核心 2011年第4期119-121,共3页
在基于GPU的异构平台上,采用开放计算语言(OpenCL)实现破解算法,利用分轮生成攻击密码、图形渲染管线加速存取以及多密码并行等方法对算法进行优化,在Intel四核CPU Q8230(2.3 GHz)和一片NVIDIA GT200组成的平台上进行实验。实验结果表明... 在基于GPU的异构平台上,采用开放计算语言(OpenCL)实现破解算法,利用分轮生成攻击密码、图形渲染管线加速存取以及多密码并行等方法对算法进行优化,在Intel四核CPU Q8230(2.3 GHz)和一片NVIDIA GT200组成的平台上进行实验。实验结果表明,在相同CPU平台上该算法能够获得高于破解软件John the ripper 17倍的破解速度。 展开更多
关键词 开放计算语言 带随机数的MD5算法 图形处理器 强力攻击
暂未订购 下载PDF
Real-time flow-based video abstraction using OpenCL 认领 引用
9
作者 Yong-jin PARK Jin-woo KIM +1 位作者 Jin-hong PARK Tack-don HAN 《Journal of Measurement Science and Instrumentation》 CAS 2012年第1期46-50,共5页
A non-photorealistic rendering technique is a method to show various effects different from those of realistic image generation.Of the various techniques,flow-based image abstraction displays the shape and color featu... A non-photorealistic rendering technique is a method to show various effects different from those of realistic image generation.Of the various techniques,flow-based image abstraction displays the shape and color features well and performs a stylistic visual abstraction.But real-time rendering is impossible when CPU is used because it applies various filtering and iteration methods.In this paper,we present real-time processing methods of video abstraction using open open computing language(OpenCL),technique of general-purpose computing on graphics processing units(GPGPU).Through the acceleration of general-purpose computing(GPU),16 frame-per-second(FPS)or greater is shown to process video abstraction. 展开更多
关键词 non-photorealistic rendering video abstraction general-purpose computing on graphics processing units(GPGPU) open computing language(OpenCL)
暂未订购 下载PDF
基于大语言模型的开放域对话系统综述 认领 引用 被引量:2
10
作者 秦董洪 孔令儒 +3 位作者 白凤波 王敬凯 李路路 徐晨 《计算机工程与应用》 EI CSCD 北大核心 2026年第6期70-95,共26页
开放域对话系统旨在实现与用户之间的流畅、自然交流,模拟人类的语言行为,能够处理各种主题和情境的对话,而无需特定任务或领域限制。其目标是使计算机系统能够理解并生成自然语言,实现高效的人机互动。大语言模型是使用大量文本数据训... 开放域对话系统旨在实现与用户之间的流畅、自然交流,模拟人类的语言行为,能够处理各种主题和情境的对话,而无需特定任务或领域限制。其目标是使计算机系统能够理解并生成自然语言,实现高效的人机互动。大语言模型是使用大量文本数据训练的深度学习模型,通过学习语言的统计特性和语义关系,大语言模型不仅能够生成和理解文本,还具备推理能力,已成为开放域对话系统中的核心技术之一。综述了当前基于大语言模型的开放域对话系统的研究现状,介绍了常用的对话数据集,并对不同模型架构的特点与应用进行了比较;提出了一种对话系统的演进架构,包括核心能力层、功能扩展层和动态优化层。核心能力层通过记忆机制和连贯性保障算法,确保对话的连续性和一致性,为系统提供稳定的运行基础;功能扩展层在此基础上,通过知识整合和个性化响应,提升对话的丰富性和个性化;动态优化层则通过话题控制和安全约束的协同作用,确保对话的稳定性和安全性,避免对话偏离主题或生成不适当的内容。三层架构相互协作,推动对话系统从基础能力到高级功能的协同演进,总结了相应的解决方案。基于现有研究成果,展望了该领域的未来发展趋势。 展开更多
关键词 开放域对话系统 大语言模型 深度学习 人机互动
暂未订购 下载PDF
基于OpenCL的Gzip数据压缩算法 认领 引用 被引量:8
11
作者 赵雅倩 李龙 +4 位作者 郭跃超 史宏志 郭振华 魏士欣 陈继承 《计算机应用》 CSCD 北大核心 2018年第A1期112-115,130,共4页
目前,数据压缩算法主要基于串行编程模型设计和实现,导致数据压缩速率较低,因而无法满足大数据分析和处理等应用的实时性需求。为了解决这个问题,以常用数据压缩算法Gzip为蓝本,提出一种实现无损数据压缩算法的专用硬件电路。首先,采用... 目前,数据压缩算法主要基于串行编程模型设计和实现,导致数据压缩速率较低,因而无法满足大数据分析和处理等应用的实时性需求。为了解决这个问题,以常用数据压缩算法Gzip为蓝本,提出一种实现无损数据压缩算法的专用硬件电路。首先,采用多字典并行查找的设计方案提高重复数据的查找速率;接着,采用匹配长度拼接技术提升数据的压缩效果;最后,采用开放计算语言(Open CL)实现了所提出的专用硬件电路。基于现场可编程门阵列(FPGA)进行功能验证和性能评测,结果表明:与基于串行编程模型设计和实现的数据压缩算法相比,所提出的硬件电路在取得适当压缩率的同时,显著地提高了数据的压缩速率,压缩速率可达12 Gb/s。 展开更多
关键词 数据压缩 开放计算语言 Gzip算法 现场可编程门阵列 硬件加速
暂未订购 下载PDF
开源情报多模态智能处理系统设计与工程实现 认领 引用
12
作者 董泽云 甘莅豪 +1 位作者 薛楠 陆泰廷 《大数据》 2026年第1期71-83,共13页
针对开源情报系统存在的模态割裂、结构化能力不足及用户交互性差等问题,提出一种融合计算机视觉、自然语言处理与文本转语音技术的智能信息处理系统。基于多源异构数据设计了涵盖数据采集、预处理、深度建模、智能决策与用户交互反馈... 针对开源情报系统存在的模态割裂、结构化能力不足及用户交互性差等问题,提出一种融合计算机视觉、自然语言处理与文本转语音技术的智能信息处理系统。基于多源异构数据设计了涵盖数据采集、预处理、深度建模、智能决策与用户交互反馈的完整闭环流程,重点突破跨模态数据融合、情报内容结构化处理、语音播报与多媒体可视化呈现等关键技术。实验结果表明,系统在情报抽取准确率、响应时间及用户可解释反馈等关键指标上表现优异,具备模块化与可扩展性,适配政务安全、金融风控与公共舆情等场景。 展开更多
关键词 开源情报 计算机视觉 自然语言处理 文本转语音 语音识别 多模态融合 大语言模型 人工智能
暂未订购 下载PDF
Dixit Player with Open CLIP 认领 引用 被引量:1
13
作者 Ryan Wei 《Journal of Data Analysis and Information Processing》 2023年第4期536-547,共12页
A computer vision approach through Open AI’s CLIP, a model capable of predicting text-image pairs, is used to create an AI agent for Dixit, a game which requires creative linking between images and text. This paper c... A computer vision approach through Open AI’s CLIP, a model capable of predicting text-image pairs, is used to create an AI agent for Dixit, a game which requires creative linking between images and text. This paper calculates baseline accuracies for both the ability to match the correct image to a hint and the ability to match up with human preferences. A dataset created by previous work on Dixit is used for testing. CLIP is utilized through the comparison of a hint to multiple images, and previous hints, achieving a final accuracy of 0.5011 which surpasses previous results. 展开更多
关键词 Computer Vision AI CLIP Dixit Open AI Creative Gameplay Open CLIP Natural Language Processing Visual Models Game AI Image-Text Pairing
暂未订购 下载PDF
面向LLM开放域问答中多方私有表格筛选:一种MPC可公开聚合审计与动态信誉的增强方法 认领 引用 被引量:1
14
作者 胡睿 吴昊 +3 位作者 潘宇轩 张琳 刘雨 朱孔林 《电子学报》 EI CAS CSCD 北大核心 2025年第9期3089-3102,共14页
大语言模型(Large Language Model,LLM)驱动的开放域问答(Open-Domain Question Answering,ODAQ)系统,如GIST(Generating Identifiers and Selecting chunks for Tables)框架,在处理海量表格数据时展现出巨大潜力,受到了广泛关注.然而,... 大语言模型(Large Language Model,LLM)驱动的开放域问答(Open-Domain Question Answering,ODAQ)系统,如GIST(Generating Identifiers and Selecting chunks for Tables)框架,在处理海量表格数据时展现出巨大潜力,受到了广泛关注.然而,当ODQA系统需要整合多方私有表格数据进行Top-K候选筛选等环节时,传统方法需要访问全部原数据,这在数据隐私、计算透明度及参与方行为可信度方面面临挑战.虽然现有研究采用零知识证明和基于权益的机制实现了公开可验证性,但在大规模场景下生成和验证单个证明的开销过高,而传统的基于权益的机制在公平性和对动态环境的适应性方面也存在局限性.对此,本文基于多方安全计算(Multi-Party Computation,MPC)、可公开聚合审计与动态信誉机制,提出了一种面向LLM开放域问答中多方私有表格筛选的增强方法.将Top-K多方私有表格筛选过程通过MPC完成,以保护多方私有数据隐私.同时,引入高效的聚合审计机制,将零知识证明技术与随机抽样、聚合证明构造、基于时间窗口的批处理和错误定位相结合,确保评分与排序过程的正确性可以被批量、公开验证.基于区块链的动态信誉反馈机制的集成也增强了系统的公平性,并约束了恶意行为.实验评估表明,本文的Top-K候选筛选方法在保证隐私的同时与GIST原有筛选方法在结果上达到0.91的Top-50平均召回率和0.83的平均Jaccard指数,具有高度一致性,不会影响ODQA端到端任务性能.同时,大规模任务下可公开审计的证明和验证效率均得到提升,与单独的证明相比节省了约87%的证明时间.反馈机制的适应性和公平性也得到了增强. 展开更多
关键词 开放域问答 大语言模型 多方安全计算 可公开审计 零知识证明 区块链
暂未订购 下载PDF
边缘受限条件下大模型部署优化技术发展 认领 引用
15
作者 张明轩 《计算机与数字工程》 2025年第11期3198-3201,3263,共4页
大型语言模型(LLMs)由于参数量大以及处理的上下文信息长等特点,在边缘受限计算环境下如何部署与优化已经成为重要的挑战。通过汇总共享存储空间、激活函数优化、注意力机制优化、相对位置编码优化、自动混合精度训练、量化技术等方面... 大型语言模型(LLMs)由于参数量大以及处理的上下文信息长等特点,在边缘受限计算环境下如何部署与优化已经成为重要的挑战。通过汇总共享存储空间、激活函数优化、注意力机制优化、相对位置编码优化、自动混合精度训练、量化技术等方面的主要优化方法,分析了在ROCm开源框架和HIP编程模型上的大模型优化实践成果以及对模型性能的影响。通过总结这些技术的特点,以及在开源框架下的探索,为实现大模型在边缘计算环境下显著提升计算和存储效率以及国产化应用部署提供了新的思路。 展开更多
关键词 大型语言模型 边缘计算 条件受限 部署与优化 开源框架
暂未订购 下载PDF
领域专用低延迟高带宽TCP/IP卸载引擎设计与实现 认领 引用 被引量:14
16
作者 冯一飞 丁楠 +1 位作者 叶钧超 柴志雷 《计算机工程》 CAS CSCD 北大核心 2022年第9期162-170,共9页
针对量化高频交易应用场景对数据传输低延迟高带宽的需求,定制一种领域专用的TCP/IP协议栈,并将其卸载到专用硬件加速模块上。采用模块化设计实现专用硬件逻辑,并与FAST协议硬件加速模块共同构成完整的低延迟高带宽高频交易系统。通过... 针对量化高频交易应用场景对数据传输低延迟高带宽的需求,定制一种领域专用的TCP/IP协议栈,并将其卸载到专用硬件加速模块上。采用模块化设计实现专用硬件逻辑,并与FAST协议硬件加速模块共同构成完整的低延迟高带宽高频交易系统。通过调整最大报文长度,实现64 Byte数据对齐,提升内核与高带宽内存(HBM)间的读写速率,并对内存结构进行优化,实现主机端与HBM间的4通道并行读写管理。对各功能模块进行数据流优化,最终构建全流水线架构。模块间统一使用AXI4-Stream接口连接,并绕过内存进行数据传输,实现传输性能的提升。实验结果表明,TCP/IP卸载引擎在Xilinx Alevo U50数据中心加速卡上可获得38.28 Gb/s的网络吞吐率,基础网络通信穿刺延迟最低为468.4 ns,在叠加FAST解码协议后延迟为677.9 ns,与传统软件处理网络堆栈(Intel i9-9900x+9802BF)的方式相比,TCP/IP引擎的吞吐率提升1倍,延迟降低为1/12,且延迟稳定,波动范围在10 ns左右,在满足量化高频交易场景需要的同时,有效减轻了CPU的负载。 展开更多
关键词 领域专用 传输控制协议/互联网协议卸载引擎 高带宽低延迟 可编程逻辑门阵列 开放运算语言
暂未订购 下载PDF
CPU+GPU异构并行的矩阵转置算法研究 认领 引用 被引量:4
17
作者 肖汉 李彩林 +1 位作者 李琦 周清雷 《东北师大学报(自然科学版)》 CAS 北大核心 2019年第4期70-77,共8页
针对当前算法优化研究一般局限于单一硬件平台、很难实现在不同平台上高效运行的问题,利用图形处理器(GPU)提出了基于开放式计算语言(OpenCL)的矩阵转置并行算法.通过矩阵子块粗粒度并行、矩阵元素细粒度并行、工作项与数据的空间映射... 针对当前算法优化研究一般局限于单一硬件平台、很难实现在不同平台上高效运行的问题,利用图形处理器(GPU)提出了基于开放式计算语言(OpenCL)的矩阵转置并行算法.通过矩阵子块粗粒度并行、矩阵元素细粒度并行、工作项与数据的空间映射和本地存储器优化方法的应用,使矩阵转置算法在GPU计算平台上的性能提高了12倍.实验结果表明,与基于CPU的串行算法、基于开放多处理(OpenMP)并行算法和基于统一计算设备架构(CUDA)并行算法性能相比,矩阵转置并行算法在OpenCL架构下NVIDIA GPU计算平台上分别获得了12.26,2.23和1.50的加速比.该算法不仅性能高,而且实现了在不同计算平台间的性能移植. 展开更多
关键词 矩阵转置 图形处理器 开放式计算语言 并行算法
暂未订购 下载PDF
面向异构架构的传递闭包并行算法 认领 引用 被引量:3
18
作者 肖汉 郭宝云 +1 位作者 李彩林 周清雷 《计算机工程》 CAS CSCD 北大核心 2021年第8期131-139,共9页
传统求图传递闭包的方法存在计算量大与计算时间长的问题。为加快处理大数据量的传递闭包算法的计算速度,结合算法密集计算和开放式计算语言(OpenCL)框架的特征,采用本地存储器优化的并行子矩阵乘和分块的矩阵乘并行计算,提出一种基于Op... 传统求图传递闭包的方法存在计算量大与计算时间长的问题。为加快处理大数据量的传递闭包算法的计算速度,结合算法密集计算和开放式计算语言(OpenCL)框架的特征,采用本地存储器优化的并行子矩阵乘和分块的矩阵乘并行计算,提出一种基于OpenCL的传递闭包并行算法。利用本地存储器优化的并行子矩阵乘算法来优化计算步骤,提高图形处理器(GPU)的存储器利用率,降低数据获取延迟。通过分块矩阵乘并行计算算法实现大数据量的矩阵乘,提高GPU计算核心的利用率。数据结果表明,与CPU串行算法、基于开放多处理的并行算法和基于统一设备计算架构的并行算法相比,传递闭包并行算法在OpenCL架构下NVIDIA GeForce GTX 1070计算平台上分别获得了593.14倍、208.62倍和1.05倍的加速比。 展开更多
关键词 矩阵乘 传递闭包 图形处理器 开放式计算语言 并行算法
暂未订购 下载PDF
OclDNN:一种可应用于TensorFlow的通用DNN库 认领 引用 被引量:2
19
作者 陈锐 孙羽菲 +4 位作者 郭强 隋轶丞 周振辉 石昌青 张玉志 《计算机工程》 CAS CSCD 北大核心 2023年第4期138-148,共11页
深度学习模型的构建、训练以及推理离不开TensorFlow等机器学习框架中深度学习算子的支撑,对于卷积、池化等深度学习中被高频调用或计算量较大的算子,机器学习框架一般通过调用深度神经网络(DNN)库来提升计算效能。现有DNN库主要由英伟... 深度学习模型的构建、训练以及推理离不开TensorFlow等机器学习框架中深度学习算子的支撑,对于卷积、池化等深度学习中被高频调用或计算量较大的算子,机器学习框架一般通过调用深度神经网络(DNN)库来提升计算效能。现有DNN库主要由英伟达、AMD等少数国外厂商开发并根据自有硬件设备特点进行优化,但其封闭性导致其他厂商生产的通用加速器难以在深度学习领域发挥作用。为解决现有DNN库无法支持国产加速器的问题,使得深度学习模型能够调用国产加速器进行运算,研究跨平台的通用DNN库,通过对开源MIOpen的结构特点和调用方式进行分析,提出修改和重构该库的方法,并实现一种基于OpenCL的DNN(OclDNN)库。考虑到TensorFlow较高的流行度及其对DNN库调用的特殊性与复杂性,研究通用DNN库在TensorFlow中的集成方法,通过StreamExecutor中的OpenCL平台实现对OclDNN的调用。实验结果表明,OclDNN在英伟达、华为等不同厂商的计算设备上运算结果正确可靠,在相同实验环境下,深度学习算子使用OclDNN时的加速性能比传统CPU并行算法提升了5~60倍。 展开更多
关键词 深度神经网络库 深度学习 开放计算语言 硬件加速器 TensorFlow框架
暂未订购 下载PDF
基于GPU加速的全源对最短路径并行算法 认领 引用 被引量:2
20
作者 肖汉 肖诗洋 +1 位作者 李焕勤 周清雷 《云南大学学报(自然科学版)》 CAS CSCD 北大核心 2023年第5期1022-1032,共11页
针对最短路径算法处理大规模数据集低效的问题,提出了基于图形处理器(Graphics Processing Unit,GPU)加速的全源对最短路径并行算法.首先通过优化矩阵乘法算法实现了在工作组内和组间进行并行运算数据,然后减少了非规则行造成的工作项分... 针对最短路径算法处理大规模数据集低效的问题,提出了基于图形处理器(Graphics Processing Unit,GPU)加速的全源对最短路径并行算法.首先通过优化矩阵乘法算法实现了在工作组内和组间进行并行运算数据,然后减少了非规则行造成的工作项分支,最后降低了工作项对邻接矩阵计算条带存储资源的访问延时.实验结果表明,与基于AMD Ryzen5 1600X CPU的串行算法、基于开放多处理(Open Multi-Processing, OpenMP)并行算法和基于统一计算设备架构(Compute Unified Device Architecture, CUDA)并行算法相比,最短路径并行算法在开放式计算语言(Open Computing Language, OpenCL)架构下NVIDIA GeForce GTX 1 070计算平台上分别获得了196.35、36.76和2.25倍的加速比,验证了提出的并行优化方法的有效性和性能可移植性. 展开更多
关键词 最短路径 重复平方法 图形处理器 开放式计算语言 并行算法
暂未订购 下载PDF
上一页 1 2 3 下一页 到第
在线咨询 使用帮助 返回顶部 意见反馈