期刊文献+
共找到221篇文章
< 1 2 12 >
每页显示 20 50 100
基于OpenCL的FFT算法并行加速研究 认领 引用
1
作者 商宏杰 杜叔强 徐立龙 《兰州工业学院学报》 2026年第4期67-71,共5页
为提升大规模数据下的计算效率,基于OpenCL异构计算框架,设计并实现了一种基2时间抽取(Radix-2 DIT)的并行FFT算法。针对位逆转置换(Bit-reversal)、蝶形运算及内存访问层级进行了工程优化,通过位移掩码运算与常量内存加速访存效率。重... 为提升大规模数据下的计算效率,基于OpenCL异构计算框架,设计并实现了一种基2时间抽取(Radix-2 DIT)的并行FFT算法。针对位逆转置换(Bit-reversal)、蝶形运算及内存访问层级进行了工程优化,通过位移掩码运算与常量内存加速访存效率。重点对比了CPU串行执行、独立显卡(dGPU)及集成显卡(iGPU)在不同数据规模下的性能表现。实验结果表明:在小规模数据下,CPU凭借零传输开销表现最优;随规模增大,iGPU在中等规模任务中展现出最佳的能效比与性能平衡,加速比达9.28,在大规模场景下,dGPU并行优势显著,加速比达到11.47。研究结论为不同应用场景下的异构算力部署提供了阈值参考与优化建议。 展开更多
关键词 FFT DFT OpenCL GPU并行
暂未订购 下载PDF
基于OpenCL的超低延迟行情加速系统设计与实现 认领 引用
2
作者 冯一飞 丁楠 +1 位作者 叶钧超 柴志雷 《计算机应用与软件》 北大核心 2025年第3期15-21,共7页
针对量化高频交易中对数据处理的低延迟需求,定制一种超低延迟的行情系统,包含网络通信、数据解码和数据分析三部分功能,并在FPGA上进行实现。对各功能模块进行并行优化,构建全流水架构;对内存架构进行优化设计,提高数据传输速率;使用... 针对量化高频交易中对数据处理的低延迟需求,定制一种超低延迟的行情系统,包含网络通信、数据解码和数据分析三部分功能,并在FPGA上进行实现。对各功能模块进行并行优化,构建全流水架构;对内存架构进行优化设计,提高数据传输速率;使用流接口实现模块间数据传输优化,降低数据处理延迟。实验结果表明:在Alveo U50上最大吞吐率可达38.4 Gbit/s,行情处理延迟最低为678 ns,波动稳定在10 ns间,与软件方案相比,性能提升12倍,吞吐率提升1.87倍,且延迟稳定。 展开更多
关键词 Vitis OpenCL 现场可编程门阵列 高频量化交易 超低延迟 系统开发设计
暂未订购 下载PDF
基于OpenCL的FPGA异构平台聚焦波束形成算法实现 认领 引用
3
作者 徐逸强 《声学与电子工程》 2025年第1期44-47,共4页
聚焦波束形成涉及的分段聚焦补偿方法,计算量大,要求处理的实时性强,因此对硬件设备的计算和存储性能要求较高。文章采用基于OpenCL的FPGA异构平台,实现一套7个景深的聚焦波束形成算法,较CPU具有3.88的加速比。仿真实验结果证实了算法... 聚焦波束形成涉及的分段聚焦补偿方法,计算量大,要求处理的实时性强,因此对硬件设备的计算和存储性能要求较高。文章采用基于OpenCL的FPGA异构平台,实现一套7个景深的聚焦波束形成算法,较CPU具有3.88的加速比。仿真实验结果证实了算法结果准确性,并具有较高的计算效率。 展开更多
关键词 OpenCL FPGA 异构平台 计算加速 聚焦波束形成
暂未订购 下载PDF
基于OpenCL的拉普拉斯图像增强算法优化研究 认领 引用 被引量:20
4
作者 贾海鹏 张云泉 +2 位作者 龙国平 徐建良 李焱 《计算机科学》 CSCD 北大核心 2012年第5期271-277,共7页
OpenCL是面向异构计算平台的通用编程框架,然而由于硬件体系结构的差异,如何在平台间功能移植的基础上实现性能移植仍是有待研究的问题。当前已有算法优化研究一般只针对单一硬件平台,它们很难实现在不同平台上的高效运行。在分析了不同... OpenCL是面向异构计算平台的通用编程框架,然而由于硬件体系结构的差异,如何在平台间功能移植的基础上实现性能移植仍是有待研究的问题。当前已有算法优化研究一般只针对单一硬件平台,它们很难实现在不同平台上的高效运行。在分析了不同GPU平台底层硬件架构的基础上,从Global Memory的访存效率、GPU计算资源的有效利用率及其硬件资源的限制等多个角度考察了不同优化方法在不同GPU硬件平台上对性能的影响;并在此基础上实现了基于OpenCL的拉普拉斯图像增强算法。实验结果表明,优化后的算法在不考虑数据传输时间的前提下,在AMD和NVIDIA GPU上都取得了3.7~136.1倍、平均56.7倍的性能加速,优化后的kernel比NVIDIA NPP库中相应函数也取得了12.3%~346.7%、平均143.1%的性能提升,验证了提出的优化方法的有效性和性能可移植性。 展开更多
关键词 OpenCL 通用计算 拉普拉斯算法 跨平台
暂未订购 下载PDF
基于OpenCL的Viola-Jones人脸检测算法性能优化研究 认领 引用 被引量:14
5
作者 贾海鹏 张云泉 +1 位作者 袁良 李士刚 《计算机学报》 EI CAS CSCD 北大核心 2016年第9期1775-1789,共15页
Viola-Jones人脸检测算法是最为成功的可实用的人脸检测算法之一.然而,随着该算法所在领域数据处理规模的不断扩大,现有算法的性能已经越来越无法满足日益增长的交互性与实时性要求.使用GPU计算平台提升该算法性能,以满足日益增长的实... Viola-Jones人脸检测算法是最为成功的可实用的人脸检测算法之一.然而,随着该算法所在领域数据处理规模的不断扩大,现有算法的性能已经越来越无法满足日益增长的交互性与实时性要求.使用GPU计算平台提升该算法性能,以满足日益增长的实时性要求已经成为研究热点.然而,该算法在对GPU的实现和优化中,存在线程间负载不均衡的非规则特性,如果仅使用传统的优化方法,则难以在GPU计算平台上达到较高性能.针对此种情况,该文构建了针对此类算法的并行优化框架,通过Uberkernel、粗粒度并行、Persistent Thread、线程与数据的动态映射、全局及本地队列等优化方法的应用,突破了负载不均衡非规则特性导致的性能瓶颈,大幅提高了人脸检测算法在GPU计算平台上的性能.同时,该文通过对不同GPU计算平台关键性能参数的定义、抽取和传递,实现了该算法在不同GPU计算平台间的性能移植.实验结果表明,与OpenCV2.4中经过高度优化的CPU版本在Intel Xeon X5550CPU上的性能相比,优化后的算法在AMD HD7970和NVIDIA GTX680两个不同GPU计算平台上分别达到了11.24-20.27和9.24-17.62倍的加速比,不仅实现了高性能,而且实现了在不同GPU计算平台间的性能移植. 展开更多
关键词 OpenCL 负载不均衡 任务队列 线程与任务动态映射 性能移植
暂未订购 下载PDF
面向神威·太湖之光的国产异构众核处理器OpenCL编译系统 认领 引用 被引量:9
6
作者 伍明川 黄磊 +2 位作者 刘颖 何先波 冯晓兵 《计算机学报》 EI CAS CSCD 北大核心 2018年第10期2236-2250,共15页
近年来硬件设计呈现出异构化的趋势,如何有效开发并行程序成为制约异构系统发展的瓶颈之一已成为业界共识.我国自主研制的"神威·太湖之光"超级计算机,采用了国产片上异构众核处理器SW26010,为了降低程序员的编程难度,同... 近年来硬件设计呈现出异构化的趋势,如何有效开发并行程序成为制约异构系统发展的瓶颈之一已成为业界共识.我国自主研制的"神威·太湖之光"超级计算机,采用了国产片上异构众核处理器SW26010,为了降低程序员的编程难度,同时提高软件的移植效率,作者设计并实现了支持国产SW26010众核处理器的OpenCL编译系统.该编译系统实现了OpenCL平台模型、内存模型和执行模型到SW26010众核处理器的映射与优化机制,同时生成性能良好的可执行文件.最后通过实验验证了该编译系统的正确性和有效性,典型OpenCL应用经该编译系统编译后,在中小输入规模下,性能显著优于Intel Xeon Phi,与NVIDIA GPU可比;在较大输入规模下,受限于局存SPM的容量限制,性能略低于NVIDIA GPU. 展开更多
关键词 OpenCL 异构 国产众核处理器 编译系统
暂未订购 下载PDF
基于OpenCL的异构系统并行编程 认领 引用 被引量:23
7
作者 詹云 赵新灿 谭同德 《计算机工程与设计》 CSCD 北大核心 2012年第11期4191-4195,4293,共5页
针对异构处理器在传统通用计算中利用率低的问题,提出基于开放计算语言OpenCL(open computing language)的新的通用计算技术,它提供了统一的编程模型。介绍了OpenCL的特点、架构及实现原理等,并提出OpenCL性能优化策略。将OpenCL与计算... 针对异构处理器在传统通用计算中利用率低的问题,提出基于开放计算语言OpenCL(open computing language)的新的通用计算技术,它提供了统一的编程模型。介绍了OpenCL的特点、架构及实现原理等,并提出OpenCL性能优化策略。将OpenCL与计算统一设备架构CUDA(compute unified device architecture)及其它通用计算技术进行对比。对比结果表明,OpenCL能够充分发挥异构处理平台上各种处理器的性能潜力,充分合理地分配任务,为进行大规模并行计算提供了新的强有力的工具。 展开更多
关键词 异构处理器 通用计算 开放计算语言(OpenCL) 性能优化 计算统一设备架构(CUDA)
暂未订购 下载PDF
基于图神经网络的OpenCL程序自动优化启发式方法 认领 引用 被引量:5
8
作者 叶贵鑫 张宇翔 +2 位作者 张成 赵佳棋 王焕廷 《计算机研究与发展》 EI CSCD 北大核心 2023年第5期1121-1135,共15页
物联网的发展与普及促使计算机异构架构迅速发展,开放运算语言(open computing language,OpenCL)作为首个跨平台异构并行计算框架,具有标准化、可移植性等优点,但因不同平台下软硬件的复杂性和多样性,使OpenCL在性能上的移植性存在一定... 物联网的发展与普及促使计算机异构架构迅速发展,开放运算语言(open computing language,OpenCL)作为首个跨平台异构并行计算框架,具有标准化、可移植性等优点,但因不同平台下软硬件的复杂性和多样性,使OpenCL在性能上的移植性存在一定的缺陷.现有的方法通过深度学习构建优化模型来提高程序运行效率,但所构建的预测模型仅考虑代码的顺序依赖关系,忽略了语法语义信息,导致代码优化效果不明显.为解决上述问题,提出了一种基于多关系图神经网络的OpenCL程序自动优化启发式方法.该方法首先把OpenCL代码转换成多关系代码图,能够提取代码的深度结构与语法语义特征;然后利用改进后的图神经网络模型,将构建的代码图编码为高维的特征向量;最后使用决策网络完成任务预测.为验证方法的有效性,分别在异构设备映射和线程粗化因子预测2个任务上进行实验评估.结果表明,在异构设备映射任务中,最优设备预测准确率能够达到88.7%,相较于现有最先进的方法,加速比可提高7.6%;在线程粗化任务中,加速比相较于现有最优的方法可提高5.2%. 展开更多
关键词 启发式优化 图网络 OpenCL 深度学习 异构设备
暂未订购 下载PDF
TensorFlow中OpenCL核函数的实现与优化 认领 引用 被引量:5
9
作者 陈锐 孙羽菲 +6 位作者 程大果 郭强 陈禹乔 石昌青 隋轶丞 张宇哲 张玉志 《计算机学报》 EI CAS CSCD 北大核心 2022年第11期2456-2474,共19页
目前,异构计算技术已经被广泛应用于人工智能领域,旨在利用以GPGPU为主的并行加速设备和CPU协同工作,更高效地完成大规模的并行计算.深度学习模型的构建、训练以及推理离不开机器学习框架的支持,但目前主流的机器学习框架基本仅支持CUD... 目前,异构计算技术已经被广泛应用于人工智能领域,旨在利用以GPGPU为主的并行加速设备和CPU协同工作,更高效地完成大规模的并行计算.深度学习模型的构建、训练以及推理离不开机器学习框架的支持,但目前主流的机器学习框架基本仅支持CUDA异构编程模型.CUDA的私有性和封闭性导致机器学习框架严重依赖于英伟达GPGPU.众多其它厂商的硬件加速器,尤其是国产加速器难以充分发挥其在深度学习中的潜力.使用开源统一异构编程标准OpenCL代替私有的CUDA编程模型,是打破这一技术壁垒的有效方法.本文提出了TensorFlow中CUDA到OpenCL核函数的代码转换方案,总结整理了核函数转换的基本规则、典型难点问题的解决方法以及OpenCL核函数的性能优化等关键技术.本文首次完成了TensorFlow 2.2版本中135个OpenCL核函数的实现.经一系列测试验证,转换生成的135个OpenCL核函数能够在多种支持OpenCL标准的加速器上正确运行,优化后,近八成的OpenCL核函数在英伟达Tesla V100S上达到了与CUDA核函数相当的计算性能.测试结果验证了本文提出的CUDA到OpenCL核函数转换方案的通用性及有效性,包含OpenCL核函数的TensorFlow版本能够在直接适配跨厂商加速器设备的同时保持较好的计算性能. 展开更多
关键词 硬件加速器 异构编程环境 CUDA OpenCL TensorFlow
暂未订购 下载PDF
面向OpenCL模型的GPU性能优化 认领 引用 被引量:22
10
作者 陈钢 吴百锋 《计算机辅助设计与图形学学报》 EI CSCD 北大核心 2011年第4期571-581,共11页
GPU的高性价比吸引了越来越多的通用计算.为充分发挥异构处理平台下GPU的通用计算能力,提出面向OpenCL模型的性能优化方法.该方法建立源程序的多面体表示,分别对GPU的全局存储器和快速存储器进行优化与分配;通过检测存储访问模式... GPU的高性价比吸引了越来越多的通用计算.为充分发挥异构处理平台下GPU的通用计算能力,提出面向OpenCL模型的性能优化方法.该方法建立源程序的多面体表示,分别对GPU的全局存储器和快速存储器进行优化与分配;通过检测存储访问模式发掘可向量化的存储访问实例,利用数据空间变换对存储访问模式进行转换,进而使用向量数据类型提高片外存储器的带宽利用率;通过检测程序中的数据重用,根据数据的访问属性和OpenCL存储模型的特性实现快速存储器的有效分配与优化,提高了片上存储器的使用效率.采用文中方法对6个测试程序进行实验的结果表明,程序的性能提高了1.6~8.4倍,证实了其有效性. 展开更多
关键词 OpenCL GPU 性能优化 异构处理 通用计算 多面体表示
暂未订购 下载PDF
基于OpenCL的3DES算法FPGA加速器 认领 引用 被引量:7
11
作者 吴健凤 郑博文 +1 位作者 聂一 柴志雷 《计算机工程》 CAS CSCD 北大核心 2021年第12期147-155,162,共9页
在数字货币、区块链、云端数据加密等领域,传统以软件方式运行的数据加解密存在计算速度慢、占用主机资源、功耗高等问题,而以Verilog/VHDL等方式实现的现场可编程门阵列(FPGA)加解密系统又存在开发周期长、维护升级困难等问题。针对3DE... 在数字货币、区块链、云端数据加密等领域,传统以软件方式运行的数据加解密存在计算速度慢、占用主机资源、功耗高等问题,而以Verilog/VHDL等方式实现的现场可编程门阵列(FPGA)加解密系统又存在开发周期长、维护升级困难等问题。针对3DES算法,提出一种基于OpenCL的FPGA加速器设计方案。设计具有48轮迭代的流水并行结构,在数据传输模块中采用数据存储调整、数据位宽改进策略提高内核实际带宽利用率,在算法加密模块中采用指令流优化策略形成流水线并行架构,同时采用内核矢量化、计算单元复制策略进一步提高内核性能。实验结果表明,该加速器在Intel Stratix 10 GX2800上可获得111.801 Gb/s的吞吐率,与Intel Core i7-9700 CPU相比性能提升372倍,能效提升644倍,与NvidiaGeForce GTX 1080Ti GPU相比性能提升20%,能效提升9倍。 展开更多
关键词 OpenCL框架 现场可编程门阵列 加解密算法 3DES算法 流水并行结构
暂未订购 下载PDF
基于OpenCL的实时KD-Tree与动态场景光线跟踪 认领 引用 被引量:8
12
作者 卢贺齐 鲍鹏 冯结青 《计算机辅助设计与图形学学报》 EI CSCD 北大核心 2013年第7期963-973,共11页
目前,基于GPU或多核CPU加速的光线跟踪算法是与硬件相关的.研究具有跨平台性能的实时光线跟踪算法既具有挑战性,又具有很强的应用价值.为此,提出一种基于OpenCL并且跨平台的动态场景实时光线跟踪绘制算法.首先通过对通用GPU并行处理性... 目前,基于GPU或多核CPU加速的光线跟踪算法是与硬件相关的.研究具有跨平台性能的实时光线跟踪算法既具有挑战性,又具有很强的应用价值.为此,提出一种基于OpenCL并且跨平台的动态场景实时光线跟踪绘制算法.首先通过对通用GPU并行处理性能进行发掘,将光线跟踪中KD-Tree建立、场景遍历和绘制3个过程均设计在GPU上,而CPU只负责其中各过程的调度,从而充分利用了GPU的计算性能,并有效地降低了数据传输开销;通过设计并行分区、并行SAH、紧密的数据管理以及区间性叶结点存储等算法,在GPU中高效、高质量地建立动态场景的KD-Tree,同时高质量的KD-Tree也有效地加速了场景的遍历速度.该算法以广度优先和大规模并行模式建立KD-Tree,更具通用性,既可以运行于NVIDIA GPU(CUDA GPU),也可以运行于AMD GPU.实验结果表明,文中算法可以在NVIDIA GPU和AMD GPU上对中等规模的动态场景实现实时光线跟踪绘制. 展开更多
关键词 KD—Tree 表面积启发式 GPU并行计算 OpenCL 光线跟踪 动态场景
暂未订购 下载PDF
一种基于OpenCL的Lukas-Kanade光流并行加速算法 认领 引用 被引量:6
13
作者 吴进 李乔深 +1 位作者 闵育 马思敏 《电讯技术》 北大核心 2018年第8期871-877,共7页
LK(Lukas-Kanade)光流法在运动目标检测和跟踪领域具有广泛应用,但其计算复杂、速度慢,难以适应异构硬件平台。为实现LK光流法在不同平台上的高效运行,设计了一种基于开放式计算语言(OpenCL)的LK光流法并行算法。该算法通过将二维图像... LK(Lukas-Kanade)光流法在运动目标检测和跟踪领域具有广泛应用,但其计算复杂、速度慢,难以适应异构硬件平台。为实现LK光流法在不同平台上的高效运行,设计了一种基于开放式计算语言(OpenCL)的LK光流法并行算法。该算法通过将二维图像上像素点上的稠密计算映射到多线程上实现数据并行,并基于OpenCL平台的共享内存等优化方法减小了主机内存与设备内存数据传输。实验测试表明,该算法相比于多核CPU下的基础OpenCV函数库中的LK算法获得了最高31倍的加速比,同时在速度上与统一计算设备体系结构(CUDA)加速的LK光流法相近。此外,还在多种不同设备下验证了加速算法的平台通用性。 展开更多
关键词 行为识别 目标跟踪 Lukas-Kanade光流法 OpenCL异构计算 GPU并行加速
暂未订购 下载PDF
基于OpenCL的FPGA设计优化方法研究 认领 引用 被引量:8
14
作者 范兴山 彭军 黄乐天 《电子技术应用》 北大核心 2014年第1期16-19,共4页
FPGA因其强大的运算能力成为了众多高性能应用的最佳选择,但其传统的开发方法存在门槛高、周期长等众多不足。OpenCL作为跨平台的开发语言,为FPGA提供了一种全新的开发方法。此方法开发周期短、抽象层次高、可移植性强,弥补了传统开发... FPGA因其强大的运算能力成为了众多高性能应用的最佳选择,但其传统的开发方法存在门槛高、周期长等众多不足。OpenCL作为跨平台的开发语言,为FPGA提供了一种全新的开发方法。此方法开发周期短、抽象层次高、可移植性强,弥补了传统开发方式的不足。介绍了OpenCL开发FPGA的相关优化方法,以矩阵乘法和QR分解为例,深入分析了各种优化方法的优缺点及适用情况。 展开更多
关键词 FPGA OpenCL 矩阵乘法 QR分解
暂未订购 下载PDF
基于OpenCL的图像积分图算法优化研究 认领 引用 被引量:7
15
作者 贾海鹏 张云泉 徐建良 《计算机科学》 CSCD 北大核心 2013年第2期1-7,共7页
图像积分图算法在快速特征检测中有着广泛的应用,通过GPU对其进行性能加速有着重要的现实意义。然而由于GPU硬件架构的复杂性和不同硬件体系架构间的差异性,完成图像积分图算法在GPU上的优化,进而实现不同GPU平台间的性能移植是一件非... 图像积分图算法在快速特征检测中有着广泛的应用,通过GPU对其进行性能加速有着重要的现实意义。然而由于GPU硬件架构的复杂性和不同硬件体系架构间的差异性,完成图像积分图算法在GPU上的优化,进而实现不同GPU平台间的性能移植是一件非常困难的工作。在分析不同GPU平台底层硬件架构的基础上,从片外访存带宽利用率、计算资源利用率和数据本地化等多个角度考察了不同优化方法在不同GPU硬件平台上对性能的影响。并在此基础上实现了基于OpenCL的图像积分图算法。实验结果表明,优化后的算法在AMD和NVIDIA GPU上分别取得了11.26和12.38倍的性能加速,优化后的GPU kernel比NVIDIA NPP库中的相应函数也分别取得了55.01%和65.17%的性能提升。验证了提出的优化方法的有效性和性能可移植性。 展开更多
关键词 OpenCL GPU 图像积分图算法 跨平台
暂未订购 下载PDF
面向OpenCL架构的大规模生物序列比对 认领 引用 被引量:2
16
作者 陈钢 韦刚 +2 位作者 李国波 裴颂文 吴百锋 《小型微型计算机系统》 CSCD 北大核心 2012年第2期392-398,共7页
为提高生物序列比对算法的性能和效率,提出一种异构处理平台下可移植的大规模生物序列比对算法及其优化方法.通过改变原有Smith-Waterman算法的计算流程和数据依赖关系,增加序列比对的并行性;通过改变存储器布局后使用向量数据类型,提... 为提高生物序列比对算法的性能和效率,提出一种异构处理平台下可移植的大规模生物序列比对算法及其优化方法.通过改变原有Smith-Waterman算法的计算流程和数据依赖关系,增加序列比对的并行性;通过改变存储器布局后使用向量数据类型,提高全局存储器的带宽利用率;通过增加偏移量改变存储器模块的映射方式,避免模块访问冲突,提高局部存储器的使用效率.实验结果表明,优化后的生物序列比对性能提升了近100倍. 展开更多
关键词 OpenCL GPU 生物序列比对 Smith-Waterman算法
暂未订购 下载PDF
基于OpenCL的并行kNN算法设计与实现 认领 引用 被引量:3
17
作者 杨朋霖 冯百明 +1 位作者 周志阳 温向慧 《计算机工程与科学》 CSCD 北大核心 2017年第12期2198-2202,共5页
kNN算法是机器学习和数据挖掘程序中经常使用的经典算法。随着数据量的增大,kNN算法的执行时间急剧上升。为了有效利用现代计算机的GPU等计算单元减少kNN算法的计算时间,提出了一种基于OpenCL的并行kNN算法,该算法对距离计算和排序两个... kNN算法是机器学习和数据挖掘程序中经常使用的经典算法。随着数据量的增大,kNN算法的执行时间急剧上升。为了有效利用现代计算机的GPU等计算单元减少kNN算法的计算时间,提出了一种基于OpenCL的并行kNN算法,该算法对距离计算和排序两个瓶颈点进行并行化,在距离计算阶段使用细粒度并行化策略和优化的线程模型,排序阶段使用优化内存模型的双调排序。以UCI数据集letter为测试集,分别使用E8400和GTS450运行kNN算法进行测试,采用GPU加速的并行kNN算法的计算速度比CPU版提高了40.79倍。 展开更多
关键词 OpenCL GPU kNN 双调排序
暂未订购 下载PDF
Three-dimensional multi-phase-field simulation of eutectoid alloy based on OpenCL parallel 认领 引用 被引量:2
18
作者 Chang-sheng Zhu Yu-jie Li +2 位作者 Fang-lan Ma Li Feng Peng Lei 《China Foundry》 SCIE CAS CSCD 2021年第3期239-248,共10页
Seeking high-performance computing methods to solve the problem of a large amount of calculation,low calculation efficiency,and small simulation scale on the traditional single central processing unit (CPU) platform i... Seeking high-performance computing methods to solve the problem of a large amount of calculation,low calculation efficiency,and small simulation scale on the traditional single central processing unit (CPU) platform is of great value to the simulation study of micro-structure.In this study,based on the three-dimensional multi-phase-field model of KKSO coupling phase-field and solute field,the open computing language (OpenCL) + graphics processing unit (GPU) heterogeneous parallel computing technology is used to simulate the eutectoid growth of Fe-C alloy and the end growth process of pearlite under pure diffusion.The effects of initial supercooling and different diffusion coefficients on the growth morphology of lamellar pearlite were investigated.The results show that ferrite and cementite are perpendicular to the front of the solid-solid interface and are coupled and coordinated to grow,and there is no leading phase under the initial supercooling degree of 20 K.With the continuous increase of the initial supercooling degree (19 K-22 K),the morphology changes of the eutectoid layer are as follows:cementite stops growing → slice amplitude increases → regular symmetric growth → oblique growth → layer merge.With the increase of the diffusion coefficient from 3×10-13 m2·s-1 to 15×10-13 m2·s-1,the growth rate of the microstructure of the lamellar pearlite increases linearly,and there is no obvious change in the frontal appearance of the pearlite. 展开更多
关键词 phase-field model lamellar pearlite eutectoid phase transition OpenCL Fe-C alloy
暂未订购 下载PDF
OpenCL加速的基于虚拟节点法的柔性体实时切割仿真 认领 引用 被引量:2
19
作者 贾世宇 潘振宽 张维忠 《计算机辅助设计与图形学学报》 EI CSCD 北大核心 2014年第10期1852-1859,共8页
为了提高柔性体变形仿真运行速度并且解决切割对变形计算稳定性的负面影响,提出了能与GPU加速的变形算法协同运作的基于虚拟节点法的柔性体实时切割仿真方法.柔性体模型由真实四面体网格嵌入虚拟四面体网格中构成,前者用于碰撞处理和图... 为了提高柔性体变形仿真运行速度并且解决切割对变形计算稳定性的负面影响,提出了能与GPU加速的变形算法协同运作的基于虚拟节点法的柔性体实时切割仿真方法.柔性体模型由真实四面体网格嵌入虚拟四面体网格中构成,前者用于碰撞处理和图形渲染,而后者则用于变形计算.切割算法首先分裂真实四面体网格;然后复制包含超过一块真实四面体连通碎片的虚拟四面体,每个复制品包含一块真实四面体碎片;再根据真实四面体之间的连接关系更新虚拟四面体之间的连接关系;最后更新真实四面体网格与虚拟四面体网格之间的镶嵌关系.为了确保仿真系统不被限制在NVIDIA公司的GPU上,GPU加速使用OpenCL实现.仿真测试结果表明,该方法可以在任意多次切割情况下保持变形计算稳定不发散,并且在NVIDIA公司和AMD公司的GPU上都可以正确运行. 展开更多
关键词 柔性体 实时变形 实时切割仿真 虚拟节点法 GPU加速 OpenCL
暂未订购 下载PDF
基于OpenCL的TensorFlow框架中Element-Wise算子实现 认领 引用 被引量:3
20
作者 隋轶丞 石昌青 +3 位作者 孙羽菲 张玉志 陈禹乔 张宇哲 《数据与计算发展前沿(中英文)》 CSCD 2022年第3期19-29,共11页
【目的】深度学习模型以较强的建模性能和优秀的多场景适应能力被广泛应用于各类典型人工智能领域。目前通常采用异构并行计算技术满足深度学习模型的算力需求,然而目前深度学习框架普遍使用CUDA或ROCm等编程模型,仅能支持特定厂商设备... 【目的】深度学习模型以较强的建模性能和优秀的多场景适应能力被广泛应用于各类典型人工智能领域。目前通常采用异构并行计算技术满足深度学习模型的算力需求,然而目前深度学习框架普遍使用CUDA或ROCm等编程模型,仅能支持特定厂商设备;对于通用异构计算设备,需要通过OpenCL编程标准实现支持,因此我们着力于实现TensorFlow框架的OpenCL版本。【方法】本文对TensorFlow框架中主要基于Eigen库提供的接口实现的Element-Wise算子进行代码分析,拆解对应结构体和类的封装方式,并基于OpenCL的编程标准对Element-Wise算子进行实现和封装,确保了代码的规范性和可扩展性。【结果】本文以CUDA算子为基准,对OpenCL的Element-Wise算子进行测试和对比,实验结果分别从正确性和计算效率两方面验证了本文OpenCL版本算子实现的可行性。【结论】作为实现OpenCL版本的TensorFlow框架这一工作的重要组成部分,本文成功实现了TensorFlow框架中Element-Wise算子的OpenCL版本,并经过实验验证了本文实现的算子的计算准确性和计算效率。 展开更多
关键词 OpenCL TensorFlow 核函数
暂未订购 下载PDF
上一页 1 2 12 下一页 到第
在线咨询 使用帮助 返回顶部 意见反馈