期刊文献+
共找到211篇文章
< 1 2 11 >
每页显示 20 50 100
三维直流电阻率法全息数值模拟及CPU-GPU并行架构 认领 引用
1
作者 戴世坤 朱德祥 +4 位作者 凌嘉宣 陈轻蕊 田红军 赵文学 才智杰 《地球物理学报》 SCIE EI CAS CSCD 北大核心 2026年第4期1727-1740,共14页
针对传统数值模拟方法在计算量大、边界条件近似及三维偏微分方程物理信息准确模拟等方面的局限性,本文提出了一种高效、高精度的全息数值模拟方法.该方法基于真实地球物理模型,通过恰当的途径准确获取异常电位的空间-波数谱,并将其转... 针对传统数值模拟方法在计算量大、边界条件近似及三维偏微分方程物理信息准确模拟等方面的局限性,本文提出了一种高效、高精度的全息数值模拟方法.该方法基于真实地球物理模型,通过恰当的途径准确获取异常电位的空间-波数谱,并将其转换回空间域,从而得到真实的电场分布.具体而言,本文对空间域异常电位满足的三维偏微分方程进行水平方向的二维傅里叶正变换,将其转化为不同波数下的一维常微分方程求解.水平方向采用全息傅里叶变换,垂直方向引入行波分解,有效消除上下边界效应,确保空间域与波数域信息的完整性,因此将该方法称为全息数值模拟理论.网格大小在水平和垂直方向上均可自由调整.基于算法的高度并行性,实现了CPUGPU并行架构.通过设计异常球体模型,分析了异常场的波数谱分布特征,验证了波数域对数采样规则的正确性;构建随机模型,验证了算法的准确性;设计边界异常体,将本文算法与有限元算法进行对比.结果表明,本文算法在保持计算精度的同时显著提升了运算效率.此外,并行实验表明,CPU-GPU并行架构适用于本文算法,千万级节点模型单次迭代计算仅需数秒.此外,通过设计起伏地形模型,验证了算法对复杂地形的适应性. 展开更多
关键词 三维直流电阻率法 全息数值模拟 全息傅里叶变换 CPU-GPU并行架构
暂未订购 下载PDF
基于CPU-GPU异步调度与R-MWM算子的大规模电力系统潮流算法 认领 引用
2
作者 单健 陈启民 《云南电力技术》 2026年第3期56-61,共6页
针对大规模电力系统潮流计算在极端工况下的不收敛及实时性难题,本文提出一种基于CPU-GPU异步调度与残差补偿Maddness卷积算子的改进全纯嵌入潮流算法。首先利用全纯嵌入理论将非线性潮流方程转化为复平面内的全纯函数解析问题,确保算... 针对大规模电力系统潮流计算在极端工况下的不收敛及实时性难题,本文提出一种基于CPU-GPU异步调度与残差补偿Maddness卷积算子的改进全纯嵌入潮流算法。首先利用全纯嵌入理论将非线性潮流方程转化为复平面内的全纯函数解析问题,确保算法的全局收敛性。其次针对高阶递归项计算量爆炸的问题,引入Maddness矩阵乘法优化理论,构建了零乘法查找表卷积算子,并设计一阶残差补偿机制以维持10-7级精度。最后设计了5+15阶异步流水线调度逻辑。对12类典型系统的仿真表明,本文方法在25000节点系统中较传统内点法提速逾16倍,较串行HEM提速21.28倍,为大电网在线安全预警提供了高效算力支撑。 展开更多
关键词 电力系统潮流计算 CPU-GPU异步调度 全纯嵌入法 Madness矩阵乘法
暂未订购 下载PDF
An Architecture-Aware Hybrid CPU-GPU Approach for WEMA-Based Fast Pattern Matching in Network Intrusion Detection Systems 认领 引用
3
作者 Adnan Hnaif Hanadi Al-Shawabkah +1 位作者 Ayman Alqafaan Mohammad Alia 《Computers, Materials & Continua》 SCIE EI 2026年第9期1100-1115,共16页
Many fast pattern-matching mechanisms are used in NIDS(Network Intrusion Detection Systems)to filter higher volumes of network traffic prior to invoking expensive rule verification stages.This filtering phase in signa... Many fast pattern-matching mechanisms are used in NIDS(Network Intrusion Detection Systems)to filter higher volumes of network traffic prior to invoking expensive rule verification stages.This filtering phase in signature-based engines,such as Snort,needs to preserve exact matching semantics while being able to process at high throughput on commodity hardware.Here,we introduce a hybrid CPU–GPU architecture-aware framework for exact multi-pattern matching based on the Weighted Exact Matching Algorithm(WEMA).WEMA performs the most relevant matching based on deterministic ordered indexing of category units,which eliminates chaotic control flow(which occurs with automata learning)and also brings out more regular memory access.An extensive evaluation across CPU-only,GPU-only,and hybrid CPU–GPU execution models is performed to analyze how WEMA interacts with heterogeneous hardware architectures.Informed by these observations,we propose a hybrid design with CPU-based control-intensive tasks—rule parsing,index construction,batching,and rule verification—retained on the CPU while selective data-parallel payload scanning is off-loaded to the GPU.Experimental results show that CPU-only execution on a commodity multicore CPU and integrated GPU platform delivers stable performance across the entire range of payload sizes,while the hybrid model achieves modest but repeatable improvements for small and medium workloads.The architecture evaluated here offers a relatively small advantage for GPU-only execution.Given the very nature of NIDS alongside the results provided in this paper,it is clear that WEMA-based acceleration on NIDS highly depends on hardware features and workload size,while selective,architecture-aware GPU utilization is crucial to maintain deterministic run-time characteristics in security-critical applications. 展开更多
关键词 NIDS WEMA exact string-matching algorithms hybrid CPUGPU architecture heterogeneous computing
暂未订购 下载PDF
基于CPU-GPU异构加速的模型推理方法 认领 引用
4
作者 张周攀 周书民 陈锐 《机电工程技术》 2026年第9期109-113,共5页
随着神经网络的不断发展,模型参数量不断增大,导致推理速度变慢。与此同时,GPU设备高速发展,为CPU和GPU异构计算体系在神经网络模型加速推理方面创造了更多的应用空间。提出采用CPU与GPU异构方式来加速神经网络模型推理。推理架构通过设... 随着神经网络的不断发展,模型参数量不断增大,导致推理速度变慢。与此同时,GPU设备高速发展,为CPU和GPU异构计算体系在神经网络模型加速推理方面创造了更多的应用空间。提出采用CPU与GPU异构方式来加速神经网络模型推理。推理架构通过设计LSTM模型实现静态模型层级设备分配,而静态分配只单独考虑本层执行速度,无法结合模型上下层与硬件设备信息。静态分配信息通过引入参数量、输入数据体积、显存占用、GPU利用率、批次大小及数据空间维度等信息,共同构建DQN系列强化学习(RL)模型,通过ε-贪婪策略实现动态平衡,输出最优调度策略。当检测到没有GPU设备时,推理架构不再工作,整个推理过程集中在CPU设备上运行。实验结果表明,异构推理系统在推理5张图片时,会逐步更新RL策略。当调度策略达到最优时,对比纯CPU推断速度提高54.68%,对比纯GPU推断速度提高14.51%,对比Layer-Switched策略环境推断速度提高3.92%。通过与LayerSwitched策略在相同设备条件下对比,所设计的异构推理架构为克服异构计算环境下的性能瓶颈提供了一种全新的解决方案。 展开更多
关键词 CPU-GPU LSTM RL 异构推断
暂未订购 下载PDF
CPU/GPU异构资源下机器双编码—解码调度算法设计 认领 引用
5
作者 黎元宝 冯汉枣 刘运奇 《微型电脑应用》 2026年第3期361-364,共4页
为了解决CPU/GPU异构资源易产生负载失衡问题,设计针对CPU/GPU异构资源的机器双编码—解码调度算法。设计异构资源数据处理算法的框架。设计数据处理顺序表和编码矩阵,利用遗传算法进行任务调度和优化,以决定编码—解码任务的执行顺序... 为了解决CPU/GPU异构资源易产生负载失衡问题,设计针对CPU/GPU异构资源的机器双编码—解码调度算法。设计异构资源数据处理算法的框架。设计数据处理顺序表和编码矩阵,利用遗传算法进行任务调度和优化,以决定编码—解码任务的执行顺序和分配给不同处理器的方式。根据调度结果,将编码任务分配给CPU进行处理,将解码任务分配给GPU进行处理。在编码任务和解码任务完成后,将两者的结果进行合并,并输出最终的处理结果。实验表明,双编码—解码调度算法的加速比在0.9以上,在3种系统配置下的时间比例始终低于40%,内存开销小于15 KB,具有良好的调度效果。 展开更多
关键词 CPU/GPU异构资源 双编码—解码调度算法 遗传算法 数据调度
暂未订购 下载PDF
基于CPU与GPU的抗干扰雷达信号处理系统设计 认领 引用
6
作者 孙慧敏 王勇 +3 位作者 雷刚 开根深 张军 张开生 《火控雷达技术》 2026年第2期29-37,42,共9页
随着电磁环境日益复杂,现代雷达系统面临严峻的干扰挑战,对信号处理的实时性与算法复杂度提出了更高的要求。本文提出一种基于CPU与GPU异构计算平台的抗干扰雷达信号处理系统设计方案。该方案充分发挥CPU在逻辑控制与任务调度方面的优势... 随着电磁环境日益复杂,现代雷达系统面临严峻的干扰挑战,对信号处理的实时性与算法复杂度提出了更高的要求。本文提出一种基于CPU与GPU异构计算平台的抗干扰雷达信号处理系统设计方案。该方案充分发挥CPU在逻辑控制与任务调度方面的优势,结合GPU在大规模并行计算方面的强大能力,构建了一种高效协同的异构处理架构。与传统FPGA或DSP方案相比,本文实现了雷达信号处理系统能在保证高性能的同时,提供更强的灵活性和更低的开发门槛,具有一定的工程价值。 展开更多
关键词 CPU 抗干扰 雷达信号处理 GPU 异构计算
暂未订购 下载PDF
CPU+GPU并行加速的星链信号实时高精度频率估计算法 认领 引用 被引量:1
7
作者 代传金 秦培杰 +1 位作者 李林 臧博 《航空学报》 EI CAS CSCD 北大核心 2025年第24期215-228,共14页
星链下行信号实时高精度频率估计算法设计与实现是LEO卫星动态机会导航工程应用的关键技术。针对传统极大似然估计、频域滑窗估计及卡尔曼滤波等算法在低信噪比星链信号捕获中鲁棒性差、实时性不足的问题,提出多子载波联合频偏估计(MC-J... 星链下行信号实时高精度频率估计算法设计与实现是LEO卫星动态机会导航工程应用的关键技术。针对传统极大似然估计、频域滑窗估计及卡尔曼滤波等算法在低信噪比星链信号捕获中鲁棒性差、实时性不足的问题,提出多子载波联合频偏估计(MC-JFE)算法,通过深度挖掘信号多子载波结构特征,联合优化载波频率与频率间隔参数,提升频率估计精度与实时性。为突破MC-JFE算法工程应用中密集计算瓶颈,创新构建了一种CPU+GPU异构并行的加速处理架构,通过协同调度CPU逻辑控制与GPU大规模并行计算能力,算法执行效率实现超一个数量级提升。为验证设计算法的理论与技术实现有效性,基于半实物仿真平台生成的星链下行信标数据,开展了5978颗星链卫星信号实时频率估计试验,并结合我国边境地区实测信号进行多普勒估计算法对比研究。结果表明:所提出的MC-JFE算法在−10~10 dB全信噪比范围内保持最低估计误差边界,估计精度提升50%以上(0 dB);通过相位信息融合机制,在部分子载波中断时维持稳定输出;基于CUDA最优线程块配置的CPU+GPU异构架构,加速比峰值达47倍,较传统CPU方案提升2.8倍,且精度与加速比呈正相关特性,为LEO卫星动态机会导航提供了高可靠、强实时的频率估计技术支撑,具有重要工程应用价值。 展开更多
关键词 星链下行信号 高精度频率估计 CPU+GPU异构 并行加速 多线程处理
暂未订购 下载PDF
利用CPU和GPU混合并行方法快速构建海洋扰动重力梯度基准图 认领 引用
8
作者 黄炎 李姗姗 +3 位作者 吕明昊 范雕 谭勖立 冯进凯 《武汉大学学报(信息科学版)》 EI CAS CSCD 北大核心 2025年第3期515-527,共13页
高精度、高分辨率的海洋扰动重力梯度基准图是将水下扰动重力梯度辅助惯性导航付诸于实践的关键技术之一,可依据边值问题理论,基于移去-恢复技术计算求得。基于传统串行算法存在计算效率低、耗时长等问题,为满足大范围乃至全球海洋扰动... 高精度、高分辨率的海洋扰动重力梯度基准图是将水下扰动重力梯度辅助惯性导航付诸于实践的关键技术之一,可依据边值问题理论,基于移去-恢复技术计算求得。基于传统串行算法存在计算效率低、耗时长等问题,为满足大范围乃至全球海洋扰动重力梯度基准图的快速构建需求,利用中央处理器(central processing unit,CPU)与图形处理器(graph processing unit,GPU)混合并行(CPU+GPU)编程平台,设计了一种高效的混合并行计算方案。首先,利用数组收缩膨胀方法,有效解决了CPU进行勒让德函数递推计算过程中内存读写冲突问题;然后,引入Hilbert空间填充曲线,将二维格网重力异常数据降维成为具有高度聚簇性的一维数组,通过其在GPU显存中的快速索引,实现了Stokes积分的高效计算。在CPU型号为Intel Xeon(R)Gold 6130、GPU型号为Tesla V100的计算机上进行实验,利用该混合并行方案计算6°×6°范围、1′分辨率的全张量海洋扰动重力梯度基准图仅需15.84 s,而传统串行方法需要35 min以上;计算2°×2°范围、30″分辨率基准图仅需22.7 s,串行方法则需要52 min;计算2°×2°范围、10″分辨率基准图需要26.7 min,串行方法则需要两天以上。在保证并行计算绝对误差小于等于1×10-6 E、Txx+Tyy+Tzz绝对值的最大值小于0.1 E、均方根误差小于0.01 E的前提下,实现了全球全张量海洋扰动重力梯度基准图模型的快速构建。 展开更多
关键词 扰动重力梯度 边值问题 CPU GPU 混合并行
暂未订购 下载PDF
基于CPU-GPU的超音速流场N-S方程数值模拟 认领 引用
9
作者 卢志伟 张皓茹 +3 位作者 刘锡尧 王亚东 张卓凯 张君安 《中国机械工程》 EI CAS CSCD 北大核心 2025年第9期1942-1950,共9页
为深入分析超音速流场的特性并提高数值计算效率,设计了一种高效的加速算法。该算法充分利用中央处理器-图形处理器(CPU-GPU)异构并行模式,通过异步流方式实现数据传输及处理,显著加速了超音速流场数值模拟的计算过程。结果表明:GPU并... 为深入分析超音速流场的特性并提高数值计算效率,设计了一种高效的加速算法。该算法充分利用中央处理器-图形处理器(CPU-GPU)异构并行模式,通过异步流方式实现数据传输及处理,显著加速了超音速流场数值模拟的计算过程。结果表明:GPU并行计算速度明显高于CPU串行计算速度,其加速比随流场网格规模的增大而明显提高。GPU并行计算可以有效提高超音速流场的计算速度,为超音速飞行器的设计、优化、性能评估及其研发提供一种强有力的并行计算方法。 展开更多
关键词 超音速流场 中央处理器-图形处理器 异构计算 有限差分
暂未订购 下载PDF
基于云平台CPU与GPU协同处理的光学卫星遥感影像正射融合方法 认领 引用
10
作者 于潇 张一 +2 位作者 吕丽红 张强 王得成 《空间科学学报》 CAS CSCD 北大核心 2025年第5期1416-1424,共9页
系统探讨了基于国产云平台调度下自主可控CPU和GPU协同处理的光学卫星遥感影像正射融合方法执行效率问题,通过数据流配置、中间数据存储访问优化等手段进一步提高了该方法执行效率.在云平台调度下,使用飞腾S2500和英伟达A100对高分二号... 系统探讨了基于国产云平台调度下自主可控CPU和GPU协同处理的光学卫星遥感影像正射融合方法执行效率问题,通过数据流配置、中间数据存储访问优化等手段进一步提高了该方法执行效率.在云平台调度下,使用飞腾S2500和英伟达A100对高分二号卫星多光谱影像进行正射融合的试验,结果表明,该方法可很大程度提高光学卫星遥感影像正射融合效率,与传统X86架构CPU与GPU协同的正射融合算法相比,加速比为14.3倍以上,数据处理时间压缩至8.4 s内,其中GPU运算耗时仅1 s,可满足并优化大数据量的光学卫星遥感影像快速正射融合的要求. 展开更多
关键词 正射融合 国产云平台 CPUGPU协同处理 数据流配置 存储访问优化
暂未订购 下载PDF
基于CPU-GPU协同的迭代物理光学并行算法研究 认领 引用
11
作者 曹倩 周远国 +1 位作者 任强 王焱 《电波科学学报》 CSCD 北大核心 2025年第3期427-438,共12页
随着雷达技术与无人驾驶的结合,电磁仿真在无人驾驶领域得到了广泛应用。当利用迭代物理光学(iterative physical optics,IPO)法求解电大散射体雷达散射截面(radar cross section,RCS)时,未知量数目比较大,导致占用内存和计算耗时非常... 随着雷达技术与无人驾驶的结合,电磁仿真在无人驾驶领域得到了广泛应用。当利用迭代物理光学(iterative physical optics,IPO)法求解电大散射体雷达散射截面(radar cross section,RCS)时,未知量数目比较大,导致占用内存和计算耗时非常大。为解决该问题,本文引入参数空间技术优化IPO算法,提高了电大尺寸RCS的计算效率,并引入计算统一设备架构(compute unified device architecture,CUDA)技术,在中央处理器(central processing unit,CPU)与图形处理器(graphics processing unit,GPU)协同平台上实现了电大尺寸目标RCS的并行计算。与商业软件FEKO比对,在NVIDIA GeForce RTX 3050显卡上获得了224.35的加速比。实例结果展示了基于CPU-GPU协同的IPO算法并行计算的可行性与高效性,可以用来解决目前只能在高性能计算机或计算机集群上解决的电大尺寸目标散射问题。 展开更多
关键词 迭代物理光学法(IPO) 参数空间技术 CPU-GPU协同 并行加速 雷达散射截面(RCS)
暂未订购 下载PDF
CPU和GPU协同处理的光学卫星遥感影像正射校正方法 认领 引用 被引量:36
12
作者 方留杨 王密 李德仁 《测绘学报》 EI CSCD 北大核心 2013年第5期668-675,共8页
系统地探讨基于CPU和GPU协同处理的光学卫星遥感影像正射校正方法。首先使用"层次性分块"策略设计基于CPU和GPU协同处理的正射校正方法,然后通过配置选择优化和存储层次性访问等手段进一步提高方法执行效率。在Tesla M2050 GP... 系统地探讨基于CPU和GPU协同处理的光学卫星遥感影像正射校正方法。首先使用"层次性分块"策略设计基于CPU和GPU协同处理的正射校正方法,然后通过配置选择优化和存储层次性访问等手段进一步提高方法执行效率。在Tesla M2050 GPU上对资源三号卫星下视全色影像进行正射校正的试验结果表明,本文方法可大幅提高光学卫星遥感影像正射校正效率,与传统串行正射校正算法相比,加速比最高达到110倍以上,相应的处理时间压缩至5 s以内,可满足对海量数据光学卫星遥感影像进行快速正射校正的要求。 展开更多
关键词 正射校正 CPUGPU协同处理 层次性分块 配置选择优化 存储层次性访问
暂未订购 下载PDF
异构集群中CPU与GPU协同调度算法的设计与实现 认领 引用 被引量:10
13
作者 高原 顾文杰 +3 位作者 丁雨恒 彭晖 陈泊宇 顾雯轩 《计算机工程与设计》 北大核心 2020年第2期592-600,F0003,共9页
为有效提高异构的CPU/GPU集群计算性能,提出一种支持异构集群的CPU与GPU协同计算的两级动态调度算法。根据各节点计算能力评测结果和任务请求动态分发数据,在节点内CPU和GPU之间动态调度任务,使用数据缓存和数据处理双队列机制,提高异... 为有效提高异构的CPU/GPU集群计算性能,提出一种支持异构集群的CPU与GPU协同计算的两级动态调度算法。根据各节点计算能力评测结果和任务请求动态分发数据,在节点内CPU和GPU之间动态调度任务,使用数据缓存和数据处理双队列机制,提高异构集群的传输和处理效率。该算法实现了集群各节点“能者多劳”,避免了单节点性能瓶颈造成的任务长尾现象。实验结果表明,该算法较传统MPI/GPU并行计算性能提高了11倍。 展开更多
关键词 异构 集群 中央处理器 图形处理器 协同调度 算法
暂未订购 下载PDF
基于CPU/GPU异构模式的高光谱遥感影像数据处理研究与实现 认领 引用 被引量:7
14
作者 汤媛媛 周海芳 +1 位作者 方民权 申小龙 《计算机科学》 CSCD 北大核心 2016年第2期47-50,77,共4页
近年来,基于GPU的新型异构高性能计算模式的蓬勃发展为众多领域应用提供了良好的发展机遇,国内外遥感专家开始引入高性能异构计算来解决高光谱遥感影像高维空间特点所带来的数据计算量大、实时处理难等问题。在此简要介绍了高光谱遥感和... 近年来,基于GPU的新型异构高性能计算模式的蓬勃发展为众多领域应用提供了良好的发展机遇,国内外遥感专家开始引入高性能异构计算来解决高光谱遥感影像高维空间特点所带来的数据计算量大、实时处理难等问题。在此简要介绍了高光谱遥感和CPU/GPU异构计算模式,总结了近几年国内外基于CPU/GPU异构模式的高光谱遥感数据处理研究现状和问题;并面向共享存储型小型桌面超级计算机,基于CPU/GPU异构模式实现了高光谱遥感影像MNF降维的并行化,通过与串行程序和共享存储的OpenMP同构模式对比,验证了异构模式在高光谱遥感处理领域的发展潜力。 展开更多
关键词 高光谱遥感 CPU/GPU OpenMP MNF
暂未订购 下载PDF
CPU/GPU异构混合并行的栅格数据空间分析研究——以地形因子计算为例 认领 引用 被引量:9
15
作者 卢敏 王金茵 +2 位作者 卢刚 陶伟东 王结臣 《计算机工程与应用》 CSCD 北大核心 2017年第1期172-177,共6页
海量数据背景下传统GIS栅格数据空间分析计算效率已经不能满足快速计算的需求,为此以地形因子计算为例,分析并测试了基于共享内存模型的CPU多核并行模式与基于流处理器模型的GPU众核并行模式的计算性能,在此基础上详细实现了负载均衡的... 海量数据背景下传统GIS栅格数据空间分析计算效率已经不能满足快速计算的需求,为此以地形因子计算为例,分析并测试了基于共享内存模型的CPU多核并行模式与基于流处理器模型的GPU众核并行模式的计算性能,在此基础上详细实现了负载均衡的设备间任务划分,进行CPU与GPU异构混合的并行技术改良研究。实验结果表明,基于相同的单机硬件环境,与多核共享内存模型或众核流处理器的单一计算平台并行方案相比,CPU/GPU异构混合并行计算方法对于栅格数据分析具有更好的加速效果。 展开更多
关键词 GIS栅格数据分析 共享内存模型 流处理器模型 CPU/GPU异构混合并行
暂未订购 下载PDF
CPU-GPU系统中基于剖分的全局性能优化方法 认领 引用 被引量:10
16
作者 张保 董小社 +3 位作者 白秀秀 曹海军 刘超 梅一多 《西安交通大学学报》 EI CAS CSCD 北大核心 2012年第2期17-23,共7页
针对将应用移植到CPU-GPU异构并行系统上时优化策略各自分散、没有一个全局的指导思想的问题,提出了一种基于剖分的全局性能优化方法.该方法由优化策略库、剖分工具库和策略配置模块组成.优化策略库将应用移植到异构并行系统上的性能优... 针对将应用移植到CPU-GPU异构并行系统上时优化策略各自分散、没有一个全局的指导思想的问题,提出了一种基于剖分的全局性能优化方法.该方法由优化策略库、剖分工具库和策略配置模块组成.优化策略库将应用移植到异构并行系统上的性能优化过程划分为访存级、内核加速级和数据划分级3级优化;针对3级优化剖分工具库提供了3级剖分机制,通过运行时的剖分技术获取剖分信息;策略配置模块根据所获取的信息指导用户在每级优化中选择合适的优化策略.实验证明,基于剖分的全局性能优化方法可以明确地指导将应用移植到CPU-GPU异构并行系统上的全局优化过程,利用该优化方法后,以矩阵相乘和傅里叶变换为例的应用性能提升明显,最终性能相对于访存级优化最高可提高30%左右. 展开更多
关键词 CPU-GPU异构并行系统 全局优化 3级优化 3级剖分
暂未订购 下载PDF
面向多核CPU与GPU平台的图处理系统关键技术综述 认领 引用 被引量:7
17
作者 张园 曹华伟 +5 位作者 张婕 申玥 孙一鸣 敦明 安学军 叶笑春 《计算机研究与发展》 EI CSCD 北大核心 2024年第6期1401-1428,共28页
图计算作为分析与挖掘关联关系的一种关键技术,已在智慧医疗、社交网络分析、金融反欺诈、地图道路规划、计算科学等领域广泛应用.当前,通用CPU与GPU架构的并行结构、访存结构、互连结构及同步机制的不断发展,使得多核CPU与GPU成为图处... 图计算作为分析与挖掘关联关系的一种关键技术,已在智慧医疗、社交网络分析、金融反欺诈、地图道路规划、计算科学等领域广泛应用.当前,通用CPU与GPU架构的并行结构、访存结构、互连结构及同步机制的不断发展,使得多核CPU与GPU成为图处理加速的常用平台.但由于图处理具有处理数据规模大、数据依赖复杂、访存计算比高等特性,加之现实应用场景下的图数据分布不规则且图中的顶点与边呈现动态变化,给图处理的性能提升和高可扩展性带来严峻挑战.为应对上述挑战,大量基于多核CPU与GPU平台的图处理系统被提出,并在该领域取得显著成果.为了让读者了解多核CPU与GPU平台上图处理优化相关技术的演化,首先剖析了图数据、图算法、图应用特性,并阐明图处理所面临的挑战.然后分类梳理了当前已有的基于多核CPU与GPU平台的图处理系统,并从加速图处理设计的角度,详细、系统地总结了关键优化技术,包括图数据预处理、访存优化、计算加速和数据通信优化等.最后对已有先进图处理系统的性能、可扩展性等进行分析,并从不同角度对图处理未来发展趋势进行展望,希望对从事图处理系统研究的学者有一定的启发. 展开更多
关键词 多核CPUGPU平台 图处理系统 图数据表示 负载均衡 不规则访存 动态图处理
暂未订购 下载PDF
CPU-GPU混合计算构架在岩土工程有限元分析中的应用 认领 引用 被引量:7
18
作者 陈曦 王冬勇 +2 位作者 任俊 张训维 苗姜龙 《土木工程学报》 EI CSCD 北大核心 2016年第6期105-112,共8页
计算机技术的快速发展促进了岩土工程数值模拟技术的进步和有限元仿真技术的应用。对于三维有限元建模,有限元离散所获得的线性方程系统规模较大,这些线性方程系统的求解通常支配着整个有限元计算的时间。为了提高有限元求解的效率,需... 计算机技术的快速发展促进了岩土工程数值模拟技术的进步和有限元仿真技术的应用。对于三维有限元建模,有限元离散所获得的线性方程系统规模较大,这些线性方程系统的求解通常支配着整个有限元计算的时间。为了提高有限元求解的效率,需要采用先进的基础迭代算法和高性能计算构架。使用性价比较高的GPU计算硬件对目前流行的预处理Krylov子空间迭代法进行了加速,重点研究了GPU对Krylov子空间迭代过程中矩阵矢量乘积的加速效果。由于预处理迭代方法的计算性能依赖于计算构架,采用数值算例对几种流行的预处理迭代方法在不同计算构架下的计算性能进行了评测,对在不同计算构架下采用何种预处理迭代方法给出了相应的建议。 展开更多
关键词 有限元法 Krylov子空间迭代法 预处理技术 矩阵存储 CPU-GPU计算构架
暂未订购 下载PDF
面向CPU-GPU集群的分布式机器学习资源调度框架研究 认领 引用 被引量:12
19
作者 朱紫钰 汤小春 赵全 《西北工业大学学报》 EI CAS CSCD 北大核心 2021年第3期529-538,共10页
随着GPU硬件设施的广泛应用,越来越多的分布式机器学习应用程序开始使用CPU-GPU混合集群资源来提高算法的效率。但是,现有的分布式机器学习调度框架要么只考虑CPU资源上的任务调度,要么只考虑GPU资源上的任务调度,即使综合考虑CPU与GPU... 随着GPU硬件设施的广泛应用,越来越多的分布式机器学习应用程序开始使用CPU-GPU混合集群资源来提高算法的效率。但是,现有的分布式机器学习调度框架要么只考虑CPU资源上的任务调度,要么只考虑GPU资源上的任务调度,即使综合考虑CPU与GPU资源的不同,也很难提高整个系统的资源使用效率,即使用CPU-GPU集群进行分布式机器学习作业面临的关键挑战是如何高效地调度作业中的任务。在对现有的方法进行分析后,提出了一种基于不均匀数据分片的策略,利用线性规划的原理,使得CPU任务时间与GPU任务时间尽可能接近,从而减少分布式机器学习作业的整体执行时间。介绍了CPU-GPU混合计算框架的调度结构,这种调度结构针对CPU计算能力与GPU计算能力的不同特点,将数据分割成大小不等的数据分片以适应于CPU和GPU计算资源,给出了CPU-GPU混合资源下的任务调度方法,对该方法进行K-Means算法验证。使用CPU-GPU混合资源计算框架,K-Means性能平均提高1.5倍,且随着GPU数量的增加,K-Means性能能够显著提升。 展开更多
关键词 异构任务 一体化调度 聚类算法 分布式
暂未订购 下载PDF
一种CPU-GPU协同计算的三维地形实时渲染算法 认领 引用 被引量:9
20
作者 郭向坤 林浒 +1 位作者 刘继申 王鸿亮 《小型微型计算机系统》 CSCD 北大核心 2018年第4期825-829,共5页
提出一种基于Open CL的CPU-GPU协同计算的大规模地形实时渲染算法,该算法侧重于把批LOD模型的构建从CPU移植到GPU.CPU主要负责把外存中的数据块实时调度到内存中,并把相应的地形块载入GPU中的显存.GPU负责利用Open CL平台并行构建LOD模... 提出一种基于Open CL的CPU-GPU协同计算的大规模地形实时渲染算法,该算法侧重于把批LOD模型的构建从CPU移植到GPU.CPU主要负责把外存中的数据块实时调度到内存中,并把相应的地形块载入GPU中的显存.GPU负责利用Open CL平台并行构建LOD模型.为了避免相邻LOD模型出现裂缝,利用地形块的裂缝检测和删除顶点的方法消除裂缝;为了解决两个LOD层次的转换过程中出现地表突跳现象,采用morphing方法实现地形的平滑过渡.实验结果表明,该算法将大量的几何计算移植到GPU上并行计算,降低了CPU的计算负载,提高了LOD模型的构建效率,加快了场景的渲染速度. 展开更多
关键词 OpenCL CPUGPU协同计算 LOD模型 平滑过渡
暂未订购 下载PDF
上一页 1 2 11 下一页 到第
在线咨询 使用帮助 返回顶部 意见反馈