<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>高性能计算专题：从 MPI 到 GPU 集群的并行编程实践 on PlumePHP</title><link>https://plumephp.com/posts/hpc/</link><description>Recent content in 高性能计算专题：从 MPI 到 GPU 集群的并行编程实践 on PlumePHP</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Wed, 30 Sep 2026 11:30:00 +0800</lastBuildDate><atom:link href="https://plumephp.com/posts/hpc/index.xml" rel="self" type="application/rss+xml"/><item><title>ARM 超算与专用加速器：A64FX 与 NVIDIA Grace</title><link>https://plumephp.com/hpc-arm-grace-a64fx/</link><pubDate>Wed, 30 Sep 2026 11:30:00 +0800</pubDate><guid>https://plumephp.com/hpc-arm-grace-a64fx/</guid><description>&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;十年前「ARM 只能做手机芯片」还是共识，如今 &lt;strong&gt;富岳（Fugaku）&lt;/strong&gt; 用 ARM 登顶 TOP500，NVIDIA &lt;strong&gt;Grace&lt;/strong&gt; 把 ARM CPU 和 GPU 焊在一起——ARM 正在成为超算与数据中心的第三极。&lt;/p&gt;</description></item><item><title>HPC 与 AI 融合：超算跑大模型训练</title><link>https://plumephp.com/hpc-ai-hpc-convergence/</link><pubDate>Wed, 30 Sep 2026 11:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-ai-hpc-convergence/</guid><description>&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;超算正在成为大模型训练的算力底座，AI 也在反过来改造科学计算——&lt;strong&gt;HPC 与 AI 融合&lt;/strong&gt;是当前计算领域最重要的趋势。一方面，大模型训练需要 HPC 级的高速网络与大规模并行；另一方面，科学模拟开始引入神经网络（科学 ML），HPC 作业与 AI 作业在同一张 GPU 集群上共存。&lt;/p&gt;</description></item><item><title>绿色 HPC：能耗优化与功率封顶实战</title><link>https://plumephp.com/hpc-green-hpc-power/</link><pubDate>Wed, 30 Sep 2026 10:30:00 +0800</pubDate><guid>https://plumephp.com/hpc-green-hpc-power/</guid><description>&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;超算中心一年的电费可以买下一个小型集群，而&lt;strong&gt;功耗墙&lt;/strong&gt;让「无脑加核提频」走到了尽头。业界从「跑得快」转向「每瓦跑得快」——&lt;strong&gt;绿色 HPC（Green HPC）&lt;/strong&gt; 研究如何让每瓦电产出更多计算量，既是成本账，也是碳排放账。&lt;/p&gt;</description></item><item><title>可移植异构编程：Kokkos 与 SYCL/oneAPI 实战</title><link>https://plumephp.com/hpc-kokkos-oneapi-portable/</link><pubDate>Wed, 30 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-kokkos-oneapi-portable/</guid><description>&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;HPC 已经从「纯 CPU」走向 CPU+GPU+加速器并存的&lt;strong&gt;异构&lt;/strong&gt;时代。每个硬件都有专属编程模型（CUDA、HIP、OpenMP offload、OpenCL），为每个后端重写一遍代码不可持续。&lt;strong&gt;可移植异构编程模型&lt;/strong&gt;的目标：写一套「单源码」，让它能在 CPU、GPU、甚至不同厂商 GPU 上编译运行。&lt;/p&gt;</description></item><item><title>SIMD 向量化：从 AVX-512 到编译器自动向量化</title><link>https://plumephp.com/hpc-simd-vectorization/</link><pubDate>Wed, 30 Sep 2026 09:30:00 +0800</pubDate><guid>https://plumephp.com/hpc-simd-vectorization/</guid><description>&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;多核给不了的那部分性能，要靠&lt;strong&gt;单核向量化&lt;/strong&gt;来补。现代 CPU 一次能同时算 4/8/16 个浮点数，但大多数程序只用上了 1/16 的能力——&lt;strong&gt;SIMD（Single Instruction, Multiple Data）&lt;/strong&gt; 就是把「一条指令处理多个数据」做满的学问。&lt;/p&gt;</description></item><item><title>NCCL 集合通信：AllReduce 原理与多卡训练网络优化</title><link>https://plumephp.com/hpc-nccl-collectives/</link><pubDate>Wed, 30 Sep 2026 09:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-nccl-collectives/</guid><description>&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;单卡装不下的模型要分到多卡，多卡就要&lt;strong&gt;同步梯度&lt;/strong&gt;；梯度同步的本质是一堆&lt;strong&gt;集合通信&lt;/strong&gt;。MPI 为 CPU 集群设计了广播/归约原语，而 GPU 时代 NVIDIA 用 &lt;strong&gt;NCCL（NVIDIA Collective Communications Library）&lt;/strong&gt; 把这套思想重新实现——针对 NVLink、PCIe、InfiniBand 的拓扑做了极致优化，成为 PyTorch DDP、Megatron、DeepSpeed 背后事实上的通信标准。&lt;/p&gt;</description></item><item><title>HPC 基准测试：HPL/Linpack、HPCG 与 TOP500 实战</title><link>https://plumephp.com/hpc-benchmark-hpl/</link><pubDate>Mon, 28 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-benchmark-hpl/</guid><description>&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;「这台超算多强？」——不能靠嘴说，要靠&lt;strong&gt;基准测试（Benchmark）&lt;/strong&gt;。从 1970 年代 LINPACK 到今天的 HPL，基准测试一直是 HPC 领域公认的标尺：TOP500 的排名、Green500 的能效、HPCG 的真实应用模拟。理解基准测试，才能真正读懂「一台机器的 FLOPS」意味着什么，也才能用它指导选型与调优。&lt;/p&gt;</description></item><item><title>Kubernetes 调度 HPC 作业：KubeRay、GPU 资源与调度器</title><link>https://plumephp.com/hpc-kubernetes-scheduling/</link><pubDate>Mon, 28 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-kubernetes-scheduling/</guid><description>&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;传统超算用 Slurm 调度作业，而 AI/云原生化浪潮下，&lt;strong&gt;Kubernetes&lt;/strong&gt; 正成为新一代 HPC 与大规模训练的事实调度平台。K8s 的优势在于：统一基础设施（存储/网络/GPU）、弹性伸缩、声明式运维；但要跑好 HPC 作业，原生 K8s 不够——需要 GPU 设备插件、批调度器（Kueue/Volcano）、KubeRay 与 MPI Operator 这类专用控制器。&lt;/p&gt;</description></item><item><title>Python 高性能计算：Dask 与 Ray 分布式计算实战</title><link>https://plumephp.com/hpc-dask-ray-python/</link><pubDate>Mon, 28 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-dask-ray-python/</guid><description>&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;Python 是数据科学主流，但单线程 GIL 与内存瓶颈让它在「大数据」前吃力。&lt;strong&gt;Dask&lt;/strong&gt; 与 &lt;strong&gt;Ray&lt;/strong&gt; 是 Python 生态里最主流的两套分布式框架：Dask 把 Pandas/NumPy 的接口扩展到「集群内存」，Ray 则提供通用的任务/actor 并行运行时。理解它们，就能在笔记本上写代码、在集群上跑千核。&lt;/p&gt;</description></item><item><title>云上弹性 HPC：AWS ParallelCluster 与按需集群实战</title><link>https://plumephp.com/hpc-cloud-elastic/</link><pubDate>Mon, 28 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-cloud-elastic/</guid><description>&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;超算中心容量有限、排队漫长；云的&lt;strong&gt;弹性&lt;/strong&gt;让 HPC 用户按需秒级拿到几千核、算完即走。但「云上跑 HPC」不是简单地把 Slurm 装进虚拟机——需要解决**动态伸缩、网络低延迟（EFA/RDMA）、共享存储（FSx for Lustre）、成本控制（Spot）**四大问题。AWS ParallelCluster 把这些打包成「声明式集群」。&lt;/p&gt;</description></item><item><title>分子动力学仿真：GROMACS 与 LAMMPS 并行加速实践</title><link>https://plumephp.com/hpc-molecular-dynamics/</link><pubDate>Mon, 28 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-molecular-dynamics/</guid><description>&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;分子动力学（Molecular Dynamics, MD）&lt;/strong&gt; 用牛顿定律数值积分粒子的运动，是蛋白质、材料、药物设计领域最常用的仿真工具。MD 的计算特征是「短程相互作用为主 + 每步计算量大 + 需跑数百万步」——天然适合并行，也把「邻居列表、域分解、GPU 加速」这些 HPC 经典技术全部用上。&lt;/p&gt;</description></item><item><title>并行 I/O 实战：MPI-IO、HDF5 与 NetCDF 数据读写</title><link>https://plumephp.com/hpc-parallel-io/</link><pubDate>Mon, 28 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-parallel-io/</guid><description>&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;科学计算跑得快不快，不只看 FLOPS——&lt;strong&gt;I/O 常常是隐藏瓶颈&lt;/strong&gt;。千万核作业算完，结果写不进文件系统照样卡死。并行 I/O 的核心矛盾是：&lt;strong&gt;计算是分布式的，而「一个文件」默认是串行的&lt;/strong&gt;。MPI-IO、HDF5、NetCDF 这三层技术把「多进程同时写一个文件」变成工程现实。&lt;/p&gt;</description></item><item><title>GPU 内核性能优化进阶：占用率、访存与指令级调优</title><link>https://plumephp.com/hpc-gpu-kernel-optimization/</link><pubDate>Sat, 26 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-gpu-kernel-optimization/</guid><description>&lt;p&gt;一个「能跑」的 GPU 内核，和「把硬件吃到饱」的内核，性能差距可以高达 10-100 倍。现代 NVIDIA GPU 单 SM 内含数千个执行单元，需要足够多的并发 warp 来隐藏访存延迟、足够规整的数据流来喂饱吞吐单元、足够低的指令依赖来填满流水线。本文从占用率开始，系统拆解 GPU 内核调优的四大维度，并覆盖 cuBLAS/cuDNN/NCCL 这类库的黑盒调优路径。&lt;/p&gt;</description></item><item><title>HPC 容器与可复现环境：Singularity/Apptainer 深入</title><link>https://plumephp.com/hpc-container-singularity/</link><pubDate>Sat, 26 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-container-singularity/</guid><description>&lt;p&gt;科学计算的可复现性危机由来已久：软件依赖版本漂移、编译器升级导致数值结果变化、不同集群 MPI 库 ABI 不兼容——这些问题让「昨天还能跑通的工作流今天复现不了」成为 HPC 用户的日常。容器技术把整个软件栈（OS 层、编译器、库、应用）打包成不可变镜像，从根本上解决了环境漂移问题。然而 HPC 集群的安全模型与 Docker 的守护进程架构存在根本冲突，于是 &lt;strong&gt;Singularity（现更名 Apptainer）&lt;/strong&gt; 应运而生，成为超算中心的容器事实标准。本文深入其架构与生产实践。&lt;/p&gt;</description></item><item><title>HPC 容错与检查点：Checkpoint/Restart、ULFM 与恢复</title><link>https://plumephp.com/hpc-fault-tolerance/</link><pubDate>Sat, 26 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-fault-tolerance/</guid><description>&lt;p&gt;百万节点级超算的残酷现实是：&lt;strong&gt;故障不是例外，而是常态&lt;/strong&gt;。以单节点每年 1 次的故障率推算，一万节点集群平均每 52 分钟就有节点宕机——而很多科学作业要连续运行数周。如果每次故障都从零重算，大规模计算将寸步难行。容错（Fault Tolerance）由此成为 HPC 的核心基础设施：它保证「坏了能恢复」，并且把恢复成本控制到最小。本文从故障模型出发，覆盖 Checkpoint/Restart、ULFM 与生产容错策略。&lt;/p&gt;</description></item><item><title>HPC 性能剖析与调优工具链：perf/gprof/VTune/Nsight</title><link>https://plumephp.com/hpc-performance-profiling/</link><pubDate>Sat, 26 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-performance-profiling/</guid><description>&lt;p&gt;「先测量，再优化」是高性能计算的第一纪律。没有数据支撑的优化往往是在猜测热点，而猜测的错误率惊人——CPU 流水线、缓存层次、内存带宽的相互作用远超直觉。性能剖析（Profiling）回答三个问题：&lt;strong&gt;时间花在哪、资源利用率如何、瓶颈在哪一层&lt;/strong&gt;。本文从方法学出发，梳理 CPU 侧与 GPU 侧、计算与通信两条线的完整工具链。&lt;/p&gt;</description></item><item><title>HPC 集群管理与软件栈运维：模块、Spack 与监控</title><link>https://plumephp.com/hpc-cluster-admin/</link><pubDate>Sat, 26 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-cluster-admin/</guid><description>&lt;p&gt;超算中心一半是研究平台，一半是工程系统。对管理员而言，硬件的峰值算力只是账面上的数字——真正的价值在于：软件栈能否让千百个用户的作业稳定跑起来，故障能否在影响扩大前被发现，能源与资源能否被持续治理。本文从环境模块讲起，覆盖 Spack 包管理、监控告警、队列治理、能源管理与故障排查，勾勒 HPC 系统管理的完整视图。&lt;/p&gt;</description></item><item><title>科学工作流引擎：Nextflow/Snakemake 与管线编排</title><link>https://plumephp.com/hpc-workflow-nextflow/</link><pubDate>Sat, 26 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-workflow-nextflow/</guid><description>&lt;p&gt;生物信息学、材料模拟、气象同化等领域的真实计算很少是单个程序，而是由数十上百个步骤串联而成的大规模管线：清洗、对齐、建模、聚合、可视化。过去人们用 Bash 脚本把它们串起来，但 Bash 脚本无法表达步骤间的数据依赖，无法自动并行，更无法在失败后从断点恢复。工作流引擎（Workflow Engine）用 &lt;strong&gt;任务（task）+ 有向无环图（DAG）&lt;/strong&gt; 重新定义了管线编排。本文深入当前 HPC 领域最主流的两个引擎——Nextflow 与 Snakemake。&lt;/p&gt;</description></item><item><title>CUDA + MPI 异构并行：多 GPU 分布式编程实战</title><link>https://plumephp.com/hpc-cuda-mpi-hybrid/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-cuda-mpi-hybrid/</guid><description>&lt;p&gt;现代超算系统已经从纯 CPU 集群演进为 GPU 加速卡主导的异构架构。&lt;/p&gt;
&lt;h2 id="多-gpu-编程模型"&gt;多 GPU 编程模型&lt;/h2&gt;
&lt;p&gt;每块 GPU 拥有独立的显存空间，线程块、网格、流的概念构建三层并行体系：&lt;/p&gt;
&lt;pre tabindex="0"&gt;&lt;code&gt;┌─────────────────────────────────────────────────────┐
│ Device (GPU) │
│ ┌────────┐ ┌────────┐ ┌────────┐ ┌────────┐ │
│ │Grid 0 │ │Grid 1 │ │Grid 2 │ │Grid 3 │ │
│ │ │ │ │ │ │ │ │ │
│ │Block 0 │ │Block 0 │ │Block 0 │ │Block 0 │ │
│ │Block 1 │ │Block 1 │ │Block 1 │ │Block 1 │ │
│ │ ... │ │ ... │ │ ... │ │ ... │ │
│ │────────│ │────────│ │────────│ │────────│ │
│ │Stream 0│ │Stream 1│ │Stream 2│ │Stream 3│ │
│ └────────┘ └────────┘ └────────┘ └────────┘ │
│ Global Memory │
└─────────────────────────────────────────────────────┘
 ↑ PCIe / NVLink / NVSwitch ↑
 ┌────┴────────────────────────────┴────┐
 │ CUDA Context │
 └──────────────────────────────────────┘
&lt;/code&gt;&lt;/pre&gt;&lt;p&gt;单个 MPI 进程通常对应一块 GPU。通过 &lt;code&gt;cudaSetDevice(rank % num_gpus_per_node)&lt;/code&gt; 实现进程与 GPU 的一一映射。&lt;/p&gt;</description></item><item><title>HBM、GDDR 与 NUMA：HPC 内存层次优化实战</title><link>https://plumephp.com/hpc-memory-hierarchy/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-memory-hierarchy/</guid><description>&lt;p&gt;现代高性能计算系统中，计算性能的 scaling 瓶颈早已从 CPU 主频转向了内存子系统。理解内存层次结构、掌握 NUMA（Non-Uniform Memory Access）架构下的编程优化，是 HPC 开发者榨干硬件潜能的关键一步。&lt;/p&gt;</description></item><item><title>HPC 并行算法设计模式</title><link>https://plumephp.com/hpc-parallel-algorithms/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-parallel-algorithms/</guid><description>&lt;h2 id="1-主从模式-master-worker"&gt;1. 主从模式 (Master-Worker)&lt;/h2&gt;
&lt;p&gt;主从模式是最直观的并行范式：一个 Master 负责任务分发与结果归并，多个 Worker 执行实际计算。该模式适合任务独立、粒度过细的场景，如蒙特卡洛模拟、参数扫描。&lt;/p&gt;</description></item><item><title>InfiniBand 与 RDMA 网络深度解析</title><link>https://plumephp.com/hpc-infini-band/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-infini-band/</guid><description>&lt;h2 id="1-infiniband-架构概览"&gt;1. InfiniBand 架构概览&lt;/h2&gt;
&lt;p&gt;InfiniBand (IB) 是为 HPC 和数据中心设计的高性能互连技术，核心优势在于低延迟（亚微秒级）、高带宽（当前 NDR 达 400Gb/s）以及内核旁路（Kernel Bypass）。其基本拓扑单元由三类设备构成：&lt;/p&gt;</description></item><item><title>Lustre 并行文件系统调优实战</title><link>https://plumephp.com/hpc-lustre-filesystem/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-lustre-filesystem/</guid><description>&lt;p&gt;Lustre 是目前超算中心部署最广泛的并行文件系统，专为大规模 MPI 并行 I/O 场景设计。理解其 MDS-OSS-Client 架构、条带化机制与 &lt;a href="https://plumephp.com/posts/linux/"&gt;Linux&lt;/a&gt; 内核参数调优，是释放大规模 HPC 集群 I/O 性能的关键。&lt;/p&gt;</description></item><item><title>MPI 并行编程入门：从点到点通信到非阻塞</title><link>https://plumephp.com/hpc-mpi-basics/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-mpi-basics/</guid><description>&lt;p&gt;MPI（Message Passing Interface）是分布式内存系统中最主流的并行编程标准。无论节点间通过 InfiniBand 还是以太网互联，MPI 提供了统一的通信原语。理解 MPI 通信模型是编写可扩展并行程序的基础。&lt;/p&gt;</description></item><item><title>OpenFOAM 流体模拟入门</title><link>https://plumephp.com/hpc-openfoam-cfd/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-openfoam-cfd/</guid><description>&lt;p&gt;OpenFOAM 是业界最广泛使用的开源计算流体力学（CFD）框架，基于 &lt;a href="https://plumephp.com/posts/cpp/"&gt;C++&lt;/a&gt; 编写，采用有限体积法（Finite Volume Method）求解 Navier-Stokes 方程。本文从工程实践角度拆解其框架、网格、求解器配置与并行策略。&lt;/p&gt;</description></item><item><title>OpenMP 共享内存并行编程：从循环到任务</title><link>https://plumephp.com/hpc-openmp/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-openmp/</guid><description>&lt;p&gt;OpenMP 是最简便的共享内存多线程并行接口。区别于 MPI 的显式消息传递，OpenMP 通过编译器指令在串行代码基础上标记可并行区域。对于 NUMA 架构的多核 CPU，正确使用 OpenMP 可以充分释放硬件并行潜力。&lt;/p&gt;</description></item><item><title>PETSc 科学计算库实战指南</title><link>https://plumephp.com/hpc-petsc-solver/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-petsc-solver/</guid><description>&lt;h2 id="1-petsc-体系结构"&gt;1. PETSc 体系结构&lt;/h2&gt;
&lt;p&gt;PETSc（Portable, Extensible Toolkit for Scientific Computation）是 Argonne 国家实验室开发的大规模并行科学计算库，以 C 编写，提供 C/&lt;a href="https://plumephp.com/posts/cpp/"&gt;C++&lt;/a&gt;/Fortran/&lt;a href="https://plumephp.com/posts/python/"&gt;Python&lt;/a&gt; 绑定。其核心分层如下：&lt;/p&gt;</description></item><item><title>ROCm HIP GPU 编程实战</title><link>https://plumephp.com/hpc-amd-rocm/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-amd-rocm/</guid><description>&lt;p&gt;AMD ROCm 是 AMD 推出的开源 GPU 计算软件栈，旨在与 NVIDIA CUDA 生态直接竞争。HIP（Heterogeneous-computing Interface for Portability）作为其编程抽象层，允许开发者以接近 CUDA 的语法编写跨平台 GPU 代码。本文从架构到代码，拆解 ROCm/HIP 的完整实践路径。&lt;/p&gt;</description></item><item><title>Roofline 性能模型：判定性能瓶颈与优化方向</title><link>https://plumephp.com/hpc-roofline-model/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-roofline-model/</guid><description>&lt;p&gt;Roofline 模型由 Samuel Williams 等人于 2009 年提出，是 HPC 性能分析领域最经典、最直观的可视化工具之一。它以单一图表将程序的&amp;quot;性能天花板&amp;quot;与&amp;quot;实际表现&amp;quot;进行映射，帮助开发者快速判定瓶颈到底出在内存带宽还是计算峰值上。&lt;/p&gt;</description></item><item><title>Slurm 集群调度系统深度解析与实战</title><link>https://plumephp.com/hpc-slurm-scheduling/</link><pubDate>Thu, 10 Sep 2026 10:00:00 +0800</pubDate><guid>https://plumephp.com/hpc-slurm-scheduling/</guid><description>&lt;p&gt;Slurm（Simple &lt;a href="https://plumephp.com/posts/linux/"&gt;Linux&lt;/a&gt; Utility for Resource Management）是当今 HPC 领域最主流的集群资源调度与作业管理系统。它管理着全球 Top500 超算中超过半数以上的系统资源，从几节点的小型实验室集群到数万个节点的大型超算中心，Slurm 都提供了稳定、可扩展的调度能力。&lt;/p&gt;</description></item><item><title>Dell R650 vs HPE DL360 Gen11 企业级服务器深度评测</title><link>https://plumephp.com/dell-r650-vs-hpe-dl360-gen11/</link><pubDate>Thu, 06 Nov 2025 13:00:00 +0800</pubDate><guid>https://plumephp.com/dell-r650-vs-hpe-dl360-gen11/</guid><description>&lt;h2 id="前言"&gt;前言&lt;/h2&gt;
&lt;p&gt;在企业级2U双路机架服务器市场，Dell PowerEdge R650和HPE ProLiant DL360 Gen11是两款旗舰级产品，代表着各自厂商在通用计算领域的最高水平。本文将对这两款服务器进行全方位深度对比，为企业IT采购决策提供详实的参考依据。&lt;/p&gt;</description></item></channel></rss>