当前位置:首页>java>[原子操作基础][CUDA 编程系列][传统软件工程师转行 AI 需要掌握的一千个知识点]

[原子操作基础][CUDA 编程系列][传统软件工程师转行 AI 需要掌握的一千个知识点]

  • 2026-09-08 13:40:51
[原子操作基础][CUDA 编程系列][传统软件工程师转行 AI 需要掌握的一千个知识点]

经典模型+cuda知识

一手理论+一手实践→天下我有

列个提纲,一壶酒,一个手机,上班路上一小时,一写写一年👌🥊🥊

没有牛逼的人,只有坚持到底的人

这篇文章估计要写好久…

不对,写一点,发一点

简单,才足以坚持,坚持才足以完成

CUDA编程→性能分析工具
CUDA编程→调试工具使用
CUDA编程→动态执行
CUDA编程→统一内存概念
CUDA编程→设备管理与多GPU
CUDA编程→原子操作基础
CUDA中常用的原子操作函数
0.原子、非原子操作对比
原子操作决策流程图
1.算术原子操作
// 整数类型atomicAdd(int* address, int val);        // 加法atomicSub(int* address, int val);        // 减法atomicExch(int* address, int val);       // 交换atomicMin(int* address, int val);        // 最小值atomicMax(int* address, int val);        // 最大值atomicInc(int* address, int val);        // 增加到val后归0atomicDec(int* address, int val);        // 减少到0后重置为valatomicCAS(int* address, int compare, int val);  // 比较并交换// 64位整数(需要计算能力3.5+)atomicAdd(long long* address, long long val);// 浮点数(需要计算能力6.0+)atomicAdd(float* address, float val);atomicAdd(double* address, double val);加法示例__global__ void atomicAddKernel(int* counter, int* data, int N) {    int idx = blockIdx.x * blockDim.x + threadIdx.x;        if (idx < N) {        // 每个线程将data[idx]的值原子性地加到counter        atomicAdd(counter, data[idx]);    }}计算直方图__global__ void histogramKernel(int* input, int* histogram, int N, int bins) {    int idx = blockIdx.x * blockDim.x + threadIdx.x;    if (idx < N) {        int bin = input[idx] % bins;  // 计算bin索引        atomicAdd(&histogram[bin], 1);  // 原子递增对应bin    }}寻找最大值__global__ void findMaxKernel(int* input, int* maxValue, int N) {    int idx = blockIdx.x * blockDim.x + threadIdx.x;    if (idx < N) {        int old = *maxValue;        int newVal = input[idx];        // 原子比较并更新最大值        while (newVal > old) {            if (atomicCAS(maxValue, old, newVal) == old) {                break;            }            old = *maxValue;  // 如果失败,重试        }    }}
CAS 流程
2.位运算原子操作
atomicAnd(int* address, int val);   // 位与atomicOr(int* address, int val);    // 位或atomicXor(int* address, int val);   // 位异或
3.原子操作与共享内存
可以操作共享内存,但是需要指定地址
__global__ voidsharedMemoryAtomic(int* globalData, int N) {    __shared__ int sharedCounter;    if (threadIdx.x == 0) {        sharedCounter = 0;    }    __syncthreads();    int idx = blockIdx.x * blockDim.x + threadIdx.x;    if (idx < N) {        // 对共享内存执行原子操作        atomicAdd(&sharedCounter, 1);    }    __syncthreads();    // 将结果写回全局内存    if (threadIdx.x == 0) {        atomicAdd(&globalData[blockIdx.x], sharedCounter);    }}
4.性能优化建议
减少竞争:过多的线程竞争同一内存地址会严重影响性能
使用层次化方法:
    线程块内使用共享内存进行部分归约
    再使用原子操作更新全局内存
    选择合适的数据类型:在满足需求的前提下,使用更小的数据类型
    避免不必要的原子操作:如果不需要跨线程同步,不要使用原子操作
5.原子操作的局限性
性能开销:原子操作比普通内存操作慢得多
序列化:对同一内存地址的原子操作是串行执行的
不支持复杂操作:原子操作只支持基本算术和位运算
7.原子操作 vs 规约操作
cuda  code
#include<iostream>#include<cuda_runtime.h>// 使用原子操作的朴素实现__global__ voidnaiveAtomicSum(int* data, int* result, int N){    int idx = blockIdx.x * blockDim.x + threadIdx.x;    if (idx < N) {        atomicAdd(result, data[idx]);    }}// 使用共享内存优化的实现__global__ voidoptimizedAtomicSum(int* data, int* result, int N){    __shared__ int blockSum[256];    int tid = threadIdx.x;    int idx = blockIdx.x * blockDim.x + threadIdx.x;    blockSum[tid] = 0;    if (idx < N) {        blockSum[tid] = data[idx];    }    __syncthreads();    // 在共享内存中归约    for (int stride = blockDim.x / 2; stride > 0; stride >>= 1) {        if (tid < stride) {            blockSum[tid] += blockSum[tid + stride];        }        __syncthreads();    }    // 只有线程0原子更新全局结果    if (tid == 0) {        atomicAdd(result, blockSum[0]);    }}intmain(){    const int N = 1000000;    int* h_data = new int[N];    int* d_data, *d_result;    // 初始化数据    for (int i = 0; i < N; i++) {        h_data[i] = 1;    }    // 分配设备内存    cudaMalloc(&d_data, N * sizeof(int));    cudaMalloc(&d_result, sizeof(int));    // 拷贝数据到设备    cudaMemcpy(d_data, h_data, N * sizeof(int), cudaMemcpyHostToDevice);    // 测试朴素原子操作    int h_result = 0;    cudaMemset(d_result, 0, sizeof(int));    naiveAtomicSum<<<(N+255)/256, 256>>>(d_data, d_result, N);    cudaMemcpy(&h_result, d_result, sizeof(int), cudaMemcpyDeviceToHost);    std::cout << "Naive atomic sum: " << h_result << std::endl;    // 测试优化版本    h_result = 0;    cudaMemset(d_result, 0, sizeof(int));    optimizedAtomicSum<<<(N+255)/256, 256>>>(d_data, d_result, N);    cudaMemcpy(&h_result, d_result, sizeof(int), cudaMemcpyDeviceToHost);    std::cout << "Optimized atomic sum: " << h_result << std::endl;    // 清理    delete[] h_data;    cudaFree(d_data);    cudaFree(d_result);    return 0;}
原子操作性能瓶颈
层次化规约
8.硬件角度的原子操作
9.总结
CUDA原子操作是处理线程间数据竞争的重要工具,但需要谨慎使用:
    在少量线程访问同一内存时效率较高
    在高竞争情况下性能会显著下降
     应考虑使用共享内存等优化技术减少原子操作的使用
    对于大规模并行归约,通常使用分层的归约算法比单纯使用原子操作更高效
    理解原子操作的特性和适用场景,是编写高效CUDA程序的关键之一。
CUDA编程→流与并发执行
[CUDA流][CUDA 编程系列][传统软件工程师转行 AI 需要掌握的一千个知识点]
CUDA编程→Warp级编程
[warp 级编程][CUDA 编程系列][传统软件工程师转行 AI 需要掌握的一千个知识点]
CUDA编程→共享内存应用
[共享内存应用][CUDA 编程系列][传统软件工程师转行 AI 需要掌握的一千个知识点]
CUDA编程→全局内存优化
[全局内存优化][CUDA 编程系列][传统软件工程师转行 AI 需要掌握的一千个知识点]
CUDA编程→内存管理基础
[内存管理基础][CUDA 编程系列][传统软件工程师转行 AI 需要掌握的一千个知识点]
CUDA编程→内核函数
[函数code&网格、线程块、SM、调度器等硬件知识][CUDA 编程系列][传统软件工程师转行 AI 需要掌握的一千个知识点]
CUDA编程→网格、线程块、SM、调度器等硬件知识
[函数code&网格、线程块、SM、调度器等硬件知识][CUDA 编程系列][传统软件工程师转行 AI 需要掌握的一千个知识点]
CUDA编程→基础知识
[基础知识][CUDA 编程系列][传统软件工程师转行 AI 需要掌握的一千个知识点]
200人 老黄口中的200人
老黄(黄仁勋)口中的 200 人[传统软件工程师转行 AI 需要掌握的一千个知识点]
具身智能
具身智能[传统软件工程师转行 AI 需要掌握的一千个知识点]
自动驾驶路线简述
自动驾驶路线简述[传统软件工程师转行 AI 需要掌握的一千个知识点]
模型测评
模型测评[传统软件工程师转行 AI 需要掌握的一千个知识点]
MCP
MCP[传统软件工程师转行 AI 需要掌握的一千个知识点]
上下文工程 or RAG
上下文工程 or RAG[传统软件工程师转行 AI 需要掌握的一千个知识点]
vLLM  FlashAttention
vLLM & FlashAttention[传统软件工程师转行 AI 需要掌握的一千个知识点]
Jupyter &&  开发框架:Pytorch CUDA
Jupyter  & Pytorch[传统软件工程师转行 AI 需要掌握的一千个知识点]
CUDA 编程
CUDA[传统软件工程师转行 AI 需要掌握的一千个知识点]
GPU
GPU[传统软件工程师转行 AI 需要掌握的一千个知识点]
开源模型
LLaMa - 开源模型[传统软件工程师转行 AI 需要掌握的一千个知识点]
世界模型
世界模型[传统软件工程师转行 AI 需要掌握的一千个知识点→神经网络]
Mamba
Mamba(线性注意力)【传统软件工程师转行 AI 需要掌握的一千个知识点→神经网络】
MoR
传统软件工程师转行 AI 需要掌握的一千个知识点→神经网络→MoR
神经辐射网络
传统软件工程师转行 AI 需要掌握的一千个知识点→神经网络→神经辐射网络
RLHF
传统软件工程师转行 AI 需要掌握的一千个知识点→神经网络→RLHF
COT 思维链
传统软件工程师转行 AI 需要掌握的一千个知识点→神经网络→思维链

DeepSeek R1

传统软件工程师转行 AI 需要掌握的一千个知识点→神经网络→强化学习 DeepSeek :R1

强化学习

传统软件工程师转行 AI 需要掌握的一千个知识点→神经网络→ 强化学习 Q-Learning、DQN、PG、PPO

多模态

传统软件工程师转行 AI 需要掌握的一千个知识点→神经网络→ 多模态 CLIP

Diffusion

传统软件工程师转行 AI 需要掌握的一千个知识点→神经网络→ 扩散模型 Dissfussion  DDPM

GPT 系列

GPT1  GPT2 GPT3  GPT3.5 GPT4

终于到了这个跨时代的GPT了,足以记录在人类文明史的一页

GPT1

传统软件工程师转行 AI 需要掌握的一千个知识点→神经网络→ GPT1

GPT2 、GPT3

传统软件工程师转行 AI 需要掌握的一千个知识点→神经网络→ GPT2、3

GPT3.5 、GPT4

传统软件工程师转行 AI 需要掌握的一千个知识点→神经网络→ GPT3.5、4

Transformer传统软件工程师转行 AI 需要掌握的一千个知识点→神经网络→ Transformers

GAN

传统软件工程师转行 AI 需要掌握的一千个知识点→神经网络→ GAN

AlphaGo

传统软件工程师转行 AI 需要掌握的一千个知识点→神经网络→ AlphaGo

ResNet

传统软件工程师转行 AI 需要掌握的一千个知识点→神经网络→ ResNet

CNN AlexNet VGG 

传统软件工程师转行 AI 需要掌握的一千个知识点→神经网络→ CNN AlexNet VGG

VAE

传统软件工程师转行 AI 需要掌握的一千个知识点→神经网络→ VAE

深度信念网络

传统软件工程师转行 AI 需要掌握的一千个知识点→神经网络→深度信念网络

集成学习(主导了十年)

RNN Lstm传统软件工程师转行 AI 需要掌握的一千个知识点→神经网络→RNN

CNN Lenet-5传统软件工程师转行 AI 需要掌握的一千个知识点→神经网络→CNN

Hopfield网络&&玻尔兹曼机传统软件工程师转行 AI 需要掌握的一千个知识点→神经网络→ Hopfield网络&玻尔兹曼机

反向传播传统软件工程师转行 AI 需要掌握的一千个知识点→神经网络→反向传播

多层感知机

传统软件工程师转行 AI 需要掌握的一千个知识点→神经网络→多层感知机

感知机

传统软件工程师转行 AI 需要掌握的一千个知识点→神经网络→感知机

MP 神经元

传统软件工程师转行 AI 需要掌握的一千个知识点→神经网络→MP神经元

最新文章

随机文章