<?xml version="1.0" encoding="UTF-8"?><?xml-stylesheet type="text/xsl" href="/rss.xsl" ?><rss version="2.0"><channel><title>WingEdge777&apos;s Blog</title><description>这是 WingEdge777 的博客，专注于算法和后端相关技术的实战分享，涵盖 LLM、AIGC、AI Infra 等技术优化，涉及Python、C++、Go、Rust、Linux、Docker、k8s等领域。同时，博客也分享作者的生活、想法随笔等。</description><link>https://www.baizeway.com</link><item><title>一文入门推理系统性能优化：流水线、计算通信 Overlap 与 Offload/Onload 实践</title><link>https://www.baizeway.com/article/46d98e082b05aca8</link><guid isPermaLink="true">https://www.baizeway.com/article/46d98e082b05aca8/</guid><description>相信大家都听到过训练端pytorchFSDP，ZeRO1/2/3,Deepspeed/Megatron的pipeline优化、offloading之类的，推理端vLLM、SGLang等框架会提到计算和通信重叠，零CPU开销调度（zero-overheadschedule,当然这个有CUDAgraph</description><pubDate>Tue, 16 Jun 2026 17:42:08 GMT</pubDate></item><item><title>[TileLang] 0: vector add 向量化访存和生成代码分析</title><link>https://www.baizeway.com/article/1dd8ab388e48946c</link><guid isPermaLink="true">https://www.baizeway.com/article/1dd8ab388e48946c/</guid><description>TileLang 入门实战：以 vector add 为例分析向量化访存与代码生成，对比 Triton 并解读自动生成的高性能 CUDA Kernel。</description><pubDate>Tue, 02 Jun 2026 19:55:52 GMT</pubDate></item><item><title>[CUDA 优化实战] topk_topp_sampling - 乱拳打死老师傅 ： 暴力插入排序 topK、block reduce array merge</title><link>https://www.baizeway.com/article/569257f2e554fcfb</link><guid isPermaLink="true">https://www.baizeway.com/article/569257f2e554fcfb/</guid><description>CUDA 实现 LLM 推理 token sampling：讲解 topK/topP 采样、暴力插入排序与 block reduce array merge 等内核优化技巧。</description><pubDate>Fri, 22 May 2026 15:17:21 GMT</pubDate></item><item><title>[CUDA 优化实战] 纯手搓 flash decoding sm120 : 超越 flashinfer.single_decode_with_kv_cache</title><link>https://www.baizeway.com/article/2a8ffb697f7eb56e</link><guid isPermaLink="true">https://www.baizeway.com/article/2a8ffb697f7eb56e/</guid><description>纯手搓 sm120 flash decoding kernel，单 query 长 KV cache 场景下超越 flashinfer 的 decode attention 优化实战。</description><pubDate>Thu, 21 May 2026 13:19:23 GMT</pubDate></item><item><title>[CUDA 优化实战] fmha sm120 : 超越 torch.sdpa(flash-attention-2)</title><link>https://www.baizeway.com/article/7d1151d07a70e2c9</link><guid isPermaLink="true">https://www.baizeway.com/article/7d1151d07a70e2c9/</guid><description>在 sm120 架构上纯手搓 FMHA，基于 TMA+ldmatrix+mma 在 prefill 场景超越 torch.sdpa 与 Flash Attention-2 的实战复盘。</description><pubDate>Tue, 19 May 2026 21:56:50 GMT</pubDate></item><item><title>一文理解 PyTorch 进行分布式应用开发 - 分布式推理入门实战</title><link>https://www.baizeway.com/article/f943166143951a0b</link><guid isPermaLink="true">https://www.baizeway.com/article/f943166143951a0b/</guid><description>用不到 200 行 PyTorch 代码从零手搓大模型分布式推理：数据并行 DP、张量并行 TP、流水线并行 PP，2 卡实战，无需 Megatron 或 vLLM。</description><pubDate>Fri, 15 May 2026 12:30:03 GMT</pubDate></item><item><title>[CUDA 优化实战] hgemm sm120 - 100KB SMEM 中的“微雕”战争：Tensor-core、TMA、ldmatrix、mma</title><link>https://www.baizeway.com/article/b2ab376d19f52ff4</link><guid isPermaLink="true">https://www.baizeway.com/article/b2ab376d19f52ff4/</guid><description>在 RTX 5060 sm120 架构上手搓 hgemm：基于 100KB 共享内存，结合 TMA、ldmatrix、mma 等 Tensor Core 技术进行极致半精度 GEMM 调优实战。</description><pubDate>Sun, 10 May 2026 14:32:05 GMT</pubDate></item><item><title>[CUDA 优化实战] hgemm - 超越 cuBLAS：Tensor-core、cp.async、ldmatrix、mma</title><link>https://www.baizeway.com/article/5a219c62549f9573</link><guid isPermaLink="true">https://www.baizeway.com/article/5a219c62549f9573/</guid><description>FP16/BF16 HGEMM 手搓实战：运用 cp.async、ldmatrix、mma 与 swizzle，在 RTX 5060 上超越 cuBLAS 的半精度矩阵乘法优化全复盘。</description><pubDate>Sun, 10 May 2026 14:29:19 GMT</pubDate></item><item><title>[CUDA 优化实战] sgemm tf32 - 超越 cuBLAS：Tensor-core、cp.async、ldmatrix、mma</title><link>https://www.baizeway.com/article/ba9e9d9171004edc</link><guid isPermaLink="true">https://www.baizeway.com/article/ba9e9d9171004edc/</guid><description>TF32 Tensor Core SGEMM 优化实战：深入 cp.async、ldmatrix、mma 与 XOR swizzle 推导，在特定规模下挑战并超越 cuBLAS。</description><pubDate>Sat, 09 May 2026 10:14:49 GMT</pubDate></item><item><title>ContextClip：为 LLM 投喂纯净 Markdown 上下文的浏览器提取利器</title><link>https://www.baizeway.com/article/133b6cec3f625597</link><guid isPermaLink="true">https://www.baizeway.com/article/133b6cec3f625597/</guid><description>最近vibecoding了个小工具，chrome扩展ContextClip，ContextClip是一款专为投喂本地LLM、RAG和Agent开发的零依赖、重隐私Chrome浏览器扩展。它直击传统网页信息收集时“截图耗时/不兼容”和“复制粘贴格式混乱”的痛点。项目地址：ContextClip#为什么</description><pubDate>Fri, 08 May 2026 21:39:36 GMT</pubDate></item><item><title>白嫖 github action + Gemini 自动化每日精选论文</title><link>https://www.baizeway.com/article/56dd1be2094125b9</link><guid isPermaLink="true">https://www.baizeway.com/article/56dd1be2094125b9/</guid><description>AIcoding现在越来越火热，不可避免有点焦虑。我也vibecoding了一个Gemini每日精选论文工具（白嫖githubaction和googleAIstudio大模型token），加紧学习效率。欢迎star/fork使用#背景随着AI技术的飞速发展，每天都有大量的论文发表，作为工程师或者研究</description><pubDate>Fri, 10 Apr 2026 23:18:27 GMT</pubDate></item><item><title>WSL2 shell 使用优化 - 交互响应速度、代理配置</title><link>https://www.baizeway.com/article/8483c569b3895079</link><guid isPermaLink="true">https://www.baizeway.com/article/8483c569b3895079/</guid><description>我承认，世界上最好的linux发行版，那就是—WSL#0.背景本人虽然使用Windows电脑，但一直使用WSL2工作，所有项目代码等都在WSL2里，也更习惯于linux命令行操作。结合vscode的remote套件连接WSL进行开发非常方便。但默认配置下在使用shell，可能会有代理配置难或代理无法</description><pubDate>Thu, 09 Apr 2026 13:37:05 GMT</pubDate></item><item><title>[CUDA 入门] 认识 CUDA “不存在的存储层级” - local memory</title><link>https://www.baizeway.com/article/af26ad7682e3061a</link><guid isPermaLink="true">https://www.baizeway.com/article/af26ad7682e3061a/</guid><description>CUDA 入门：揭开 local memory 逻辑私有、物理落 global 的本质，讲解触发场景与避免编译器溢出到 local memory 的性能要点。</description><pubDate>Wed, 01 Apr 2026 19:44:28 GMT</pubDate></item><item><title>[CUDA 优化实战] safe online softmax - 面试必问：任意 hidden_size、one pass、two pass、trade-off、split-k</title><link>https://www.baizeway.com/article/8b8f983df949c7c0</link><guid isPermaLink="true">https://www.baizeway.com/article/8b8f983df949c7c0/</guid><description>CUDA safe online softmax 全场景攻略：覆盖任意 hidden_size、one pass/two pass、split-k 等面试高频考点的实现方法与 trade-off 分析。</description><pubDate>Tue, 31 Mar 2026 17:11:15 GMT</pubDate></item><item><title>[CUDA 入门] L1/TEX/SMEM - 再识bank conflict</title><link>https://www.baizeway.com/article/bff10dfdf376e83f</link><guid isPermaLink="true">https://www.baizeway.com/article/bff10dfdf376e83f/</guid><description>结合 NCU 验证与 NV GTC 技术报告，重新理解 L1/TEX/SMEM 共享存储上的 warp 间 Bank Conflict 成因与规避方法。</description><pubDate>Fri, 06 Mar 2026 20:40:38 GMT</pubDate></item><item><title>[CUDA 优化实战] sgemm - 超越 cuBLAS：带你学会极致优化的矩阵乘法 cuda c++ 实现</title><link>https://www.baizeway.com/article/ce4e1621e32a7b08</link><guid isPermaLink="true">https://www.baizeway.com/article/ce4e1621e32a7b08/</guid><description>纯 C++ CUDA 手搓 SGEMM，从 naive tiling 到双缓冲与 swizzle，在 RTX 5060 上超越 cuBLAS，系统复盘 FP32 矩阵乘法极致优化全流程。</description><pubDate>Thu, 05 Mar 2026 17:47:31 GMT</pubDate></item><item><title>[CUDA 优化实战] RoPE - 手写算子的作用之 kernel fusion：减少访存次数、减少启动开销的优化技巧</title><link>https://www.baizeway.com/article/722570534c4ba0f8</link><guid isPermaLink="true">https://www.baizeway.com/article/722570534c4ba0f8/</guid><description>对比 PyTorch 与手写 CUDA Kernel 实现 RoPE 算子，解析 kernel fusion 如何通过减少访存与启动开销突破大模型推理的显存带宽瓶颈。</description><pubDate>Thu, 05 Mar 2026 17:36:30 GMT</pubDate></item><item><title>[CUDA 优化实战] 矩阵转置-从 Padding 到 XOR Swizzle：CUDA 共享内存优化的艺术</title><link>https://www.baizeway.com/article/49c4e15376366f8d</link><guid isPermaLink="true">https://www.baizeway.com/article/49c4e15376366f8d/</guid><description>CUDA 矩阵转置优化实战：从合并/跨步访存的朴素 Kernel，演进到 Shared Memory Tiling、Padding 与 XOR Swizzle，详解共享内存 Bank Conflict 的成因与规避方法。</description><pubDate>Fri, 13 Feb 2026 19:26:22 GMT</pubDate></item><item><title>CUDA 开发者应该熟悉的数</title><link>https://www.baizeway.com/article/548cec5dfba296d5</link><guid isPermaLink="true">https://www.baizeway.com/article/548cec5dfba296d5/</guid><description>梳理 CUDA 性能调优必知的硬件参数与延迟量级——Warp Size、SM 数量、访存带宽等黄金数字，帮助开发者榨干 GPU 算力。</description><pubDate>Mon, 09 Feb 2026 20:38:13 GMT</pubDate></item><item><title>深度解读 DeviceQuery：理解你的 GPU 硬件属性</title><link>https://www.baizeway.com/article/5860d3d6e3f62297</link><guid isPermaLink="true">https://www.baizeway.com/article/5860d3d6e3f62297/</guid><description>以 RTX 5060 为例深度解读 CUDA deviceQuery 输出，帮你理解计算能力、SM 配置、内存层次等硬件属性以指导 Kernel 开发。</description><pubDate>Fri, 06 Feb 2026 13:30:44 GMT</pubDate></item><item><title>手把手 CUDA 编程实践</title><link>https://www.baizeway.com/article/3c6cbaa1ee1bfb8c</link><guid isPermaLink="true">https://www.baizeway.com/article/3c6cbaa1ee1bfb8c/</guid><description>记录 vitamin-cuda 项目从零开始的 CUDA 算子开发实践，从基础 kernel 到应用优化，打造 LeetCUDA 风格的手把手学习路线。</description><pubDate>Wed, 21 Jan 2026 19:43:44 GMT</pubDate></item><item><title>leetcode 712. 两个字符串的最小 ASCII 删除和 (medium)</title><link>https://www.baizeway.com/article/fc1c09c2eb681651</link><guid isPermaLink="true">https://www.baizeway.com/article/fc1c09c2eb681651/</guid><description>经典动态规划-公共子序列问题的基础变形题#题面给定两个字符串s1和s2，返回使两个字符串相等所需删除字符的ASCII值的最小和。#解析经典的公共子序列问题是找出两个序列的最长公共子序列（可以通过删除或增加字符），动态规划主要思路是找到状态的定义以及状态间转移方式。公共子序列需要维护长度，该题相对应的</description><pubDate>Sat, 10 Jan 2026 12:13:13 GMT</pubDate></item><item><title>我的公司老了</title><link>https://www.baizeway.com/article/8cf595ce06f21ca4</link><guid isPermaLink="true">https://www.baizeway.com/article/8cf595ce06f21ca4/</guid><description>我的公司老了，尽管年纪不大，但真的老了#老兵不会死去，只是凋亡最近在做一个项目的升级，可以称得上是技术框架在版本号上的大跃进，ubuntu20到ubuntu24，gcc8到gcc13，torchv1到torch2.9，tensort8到tensorrt10.14，cuda11到cuda13。本以为只</description><pubDate>Wed, 26 Nov 2025 21:33:38 GMT</pubDate></item><item><title>leetcode 3321. 计算子数组的 x-sum II (hard)</title><link>https://www.baizeway.com/article/b084669b799d0d42</link><guid isPermaLink="true">https://www.baizeway.com/article/b084669b799d0d42/</guid><description>是leetcode每日一题跳出来的。咋看了一眼题就觉得很有趣，让我想到经典的类似题，如：维护一个队列中的中位数，具体题不记得了。#计算子数组的x-sumII如之前所言，这题的题面就让人容易联想到维护滑动窗口中的中位数，维护中位数的做法是如何实现的呢，就是用一大一小个set，每次插入数据无脑往大的se</description><pubDate>Sat, 15 Nov 2025 12:30:41 GMT</pubDate></item><item><title>英伟达之死...</title><link>https://www.baizeway.com/article/6617ff2c82210644</link><guid isPermaLink="true">https://www.baizeway.com/article/6617ff2c82210644/</guid><description>这只是一个平行世界的幻想，从某种意义上来说，你，我，我们，整个宇宙，终将逝去。#序未来的某周二，NVIDIA死了。也许是周三，我们不知道。只见零散的媒体消息掠过：已经没人使用CUDA了，都用xxx了。这说明不了什么，可能NVIDIA周一就死了。#英伟达的发家史二三十年前，那个穿皮衣的男人创建了一家公</description><pubDate>Mon, 10 Nov 2025 20:41:49 GMT</pubDate></item><item><title>大语言模型 think budget</title><link>https://www.baizeway.com/article/1234567</link><guid isPermaLink="true">https://www.baizeway.com/article/1234567/</guid><description>我不知道有多少人在使用思考模型，但笔者个人对思考模型的推理性能（性能吞吐）是极度不满意的，因此笔者一直避免使用思考模型，但人在江湖身不由己，有时候不得不使用思考模型。从OpenAI开始提出推理模型开始，思考模型已经逐渐成为了学界和业界的热点，国内开源模型两巨头qwen和deepseek，都有思考模式</description><pubDate>Sun, 26 Oct 2025 17:13:27 GMT</pubDate></item></channel></rss>