关于我
👋 你好,我是枫语
一名专注于大语言模型训练与推理的 AI 工程师。目前主要研究方向是使⽤强化学习(RL)的方法让大模型更聪明、更可靠 — 涵盖从分布式训练、RLHF 对齐到推理优化的完整链路。
🎯 技术栈
| 方向 | 技术 |
|---|---|
| 分布式训练 | PyTorch · DeepSpeed · FSDP · Megatron-LM |
| 推理优化 | vLLM · TensorRT-LLM · FlashAttention · quantization |
| 强化学习 | PPO · GRPO · Reward Modeling · RLHF/RLAIF |
| 模型架构 | Transformer · Mixture of Experts · KV Cache |
| ML 系统 | NCCL · CUDA · Ray · NCCL · InfiniBand |
| 因果推断 | DUCG · DoWhy · Causal Discovery |
🚀 开源项目
| 项目 | 描述 | 状态 |
|---|---|---|
| LLM-Practice | LLM 训练/推理实战代码与笔记 | 🟡 更新中 |
| RLHF-Notes | RLHF 理论与实践完整笔记 | 🟡 更新中 |
📝 精选文章
分布式训练
- DeepSpeed ZeRO 源码剖析 — 从显存优化到通信模式的全链路分析
- FSDP vs DeepSpeed 对比 — 两种分布式训练范式在真实场景下的优劣
RLHF & 对齐
- PPO 在 RLHF 中的数学推导 — 从策略梯度到 KL 散度约束的完整推导
- Reward Model 训练实战 — 从数据标注到模型评估的完整流程
推理优化
- vLLM PagedAttention 源码分析 — KV Cache 管理的核心设计
- FlashAttention 原理与实现 — 从 tiling 到 recomputation 的完整解读
📬 交流与联系
- GitHub: @meiluosi
- Email: 见侧边栏
“用 RL 的方法,让大模型更聪明、更可靠。”