关于我

👋 你好,我是枫语#

一名专注于大语言模型训练与推理的 AI 工程师。目前主要研究方向是使⽤强化学习(RL)的方法让大模型更聪明、更可靠 — 涵盖从分布式训练、RLHF 对齐到推理优化的完整链路。


🎯 技术栈#

方向技术
分布式训练PyTorch · DeepSpeed · FSDP · Megatron-LM
推理优化vLLM · TensorRT-LLM · FlashAttention · quantization
强化学习PPO · GRPO · Reward Modeling · RLHF/RLAIF
模型架构Transformer · Mixture of Experts · KV Cache
ML 系统NCCL · CUDA · Ray · NCCL · InfiniBand
因果推断DUCG · DoWhy · Causal Discovery

🚀 开源项目#

项目描述状态
LLM-PracticeLLM 训练/推理实战代码与笔记🟡 更新中
RLHF-NotesRLHF 理论与实践完整笔记🟡 更新中

📝 精选文章#

分布式训练#

RLHF & 对齐#

推理优化#


📬 交流与联系#


“用 RL 的方法,让大模型更聪明、更可靠。”

Profile Image of the Author
枫语
LLM 训练/推理 · 分布式系统 · RLHF
公告
LLM 训练/推理 · 分布式系统 · RLHF — 用 RL 的方法让大模型更聪明
音乐
封面

音乐

暂未播放

0:000:00
暂无歌词
分类
标签
站点统计
文章
33
分类
9
标签
15
总字数
75,837
运行时长
0
最后活动
0 天前
站点信息
构建平台
GitHub Actions
博客版本
v6.13.5
文章许可
CC BY-NC-SA 4.0

文章目录