Transformer架构详解
深入理解自注意力机制与位置编码
2024-09-01
|
931 字
|
5 分钟
MCTS算法深度解析
蒙特卡洛树搜索的原理与变种
2024-08-20
|
3838 字
|
19 分钟
统计学基础与假设检验
数据分析的统计学基石
2024-08-15
|
4261 字
|
21 分钟
强化学习调参技巧与实战经验
超参数优化、稳定性提升与样本效率改进
2024-08-05
|
4479 字
|
22 分钟
模型基础强化学习详解
深入理解马尔可夫决策过程、值函数与Bellman方程
2024-07-28
|
3070 字
|
15 分钟
DUCG建模实战指南
从问题分析到模型构建的完整流程与工具实践
2024-07-22
|
5839 字
|
29 分钟
多智能体强化学习
合作与竞争:MARL 的关键技术
2024-07-20
|
3096 字
|
15 分钟
Actor-Critic 算法家族
A2C/A3C、PPO、SAC 全面梳理
2024-07-12
|
2957 字
|
15 分钟
策略梯度方法详解
从REINFORCE到基线与方差降低
2024-07-05
|
3325 字
|
17 分钟
Alpha Zero算法实现五子棋
深度强化学习在游戏AI中的创新应用
2024-06-30
|
1181 字
|
6 分钟
Profile Image of the Author
枫语
LLM 训练/推理 · 分布式系统 · RLHF
公告
LLM 训练/推理 · 分布式系统 · RLHF — 用 RL 的方法让大模型更聪明
音乐
封面

音乐

暂未播放

0:000:00
暂无歌词
分类
标签
站点统计
文章
33
分类
9
标签
15
总字数
75,837
运行时长
0
最后活动
0 天前
站点信息
构建平台
GitHub Actions
博客版本
v6.13.5
文章许可
CC BY-NC-SA 4.0

文章目录