PPO、GRPO 与策略梯度数学推导
选择一个标签快速筛选;未选择时,按更新时间展示全部公开文章。
PPO、GRPO 与策略梯度数学推导
从基础概念到 RLHF 的学习笔记
强化学习理论与 PPO 应用综述
强化学习术语、算法与 AlphaGo 笔记
Introduction+转义字符+注释+代码规范+DOS
课程与资料导航
绘图基础与常见图表示例
DataFrame 基础操作笔记
数组基础与常用操作笔记
Hugging Face Deep RL Course 学习索引
顶级会议和期刊的10篇最具影响力论文
酒店系统AI助手
功能更新文档
功能开发
索引优化
章节课后题笔记
数组,排序,查找
第二阶段
房屋出租系统
Super+继承+多态
类与对象
控制结构
运算符
变量+“+”+数据类型+编码+数据类型转换
Introduction+转义字符+注释+代码规范+DOS