强化学习 · 课程与实验
Hands-on Modern RL
现代强化学习:从基础到大模型与智能体
结合概念讲解、数学推导与代码实验,学习价值函数、DQN、策略梯度和 PPO,并进一步探索 RLHF、DPO、GRPO 与 Agentic RL。
从这里开始先阅读课程导论与环境准备,再跟随章节完成实验;课程仍在完善,优先学习已完成章节。
LEARN BY BUILDING
从理解原理到动手实现,沿着公开课程与开源代码,探索强化学习、语言模型与计算机视觉。
强化学习 · 课程与实验
现代强化学习:从基础到大模型与智能体
结合概念讲解、数学推导与代码实验,学习价值函数、DQN、策略梯度和 PPO,并进一步探索 RLHF、DPO、GRPO 与 Agentic RL。
从这里开始先阅读课程导论与环境准备,再跟随章节完成实验;课程仍在完善,优先学习已完成章节。
语言模型 · 代码实践
通过完整代码,理解语言模型如何训练
Andrej Karpathy 的开源语言模型训练项目,以精简、可修改的代码串联分词、预训练、微调、评估与推理,适合结合源码理解完整训练流程。
从这里开始先读 README 的入门说明,再沿训练脚本阅读代码;选择与自己设备相符的运行方式。
大模型 · 高效微调
从准备数据到完成模型微调
面向语言模型与视觉语言模型的微调框架,支持监督微调、LoRA、QLoRA 等训练方式,并提供命令行与可视化界面。
从这里开始先跟随官方快速开始准备数据,跑通一个小模型的 LoRA 微调,再学习评估与推理。
强化学习 · 大模型后训练
把 PPO 与 GRPO 带入训练实践
面向大模型后训练的强化学习框架,提供 PPO、GRPO 等算法实践,覆盖数据准备、奖励函数、采样生成与分布式训练。
从这里开始先阅读安装与快速开始,理解数据、奖励函数和训练配置,再跟随官方示例运行实验。
计算机视觉 · 文字识别
从图像文字识别到文档解析
飞桨生态的文字识别与文档解析工具,提供文字检测、识别以及表格、版面等文档结构处理能力,适合结合实际图片与文档开展实践。
从这里开始先跑通一张图片的文字识别,理解检测与识别结果,再尝试文档结构解析和应用集成。
计算机视觉 · 目标检测
YOLO 系列的 Ultralytics 实践入口
通过 Ultralytics 官方实现学习 YOLO 系列模型,覆盖目标检测、实例分割、姿态估计与目标跟踪,并贯通训练、验证、预测与模型导出。
从这里开始先用预训练模型完成预测,再用自己的标注数据训练检测模型,逐步学习验证与导出流程。
更多教程,陆续收录。
教程内容由原作者维护,点击相应入口前往原站学习。