后训练扫盲:SFT 记知识、RL 学长处,和 Agent 有什么关系
不训模型的工程师视角的后训练扫盲:预训练、SFT、RL 各自做什么,为什么验证器便宜的领域进展最快,以及奖励设计思维对 Agent 应用层的启发。
共 7 篇文章
不训模型的工程师视角的后训练扫盲:预训练、SFT、RL 各自做什么,为什么验证器便宜的领域进展最快,以及奖励设计思维对 Agent 应用层的启发。
意义 每一项工作,都是一个pdca循环,都需要计划、实施、检查结果,并进一步进行改进,同时进入下一个循环,只有在日积月累的渐进改善中,才可能会有质的飞跃,才可能取得完善每一项工作 细则 Plan:制定目标与计划; Do:任务展开,组织实 施; Check:对过程中的关键点和最终结果进行检查; Action:纠正偏差,对…
image.png 7个问题理解《金字塔原理》: 什么是金字塔原理? 一件事情可归纳出一个中心论点,而这个中心论点可以由3-7个论据进行支撑; 每一个论据本身又可作为一个论点,同样被3-7个论据支撑… 如此重复往返,就形成金字塔一样的结构。 使用金字塔原理要注意哪些关键点? ①结论先行: 原因:符合人类大脑运作方式,…