02 / WRITING
概念随笔
05 篇 · 持续更新
PROBABILITY约 9 分钟
01
重要性采样与拒绝采样
从蒙特卡洛积分出发,理解提议分布、重要性权重,以及拒绝采样如何用可控的代价换取目标分布样本。
FOUNDATIONS约 7 分钟
02
熵
从信息量到信息熵,再到交叉熵与 KL 散度:用编码视角串起几个常被混用的概念。
DEEP LEARNING约 8 分钟
03
重参数化
随机采样为什么会让梯度断开,VAE 与 Gumbel Softmax 又如何把随机性移到可控的位置。
LLM TRAINING约 4 分钟
04
RL 中的 Loss 计算级别
对比 GRPO、DAPO 与 GSPO 的奖励、重要性采样和 Loss 聚合维度,理解长度偏见从何而来。
DATASETS约 20 分钟
05
代码与数学数据集
面向预训练、SFT 与 RL 的代码和数学数据集索引,记录规模、来源、用途与验证方式。