AN INDEPENDENT AI RESEARCH JOURNAL08 ARTICLES / CONTINUALLY BOUND

Ordo ex Chaos

于混沌淘金,向秩序前行。
致模型,亦致求索者。

浏览全部文章 ↓
WRITING INDEX / 文章索引

锚定一问,
向深处掘进

显存刺客 KV Cache:从算清账到撑起百万上下文

KV Cache 已经不只是一个推理优化细节,而是长上下文、多模态、Agent 服务的成本中枢。本文从显存公式讲起,沿系统管理、模型架构、动态压缩、量化与 Offloading 五条路线,重新整理 2026 年前后的 KV Cache 技术版图。

万字长文:LLM 高阶解码策略与推理加速范式全景深度解析

从概率分布干预到系统级软硬件协同,深度拆解 DoLa、CFG、投机解码家族 (EAGLE/SSD) 以及多词预测 (Medusa/MTPC) 的数学原理与工程实现。

后 GRPO 时代:长 CoT 的爆发与“对齐”新挑战

从 DAPO、GSPO、LUSPO 到 Dr.GRPO、GMPO、PMPO,一文拆解 GRPO 变体的核心动机、目标函数与工程改造路径。

资源受限下的破局者:On-Policy Distillation

在算力与标注数据双重受限下,On-Policy Distillation 如何用 Reverse KL、γ=0 与在线探索实现高效后训练。

大模型字斟句酌的暗箱操作:Decoding 算法全景硬核拆解

Greedy、Beam、Top-K、Top-P、Min-P、Contrastive 与 Constrained Decoding 的底层机制与 PyTorch 实现全景拆解。

参数高效微调的终极炼丹术:从 LoRA 到它的“魔改”宇宙

从 LoRA、LoRA+、PiSSA、DoRA 到 TinyLoRA 与 LoRA-Mixer,一文看懂参数高效微调的核心机制与工程取舍。

后 DPO 时代的百家争鸣:如何优雅地给大模型“立规矩“

各大顶级实验室爆改 DPO出了一套极其华丽的招式表

人类偏好的刻度:PPO、DPO 与 GRPO 极简拆解

在探讨大语言模型(LLM)的对齐算法之前,我们需要先理清模型训练的宏观图景。大模型的训练通常分为三个阶段:预训练(Pre-training)、指令微调(SFT)和人类偏好对齐(RLHF/Alignment)。

READER'S INSERT / 01

负熵周报

All models are wrong, but some are useful.

订阅身份同时用于文章评论区登录。
ABOUT THE JOURNAL

自混沌寻序
向智能观己

about.sh

$ cat about.txt 在模型与损失的褶皱里寻路 在试错与迭代的往复中自观 训智能亦是观心,探规律亦是探路 真理无穷,进一步有进步的欢喜

EDITOR / AUTHOR梅鼎琰 🔥mmy12580@gmail.com