为什么需要 Build LLM from Scratch
研究者越来越依赖 API、框架和现成模型时,为什么仍然需要理解语言模型的底层实现?
语言模型的抽象层仍然会泄漏,真正的研究问题常常要求我们回到底层,理解 token、Transformer、训练、系统、数据和对齐如何共同决定一个模型的能力边界。
过去十年,语言模型研究者使用技术的方式发生了明显变化。2016 年左右,研究者往往自己实现并训练模型;2018 年前后,很多工作转向下载 BERT 这类预训练模型再做 fine-tuning;到今天,许多研究和产品验证直接从 GPT、Claude 或 Gemini 这类 API 模型开始。抽象层级提高以后,生产力确实提升了,但这些抽象不是完全密封的。
语言模型系统不像编程语言或操作系统那样已经形成稳定、清晰、可长期依赖的抽象边界。模型规模、数据配方、训练稳定性、推理系统和硬件效率之间存在大量交叉影响。如果研究目标是理解或改进这项技术本身,而不只是调用一个现成能力,就必须能拆开这套系统。