nanochat 是 Karpathy 开源的极简 LLM 训练实验框架,专为单 GPU 节点设计,代码极简、易于改造,覆盖分词、预训练、微调、评估与推理全部阶段。只需一个复杂度旋钮(层数 depth)即可训练一整套计算最优模型序列。
核心特性
🎓 全流程覆盖
- 分词、预训练、微调、评估、推理一站式
- 训练完成后可直接通过 CLI 与模型对话
💰 极致成本
- 约 $48(8×H100 约 2 小时)即可训练出 GPT-2 能力级模型
- 使用抢占式实例时总成本可低至 ~$15
🧩 极简可改造
- 代码量小、结构清晰,适合学习与研究
- 单参数(depth)控制模型规模
使用场景
- 学习 LLM 完整训练流程
- 低成本实验训练小型模型
- 教学演示与科研基线