Token Efficiency
在大模型预训练(Pre-training)中,如何将每一份高质量数据(Token)的智力榨取和模型压缩率最大化的优化目标。
背景与痛点
- 数据墙与常数瓶颈:高质量人类语料数据的增长极其缓慢,且多模态数据并不能直接提升文本大模型本身的智商上限。高质量文本数据量在物理上接近一个“常数”(例如 30T 左右的行业公认高质量 token 极限)。
- Token 效率 vs 计算效率:
- 计算效率 (Compute Efficiency):关注通过优化计算平台、算力集群,让模型训练得更快。但这并不能提升智能的最终上限。
- Token 效率 (Token Efficiency):关注在吃下相同数量的数据时,模型脑子能够长得更多、智能上限更高(Lo降得更低、压缩率更高)。
核心实现策略 (以 Kimi K2 为例)
- 非 Adam 优化器 (矩阵正交化):传统模型训练大多使用 Adam 优化器。Kimi 在万亿参数规模大模型上,采用基于矩阵正交化(源自 Muon 优化器并克服了大规模训练时 max logit 爆炸的技术瓶颈)的新型优化器。在 Computer-Optimal 情况下能将学习效率提升 2 倍(即吃一份高质量数据,等价于使用 Adam 学两份数据的智能效果,相当于把 30T 高质量数据变成 60T)。
- 高质量数据改写 (Data Rewrite):对于极高智商的核心数据,直接重复学习会导致模型泛化性下降和过拟合。通过将原始高质量数据进行一定泛化程度的改写(Rewrite),能够增加系统的信息熵(新商输入),让大模型以更高的泛化性能吸收核心知识。
Source: 2026-06-22-youtube-youtu-be-91fmhAnECVc-si-YJi23juyT-M2MZqu(来源未公开)