Machine Learning Project Composition (机器学习项目构成)
在机器学习工程实践中,项目时间和精力的分配与大众的常规认知存在显著偏差。许多人认为机器学习项目的 99% 精力都在“模型训练”上,但在实际落地的 ML 工程中,精力分配往往更为复杂。
精力分配比例
根据蔡云达 (@yunta_tsai) 的总结,一个健全的机器学习项目的实际精力分配为:
- 评估 (Evaluation):50%。
- 数据清洗 (Data Cleaning):40%。
- 系统集成 (Integration):8%。
- 模型训练 (Training):2%。
Source: 2026-06-21-x-x-com-yunta_tsai-status-2068364559698780520-s-46(来源未公开)
理论解释:学习的噪底 (Noise Floor for Learning)
- 香农编码的最优边界:评估与数据清洗(合计占比 90%)共同设定了学习的“噪声下限 (Noise Floor)”。没有任何模型算法或“机器学习魔法”能够让机器越过这一噪底,因为它代表了数据的香农编码的最优边界。
- 本体论 (Ontology) 的重要性:数据噪底的决定性意味着工程人员必须每天审视并优化本体论,即使是旧的标签 (labels) 也需要被不断重审和微调。
Source: 2026-06-21-x-x-com-yunta_tsai-status-2068364559698780520-s-46(来源未公开)