AMA2634 统计导论:从描述统计、概率分布到统计推断与线性回归
统计学不是一份需要背诵的公式清单。它真正研究的是:面对带有随机性、噪声和有限样本的数据,我们怎样描述现象、量化不确定性,并对总体作出有边界的判断。
本文根据 AMA2634 Introduction to Statistics 的 10 讲课程资料整理,主线是:
1 | 数据与抽样 |
读完以后,不仅应该会代公式,还应该能判断:为什么采用这个统计量、公式依赖什么假设、结论可以说到什么程度,以及什么时候不能使用它。
Data Science / NLP / LLM Applications
大四学生,正在系统整理 Python 工程、数据科学、机器学习、NLP/LLM 应用、 数学笔记和项目复盘。这里既是学习档案,也是逐步成型的技术作品集。
把课程项目、技术笔记和实验记录整理成长期可回看的作品体系。
从传统机器学习 baseline 到 DistilBERT + LoRA,再到 XGBoost hybrid 的完整情感分类项目。
DistilBERT / LoRA / XGBoost / Macro F1Python、C++、算法题、项目结构和可复现脚本。
02Math for ML线性代数、SVD、张量分解、优化和模型背后的数学。
03Data SystemsPandas、Dask、Spark、特征工程和大数据分析。
04Portfolio Output把项目文章、GitHub、实验结果整理成可面试讲述的作品。
AMA2634 统计导论:从描述统计、概率分布到统计推断与线性回归
统计学不是一份需要背诵的公式清单。它真正研究的是:面对带有随机性、噪声和有限样本的数据,我们怎样描述现象、量化不确定性,并对总体作出有边界的判断。
本文根据 AMA2634 Introduction to Statistics 的 10 讲课程资料整理,主线是:
1 | 数据与抽样 |
读完以后,不仅应该会代公式,还应该能判断:为什么采用这个统计量、公式依赖什么假设、结论可以说到什么程度,以及什么时候不能使用它。
AMA3602 应用线性模型教程:从简单回归、多元回归到模型诊断、变量选择与混合效应模型
这篇文章根据 AMA3602 Applied Linear Models 的讲义、tutorial、summary note 和 Boston Housing 项目资料整理。它不是考试提纲,而是一篇面向“真的会用回归建模”的教程:先把简单线性回归和多元线性回归讲清楚,再进入残差诊断、变量选择、多重共线性、ridge regression,最后接到随机效应模型和一个 Boston Housing 房价建模案例。
如果把机器学习理解成“用数据拟合一个可泛化的函数”,那么线性模型就是最值得先学扎实的一类模型。它简单,但不幼稚;它的假设透明,诊断方法成熟,而且很多复杂模型的思想都可以在这里找到原型。