DSAI4205 Big Data Analytics 全景导览:从分布式系统到 NLP、图分析与推荐系统

这篇文章根据 DSAI4205 Big Data Analytics 的 Lecture 1-10 和复习材料整理。目标不是把课件逐页翻译一遍,而是把这门课真正要训练的思维串起来:当数据大到单机放不下、处理不过来、结构又越来越复杂时,我们应该如何存储、计算、分析和建模。

如果只背术语,很容易把这门课学成一堆零散概念:HDFS、Dask、Spark、Hive、NLP、PageRank、NoSQL、推荐系统。更好的理解方式是把它们看成同一个问题的不同层次:

Data ScaleDistributed StorageParallel ComputingStructured / Unstructured AnalyticsGraph and Recommendation\text{Data Scale} \rightarrow \text{Distributed Storage} \rightarrow \text{Parallel Computing} \rightarrow \text{Structured / Unstructured Analytics} \rightarrow \text{Graph and Recommendation}

阅读更多

最优化核心概念导览:Convexity、Duality、KKT 与数值优化

最优化是机器学习、数据挖掘、运筹、控制和 AI infra 里都会反复出现的一条主线。训练模型是在最小化 loss,推荐系统是在优化排序目标,推理系统是在优化吞吐和延迟;即使问题表面很不一样,背后经常都可以抽象成“目标函数 + 约束 + 求解算法”。

这篇文章根据 AMA4850 的复习材料整理,但这里不按考试提纲写,而是把它改写成一篇最优化知识导览:从凸性出发,接到对偶理论、KKT 最优性条件,再到梯度下降、拟牛顿法、罚函数和 barrier method。原 PDF 保留在这里,方便对照完整材料。

阅读更多

学习日志

学习日志

这篇文章用来记录短期学习进度和阶段性计划。

阅读更多

Pandas 入门到实用:数据读取、清洗、合并、聚合与项目流程

Pandas 是 Python 中最常用的数据分析库之一。它适合处理表格数据,例如 CSV、Excel、实验记录、Kaggle 数据集、推荐系统日志和机器学习训练数据。

如果说 NumPy 更像“高效数组计算工具”,那么 Pandas 更像“带行列标签的表格处理工具”。它最适合做数据分析项目的前半段:读取数据、检查质量、清洗字段、构造特征、合并多张表、聚合统计,最后把干净的数据交给模型或可视化工具。

阅读更多

多元微积分 Lecture 1:向量、点积与叉积

课程背景

多元微积分是在一元微积分的基础上,把函数、导数、积分推广到更高维空间。

一元微积分研究的是一条线上的变化,多元微积分研究的是平面或空间中的变化。它在机器学习、优化、物理建模和计算机图形学中都很重要。

阅读更多

C++ Lecture 1:基础语法入门

这是一篇早期 C++ 入门课堂笔记,内容比较碎片化。更完整、系统、适合作为主线学习的版本请阅读:C++ 程序设计入门到实用:语法、函数、数组、算法、类与指针

为什么要学 C++

C++ 比 Python 更接近底层,语法也更严格。它需要你明确变量类型、函数返回值、头文件和编译过程。

对于算法岗来说,C++ 很重要,因为很多笔试、竞赛和高性能系统都会用 C++。对于未来想做 AI Infra 或推理优化的人来说,C++ 也是绕不开的基础。

阅读更多

向量空间与矩阵乘法背后的空间意义

前记

学习线性代数时,矩阵乘法经常被直接定义成一堆公式。公式当然重要,但如果只记公式,很容易不知道它到底在“改变什么”。

我更想从空间角度理解矩阵乘法:矩阵不仅是一张数字表,它也可以看成一种对空间的变换。

阅读更多
Click to play