Data Science / NLP / LLM Applications

RichardF 的技术作品集与学习实验室

大四学生,正在系统整理 Python 工程、数据科学、机器学习、NLP/LLM 应用、 数学笔记和项目复盘。这里既是学习档案,也是逐步成型的技术作品集。

NLP / LLM ApplicationsData Science / Big DataPython / C++ / PyTorch
Current TrackLearning in Public

把课程项目、技术笔记和实验记录整理成长期可回看的作品体系。

16 posts6 projects4 tracks
NLP Portfolio Project

Stock Market Sentiment Classification

从传统机器学习 baseline 到 DistilBERT + LoRA,再到 XGBoost hybrid 的完整情感分类项目。

DistilBERT / LoRA / XGBoost / Macro F1
01Programming Core

Python、C++、算法题、项目结构和可复现脚本。

02Math for ML

线性代数、SVD、张量分解、优化和模型背后的数学。

03Data Systems

Pandas、Dask、Spark、特征工程和大数据分析。

04Portfolio Output

把项目文章、GitHub、实验结果整理成可面试讲述的作品。

Recent Posts

从规则检索到 GraphRAG:贵州统计指标系统的架构、混合召回与工程优化

本文是 Guizhou-GraphRAG 的技术复盘。项目面向贵州统计指标检索:输入一句口语问题,系统需要从 2000 多条结构相似的指标中找出正确实体,并返回定义、类别、匹配证据和图谱关系。

这里最难的并不是接入 LLM,而是同时处理三类冲突:召回率与精确率的冲突、语义相似与统计口径的冲突、模型能力与结果可控性的冲突。 项目最终采用“指标知识图谱 + 多路召回 + 规则排序 + 可选模型精排”的架构,并通过单字保护、候选门控、动态权重、向量缓存和服务降级等工程优化建立可用闭环。

阅读更多
Click to play