拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

5步看懂TF-IDF+SVM:垃圾邮件与假新闻检测的实现原理(Beginner-Data-Science-Projects 新手指南)

5步看懂TF-IDF+SVM:垃圾邮件与假新闻检测的实现原理(Beginner-Data-Science-Projects 新手指南)

5步看懂TF-IDF+SVM:垃圾邮件与假新闻检测的实现原理(Beginner-Data-Science-Projects 新手指南)

【免费下载链接】Beginner-Data-Science-ProjectsThis repository is a curated collection of hands-on data science projects tailored for beginners. Whether you're just starting your journey in data science or looking to strengthen your skills, these projects provide a practical and interactive way to apply your knowledge.项目地址: https://gitcode.com/gh_mirrors/beg/Beginner-Data-Science-Projects

刚接触自然语言处理(NLP)时,文本分类往往是第一块"试金石":让机器判断一条短信是不是垃圾邮件(Spam),或一篇新闻是真是假(Fake News)。Beginner-Data-Science-Projects 仓库里的两个经典项目就带你完整走通这条路线——Message Spam Filtering(垃圾短信过滤)和Fake News Detection(假新闻检测),核心技术都是教科书级的TF-IDF + SVM 文本分类:前者 30 个真实短信样本快速上手,后者 6335 篇新闻完整演示"EDA → 清洗 → 建模 → 交叉验证 → 调参"的工程化流程 🚀

两个项目,一条学习路径

仓库把 NLP 项目组织在 NLP/ 目录下,这两个项目正好构成递进关系:

项目数据规模文本来源核心看点
Message Spam Filtering5572 条真实短信单条短文本最简 TF-IDF + 3 分类器对比
Fake News Detection6335 篇新闻文章标题 + 正文长文本7 分类器 PK + 5 折交叉验证 + 网格调参

假新闻检测项目采用标准的三段式 Notebook 结构,很适合照着走:

  • 数据探索:01_eda.ipynb
  • 文本清洗:02_data_cleaning.ipynb
  • TF-IDF 建模与评估:03_model_building.ipynb
  • 可复用工具函数:utils.py
  • 原始数据集(含 FAKE / REAL 标签):data/fake_or_real_news.csv

垃圾邮件项目则更轻量,一个脚本 messageSpamFiltering.py 加一个 Notebook messageSpamFiltering.ipynb 就能跑通全流程,数据集是经典的 SMS Spam Collection:spam.csv。

完整流程:一条短信/一篇新闻如何变成"是/否"

两个项目背后的 pipeline 完全一致,可以概括为 5 步:

原始文本 │ ① 预处理:去标点 → 去停用词 → 词干提取 ▼ 清洗后的文本 │ ② TF-IDF 向量化:文本 → 稀疏数字矩阵(约 1 万个特征维度) ▼ 特征矩阵 │ ③ 按 7:3 / 8:2 划分训练集与测试集 ▼ 训练集 + 测试集 │ ④ 模型训练:SVM / 朴素贝叶斯 / 决策树 / 逻辑回归… ▼ ⑤ 评估:Accuracy、Precision、Recall、F1、混淆矩阵

第 1 步:文本清洗——把"人话"变成"模型话"

原始短信里充斥着缩写、拼写错误和无关字符。messageSpamFiltering.py 中的preprocess函数做了三件事:

  1. 去除标点符号
  2. 过滤停用词(the、is、and 这类出现频率极高但几乎不携带分类信息的词,来自 NLTK 语料)
  3. 词干提取(用 SnowballStemmer 把 "president" 统一成 "presid","voting" 变 "vot",减少特征空间)

假新闻项目在 02_data_cleaning.ipynb 中做了类似处理,并且有一个细节:把标题(title)和正文(text)拼成一个content字段,因为标题往往包含强烈的分类线索( sensational 标题 vs 平实标题),让两者共同参与建模。

第 2 步:TF-IDF——让机器"读懂"每个词的分量

机器学习模型只认数字,不认文字。TF-IDF(Term Frequency–Inverse Document Frequency,词频–逆文档频率)是文本分类领域最经典的"翻译器":

  • TF(词频):一个词在当前文档里出现得越多,权重越高——"won a prize" 在垃圾短信里反复出现,自然分数高。
  • IDF(逆文档频率):一个词在所有文档里出现得越普遍,权重越低——"the" 几乎每篇都有,直接压到接近 0。

一句话总结:只在本篇文档重要、在其他文档罕见的词,权重最高——这正是区分垃圾邮件和正常短信、假新闻和真新闻的关键信号。

假新闻项目使用的向量化器配置(见 03_model_building.ipynb)有三个值得注意的旋钮:

参数取值作用
max_features10000只保留权重最高的 1 万个词,控制维度、减少噪声
ngram_range(1, 2)同时使用单词(unigram)和相邻词组(bigram,如 "fox news")
sublinear_tfTrue用 log(1+tf) 替代原始词频,防止高频词过度主导

最终 5044 条训练文本被转换成5044 × 10000的稀疏矩阵——每行是一篇文章,每列是一个词的 TF-IDF 权重。垃圾邮件项目则用默认配置的TfidfVectorizer("english")(同样自动过滤英文停用词)。

第 3 步:SVM——在高维空间里画一条"最优分界线"

SVM(支持向量机,Support Vector Machine)的核心思想是:在特征空间中找到一条分隔两类样本的超平面,使离分界线最近的样本(支持向量)到线的距离(margin)最大——间隔越大,模型越稳健。

在 TF-IDF 产生的高维稀疏特征上,线性 SVM是文本分类的"黄金搭档":训练快、可解释(每个词都有权重)、且泛化能力极强。

  • 假新闻项目直接使用LinearSVC,最终测试集 F1 达0.9287;5 折交叉验证中更是拿到全场最高的0.9415(±0.0034),稳定性最好。
  • 垃圾邮件项目则用了带 sigmoid 核的SVC(kernel='sigmoid')做演示对比。实践中建议新手优先用线性核——它几乎总是文本分类的首选,sigmoid 核表现通常平平。

第 4 步:不止 SVM——7 个分类器同台竞技

假新闻项目并不迷信单一模型,而是在同一套 TF-IDF 特征上横向对比了 7 个经典分类器,按加权 F1 排序(数据来自 README):

模型AccuracyF1
Logistic Regression(调参后 C=10)0.92950.9295
Linear SVM0.92870.9287
Passive Aggressive0.92710.9271
Ridge Classifier0.92710.9271
Logistic Regression0.91760.9176
Random Forest0.90020.9001
Multinomial / Complement NB0.88990.8897

几个对新手很有价值的结论:

  • 线性模型家族(SVM、逻辑回归、Ridge)全面领先——说明真假新闻在词汇层面差异显著,TF-IDF 已经提供了足够的信号。
  • 朴素贝叶斯落后约 4 个百分点——它的"特征相互独立"假设太强,而真假新闻的线索往往以短语簇形式出现(如 "fox news"、"wikileaks"),独立假设恰好失效。
  • 随机森林反而偏弱——树模型在高维稀疏特征上难以学到线性模型那么干净的边界。

第 5 步:交叉验证与网格调参——别只看一次划分的成绩

单次 8:2 划分的成绩可能有偶然性。项目用5 折交叉验证反复检验(见 03_model_building.ipynb 第 6 节),再用GridSearchCV在C ∈ {0.1, 1.0, 10.0}×ngram_range ∈ {(1,1), (1,2)}的网格上寻找最优组合,最终锁定{clf__C: 10.0, tfidf__ngram_range: (1, 2)},交叉验证 F1 达0.9332。

模型到底"看"什么词?逻辑回归的权重系数揭示了判别依据(均为词干形式):

  • 推向 FAKE 一类:islam state、fox news、cruz、candid、debat、gop…
  • 推向 REAL 一类:articl、sourc、us、elect、email、via、corrupt…

⚠️一个重要的泛化提醒(README 也专门指出):模型可能学到的是数据源和时代偏差(比如某一年选举季的政治词汇),而不是普适的"假"。这个测试集上 93% 的准确率,迁移到其他来源、其他时期的新闻时未必成立——这是所有文本分类项目部署前必须想清楚的问题。

评估指标速查:Accuracy 之外的真相

两个项目都输出完整的classification_report。对新手来说,理解这四个指标的分工比背公式更重要:

指标回答的问题
Accuracy 准确率整体判对的比例
Precision 精确率被判成"垃圾/假"的里面,真有多少是?(避免误伤)
Recall 召回率所有"垃圾/假"里,抓出了多少?(避免漏网)
F1Precision 与 Recall 的调和平均,综合平衡指标

垃圾邮件场景下通常更看重Recall(宁可误杀也别漏放),假新闻场景则希望 Precision 和 Recall 均衡——项目统一以加权 F1 作为主排序指标,是稳妥的选择。

上手指南:5 分钟跑通第一个文本分类项目

以最轻量的垃圾邮件过滤为例,完整步骤如下:

  1. 确认 spam.csv 位于项目目录(v1列为 spam/ham 标签,v2列为短信内容)
  2. 安装依赖:pip install pandas nltk scikit-learn
  3. 下载 NLTK 停用词数据:在 Python 中执行nltk.download('stopwords')
  4. 用 Jupyter 打开 messageSpamFiltering.ipynb,或直接运行python messageSpamFiltering.py
  5. 查看输出的 SVM / 朴素贝叶斯 / 决策树三组准确率、精确率、召回率与 F1 对比

依赖清单见 requirements.txt。想进一步练习,可以试试:把 SVM 换成线性核看看 F1 变化、给 TF-IDF 加上ngram_range=(1, 2)、或把 Spamtest.txt 里的手写测试短信喂给训练好的模型做预测。

写在最后:从这两个项目延伸到哪里

TF-IDF + SVM/线性模型是 NLP 的"老三样",至今仍是许多工业界文本分类任务的强基线(fast and boring baseline,而且常常难以被超越)。掌握这条 pipeline 后,你可以轻松平移到仓库 NLP 目录下的更多项目:Email Classification、Toxic Comment Classification、Twitter Hate Speech Detection、Song Lyrics Genre Classification——它们几乎共用同一套01_eda → 02_data_cleaning → 03_model_building骨架,换数据即可复用。

推荐学习路径:先用垃圾邮件项目(30 分钟)建立直觉 → 再精读假新闻项目(完整工程流程)→ 最后挑战情感分析类项目(Movie Review Sentiment Analysis)。文本分类是通往更复杂 NLP 任务的可靠起点,而这两个项目恰好提供了最温和的坡度 ⛰️

【免费下载链接】Beginner-Data-Science-ProjectsThis repository is a curated collection of hands-on data science projects tailored for beginners. Whether you're just starting your journey in data science or looking to strengthen your skills, these projects provide a practical and interactive way to apply your knowledge.项目地址: https://gitcode.com/gh_mirrors/beg/Beginner-Data-Science-Projects

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

返回列表