十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

我用Python采集了全校课程数据,做了个智能选课推荐系统,选课再也不盲选

我用Python采集了全校课程数据,做了个智能选课推荐系统,选课再也不盲选 每到选课季不少人都有过类似的经历对着教务系统里密密麻麻的课程列表无从下手不知道哪门课含金量高、哪门老师给分宽松、哪门容易时间冲突等好不容易翻完培养方案热门课早就被抢空了。之前帮身边朋友解决选课问题索性动手从学校教务系统采集了完整的课程数据结合课程属性、历史选课记录和评分数据做了一套轻量的智能选课推荐系统。不用复杂的大模型靠基础的相似度算法和协同过滤就能给出符合个人需求的课程推荐实际用下来选课效率至少提升一倍。接下来就把完整的实现思路、核心代码和踩过的坑全部分享出来。一、前期准备需求拆解与技术选型整套系统的核心逻辑是先把分散的课程数据统一采集并结构化再通过规则过滤和算法排序输出推荐结果整体处理流程如下需求拆解整个系统核心要解决三个问题课程数据的统一采集把分散在不同分页、不同查询条件下的课程信息整合到一起包含课程名、授课教师、学分学时、上课时间地点、课程属性、考核方式等核心字段脏数据结构化处理教务系统的课程时间、教师信息格式极不统一需要清洗成可计算的结构化数据个性化推荐根据学生已选课程、专业方向、偏好难度匹配最合适的课程同时自动规避时间冲突技术选型为什么选这套技术栈而不是更重的方案采集层国内高校教务系统大多是服务端渲染的传统页面没有复杂的前端JS渲染用requestsBeautifulSoup足够速度快资源占用低比启动浏览器效率高得多处理层pandas做结构化数据处理正则做格式提取轻量高效上手成本低推荐层采用“内容相似度用户协同过滤”的混合推荐不用引入大模型小数据量下效果足够好解释性也强学生能知道为什么推荐这门课存储层数据量不大的话用CSV就够量大可以接SQLite无需额外部署服务二、分步实操从采集到推荐的完整实现2.1 课程数据采集搞定教务系统分页与表单验证国内高校教务系统大多是ASP.NET架构带__VIEWSTATE隐藏域验证分页靠POST提交表单不是URL参数。直接采集第一页没问题翻页就会报错这是很多新手第一次踩的坑。核心思路先GET首页获取VIEWSTATE和Cookie然后POST提交分页参数每次翻页都更新VIEWSTATE保持会话一致。核心代码片段import requests from bs4 import BeautifulSoup import pandas as pd # 会话保持全程复用Cookie session requests.Session() session.headers.update({ User-Agent: Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/120.0.0.0 Safari/537.36, Referer: [http://jwc.xxx.edu.cn/lesson/list.aspx](http://jwc.xxx.edu.cn/lesson/list.aspx) }) def get_viewstate(html): 提取页面隐藏的VIEWSTATE参数ASP.NET站点必需 soup BeautifulSoup(html, html.parser) viewstate soup.find(input, {name: __VIEWSTATE})[value] viewstate_gen soup.find(input, {name: __VIEWSTATEGENERATOR})[value] return viewstate, viewstate_gen # 第一步先访问首页获取初始参数 url [http://jwc.xxx.edu.cn/lesson/list.aspx](http://jwc.xxx.edu.cn/lesson/list.aspx) resp session.get(url) viewstate, viewstate_gen get_viewstate(resp.text) course_list [] total_page 25 # 总页数从页面底部获取 # 第二步分页遍历采集 for page in range(1, total_page 1): form_data { __VIEWSTATE: viewstate, __VIEWSTATEGENERATOR: viewstate_gen, __EVENTTARGET: AspNetPager1, __EVENTARGUMENT: str(page), ddl_xy: , # 学院筛选条件 ddl_kc: # 课程类型筛选 } resp session.post(url, dataform_data) soup BeautifulSoup(resp.text, html.parser) # 解析课程表格 table soup.find(table, {id: dg_kc}) trs table.find_all(tr)[1:] # 跳过表头 for tr in trs: tds tr.find_all(td) course { course_id: tds[0].text.strip(), course_name: tds[1].text.strip(), teacher: tds[2].text.strip(), credit: float(tds[3].text.strip()), hours: int(tds[4].text.strip()), time: tds[5].text.strip(), location: tds[6].text.strip(), course_type: tds[7].text.strip(), exam_type: tds[8].text.strip() } course_list.append(course) # 更新下一页的VIEWSTATE viewstate, viewstate_gen get_viewstate(resp.text) print(f第{page}页采集完成当前累计{len(course_list)}条) # 保存原始数据 df pd.DataFrame(course_list) df.to_csv(courses_raw.csv, indexFalse, encodingutf-8-sig) print(f采集完成共获取{len(df)}门课程数据)几个关键细节不同学校的教务系统字段名、表单参数不一样要先按F12看一下实际的POST参数不要硬套采集频率不要太高每页间隔1-2秒避开选课高峰期不要给学校服务器造成压力部分系统有登录校验需要先模拟登录带上Cookie再访问课程列表2.2 数据清洗把非结构化课程信息转成可计算格式采集下来的原始数据看起来字段齐全其实根本没法直接用最大的问题就是上课时间字段格式极不统一比如“周一第1-2节{第1-16周}”“周三3-4节(双周)”“周五第5节{第3,5,7,9周}”还有多门课合上、多个时间地点的情况。这一步的核心就是用正则把时间、周次、节次全部拆出来结构化存储后面才能做时间冲突判断和相似度匹配。核心代码片段import re import pandas as pd df pd.read_csv(courses_raw.csv) def parse_course_time(time_str): 解析课程时间字符串返回周次、星期、节次列表 weeks [] weekday 0 sections [] # 提取星期 week_map {周一:1, 周二:2, 周三:3, 周四:4, 周五:5, 周六:6, 周日:7} for k, v in week_map.items(): if k in time_str: weekday v break # 提取节次匹配第1-2节 3-4节格式 sec_match re.search(r第?(\d)[-至](\d)节?, time_str) if sec_match: start_sec int(sec_match.group(1)) end_sec int(sec_match.group(2)) sections list(range(start_sec, end_sec 1)) # 提取周次匹配第1-16周 双周 第3,5,7周格式 week_match re.search(r第(\d)[-至](\d)周, time_str) if week_match: start_w int(week_match.group(1)) end_w int(week_match.group(2)) if 双周 in time_str: weeks [w for w in range(start_w, end_w 1) if w % 2 0] elif 单周 in time_str: weeks [w for w in range(start_w, end_w 1) if w % 2 1] else: weeks list(range(start_w, end_w 1)) # 处理离散周次如第3,5,7,9周 dot_match re.search(r第([\d,])周, time_str) if dot_match: weeks [int(w) for w in dot_match.group(1).split(,)] return { weekday: weekday, sections: sections, weeks: weeks } # 应用解析函数展开成多列 time_parsed df[time].apply(parse_course_time).apply(pd.Series) df pd.concat([df, time_parsed], axis1) # 过滤无效数据 df df[df[weekday] ! 0] df df[df[sections].map(len) 0] df.to_csv(courses_clean.csv, indexFalse, encodingutf-8-sig) print(f清洗完成有效课程{len(df)}门)补充说明真实场景里格式会更复杂可能一门课对应多个时间建议先按分隔符拆分再逐个解析除了时间教师字段也可能有多个老师同样需要拆分处理清洗完一定要抽样核对不然解析错了后面推荐全是时间冲突的课2.3 智能推荐引擎混合推荐算法实现推荐部分不用搞太复杂两种基础算法结合就足够好用基于课程内容的相似度推荐加上基于用户历史的协同过滤推荐最后加权排序。优点是轻量、不需要大量数据训练解释性强学生能清楚知道推荐理由。核心思路内容相似度根据课程的学科分类、学分、难度、考核方式计算课程之间的余弦相似度推荐和用户喜欢的课程相似的课协同过滤基于历史选课数据找和你选课风格相似的同学推荐他们选过而你没选的课规则过滤自动过滤时间冲突的课、已经修过的课、不符合培养方案的课再按综合评分排序核心代码片段import pandas as pd import numpy as np from sklearn.metrics.pairwise import cosine_similarity from sklearn.preprocessing import OneHotEncoder df pd.read_csv(courses_clean.csv) # 1. 构建课程特征向量 encoder OneHotEncoder(sparse_outputFalse) feature_cols [course_type, exam_type, credit] features encoder.fit_transform(df[feature_cols]) # 加入难度特征可根据挂科率或学生评分计算这里用学分和学时近似 df[difficulty] df[hours] / df[credit] / 10 features np.hstack([features, df[difficulty].values.reshape(-1, 1)]) # 2. 计算课程相似度矩阵 sim_matrix cosine_similarity(features) # 3. 基于内容的推荐函数 def recommend_by_content(liked_course_ids, top_n10): 根据用户喜欢的课程推荐相似课程 sim_scores np.zeros(len(df)) for cid in liked_course_ids: idx df[df[course_id] cid].index[0] sim_scores sim_matrix[idx] # 排除已经选过的课 liked_indices df[df[course_id].isin(liked_course_ids)].index sim_scores[liked_indices] 0 # 取TopN top_indices sim_scores.argsort()[-top_n:][::-1] return df.iloc[top_indices][[course_id, course_name, teacher, credit, course_type]] # 4. 时间冲突检测 def has_time_conflict(course_idx, selected_courses): 判断课程是否和已选课程时间冲突 target df.iloc[course_idx] target_weeks set(target[weeks]) target_sections set(target[sections]) for cid in selected_courses: selected df[df[course_id] cid].iloc[0] # 星期相同才可能冲突 if selected[weekday] ! target[weekday]: continue # 周次有重叠 week_overlap target_weeks set(selected[weeks]) if not week_overlap: continue # 节次有重叠 sec_overlap target_sections set(selected[sections]) if sec_overlap: return True return False # 5. 混合推荐内容相似度 热度评分 难度偏好 def mixed_recommend(selected_courses, prefer_difficultymedium, top_n15): content_rec recommend_by_content(selected_courses, top_n30) # 过滤时间冲突 valid_recs [] for _, row in content_rec.iterrows(): idx df[df[course_id] row[course_id]].index[0] if not has_time_conflict(idx, selected_courses): valid_recs.append(row) # 按难度偏好排序 result pd.DataFrame(valid_recs) if prefer_difficulty easy: result result.sort_values(difficulty, ascendingTrue) elif prefer_difficulty hard: result result.sort_values(difficulty, ascendingFalse) return result.head(top_n) # 测试输入已选课程ID获取推荐 selected [KC001, KC023, KC108] recommendations mixed_recommend(selected, prefer_difficultymedium) print(recommendations)补充说明如果有历史选课数据可以加入用户协同过滤效果会更精准构建用户-课程评分矩阵即可可以接入课程评分、挂科率、评价关键词这些数据排序权重会更合理实际使用时可以加上培养方案匹配优先推荐满足毕业要求的课程三、踩坑实录实战中最容易踩的几个坑VIEWSTATE更新不及时导致分页失效很多人第一次做教务系统采集都会遇到第一页正常第二页就返回首页或者报错的问题。本质就是ASP.NET的VIEWSTATE每次请求都会更新必须用上一次返回的页面里的VIEWSTATE提交下一次请求不能复用第一次的。还有部分系统会带__EVENTVALIDATION参数同样需要每次提取更新。课程时间解析不全导致冲突判断失效课程时间的格式远比想象的复杂有单周、双周、跳周、前八周、后八周还有一门课分多个时间段上的情况。正则写得太简单就会解析不全后面推荐出来的课全是时间冲突的。建议先把所有时间格式都统计一遍逐个写规则匹配解析完做一遍人工校验不要上来就全量跑。采集频率过高被封禁教务系统的防护一般都不强但不代表没有限制。尤其是选课高峰期服务器本身压力就大高频请求很容易被临时封禁IP甚至影响其他同学选课。建议每页间隔至少1秒错峰采集不要在选课开放的前几个小时跑脚本。推荐只看相似度忽略规则约束刚开始做推荐的时候很容易一味追求相似度结果推荐出来的课要么时间冲突要么已经修过要么不在培养方案里看起来很智能其实根本没法用。推荐系统的第一步永远是规则过滤把不符合硬性条件的全部排除剩下的再谈相似度和排序。四、总结这套方案跑下来采集一千多门课程只需要几分钟推荐响应都是毫秒级不用任何复杂的服务部署本地就能跑。对于学生个人或者班级使用完全足够。核心思路其实很简单先用结构化的方式把零散的课程数据整合起来再用规则过滤掉不符合要求的选项最后用基础的相似度算法做排序。不需要大模型不需要大数据解决实际问题才是关键。
返回列表