十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

从零到量化:搭建 AI 量化投资开发环境,并用机器学习预测股价

从零到量化:搭建 AI 量化投资开发环境,并用机器学习预测股价 从零到量化搭建 AI 量化投资开发环境并用机器学习预测股价阶段一 · 技术基石配套博客关键词Python 环境 · Pandas · Matplotlib · Scikit-Learn · LLM · DeepSeek · 可复现本文所有图表与指标MAE / R² / 方向准确率均来自真实运行代码数据由 numpy 固定随机种子(42)生成全程离线可复现。0. 写在前面这门课带你走到哪里很多人对量化投资 AI的想象是写个模型明天就财务自由。现实要朴素得多——量化是用代码和统计把投资逻辑工程化、可回测、可复盘AI 是其中的工具之一而非魔法。本课程分 8 大阶段本篇是阶段一技术基石目标是让你具备能跑、能信、能改的工程底座阶段主题你将获得一技术基石本篇Python 环境 数据处理 可视化 ML 预测 LLM 集成二金融通识收益率、风险、夏普、有效市场假说三量化内核因子、信号、仓位管理四回测引擎事件驱动回测、避免未来函数五基金量化组合优化、风险模型六AI 全栈特征工程流水线、模型服务化七LLM 量化 Agent用大模型做研究助手与策略生成八财富格局实盘、合规、认知升级学习路径一句话先把锤子Python 工具链磨好再学钉子金融问题最后用机器AI批量敲。1. Python 在量化 AI 中的价值与 LLM 核心概念1.1 为什么是 Python数据处理pandas一行df[close].pct_change()就算出日收益率数值计算numpy的向量化让百万级运算在毫秒级完成可视化matplotlib出图即论文级机器学习scikit-learn十几行训练一个模型AI 原生PyTorch / Transformers 生态以 Python 为一等公民。一句话量化要算得对、算得快、算得清Python 是当前综合成本最低的答案。1.2 LLM 核心概念通俗版即使你不做模型训练今天做量化也绕不开大模型。三个必须懂的词Tokenizer分词器把文本切成模型能处理的Token。中文常按字/词切英文按子词(BPE)切。类比人读书先识字模型先识 Token。股价可能是 2 个 Tokenstock可能是 1 个。参数Parameters模型内部的可调权重数量决定记忆力与容量。70 亿参数(7B)是轻量671B(如 DeepSeek-V3)是庞然。参数越多越聪明但越贵、越慢。上下文窗口Context模型一次能看到的 Token 上限如 32K / 128K / 1M。做长文本研报摘要、整份财报分析时窗口大小直接决定可用性。1.3 Prompt 工程与 Cursor 工作流要点Prompt 工程 把模糊需求翻译成模型能稳定执行的结构化指令。四条黄金法则角色 任务 约束 输出格式四件套写全给示例Few-shot要模型按某种格式返回就先给一个样例分步思考Chain-of-Thought请一步步推理能显著提升数值/逻辑题正确率可复现固定temperature如 0.2关键任务设随机种子。CursorAI 编辑器工作流把仓库当成第二大脑。你: stock_predict.py 这个脚本的 R2 是负的解释原因并给出 3 个改进方向 Cursor: (读取文件 → 定位特征工程 → 指出随机游走不可预测 → 建议换特征/加基线/改目标) 你: 把预测次日收益率改成预测 5 日累计收益率保留测试集切分逻辑 Cursor: (编辑文件 → 你 review → 运行验证)心法人定方向AI 写样板人审逻辑AI 跑实验。永远不要把能不能赚钱的判断权交给模型。2. Python 开发环境搭建实录完整命令见code/stage1/env_notes.md。核心步骤# 1) 建隔离环境避免污染系统 Pythonpython-mvenv .venvsource.venv/bin/activate# Windows: .venv\Scripts\Activate.ps1# 2) 装依赖课程统一版本pipinstallpandas3.0.3numpy2.4.6matplotlib3.11.0 scikit-learn1.9.0scipy1.17.1# 3) 目录约定# blogs/stage1/ 博客# code/stage1/ 代码# assets/data/ 运行生成的数据# assets/images/stage1/ 运行生成的图表关键坑在无显示器的服务器上绘图必须在import matplotlib.pyplot之前加matplotlib.use(Agg)否则会报TclError: no display。本课程所有绘图脚本都已处理。可复现铁律所有随机过程用np.random.default_rng(42)固定种子。这样你跑出来的图和指标和我这篇博客里的完全一致。3. Pandas 数据处理实战代码code/stage1/pandas_demo.py。它先用几何布朗运动(GBM)生成确定性合成股价再做数据实战。GBM 价格递推量化里模拟股价的标准方式S t S t − 1 ⋅ exp ⁡ ⁣ ( ( μ − 1 2 σ 2 ) σ Z ) , Z ∼ N ( 0 , 1 ) S_t S_{t-1} \cdot \exp\!\big((\mu - \tfrac{1}{2}\sigma^2) \sigma Z\big),\quad Z\sim N(0,1)St​St−1​⋅exp((μ−21​σ2)σZ),Z∼N(0,1)我们用rng np.random.default_rng(42)固定Z生成 756 个交易日约 3 年的date / close / volume。实测落盘数据片段date close volume 0 2023-02-08 100.50 968188 1 2023-02-09 98.98 1690996 2 2023-02-10 100.14 1503151 3 2023-02-13 101.60 1558791 4 2023-02-14 98.71 2225451四个核心操作真实输出dfpd.read_csv(CSV,parse_dates[date]).set_index(date)# ① 日收益率df[daily_return]df[close].pct_change()# ② 对数收益率可加性学术常用df[log_return]np.log(df[close]/df[close].shift(1))# ③ 滚动均线df[ma_20]df[close].rolling(20).mean()df[ma_60]df[close].rolling(60).mean()# ④ 月度重采样monthlydf[close].resample(ME).last().pct_change()合成数据关键统计脚本实测打印指标数值样本数756首日 → 末日收盘价100.50 → 85.05年化收益率估算-2.81%年化波动率估算23.53%年化夏普估算-0.12累计涨跌幅-15.37%这组数据刻意呈现温和下跌 正常波动正好用来演示ML 在没有真实 alpha的合成数据上会怎样表现见第 5 节。4. Matplotlib 可视化实战代码code/stage1/matplotlib_demo.py。读取上一步含特征的数据画出两张图已保存至assets/images/stage1/。4.1 价格 均线图price_ma.png蓝线为收盘价橙/绿为 20/60 日均线。均线的作用是平滑噪声、凸显趋势——价格上穿均线常被视为动能信号下穿则反之。但注意均线永远是滞后的不能预测只能描述。4.2 收益率分布直方图returns_dist.png红线是正态拟合。实测分布统计量统计量数值含义mean-0.000111日收益率均值≈0std0.014825日波动约 1.48%skew0.0761轻微右偏kurt-0.0706近似正态厚尾不明显关键认知日收益率近似服从均值为 0 的正态分布。这正是短期价格不可预测的数学根源——如果明天的涨跌和方向真的藏在历史里分布就不会这么随机。5. Scikit-Learn 股价预测重点代码code/stage1/stock_predict.py。5.1 特征与目标怎么定我们预测次日收益率平稳量而不是绝对价格。原因很关键股价是带漂移的随机游走绝对价格水平方差极大直接回归会得到严重为负的 R²模型不如永远猜均值。改用平稳的收益率才符合量化规范。特征滞后窗口 LOOKBACK5# 前 5 日收益率foriinrange(1,6):df[fret_lag_{i}]df[close].pct_change(i)# 均线乖离价格相对短期均线的偏离动量/均值回归信号df[ma_dev]df[close]/df[ma_20]-1.0切分按时间前 80% 训练、后 20% 测试共 736 条样本测试集 148 条杜绝未来信息泄露。5.2 模型与基线Naive Baseline永远预测收益率 0“明天和今天一样”——任何模型必须先打败它LinearRegression线性基线RandomForest200 棵树深度 8非线性模型。5.3 真实运行结果脚本实测打印[结果-次日收益率预测] Naive Baseline (pred0): MAE0.0127 R2-0.0053 方向准确率≈50% (随机) LinearRegression : MAE0.0128 R2-0.0160 方向准确率47.97% RandomForest : MAE0.0128 R2-0.0216 方向准确率50.00% (测试集样本数148)5.4 怎么读这个结果 —— 本节课最重要的结论模型MAER²方向准确率Naive Baseline0.0127≈050%LinearRegression0.0128-0.01647.97%RandomForest0.0128-0.02250.00%R² 全为负或≈0两个 ML 模型都没有解释力预测误差比直接猜 0还大一点点方向准确率 48%~50%和抛硬币没区别——你无法靠昨天涨所以今天涨稳定赚钱这不是代码写错了而是市场的真相在有效市场/随机游走假设下滞后收益率几乎不含对未来收益的可提取信息。量化第一课先建基线(baseline)。任何炫酷模型若 R² 不显著为正、方向准确率不显著超过 50%它就毫无实盘价值。本例用 RandomForest 这种强模型依然打不过随机恰恰说明——数据里没有信号时模型再强也救不了。真正的 alpha 来自更好的特征、更好的数据、更深的金融逻辑而非更大的树。5.5 扩展获取真实行情需联网# 安装pip install yfinanceimportyfinanceasyf dfyf.download(AAPL,start2022-01-01,end2025-01-01)df[close].pct_change()# 同样的 pandas 操作直接复用本课程实际运行的代码不依赖网络yfinance 仅作为扩展留给你练手。6. DeepSeek API 集成 离线 Mock 兜底代码code/stage1/deepseek_api.py。6.1 模型选型对比公开信息以官网为准维度DeepSeek (deepseek-chat)GPT (gpt-4o-mini)Gemini (gemini-1.5-flash)Claude (claude-3-5-haiku)厂商深度求索(中国)OpenAI(美)Google(美)Anthropic(美)上下文64K(最大128K)128K1M200K中文能力★★★★★★★★★★★★★★★★★代码能力★★★★★★★★★★★★★★★★★★★性价比★★★★★(极低)★★★★★★★★★★国内直连是否否否课程推荐DeepSeek作为主力中文与代码强、价格极低、国内直连特别适合教学与高频 API 调用。6.2 完整调用代码联网 有 Key 时importrequests,osdefcall_deepseek(prompt,modeldeepseek-chat):api_keyos.getenv(DEEPSEEK_API_KEY)resprequests.post(https://api.deepseek.com/chat/completions,headers{Authorization:fBearer{api_key},Content-Type:application/json},json{model:model,messages:[{role:user,content:prompt}],temperature:0.3,max_tokens:512},timeout30,)returnresp.json()[choices][0][message][content].strip()6.3 离线 Mock 兜底保证示例永远可跑真实 API 依赖网络与密钥教学中容易跑不通。我们加一个规则模板兜底当无 Key / 无网络时用均线乖离、动量、波动率三条规则生成策略建议。defmock_advisor(ctx):# ctx: ma_dev(乖离), mom_5(5日动量), vol(年化波动)ifctx[ma_dev]-0.03:return超卖存在反弹机会ifctx[ma_dev]0.03:return偏热注意回调...6.4 一次真实运行输出本机 mock 模式 运行模式: MOCK [MOCK 策略建议 - 离线规则模板] 均线乖离-0.0213 | 5日动量0.0180 | 年化波动率0.23 建议价格贴近 20 日均线趋势中性近 5 日动量平稳波动率温和仓位可保持中性。 注本建议由规则生成仅供教学演示非投资建议设置 DEEPSEEK_API_KEY 后可获得 LLM 智能解读。设置环境变量DEEPSEEK_API_KEY后同一脚本会自动切到真实 LLM 调用无需改业务代码——这正是可降级 AI 组件的工程范式离线能演示联网更聪明。7. 关键点总结与下一步本阶段你已掌握✅环境venv 隔离 固定版本依赖 Agg后端离线绘图✅数据GBM 合成数据、固定种子可复现、Pandas 加载/收益率/滚动/重采样✅可视化价格均线图、收益率分布图已存 PNG✅ML特征工程 时间切分 LinearRegression/RandomForest 基线思维✅AIDeepSeek 集成 模型对比 离线 mock 兜底✅最重要的认知没有信号的数据再强的模型也预测不了——先建基线再谈超越。下一步 → 阶段二金融通识下一阶段我们将正式建立金融语言收益率与对数收益率的区别、风险如何度量波动、回撤、CVaR、夏普/索提诺/卡玛等风险调整收益指标以及有效市场假说为何是量化者的第一性原理。你会明白阶段一里 ML 打不过随机不是意外而是假说在合成数据上的必然投射。阶段二代码预告code/stage2/risk_metrics.py—— 用真实/合成净值曲线算全套风险指标。参考链接Pandas 官方文档https://pandas.pydata.org/docs/Matplotlib 后端说明https://matplotlib.org/stable/users/explain/backends.htmlScikit-Learn 用户指南https://scikit-learn.org/stable/user_guide.htmlDeepSeek 开放平台https://platform.deepseek.com/有效市场假说EMHhttps://en.wikipedia.org/wiki/Efficient-market_hypothesisGBM 维基https://en.wikipedia.org/wiki/Geometric_Brownian_motion免责声明本文所有策略、建议、代码均用于教学演示不构成任何投资建议。历史/合成数据表现不代表未来收益实盘有风险入市需谨慎。
返回列表