第十七章:机器学习与信息提取

各位,咱们今天聊点硬核的。文本挖掘、主题模型、深度学习情感分析,还有图神经网络——这些词听着是不是有点晕?别急,我一个一个拆开讲。说白了,这一章的核心就一句话:怎么从一堆乱七八糟的文字里,把有用的交易信号给捞出来

我做了这么多年量化,最大的感触就是——市场里真正有价值的信息,往往藏在那些非结构化的文本里。什么财报电话会议记录、新闻快讯、社交媒体上的情绪波动……这些才是驱动价格变动的底层燃料。你光盯着K线看,那叫后知后觉。

核心观点: 文本数据是另类数据中信息含量最丰富的一类。谁先学会从文字里提取信号,谁就抢占了先机。

17.1 文本挖掘技术:从原始文本到结构化特征

文本挖掘,说白了就是把自然语言变成机器能理解的东西。我刚开始做这个的时候,踩过不少坑。比如最简单的分词,中文和英文完全两码事。英文按空格切就行,中文你得考虑“中国人民银行”到底该不该拆开。

常用的技术栈包括:

  • 分词与词性标注:Jieba、HanLP、Stanford NLP
  • TF-IDF:衡量一个词在文档中的重要性
  • Word2Vec / GloVe:把词映射到向量空间
  • BERT / RoBERTa:预训练语言模型,上下文感知

我个人习惯,做金融文本挖掘时,第一步永远是构建领域词典。比如“降准”、“逆回购”、“PMI”这些词,在通用语料里可能没什么权重,但在金融场景里,它们就是核心信号。

小技巧: 我建议你建一个自定义词典,把常见的金融术语、公司名、产品名都加进去。分词效果能提升一大截。

17.2 主题模型(LDA)在金融中的应用

LDA,全称Latent Dirichlet Allocation,中文叫隐含狄利克雷分配。名字挺唬人,其实原理不复杂。它假设每篇文档是由若干个主题混合而成的,每个主题又是由若干个词的概率分布构成的。

举个例子。你有一堆财经新闻,LDA能自动把它们分成“货币政策”、“行业动态”、“公司财报”等几个主题。每个主题下,你会看到一些高频词。比如“利率”、“央行”、“存款准备金率”这些词大概率会聚在货币政策主题下。

我在项目中用过LDA做主题轮动策略。具体做法是:

  1. 每天抓取全市场的财经新闻
  2. 用LDA提取当天的主要主题
  3. 计算每个主题的强度(即该主题在当天新闻中的占比)
  4. 当某个主题强度突然上升时,买入相关板块的股票

效果怎么样?说实话,胜率大概在55%-60%之间,不算惊艳,但作为辅助信号足够了。关键是,它能帮你捕捉到市场情绪的早期变化。

注意: LDA有个坑——主题数K需要人工设定。设少了,主题太笼统;设多了,主题太碎片化。我一般用困惑度(Perplexity)和主题一致性(Coherence)来调参,但最终还是要靠人工判断。

17.3 深度学习情感分析

情感分析,说白了就是判断一段文字是正面、负面还是中性。在金融领域,这个任务比通用场景要难得多。为什么?因为金融文本里充满了反讽、隐晦、专业术语

比如这句话:“该公司业绩表现令人失望,但市场反应却异常乐观。”——你说这是正面还是负面?传统的情感词典根本搞不定。

所以,我后来转向了深度学习方案。常用的模型包括:

  • LSTM + Attention:捕捉长距离依赖关系
  • BERT-Finance:在金融语料上微调的BERT模型
  • FinBERT:专门为金融情感分析设计的预训练模型

我记得有一次,我用FinBERT分析某公司的财报电话会议记录。模型识别出管理层在回答问题时使用了大量“不确定”、“可能”、“或许”这类词,情感得分显著偏低。结果一周后,该公司股价果然大跌。这就是情感分析的威力——它能捕捉到连分析师都忽略的细微信号。

实战建议: 不要只看单一的情感得分。我习惯把情感得分、情感波动率、情感分歧度三个指标结合起来用。分歧度越高,说明市场对同一事件的看法越不一致,往往意味着后续波动会加大。

17.4 图神经网络与信息网络

最后这个,是近几年最火的方向。图神经网络(GNN)的核心思想是:把实体看作节点,把关系看作边,然后在图上做学习

在金融场景里,这个思路太自然了。你想啊:

  • 公司之间有关联交易
  • 股东之间有一致行动人关系
  • 行业之间有上下游关系
  • 新闻事件之间有时间关联

这些关系天然就是一个图结构。传统的机器学习模型(比如XGBoost)处理不了这种关系型数据,但GNN可以。

我做过一个供应链风险传导模型。具体做法是:

  1. 构建一个图,节点是上市公司,边是供应链关系
  2. 用GCN(图卷积网络)学习每个节点的表示
  3. 当某个节点出现负面新闻时,模型自动预测哪些关联节点会受到影响

效果出乎意料的好。有一次,某汽车零部件公司被曝出质量问题,模型在当天就预警了它的下游整车厂和上游原材料供应商。而传统方法至少要等到第二天才能反应过来。

避坑指南: 我曾经犯过一个错误——把所有的关系都平等对待。后来发现,供应链关系中的“独家供应商”和“可替代供应商”,信息含量完全不一样。所以,我建议你在构建图的时候,给不同的边赋予不同的权重。

知识体系总览

下面这张图,是我自己梳理的本章知识结构。你可以把它当作一个导航图,随时回来对照。

机器学习与信息提取 文本挖掘技术 分词 / TF-IDF / Word2Vec 领域词典构建 BERT / RoBERTa LDA主题模型 主题提取与强度计算 主题轮动策略 困惑度与一致性调参 深度学习情感分析 LSTM + Attention FinBERT微调 情感分歧度指标 图神经网络与信息网络 供应链风险传导 GCN / GAT / 关系图构建 关联节点预警与传导路径

这张图把四个技术方向的关系理清楚了。从左到右,从基础到前沿。文本挖掘是地基,LDA和情感分析是两座主楼,图神经网络是顶层建筑。你如果能把它们串起来用,效果绝对1+1>2。


无相订单流研究社 微信Lucian808555