第七章:信息交易概率(PIN)模型

各位同学,今天我们来聊一个在量化交易里非常核心的概念——信息交易概率模型,也就是大家常说的PIN。说实话,这个模型我最早接触是在2015年做A股因子研究的时候,当时觉得这东西太理论了,直到后来在实盘中尝到了甜头,才真正理解它的价值。

核心一句话:PIN模型试图回答一个问题——某只股票当前的价格波动,到底有多少是因为知情交易者在行动?

7.1 PIN模型原理

PIN的全称是Probability of Informed Trading,翻译过来就是“知情交易概率”。它的基本思想其实很朴素:市场上存在两类交易者——知情交易者和不知情交易者。知情交易者掌握着尚未公开的私有信息,他们会根据信息方向(利好或利空)选择买入或卖出;而不知情交易者纯粹是出于流动性需求在交易。

我习惯用一个比喻来理解:想象一个赌场,有些玩家知道骰子的秘密(知情交易者),有些纯粹是来碰运气的(不知情交易者)。PIN模型就是用来估算,当前这局游戏里,知道秘密的玩家占比有多大。

模型的核心参数有四个:

  • α(信息事件发生概率):某个交易日发生私有信息事件的概率
  • δ(坏消息概率):如果信息事件发生,它是坏消息的概率
  • μ(知情交易强度):知情交易者的订单到达率
  • ε(不知情交易强度):不知情交易者的订单到达率(买入和卖出通常假设相同)

有了这些参数,PIN的计算公式就很简单了:

PIN = (α × μ) / (α × μ + 2ε)

说白了,分子是知情交易带来的订单量,分母是总订单量。这个比值越高,说明当前股票的信息不对称程度越严重。

我的经验:在实际项目中,PIN值超过0.3的股票通常要格外小心。我曾经用这个阈值过滤掉了一批“看起来很美”的股票,结果避开了好几只庄股。

7.2 EHO算法估计PIN

参数估计是PIN模型落地的关键。最经典的方法是EHO算法,由Easley、Hvidkjaer和O'Hara三位学者提出。嗯,这里要注意,EHO算法本质上是一个极大似然估计问题。

似然函数长这样:

L(θ|B,S) = (1-α) × e^(-2ε) × (ε^B/B!) × (ε^S/S!) 
           + α × δ × e^(-(ε+μ)) × ((ε+μ)^B/B!) × (ε^S/S!)
           + α × (1-δ) × e^(-(ε+μ)) × (ε^B/B!) × ((ε+μ)^S/S!)

其中B是当日买单数量,S是卖单数量。看着复杂,其实逻辑很清楚:三种市场状态(无信息事件、坏消息、好消息)的概率加权求和。

我在实际跑EHO算法时踩过一个坑——初始值设置不当会导致算法不收敛。后来我总结了一套经验:

  1. 先用简单方法估算α、δ的初始值(比如用过去60天的涨跌比例)
  2. μ的初始值设为平均日超额订单量的1.5倍
  3. ε的初始值设为平均日订单量的0.8倍
  4. 使用L-BFGS-B优化方法,加上边界约束

避坑指南:我曾经在2018年用EHO算法处理全A股数据,结果发现大约15%的股票似然函数不收敛。后来排查发现,是这些股票的买单卖单数据存在大量零值,导致对数似然函数计算溢出。解决方案是给零值加一个极小量(比如1e-10)。

7.3 PIN的改进模型

经典PIN模型有个明显的缺陷——它假设所有知情交易者的行为模式是一样的。但现实情况要复杂得多。举个例子,某只股票可能同时被两家机构盯上,一家做多,一家做空,这时候经典PIN就会失效。

针对这个问题,学术界提出了两个重要的改进方向:

AdjPIN(调整PIN)

AdjPIN模型放松了“不知情交易者买卖强度相等”的假设。说白了,它允许不知情交易者的买入和卖出强度不同。这在A股市场特别重要,因为散户的买卖行为往往存在明显的方向性偏差。

AdjPIN的似然函数比经典PIN多了一个参数ε_b和ε_s,分别代表不知情买入和卖出的强度。虽然参数多了,但拟合效果通常更好。我个人在沪深300成分股上测试过,AdjPIN的AIC值平均比经典PIN低8%左右。

MPIN(多层PIN)

MPIN模型更进一步,它允许存在多个层次的知情交易者。每个层次有自己的μ值,代表不同信息优势程度的交易者。这个模型特别适合处理那些有“内幕消息链条”的股票。

MPIN的估计难度比前两个大得多,因为参数空间呈指数级增长。我建议一般先用两层的MPIN试试,三层以上基本就是过拟合了。

模型 参数数量 适用场景 估计难度
经典PIN 4 流动性好的大盘股
AdjPIN 5 散户参与度高的股票
MPIN(2层) 7 存在多路资金的股票

7.4 PIN在选股中的应用

理论讲完了,咱们来点实在的——PIN怎么用在选股上?

我个人的做法是构建一个“PIN因子”。具体来说:

  • 低PIN策略:选择PIN值低的股票。这些股票信息不对称程度低,更适合做高频或统计套利。
  • 高PIN策略:选择PIN值高的股票。这些股票可能存在未公开的利好或利空信息,适合做事件驱动策略。
  • PIN变化率:关注PIN值的短期变化。如果某只股票的PIN突然飙升,往往意味着有大事要发生。

我记得在2019年做过一个回测:用PIN变化率作为预警信号,配合成交量异常放大,成功捕捉到了好几只重组股的停牌前异动。当然,这种策略的换手率很高,交易成本是个大问题。

实战要点:PIN因子单独使用的效果一般,我建议把它和换手率、波动率等因子结合。比如,高PIN+低换手率的组合,往往比单纯高PIN的选股效果更好。

最后,我想强调一点:PIN模型不是万能的。它依赖高频的逐笔交易数据,如果数据质量不好,估计结果会偏差很大。另外,在涨跌停板制度下,PIN的估计也会失真。这些都是你在实际应用中需要特别注意的地方。

PIN模型知识体系 PIN模型核心原理 EHO算法估计 改进模型 选股应用 极大似然估计 初始值设置技巧 AdjPIN:不对称买卖 MPIN:多层知情交易 低PIN策略 高PIN策略 PIN变化率预警 核心目标:量化信息不对称程度,辅助交易决策

我的建议:初学者先从经典PIN模型入手,用EHO算法跑通流程。等理解了底层逻辑,再尝试AdjPIN和MPIN。别一上来就搞复杂的,容易迷失在参数估计的细节里。

无相订单流研究社 微信Lucian808555