20171215-申万宏源-量化策略_数据挖掘在上市公司财务造假识别中的应用_25页_1mb
报告摘要
数据挖掘在上市公司财务造假识别中的应用总结
核心内容
本文探讨了数据挖掘技术在识别上市公司财务造假中的应用,重点分析了神经网络、支持向量机(SVM)和决策树(C&RT、QUEST、CHAID、C5.0)等方法在财务造假识别中的表现。研究选取了2002年之后A股市场被中国证监会、沪深交易所公开处罚的造假样本,并通过数据挖掘方法进行分析,旨在找到最适合识别财务造假的模型。
主要观点
- 上市公司财务造假问题严重,给投资者带来巨大损失,也影响资本市场健康发展。
- 常见的财务造假手段包括虚增交易、虚增资产、提前确认收入、利用过渡性科目调节利润、隐瞒重大事项等。
- 数据挖掘技术如神经网络、SVM和决策树可以用于财务造假识别,但面临数据分类不平衡的挑战。
- 在处理分类不平衡问题时,通过设置误分类损失函数,可以提升模型对造假样本的识别能力。
- 决策树方法比神经网络和SVM更适合财务造假识别,其中CHAID算法表现最优。
关键信息
数据样本
- 造假样本:选取2002年后A股市场被公开处罚的上市公司,共171条记录。
- 控制样本:匹配同行业未被处罚的上市公司,共7839条记录。
- 样本分布:造假样本主要集中在化工、医药生物、纺织服装等行业,2011-2015年为高发期。
特征指标
以下为初步筛选的特征指标,用于分析上市公司年报是否造假:
| 名称 | 代号 |
|---|---|
| 资产负债率 | Asset_lia_ratio |
| 流动比率 | Curr_ratio |
| 速动比率 | Quick_ratio |
| 主营业务毛利率 | Mainb_grop_rate |
| 营业收入净利润率 | Rev_netp_rate |
| 应收账款占流动资产比例 | Rec_to_Cur |
| 预付款项占流动资产比例 | Pre_to_Cur |
| 其他应收款占流动资产比例 | OtherRec_to_Cur |
| 净利润同比增长率 | Npro_gro_rate |
| 主营业务收入同比增长率 | Rev_gro_rate |
| 营业利润同比增长率 | Opro_gro_rate |
| 经营活动产生的净流量增长率 | Ntra_gro_rate |
| 造假前1年是否亏损 | Pre_np |
| 前五大股东股权集中度 | Hold_pct |
| 审计信息 | Opinion |
| 净资产收益率 | ROE |
| 总资产报酬率 | ROA |
| 应收账款周转率 | Rec_tur_rate |
| 存货周转率 | Sto_tur_rate |
| 总资产周转率 | Tola_tur_rate |
模型比较
| 模型 | 准确率 | 精确度 | 召回率 | F值 |
|---|---|---|---|---|
| 神经网络 | 97.90% | 100.00% | 2.94% | 5.71% |
| SVM | 97.74% | 34.78% | 4.71% | 8.29% |
| C&RT | 94.39% | 10.06% | 20.00% | 13.39% |
| QUEST | 90.11% | 7.33% | 30.59% | 11.83% |
| CHAID | 93.16% | 17.78% | 59.41% | 27.37% |
| C5.0 | 74.27% | 7.07% | 89.41% | 13.10% |
误分类损失函数的影响
- 在所有模型中,加入误分类损失函数后,决策树类模型(特别是CHAID)在召回率上表现更优。
- CHAID算法在全样本中表现最佳,其召回率为59.41%,精确度为17.78%,F值为27.37%。
- C5.0算法在召回率上表现最好,达到89.41%,但精确度相对较低。
重点指标
在识别上市公司年报是否造假时,需重点关注以下指标:
- 审计师意见(Opinion):负面意见表明财务造假可能性较高。
- 前一年是否亏损(Pre_np):前一年亏损的公司更可能进行财务造假。
- 其他应收款占流动资产比例(OtherRec_to_Cur):该比例偏高时,财务造假的可能性大。
- 销售毛利率(Sale_grop_ratio):偏高时可能为财务造假的信号。
- 预付款项占流动资产比例(Pre_to_Cur):该比例偏高时,公司可能通过虚增收入来填补资金缺口。
方法说明
神经网络(MLP)
- 神经网络具有较高的准确率,但对造假样本的识别能力较弱。
- 通过Bagging方法增强模型稳定性,但未显著改善对造假样本的识别效果。
支持向量机(SVM)
- SVM模型在准确率上表现良好,但同样在识别造假样本方面存在不足。
- 采用RBF核函数处理非线性问题,但未在识别能力上显著优于决策树模型。
决策树(C&RT、QUEST、CHAID、C5.0)
- 决策树在处理分类不平衡问题时,通过加入误分类损失函数可以提升识别能力。
- CHAID算法在四个决策树模型中综合表现最优,具有较高的召回率和F值。
- C5.0算法虽然召回率高,但精确度较低,不适用于高精确度需求的场景。
结论
- 在识别上市公司财务造假问题上,决策树模型优于神经网络和SVM模型。
- CHAID算法在四个决策树模型中表现最佳,适合用于识别财务造假。
- 在实际应用中,应结合财务指标和非财务指标,重点关注审计师意见、前一年是否亏损、其他应收款、销售毛利率和预付款项占流动资产比例等关键指标。
附注
- 本报告由申万宏源证券有限公司发布,未经授权不得复制或分发。
- 投资决策应基于个人判断,本报告仅供参考,不构成投资建议。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载