开篇:一个让银行亏惨了的”优质客户”
2022年,某城商行发放了一笔300万的普惠贷款,借款人是一家成立8年的机械设备加工厂。从表面上看,这家企业everything都符合”优质客户”标准:有固定资产、有稳定的上下游合同、纳税评级B级、法定代表人征信完美无缺。银行客户经理甚至因为”客户资料太漂亮”而感到放心。
结果呢?6个月后企业断供,银行追债时才发现——这家工厂的”稳定订单”是伪造的,上下游合同全是关联公司签的,厂房里的设备80%是租来的,真正值钱的设备三年前就抵押给另一家小贷公司了。更离谱的是,企业法人的个人征信报告也是精心包装的,用了几套房产做”资产证明”,实际上这些房产早在两年前就做了二押。
这笔300万的坏账,让整个分支行的普惠贷款KPI直接爆掉。而类似的故事,在中国银行业的中小企业信贷领域,每天都在上演。
伪需求的本质:不是”骗”,而是”结构性造假”
很多人对”伪需求”的理解停留在”企业故意造假骗贷”这个层面。但在实际的信贷风控中,伪需求远比这复杂。我们可以把它分为几个层次:
第一层:信息不对称导致的”误判”。中小企业普遍财务不规范,很多老板说实话——”我们记账就是随便记记”“银行要什么报表我就编什么”。这不是恶意欺诈,而是能力不足。银行用大企业的财务分析模型去套这些小企业,自然会得出错误结论。
第二层:软信息缺失导致的”盲判”。传统信贷风控依赖硬数据:财务报表、资产证明、纳税记录。但中国大量中小企业的真实经营状况藏在”软信息”里——老板的人品、家庭稳定性、行业口碑、上下游关系深度。这些信息在传统模型中几乎无法量化,导致很多”看起来不行”的企业被误杀,而”看起来完美”的造假企业却顺利通过。
第三层:主动欺诈导致的”硬判”。这是最恶劣的情况,企业有组织地伪造合同、虚增收入、隐藏负债。有些企业甚至专门聘请”信贷中介”来包装资料,形成了一条灰色产业链。
传统风控模型只能处理第一层和第二层的部分问题,对第三层几乎毫无防备。而数据驱动的AI风控,真正价值在于——它能够把这三层问题全部识别出来。
数据源革命:从”财务报表”到”全量行为数据”
传统信贷风控的数据源非常有限,主要依赖企业主动提供的财务报表、银行流水、纳税记录。这些数据有个致命问题:它们是”经过筛选的”,企业可以选择提供哪些、隐瞒哪些。
数据驱动的风控彻底改变了这个逻辑。我们现在可以获取的数据源包括:
税务数据:通过银税互动,银行可以直接获取企业的增值税申报记录、发票开具数据。这些数据比财务报表更难造假,因为每一张发票都有对应的进项和销项,税务局系统里有交叉验证。
工商数据:企业的股权结构变更、股东退出、高管变动、行政处罚、司法诉讼等信息,全部可以在国家企业信用信息公示系统查询。一个频繁变更股东结构、高管离职的企业,风险信号远大于一个”财务数据漂亮但人事动荡”的企业。
司法数据:中国执行信息公开网、裁判文书网、破产重整信息等平台,可以查询企业及其关联方的诉讼记录、被执行记录、失信记录。很多企业以为”法院判了但没执行”就不影响征信,但实际上这些信息在风控模型中是强负向特征。
水电煤数据:对于制造业企业,用电量是最难造假的指标。一家声称”产能饱满、订单充足”的工厂,如果用电量连续六个月下降,那它的财务报表一定有问题。这个逻辑在2019年浙江某农商行的实践中被反复验证——他们发现用电量与产值的相关系数高达0.87,远高于营收与利润的相关系数0.62。
供应链数据:企业的上下游交易记录、物流信息、仓储数据,可以从B2B平台、物流平台、ERP系统中获取。一家声称”核心客户是华为、比亚迪”的企业,如果它的物流记录里完全没有这两家公司的运输信息,那所谓的”核心客户”就值得怀疑。
行为数据:企业法人的手机使用习惯、社交关系、消费记录、甚至他的朋友圈内容,都可以作为辅助风控维度。这不是”侵犯隐私”,而是”在授权前提下使用替代数据”。很多研究表明,法人个人的消费稳定性和社交网络的复杂性,与企业经营风险高度相关。
特征工程:如何把”乱七八糟的数据”变成”有用的信号”
有了数据源还不够,关键是如何把这些数据转化为风控模型可用的特征。这个过程叫做”特征工程”,是AI风控最核心的技术壁垒。
让我用一个实际案例来说明。2021年,某国有大行在普惠贷款业务中遇到一个问题:大量小微制造企业申请贷款,但传统评分卡模型给它们的评分普遍偏低,导致很多”看起来风险高”的企业实际上经营正常,被错误拒贷。
风控团队花了三个月时间做特征工程,最终提炼出以下关键特征:
发票特征:
- 月均开票金额波动率:如果一家企业开票金额忽高忽低,说明业务不稳定
- 发票连号比例:如果大量发票号码连续,说明可能是”开票刷流水”而非真实交易
- 进项销项匹配度:如果企业大量开票但几乎没有进项发票,可能是”空壳开票”
- 发票地域分布:如果企业声称做全国生意,但发票全部来自本地,可疑
用电特征:
- 用电环比增长率:与行业平均增速对比
- 峰谷用电比:制造业企业如果谷电比例异常高,可能是”夜间开机刷数据”
- 用电与产值弹性:用电量增长但产值不增长,说明效率下降或数据造假
社交特征:
- 企业法人手机号在网时长:新办的手机号风险更高
- 联系人数量及稳定性:如果联系人频繁更换,说明社交网络不稳定
- 联系人行业分布:如果所有联系人都是”供应商”或”客户”,没有亲友,可疑
这些特征单独看可能意义不大,但组合起来就形成了强大的识别能力。比如,一个企业如果同时满足”发票连号比例高”+“用电与产值弹性异常”+“法人手机号在网时间短”,那它大概率是一个”包装出来”的假客户。
模型选择:为什么XGBoost比逻辑回归更适合中小企业风控
在信贷风控领域,传统上主流模型是逻辑回归(Logistic Regression)。逻辑回归的优势是”可解释性强”,每个特征的系数都是明确的,监管也认可。但它有个致命缺点:无法捕捉特征之间的非线性关系。
中小企业的经营数据恰恰充满了非线性关系。比如,”纳税评级”这个特征,A级和B级的风险差异很小,但B级和C级的风险差异巨大——这是一个典型的非线性关系。逻辑回归很难捕捉这种”阶梯式”的风险变化。
而XGBoost(Extreme Gradient Boosting)这类树模型,天然适合处理非线性关系。它通过多棵决策树的叠加,可以自动捕捉特征之间复杂的交互作用。
但树模型也有缺点:可解释性差。为了解决这个问题,行业里发展出了SHAP(SHapley Additive exPlanations)方法,可以给每个预测结果提供”特征贡献度”解释。比如,模型预测某企业违约概率为15%,SHAP可以告诉你:这个15%里,有8%来自”用电异常”,有4%来自”发票连号”,有3%来自”法人社交网络不稳定”。
这样既保留了模型的高精度,又满足了监管对”可解释性”的要求。
实战案例:某农商行如何用AI风控把不良率从5.2%降到1.8%
2020年,某县级农商行面临一个困境:普惠贷款不良率高达5.2%,远高于行业平均的2.5%。监管开始约谈,银行内部压力巨大。他们决定引入AI风控模型,重新设计审批流程。
第一阶段:数据治理(3个月)
银行首先做了大量数据清洗工作。他们发现,历史数据中有30%的”缺失值”实际上是”企业不愿提供”而非”真的没有”。于是他们调整了数据策略:不再依赖企业主动填报的财务数据,转而通过外部数据接口获取客观数据。
他们接入了以下数据源:
- 税务数据(通过银税互动平台)
- 工商数据(通过国家企业信用信息公示系统)
- 司法数据(通过中国执行信息公开网)
- 水电数据(通过与当地供电公司合作)
- 供应链数据(通过与当地B2B平台合作)
第二阶段:特征工程(2个月)
数据团队基于历史逾期案例,提取了127个特征,包括:
- 企业层面的:发票特征、用电特征、工商变更频率、司法风险指数
- 法人层面的:手机号在网时长、社交网络稳定性、个人消费稳定性
- 行业层面的:行业景气指数、行业平均违约率、行业季节性波动
第三阶段:模型训练(1个月)
他们使用XGBoost作为主模型,LightGBM作为辅助模型,最终形成了一个”模型集成”方案。训练数据包含过去5年的2.3万笔贷款,其中逾期案例4500笔,违约案例800笔。
模型效果:
- AUC(区分度):0.89
- KS值(最大区分度):0.62
- 在验证集上,不良率从5.2%降至1.8%
第四阶段:部署与监控(持续)
模型上线后,他们建立了”模型监控看板”,实时跟踪以下指标:
- 特征分布漂移:如果某个特征的平均值突然变化,说明外部环境变化
- 预测分数分布:如果高分客户突然增多,说明审批可能过松
- 逾期率追踪:按月份追踪实际逾期率与预测违约率的偏差
为什么传统风控识别不了伪需求?
理解了AI风控的方案后,我们反过来看:为什么传统风控会”看走眼”?
原因一:单一数据源依赖。传统风控主要依赖企业提供的财务报表和银行流水。这些数据可以被”精心包装”。比如,企业可以在申请贷款前一个月突击开票、突击收款,让报表看起来”非常漂亮”。但税务数据、用电数据、物流数据是跨平台的,很难同时造假。
原因二:线性模型局限。逻辑回归等线性模型假设特征与风险之间是线性关系。但现实中,很多风险信号是”阈值型”的——比如,企业法人更换频繁,前3次可能还好,第4次就危险,第5次就非常危险。线性模型捕捉不到这种”累积效应”。
原因三:缺少”软信息”量化。传统风控很难量化”老板的人品”、”企业的行业口碑”这些信息。但AI模型可以通过法人的社交网络稳定性、历史交易对手的评价、甚至法人的社交媒体内容,间接量化这些”软信息”。
原因四:静态评估而非动态监控。传统风控只在贷款审批时做一次评估,之后很少追踪。但AI风控可以实时追踪企业的经营数据变化,一旦发现异常(比如用电量突然下降、发票开具减少),立即触发预警。
中小企业融资困境的”结构性根源”
AI风控虽然强大,但我们不能神化它。中小企业融资难的根本原因,不仅仅是”风控技术不够好”,而是一个结构性问题。
结构性原因一:信息不对称。中小企业普遍财务不规范,银行不了解它们的真实经营状况。这是”市场失灵”的典型表现。
结构性原因二:抵押物缺失。银行传统上依赖抵押物来降低风险,但大量中小企业(特别是科技型、服务型企业)没有足够的固定资产。这不是”企业不努力”,而是”资产结构不匹配”。
结构性原因三:风险定价能力不足。银行对中小企业的风险定价往往”一刀切”——要么拒贷,要么高利率。这导致大量”中等风险”的企业既贷不到款,又负担不起高利贷。
结构性原因四:监管合规成本。银行发放普惠贷款需要满足”尽职免责”、”不良容忍度”等监管要求。但这些要求在实际执行中往往”变形”——客户经理怕担责,宁可拒贷也不愿冒险。
AI风控可以部分解决”信息不对称”和”风险定价”问题,但无法解决”抵押物缺失”和”监管成本”问题。这些需要政策层面的配合,比如建立政府担保基金、完善个人破产制度、优化监管考核机制。
伪需求识别的”三大陷阱”
即使有了AI模型,我们在实际部署中也会遇到各种陷阱。以下是三个最常见的:
陷阱一:过度拟合历史数据。有些团队在训练模型时,把历史逾期案例”学得太死”,导致模型在新客户上表现很差。比如,历史数据显示”法人手机号在网时间短”的企业违约率高,但模型可能把这个特征过度放大,导致所有新办手机号的优质企业都被误杀。
解决方案:使用”跨时间验证”——用2018-2020年的数据训练,2021年的数据验证,确保模型在时间维度上的泛化能力。
陷阱二:忽略”数据质量”。很多银行在引入AI风控时,假设外部数据”都是准确的”。但实际上,工商数据可能有延迟,司法数据可能有错误,税务数据可能有申报误差。如果模型过度依赖某些” noisy “的特征,整体效果会打折扣。
解决方案:对每个数据源做”数据质量评估”,包括完整率、准确率、更新频率。对于低质量数据源,降低其特征权重。
陷阱三:忽视”业务逻辑”。有些数据科学家做出的模型,AUC高达0.95,但业务团队一看就懵了——”为什么’企业法人朋友圈点赞数’会影响违约概率?”这种模型即使精度高,也难以落地。
解决方案:特征工程必须与业务专家深度合作。每个特征都要有”业务可解释性”,否则再高的AUC也是空中楼阁。
未来趋势:从”识别伪需求”到”创造真需求”
AI风控的终极目标,不应该是”识别伪需求”,而应该是”创造真需求”。
什么意思?传统风控的逻辑是”筛选优质客户”,把风险高的客户拒之门外。但这样会错过大量”暂时困难但有潜力”的企业。比如,一家科技型中小企业,目前营收不高、甚至亏损,但它有核心技术、有研发团队、有市场潜力。传统风控会给它打”高风险”标签,直接拒贷。但AI风控可以通过分析它的专利数量、研发投入、团队成员背景、客户反馈等数据,识别出它的”潜在价值”,给予授信。
这就是从”风险识别”到”价值识别”的转变。
未来,随着数据源的进一步丰富(比如企业用电数据、供应链数据、甚至卫星遥感数据——可以监测工厂的实际生产情况),AI风控的能力会更强。我们甚至可以做到”实时授信”——企业申请贷款,系统10秒钟内完成评估,基于实时数据给出动态额度。
但这也会带来新的问题:数据隐私、算法歧视、监管滞后。这些需要技术、政策、伦理的多方协同。
结语:风控不是”拒绝”,而是”理解”
回到开头那个300万坏账的案例。如果当时银行使用了AI风控模型,它会发现什么?
首先,税务数据会显示这家企业的增值税申报金额与营收严重不匹配——开票金额高,但实际缴税很少,这是典型的”虚开发票”信号。
其次,用电数据会显示这家企业的用电量在过去两年持续下降,但声称”产能翻倍”——这是明显的矛盾。
再次,供应链数据会显示这家企业的”核心客户”根本没有对应的物流记录——合同是假的。
最后,法人层面的数据会显示,企业法人本人有赌博嗜好、社交网络复杂、手机号频繁更换——这些都是”软风险”信号。
如果这些信号被整合到模型中,这家企业根本不会通过审批。或者,即使审批通过,也会给予一个极低的额度和极短期限,而不是300万的长期贷款。
风控的本质,不是”拒绝所有人”,而是”理解每个人”。对于优质客户,我们应该大胆授信;对于风险客户,我们应该谨慎评估;对于伪需求客户,我们应该识别并拒绝。而AI风控,正是帮助我们做到这一点的最佳工具。
但工具再强大,也需要”人”来使用。数据科学家需要理解业务,业务专家需要理解数据,监管者需要理解技术。只有三方协同,才能让AI风控真正发挥价值,让中小企业融资难的问题得到实质性缓解。
这不是一个技术问题,而是一个”生态系统”问题。而我们,才刚刚起步。
