Publications & Related Work
I will introduce my work in academic research and engineering implementation over the past two years here.
Academic Research
GNN
Physics-informed graph neural network representation learning for crystal property prediction
Authors: Jie Cao, Kai Huang, Jian Mao, Mengya Zhong, Chen Chen, Kexun Li & Taikang Liu
npj Computational Materials (2026)
- 背景:晶体材料性质的准确预测对于加速新型功能材料的发现至关重要。晶体性质本质上是多种原子物理化学属性协同作用的结果。
- 动机:现有的晶体表征学习方法往往难以充分挖掘那些对性质预测具有高价值的物理属性,导致图神经网络表征能力受限。如何在保证模型通用性的前提下,系统地引入关键物理属性并避免信息冗余,将其高效地嵌入晶体图与图神经网络协同建模,是当前晶体性质预测的难题。
- 方法:提出了一种基于多边图神经网络的晶体表征与性质预测框架。利用特征工程与机器学习方法,构建基于物理属性的原子描述符用于初始化节点表示,结合物理性质与空间结构信息构建融合边特征,将新的表征学习策略应用于周期性晶体图。同时,通过近似拟合数据分布设计权重函数,高效计算中心原子邻域内的所有原子对的权重,提升模型训练和推理速度。接着,利用可解释性方法评估不同属性对预测结果的贡献度,量化对比不同特征的相对重要性。通过可解释性框架反馈结果,动态构建适用于不同任务的原子描述符,充分释放模型的预测潜力,将静态特征工程转化为动态的、任务感知的优化过程。
Diffusion
TBD…
Engineering Implementation
JPX 东京股票交易预测 JPX Tokyo Stock Exchange Prediction
职责:数据清洗、股票业务分析、建立Baseline、时序特征工程、多模型融合
项目简介:围绕2000只股票构建从数据清洗、建立 Baseline、时序特征工程、行业分段建模到多模型融合的完整量化预测流程,实现股票未来收益率排名预测,最终根据排名前200和后200只股票的收益差进行评分。
核心工作:
- 整合多表数据,针对金融时序数据中高比例缺失、停牌缺口、字段类型不一致等问题,建立多套特征处理流程(日期对齐、缺失填充、价格前后向补齐、调整因子处理、特征筛选等),同时保证训练、推理链路一致性。
- 根据股票业务特点,构建以收盘价为核心的滑动窗口统计特征、指数加权移动平均、增长率、阴阳线、波动性、差分特征等时序特征,增强模型对长期趋势、短期动态变化的学习能力。
- 结合副表信息,按行业类型划分数据并实现模型的分组训练与预测,降低行业异质性带来的学习偏差,提升模型对行业数据内部结构性模式的捕捉能力。
- 利用线性模型捕捉长期趋势稳定性和 LightGBM 模型捕捉非线性波动的差异化优势,构建了由全局 LightGBM、行业级 LightGBM 与线性回归模型组成的多模型协同融合框架,有效抑制单一模型的过拟合问题。
项目成果:构建了从数据预处理、Baseline建立、多套特征工程构建到多模型融合的完整流程。最终在 Kaggle 获得0.473分,高于第一名的0.381分。验证了基于多套特征工程的多模型融合策略在股票预测任务中的有效性。
Home Credit 信贷违约风险预测 Home Credit Default Risk
职责:数据清洗、信贷业务分析、建立Baseline、时序特征工程、多模型融合
项目简介: 利用海量的历史信贷数据(包含贷款申请、历史贷款记录、信用卡记录、还款记录等数据集),预测潜在客户的违约概率,以协助金融机构降低信贷风险并优化放款策略。
核心工作:
- 探索主表数据的缺失值与异常值分布,基于业务特点进行差异化填补和删除。利用皮尔逊系数,热力图、核密度估计图等可视化方法进行相关性分析,筛选有价值的特征用于特征衍生工作。
- 根据信贷业务特点,构造贷款利率、还款压力、供养压力、历史贷款信息、违约严重性等核心业务特征。利用求和、均值、标准差等统计指标对脱敏数据进行衍生。使用核密度估计图验证衍生特征与标签的相关性,进一步筛选重要特征进行衍生。
- 利用 Kmeans 聚类对类别特征和标签实现防泄漏式目标编码,抑制因标签泄露导致的过拟合问题。
- 由于主、副表数据间存在一对多的映射关系,采用聚合链接策略(分组、聚合、关联、评估),对借款人在其所在群体中的相对情况进行相对行为分析与分层聚合分析,最终构建得到 1420 维特征的用户信用画像。
- 利用 Featuretools 实现自动化特征衍生得到 451 维特征,自动捕捉多层跨表非线性关联与信用动态演变趋势;同时通过相关性过滤及缺失率筛选实现高效降维,平衡模型的预测精度与推理效率。
- 以基于 Focal loss 加权损失函数的 LightGBM 为核心基准模型,基于贝叶斯优化的逻辑回归为惩罚模型,实现了基于手动与自动化特征工程的多模型加权融合策略。
项目成果:通过数据清洗、业务分析、Baseline建立、手动与自动化特征工程构建、多模型融合,从基线的0.743分提升到融合模型的0.803分,位于Kaggle金牌榜第7名。验证了特征工程与模型融合策略在风控场景中的有效性。