集成学习框架下的乘客状态预测

生活消费 出行 案例ID:244806
Bill
2 年经验· 上海财经大学
微信扫码沟通,客服可协助直接对接工程师;如当前档期不合,也可继续推荐相似案例作者。

案例介绍

基于Kaggle SpaceshipTitanic竞赛数据,独立完成了涵盖数据清洗、特征工程、模型训练与评估的端到端机器学习二分类预测项目。针对数据集中的混合类型特征与非随机缺失现象,设计了基于业务逻辑的智能填补策略(利用CryoSleep与消费金额的互斥关系进行缺失值反推),并对Cabin字段进行字符串拆分解构出Deck/NUM/Side三个空间特征,同时通过对数变换修正消费类特征的长尾分布并提取PassengerId中的群组出行信息(GroupId/GroupSize/IsSolo)。算法层面依次实现了RandomForest基准测试、HistGradientBoosting流水线构建,最终采用LightGBM配合StratifiedKFold五折交叉验证与早停机制,通过软投票集成策略将验证集准确率提升至80.88%。技术栈使用Python、Pandas、Scikit-learn、LightGBM、Matplotlib。可承接机器学习建模、数据清洗与特征工程、分类预测系统开发、Kaggle类竞赛项目等需求。

集成学习框架下的乘客状态预测

生活消费 · 出行 案例ID:244806
联系该工程师
微信扫码,建群沟通
作者: Bill - 2年经验- 上海财经大学

案例介绍

基于Kaggle SpaceshipTitanic竞赛数据,独立完成了涵盖数据清洗、特征工程、模型训练与评估的端到端机器学习二分类预测项目。针对数据集中的混合类型特征与非随机缺失现象,设计了基于业务逻辑的智能填补策略(利用CryoSleep与消费金额的互斥关系进行缺失值反推),并对Cabin字段进行字符串拆分解构出Deck/NUM/Side三个空间特征,同时通过对数变换修正消费类特征的长尾分布并提取PassengerId中的群组出行信息(GroupId/GroupSize/IsSolo)。算法层面依次实现了RandomForest基准测试、HistGradientBoosting流水线构建,最终采用LightGBM配合StratifiedKFold五折交叉验证与早停机制,通过软投票集成策略将验证集准确率提升至80.88%。技术栈使用Python、Pandas、Scikit-learn、LightGBM、Matplotlib。可承接机器学习建模、数据清洗与特征工程、分类预测系统开发、Kaggle类竞赛项目等需求。

相似案例推荐

发布任务

企业点击发布任务,工程师会在任务下报名,招聘专员也会在 1 小时内与您联系确认。

1小时精推人才

需求方专属客服,免费梳理匹配

需求方客服微信二维码
扫码加微信 · 客服人工对接
更多案例
微信沟通 客服 看中这位工程师了?客服帮你 1 小时对接沟通 → ×