来源:DeepHub IMBA
本文共1500字,建议阅读8分钟
本文作者将使用 HistGradientBoostingRegressor 进行测试。

Kaggle 决定将他们每月的表格竞赛延续到 2022 年这对于我们来说是非常好的消息。并且Kaggle 表示他们已经考虑大家的评论,所以我希望这意味着他们将不再使用庞大到使系统崩溃的数据集,这次1月的比赛数据集就不是很大。

在我看来,2022 年 1 月的竞赛问题是对涵盖几年时间的销售额的预测,这可以用机器学习构成一个时间序列。

我在下面的屏幕截图中包含了问题陈述的一部分,其中包含了和这项竞赛问题有关的代码:

本篇文章我使用 HistGradientBoostingRegressor 进行测试。首先要导入运行程序需要的库,numpy,Pandas,matplotlib 和 seaborn:

然后我使用 Pandas 读取csv 并将它们转换为df:

我使用 seaborn 来分析目标,[‘num_sold’]是我们需要预测销售额。当我分析它时,可以看到它是偏斜的,并且有一些异常值:

然后我决定删除异常值,希望这样预测会有所改善。下面屏幕截图中的代码是我用来删除异常值的代码。虽然在这篇文章中没有记录,但我后来将乘数改为 2.25 而不是 1.5,并发现预测有小幅改进:

将异常值转换为空值后,我查看了这些空值并且进行了删除:

我创建了变量 target,它将用于进行预测。我再次分析了目标,一旦删除了异常值,数据列的形状就大大改善了:

我创建了一个新的df,这个df包含了train和test的数据:

除此以外,我还删除了 id_row 因为它不是必需的:

然后使用pandas处理时间特征:

日期列转换成时间戳后,我创建了一个新列 [‘day_of_week’] 并使用 datetime 来确定这一天属于一周中的哪一天。

然后我创建了另一列。['Is_weekend'] 确定当天是否在周末:

然后我将列 [‘is_weekend’] 乘以 1 将其转换为整数:

我使用 datetime 库创建了三个新列,[‘year’]、[‘month’] 和 [‘day’]:

一旦确定了年月日,我就可以检查哪些天是假期。我做的第一件事是确定这一天是否落在 12 月 25 日,并将这些数据放入布尔列 [‘xmas1’],然后将其转换为整数:

然后我按照上面使用的相同格式查看相关日期是否为 12 月 26 日,并将该信息放入新创建的列 [‘xmas2’]。

我还检查了一天是否在新年并将此信息放在创建的列中,[‘new_year’]:

找出一天是否是复活节有点棘手,因为复活节并不是固定的日期:

一旦假期被放在适当的列中,我使用 sklearn 并创建了一个 for 循环来对所有属于 dtype 对象的列进行顺序编码:

然后我使用 datetime 将日期转换为新创建的列 [‘date_num’] 中的数字,然后将此数字转换为整数:

然后我删除了 [‘date’] 和 [‘year’] 列,因为它们在进行预测时不会提供任何有价值的信息:

下面定义 X、y 和 X_test 变量。y 变量是目标,X 变量由combi 到train 的长度组成,X_test 变量由combi 从train 的长度到末尾组成:

然后我使用 sklearn 的 train_test_split 将 X 和 y 变量分成训练和验证集:

然后我定义了模型,在这个例子中我决定使用 sklearn 的 HistGradientBoostingRegressor。(只使用了默认值,但如果我也使用了 grid_search_cv,我的分数可能会更高。)

然后我在验证集上预测:

我检查了指标。理想情况下,分数应尽可能低:

我使用 matplotlib 绘制预测值与真实值的关系图:

然后我在测试集上预测:

一旦我对测试集进行了预测,我就可以提交的数据了:

我取得的分数,可以从下面的屏幕截图中看出:

总而言之,我只是在一天内完成了这个竞赛问题的程序,但是我可以做一些事情来提高我的分数,例如更改我用来删除异常值的公式以及使用 GridSearchCV 来确定要使用的最佳参数。我还可以加入更多节日。

我不得不说,很高兴使用不会使我的计算机崩溃的较小数据集。

这篇文章的代码可以在我的个人 Kaggle 帐户中找到,链接在这里:

https://www.kaggle.com/tracyporter/jan-22-tabular-hist-grad-boost-reg?scriptVersionId=84230226

本文作者:Tracyrenee

Kaggle Tabular Playground Series - Jan 2022 的baseline和日期特征处理相关推荐

  1. Kaggle时间序列(Time Series)教程 6-使用机器学习预测(forecasting-with-machine-learning)

    引言 在第2课和第3课中,我们将预测视为一个简单的回归问题,我们的所有特征都来自单个输入,即时间索引. 只需生成我们想要的趋势和季节性特征,我们就可以轻松地创建未来任何时间的预测. 然而,当我们在第4 ...

  2. Kaggle时间序列(Time Series)教程 2-趋势(Trend)

    什么是趋势(Trend)? 时间序列的趋势部分表示该序列平均值的持续.长期变化. 趋势是一系列中移动最慢的部分,代表了最大时间尺度的重要性. 在产品销售的时间序列中,随着越来越多的人逐年意识到该产品, ...

  3. kaggle房价预测特征意思_机器学习-kaggle泰坦尼克生存预测(一)-数据清洗与特征构建...

    1.背景: 1.1 关于kaggle: 谷歌旗下的 Kaggle 是一个数据建模和数据分析竞赛平台.该平台是当下最流行的数据科研赛事平台,其组织的赛事受到全球数据科学爱好者追捧. 如果学生能够在该平台 ...

  4. WSDM 2022 | 点击率模型特征交叉方向的发展及CAN模型介绍

    丨目录: · 摘要 · 背景 · 问题和方法 ·  Co-Action Network方案 · 方案扩展 · 总结 · References · 关于我们 ▐ 一.摘要 排序模块在广告.推荐和搜索等系 ...

  5. KDD 2022 | 深度图神经网络中的特征过相关:一个新的视角

    目录 前言 1 引言 2 背景和相关工作 2.1 GNN 2.2 相关工作 3 Preliminary Study 3.1 过相关和过平滑 3.2 过相关分析 3.2.1 传播导致更高的相关性 3.2 ...

  6. ICLR 2022 || 通过邻域/度/初始特征重建的等图自编码器

    来源:深度学习与图网络 本文为论文,建议阅读5分钟该论文提出了一种新的图表示学习方法. Graph Auto-Encoder via Neighborhood Wasserstein Reconstr ...

  7. 机器学习多模型组合在竞赛项目中的应用十例

    一.Kaggle的房价预测竞赛.         在这个竞赛中,参赛者需要预测位于美国艾奥瓦州的住宅的销售价格. 在这个竞赛中,一个常见的方法是将多个不同的机器学习模型组合使用,以提高预测的准确性.例 ...

  8. 从0基础到全国亚军,自学机器学习如何挺进Kaggle前20%

    前半部分是各种碎碎念,介绍自己0基础入门机器学习的经历,不喜欢可以跳过 后半部分介绍自己的比赛方案 双非文科出身,0基础完全靠自学入门[机器学习],在一场练习赛中Sole,成绩从第1661名达到了全球 ...

  9. 【机器学习基础】回归相关指标优化​

    作者: 尘沙杰少.谢嘉嘉.DOTA.有夕 赛题理解,分析,规划之回归相关指标优化 此处我们列举kaggle过往几年中,在回归问题中经常出现的一些评估指标,因为在数据竞赛中我们更多的是考虑在特定评测指标 ...

最新文章

  1. 通过超链接访问后台方法_超有用的公众号超链接,3分钟学会2种超链接方法,特别实用!...
  2. liunx版mysql服务无法启动_linux环境下mysql无法启动
  3. Arcgis for Android 空间数据WKT与JSON描述
  4. android tab 选中变色,Android 底部导航栏的Tab选中不变色?
  5. 虚拟机上用U盘安装系统
  6. 红米pro android o刷机,红米Pro官方卡刷机教程 怎么刷机
  7. JavaScript 基础知识总结归纳(一)
  8. python 函数嵌套和嵌套调用
  9. 百度移动统计热力图和事件分析的坑
  10. Starbound正式版的Mod制作(一)nbsp;…
  11. 安徽师大附中%你赛day5 T3 树上行走 解题报告
  12. 优雅整洁的 Java 代码命名技巧,风之极·净化
  13. Hadoop学习之SSH免密登录配置(以三台虚拟机为例,完全分布式)
  14. 林纳斯·托瓦兹 Linus Torvalds
  15. 【计算机网络】传输层(一)—— 传输层概述
  16. [转]IT人的学习方法
  17. 针对宽带拨号错误代码及解决方法
  18. 知识点 channel的使用
  19. 模拟电路58(方波产生电路与锯齿波产生电路)
  20. 深度系统linux15.3 32位下载,Deepin 15.3 i386官方正式版(32位)

热门文章

  1. vue读取redis 值_Jmeter连接Redis,一定很容易学会吧
  2. 教你快速撸一个免费HTTPS证书
  3. Kubernetes的十大使用技巧
  4. 086.冒泡排序的缺点及解决方案
  5. 字符串字符数组和基本类型的相互转换
  6. 网络上可供测试的Web Service
  7. W3C HTML 工作组联合主席Paul Cotton谈HTML5发展愿景
  8. php 调用url field,使用 PHP curl 调用 API,如何传递如下格式的 POSTFIELD?
  9. c++判断双击间隔_录井工常见故障判断处理
  10. mysql查询前10条记录