首页 文章 精选 留言 我的

精选列表

搜索[子流程],共10000篇文章
优秀的个人博客,低调大师

XGboost数据比赛实战之调参篇(完整流程)

这一篇博客的内容是在上一篇博客Scikit中的特征选择,XGboost进行回归预测,模型优化的实战的基础上进行调参优化的,所以在阅读本篇博客之前,请先移步看一下上一篇文章。 我前面所做的工作基本都是关于特征选择的,这里我想写的是关于XGBoost参数调整的一些小经验。之前我在网站上也看到很多相关的内容,基本是翻译自一篇英文的博客,更坑的是很多文章步骤讲的不完整,新人看了很容易一头雾水。由于本人也是一个新手,在这过程中也踩了很多大坑,希望这篇博客能够帮助到大家!下面,就进入正题吧。 首先,很幸运的是,Scikit-learn中提供了一个函数可以帮助我们更好地进行调参: sklearn.model_selection.GridSearchCV 常用参数解读: estimator:所使用的分类器,如果比赛中使用的是XGBoost的话,就是生成的model。比如: model = xgb.XGBRegressor(**other_params) param_grid:值为字典或者列表,即需要最优化的参数的取值。比如:cv_params = {'n_estimators': [550, 575, 600, 650, 675]} scoring :准确度评价标准,默认None,这时需要使用score函数;或者如scoring='roc_auc',根据所选模型不同,评价准则不同。字符串(函数名),或是可调用对象,需要其函数签名形如:scorer(estimator, X, y);如果是None,则使用estimator的误差估计函数。scoring参数选择如下: 具体参考地址:http://scikit-learn.org/stable/modules/model_evaluation.html 这次实战我使用的是r2这个得分函数,当然大家也可以根据自己的实际需要来选择。 调参刚开始的时候,一般要先初始化一些值: learning_rate: 0.1 n_estimators: 500 max_depth: 5 min_child_weight: 1 subsample: 0.8 colsample_bytree:0.8 gamma: 0 reg_alpha: 0 reg_lambda: 1 链接:XGBoost常用参数一览表 你可以按照自己的实际情况来设置初始值,上面的也只是一些经验之谈吧。 调参的时候一般按照以下顺序来进行: 1、最佳迭代次数:n_estimators if __name__ == '__main__': trainFilePath = 'dataset/soccer/train.csv' testFilePath = 'dataset/soccer/test.csv' data = pd.read_csv(trainFilePath) X_train, y_train = featureSet(data) X_test = loadTestData(testFilePath) cv_params = {'n_estimators': [400, 500, 600, 700, 800]} other_params = {'learning_rate': 0.1, 'n_estimators': 500, 'max_depth': 5, 'min_child_weight': 1, 'seed': 0, 'subsample': 0.8, 'colsample_bytree': 0.8, 'gamma': 0, 'reg_alpha': 0, 'reg_lambda': 1} model = xgb.XGBRegressor(**other_params) optimized_GBM = GridSearchCV(estimator=model, param_grid=cv_params, scoring='r2', cv=5, verbose=1, n_jobs=4) optimized_GBM.fit(X_train, y_train) evalute_result = optimized_GBM.grid_scores_ print('每轮迭代运行结果:{0}'.format(evalute_result)) print('参数的最佳取值:{0}'.format(optimized_GBM.best_params_)) print('最佳模型得分:{0}'.format(optimized_GBM.best_score_)) 写到这里,需要提醒大家,在代码中有一处很关键: model = xgb.XGBRegressor(**other_params)中两个*号千万不能省略!可能很多人不注意,再加上网上很多教程估计是从别人那里直接拷贝,没有运行结果,所以直接就用了 model = xgb.XGBRegressor(other_params)。悲剧的是,如果直接这样运行的话,会报如下错误: xgboost.core.XGBoostError: b"Invalid Parameter format for max_depth expect int but value... 不信,请看链接:xgboost issue 以上是血的教训啊,自己不运行一遍代码,永远不知道会出现什么Bug! 运行后的结果为: [Parallel(n_jobs=4)]: Done 25 out of 25 | elapsed: 1.5min finished 每轮迭代运行结果:[mean: 0.94051, std: 0.01244, params: {'n_estimators': 400}, mean: 0.94057, std: 0.01244, params: {'n_estimators': 500}, mean: 0.94061, std: 0.01230, params: {'n_estimators': 600}, mean: 0.94060, std: 0.01223, params: {'n_estimators': 700}, mean: 0.94058, std: 0.01231, params: {'n_estimators': 800}] 参数的最佳取值:{'n_estimators': 600} 最佳模型得分:0.9406056804545407 由输出结果可知最佳迭代次数为600次。但是,我们还不能认为这是最终的结果,由于设置的间隔太大,所以,我又测试了一组参数,这次粒度小一些: cv_params = {'n_estimators': [550, 575, 600, 650, 675]} other_params = {'learning_rate': 0.1, 'n_estimators': 600, 'max_depth': 5, 'min_child_weight': 1, 'seed': 0, 'subsample': 0.8, 'colsample_bytree': 0.8, 'gamma': 0, 'reg_alpha': 0, 'reg_lambda': 1} 运行后的结果为: [Parallel(n_jobs=4)]: Done 25 out of 25 | elapsed: 1.5min finished 每轮迭代运行结果:[mean: 0.94065, std: 0.01237, params: {'n_estimators': 550}, mean: 0.94064, std: 0.01234, params: {'n_estimators': 575}, mean: 0.94061, std: 0.01230, params: {'n_estimators': 600}, mean: 0.94060, std: 0.01226, params: {'n_estimators': 650}, mean: 0.94060, std: 0.01224, params: {'n_estimators': 675}] 参数的最佳取值:{'n_estimators': 550} 最佳模型得分:0.9406545392685364 果不其然,最佳迭代次数变成了550。有人可能会问,那还要不要继续缩小粒度测试下去呢?这个我觉得可以看个人情况,如果你想要更高的精度,当然是粒度越小,结果越准确,大家可以自己慢慢去调试,我在这里就不一一去做了。 2、接下来要调试的参数是min_child_weight以及max_depth: 注意:每次调完一个参数,要把 other_params对应的参数更新为最优值。 cv_params = {'max_depth': [3, 4, 5, 6, 7, 8, 9, 10], 'min_child_weight': [1, 2, 3, 4, 5, 6]} other_params = {'learning_rate': 0.1, 'n_estimators': 550, 'max_depth': 5, 'min_child_weight': 1, 'seed': 0, 'subsample': 0.8, 'colsample_bytree': 0.8, 'gamma': 0, 'reg_alpha': 0, 'reg_lambda': 1} 运行后的结果为: [Parallel(n_jobs=4)]: Done 42 tasks | elapsed: 1.7min [Parallel(n_jobs=4)]: Done 192 tasks | elapsed: 12.3min [Parallel(n_jobs=4)]: Done 240 out of 240 | elapsed: 17.2min finished 每轮迭代运行结果:[mean: 0.93967, std: 0.01334, params: {'min_child_weight': 1, 'max_depth': 3}, mean: 0.93826, std: 0.01202, params: {'min_child_weight': 2, 'max_depth': 3}, mean: 0.93739, std: 0.01265, params: {'min_child_weight': 3, 'max_depth': 3}, mean: 0.93827, std: 0.01285, params: {'min_child_weight': 4, 'max_depth': 3}, mean: 0.93680, std: 0.01219, params: {'min_child_weight': 5, 'max_depth': 3}, mean: 0.93640, std: 0.01231, params: {'min_child_weight': 6, 'max_depth': 3}, mean: 0.94277, std: 0.01395, params: {'min_child_weight': 1, 'max_depth': 4}, mean: 0.94261, std: 0.01173, params: {'min_child_weight': 2, 'max_depth': 4}, mean: 0.94276, std: 0.01329...] 参数的最佳取值:{'min_child_weight': 5, 'max_depth': 4} 最佳模型得分:0.94369522247392 由输出结果可知参数的最佳取值:{'min_child_weight': 5, 'max_depth': 4}。(代码输出结果被我省略了一部分,因为结果太长了,以下也是如此) 3、接着我们就开始调试参数:gamma: cv_params = {'gamma': [0.1, 0.2, 0.3, 0.4, 0.5, 0.6]} other_params = {'learning_rate': 0.1, 'n_estimators': 550, 'max_depth': 4, 'min_child_weight': 5, 'seed': 0, 'subsample': 0.8, 'colsample_bytree': 0.8, 'gamma': 0, 'reg_alpha': 0, 'reg_lambda': 1} 运行后的结果为: [Parallel(n_jobs=4)]: Done 30 out of 30 | elapsed: 1.5min finished 每轮迭代运行结果:[mean: 0.94370, std: 0.01010, params: {'gamma': 0.1}, mean: 0.94370, std: 0.01010, params: {'gamma': 0.2}, mean: 0.94370, std: 0.01010, params: {'gamma': 0.3}, mean: 0.94370, std: 0.01010, params: {'gamma': 0.4}, mean: 0.94370, std: 0.01010, params: {'gamma': 0.5}, mean: 0.94370, std: 0.01010, params: {'gamma': 0.6}] 参数的最佳取值:{'gamma': 0.1} 最佳模型得分:0.94369522247392 由输出结果可知参数的最佳取值:{'gamma': 0.1}。 4、接着是subsample以及colsample_bytree: cv_params = {'subsample': [0.6, 0.7, 0.8, 0.9], 'colsample_bytree': [0.6, 0.7, 0.8, 0.9]} other_params = {'learning_rate': 0.1, 'n_estimators': 550, 'max_depth': 4, 'min_child_weight': 5, 'seed': 0, 'subsample': 0.8, 'colsample_bytree': 0.8, 'gamma': 0.1, 'reg_alpha': 0, 'reg_lambda': 1} 运行后的结果显示参数的最佳取值:{'subsample': 0.7,'colsample_bytree': 0.7} 5、紧接着就是:reg_alpha以及reg_lambda: cv_params = {'reg_alpha': [0.05, 0.1, 1, 2, 3], 'reg_lambda': [0.05, 0.1, 1, 2, 3]} other_params = {'learning_rate': 0.1, 'n_estimators': 550, 'max_depth': 4, 'min_child_weight': 5, 'seed': 0, 'subsample': 0.7, 'colsample_bytree': 0.7, 'gamma': 0.1, 'reg_alpha': 0, 'reg_lambda': 1} 运行后的结果为: [Parallel(n_jobs=4)]: Done 42 tasks | elapsed: 2.0min [Parallel(n_jobs=4)]: Done 125 out of 125 | elapsed: 5.6min finished 每轮迭代运行结果:[mean: 0.94169, std: 0.00997, params: {'reg_alpha': 0.01, 'reg_lambda': 0.01}, mean: 0.94112, std: 0.01086, params: {'reg_alpha': 0.01, 'reg_lambda': 0.05}, mean: 0.94153, std: 0.01093, params: {'reg_alpha': 0.01, 'reg_lambda': 0.1}, mean: 0.94400, std: 0.01090, params: {'reg_alpha': 0.01, 'reg_lambda': 1}, mean: 0.93820, std: 0.01177, params: {'reg_alpha': 0.01, 'reg_lambda': 100}, mean: 0.94194, std: 0.00936, params: {'reg_alpha': 0.05, 'reg_lambda': 0.01}, mean: 0.94136, std: 0.01122, params: {'reg_alpha': 0.05, 'reg_lambda': 0.05}, mean: 0.94164, std: 0.01120...] 参数的最佳取值:{'reg_alpha': 1, 'reg_lambda': 1} 最佳模型得分:0.9441561344357595 由输出结果可知参数的最佳取值:{'reg_alpha': 1, 'reg_lambda': 1}。 6、最后就是learning_rate,一般这时候要调小学习率来测试: cv_params = {'learning_rate': [0.01, 0.05, 0.07, 0.1, 0.2]} other_params = {'learning_rate': 0.1, 'n_estimators': 550, 'max_depth': 4, 'min_child_weight': 5, 'seed': 0, 'subsample': 0.7, 'colsample_bytree': 0.7, 'gamma': 0.1, 'reg_alpha': 1, 'reg_lambda': 1} 运行后的结果为: [Parallel(n_jobs=4)]: Done 25 out of 25 | elapsed: 1.1min finished 每轮迭代运行结果:[mean: 0.93675, std: 0.01080, params: {'learning_rate': 0.01}, mean: 0.94229, std: 0.01138, params: {'learning_rate': 0.05}, mean: 0.94110, std: 0.01066, params: {'learning_rate': 0.07}, mean: 0.94416, std: 0.01037, params: {'learning_rate': 0.1}, mean: 0.93985, std: 0.01109, params: {'learning_rate': 0.2}] 参数的最佳取值:{'learning_rate': 0.1} 最佳模型得分:0.9441561344357595 由输出结果可知参数的最佳取值:{'learning_rate': 0.1}。 我们可以很清楚地看到,随着参数的调优,最佳模型得分是不断提高的,这也从另一方面验证了调优确实是起到了一定的作用。不过,我们也可以注意到,其实最佳分数并没有提升太多。提醒一点,这个分数是根据前面设置的得分函数算出来的,即: optimized_GBM = GridSearchCV(estimator=model, param_grid=cv_params, scoring='r2', cv=5, verbose=1, n_jobs=4) 中的scoring='r2'。在实际情境中,我们可能需要利用各种不同的得分函数来评判模型的好坏。 最后,我们把得到的最佳参数组合扔到模型里训练,就可以得到预测的结果了: def trainandTest(X_train, y_train, X_test): # XGBoost训练过程,下面的参数就是刚才调试出来的最佳参数组合 model = xgb.XGBRegressor(learning_rate=0.1, n_estimators=550, max_depth=4, min_child_weight=5, seed=0, subsample=0.7, colsample_bytree=0.7, gamma=0.1, reg_alpha=1, reg_lambda=1) model.fit(X_train, y_train) # 对测试集进行预测 ans = model.predict(X_test) ans_len = len(ans) id_list = np.arange(10441, 17441) data_arr = [] for row in range(0, ans_len): data_arr.append([int(id_list[row]), ans[row]]) np_data = np.array(data_arr) # 写入文件 pd_data = pd.DataFrame(np_data, columns=['id', 'y']) # print(pd_data) pd_data.to_csv('submit.csv', index=None) # 显示重要特征 # plot_importance(model) # plt.show() 好了,调参的过程到这里就基本结束了。正如我在上面提到的一样,其实调参对于模型准确率的提高有一定的帮助,但这是有限的。最重要的还是要通过数据清洗,特征选择,特征融合,模型融合等手段来进行改进! 完整代码可到我的GitHub上进行下载。(声明一点,我的代码质量不是很好,大家参考一下思路就行) 更多干货,欢迎去听我的GitChat:

优秀的个人博客,低调大师

谢烟客---------Linux之DNS请求流程及资源记录定义

DNS类型/同步类型/域和区域的区别 SOA内部数据特性 DNS负载均衡(Load balance)的实现 缓存DNS服务器 缓存定义、作用、多级缓存 一次完整的解析请求 解析答案 DNS分布式特点 区域解析库/RR/RR_TYPE A记录的轮循、多主机名对同一个主机、泛域名解析 <<反反复复,多次权衡的结果 >> DNS类型、同步类型、区域和域的区别 SOA内部数据特性 DNS负载均衡(Load balance)的实现 缓存DNS服务器 缓存定义、作用、多级缓存 一次完整的解析请求 本地主机发起递归,运营商缓存DNS迭代 本地主机发起递归,本地缓存DNS迭代 解析答案 DNS分布式特点 区域解析库:由众多RR组成 RR: 资源记录类型Resource Record详细记录所有主机名和IP对应的关系 RR_TYPE: RR格式: name [TTL] IN RR_TYPE vlaue 1)TTL: 解析结果的缓存时长,单位是"s" 秒 2)@ at可以引用区域名 3)相邻多个资源记录,name相同时,可以省略name 4)每个NS,MX记录对应一个A记录 SOA, NS, MX, A, PTR, CNAME SOA记录 1 2 3 4 5 6 7 8 例如: @ 86400 INSOA@linux.magedu.com.( 20170916 ;serial 10M;refresh 5M;retry 1W;expire 1D;TTL ) NS 记录 MX记录 A记录 PTR记录 CNAME记录 本文转自 lccnx 51CTO博客,原文链接:http://blog.51cto.com/sonlich/1965799,如需转载请自行联系原作者

优秀的个人博客,低调大师

iOS:使用集成的支付宝SDK的支付流程

基本步骤: 1.先与支付宝签约,获得商户的ID(partner)和账号ID(seller),这一部分主要是又公司负责; 2.下载相应的公钥私钥文件,用来给签名进行加密; 3.下载支付宝集成的SDK,网址:https://club.alipay.com/ 里面提供了非常详细的文档、如何签名、如何获取公钥私钥、如何调用支付接口等; 4.生成订单信息; 5.调用支付宝客户端,由支付宝客户端跟支付宝安全服务器打交道; 6.支付宝支付完成后,返回支付结果给商户客户端和服务器。 SDK里有集成支付功能的一个Demo: 要想支付接口可以参考以下文件夹的库文件(把这三个添加到呢的客户端中) 演示实例: 调用支付接口可以参考AlixPayDemoViewController的下面方法 -(void)tableView:(UITableView *)tableView didSelectRowAtIndexPath:(NSIndexPath *)indexPath 如何创建订单 ( 订单根据自己公司看是什么样的) 如何签名 如何调用支付接口 都在这个方法里面了 1 // 2 //选中商品调用支付宝快捷支付 3 // 4 - (void)tableView:(UITableView *)tableView didSelectRowAtIndexPath:(NSIndexPath *)indexPath 5 { 6 /* 7 *点击获取prodcut实例并初始化订单信息 8 */ 9 Product *product = [_products objectAtIndex:indexPath.row]; 10 11 /* 12 *商户的唯一的parnter和seller。 13 *本demo将parnter和seller信息存于(AlixPayDemo-Info.plist)中,外部商户可以考虑存于服务端或本地其他地方。 14 *签约后,支付宝会为每个商户分配一个唯一的 parnter 和 seller。 15 */ 16 //如果partner和seller数据存于其他位置,请改写下面两行代码 17 NSString *partner = [[NSBundle mainBundle] objectForInfoDictionaryKey:@"Partner"]; 18 NSString *seller = [[NSBundle mainBundle] objectForInfoDictionaryKey:@"Seller"]; 19 20 //partner和seller获取失败,提示 21 if ([partner length] == 0 || [seller length] == 0) 22 { 23 UIAlertView *alert = [[UIAlertView alloc] initWithTitle:@"提示" 24 message:@"缺少partner或者seller。" 25 delegate:self 26 cancelButtonTitle:@"确定" 27 otherButtonTitles:nil]; 28 [alert show]; 29 [alert release]; 30 return; 31 } 32 33 /* 34 *生成订单信息及签名 35 *由于demo的局限性,本demo中的公私钥存放在AlixPayDemo-Info.plist中,外部商户可以存放在服务端或本地其他地方。 36 */ 37 //将商品信息赋予AlixPayOrder的成员变量 38 AlixPayOrder *order = [[AlixPayOrder alloc] init]; 39 order.partner = partner; 40 order.seller = seller; 41 order.tradeNO = [self generateTradeNO]; //订单ID(由商家自行制定) 42 order.productName = product.subject; //商品标题 43 order.productDescription = product.body; //商品描述 44 order.amount = [NSString stringWithFormat:@"%.2f",product.price]; //商品价格 45 order.notifyURL = @"http://www.xxx.com"; //回调URL 46 47 //应用注册scheme,在AlixPayDemo-Info.plist定义URL types,用于快捷支付成功后重新唤起商户应用 48 NSString *appScheme = @"AlixPayDemo"; 49 50 //将商品信息拼接成字符串 51 NSString *orderSpec = [order description]; 52 NSLog(@"orderSpec = %@",orderSpec); 53 54 //获取私钥并将商户信息签名,外部商户可以根据情况存放私钥和签名,只需要遵循RSA签名规范,并将签名字符串base64编码和UrlEncode 55 id<DataSigner> signer = CreateRSADataSigner([[NSBundle mainBundle] objectForInfoDictionaryKey:@"RSA private key"]); 56 NSString *signedString = [signer signString:orderSpec]; 57 58 //将签名成功字符串格式化为订单字符串,请严格按照该格式 59 NSString *orderString = nil; 60 if (signedString != nil) { 61 orderString = [NSString stringWithFormat:@"%@&sign=\"%@\"&sign_type=\"%@\"", 62 orderSpec, signedString, @"RSA"]; 63 64 //获取快捷支付单例并调用快捷支付接口 65 AlixPay * alixpay = [AlixPay shared]; 66 int ret = [alixpay pay:orderString applicationScheme:appScheme]; 67 68 if (ret == kSPErrorAlipayClientNotInstalled) { 69 UIAlertView * alertView = [[UIAlertView alloc] initWithTitle:@"提示" 70 message:@"您还没有安装支付宝快捷支付,请先安装。" 71 delegate:self 72 cancelButtonTitle:@"确定" 73 otherButtonTitles:nil]; 74 [alertView setTag:123]; 75 [alertView show]; 76 [alertView release]; 77 } 78 else if (ret == kSPErrorSignError) { 79 NSLog(@"签名错误!"); 80 } 81 82 } 83 84 [tableView deselectRowAtIndexPath:indexPath animated:YES]; 85 } 只要集成的关键就是下面这几步: //.封装订单模型 AlixPayOrder *order = [[AlixPayOrder alloc] init]; // 生成订单描述 NSString *orderSpec = [order description]; //2.签名 id<DataSigner> signer = CreateRSADataSigner(@“私钥key”); // 传入订单描述 进行 签名 NSString *signedString = [signer signString:orderSpec]; //3.生成订单字符串 NSString *orderString = [NSString stringWithFormat:@"%@&sign=\"%@\"&sign_type=\"%@\"", orderSpec, signedString, @"RSA"]; //4.调用支付接口 AlixPay * alixpay = [AlixPay shared]; // appScheme:商户自己的协议头 int ret = [alixpay pay:orderString applicationScheme:appScheme]; 程序猿神奇的手,每时每刻,这双手都在改变着世界的交互方式! 本文转自当天真遇到现实博客园博客,原文链接:http://www.cnblogs.com/XYQ-208910/p/5024104.html ,如需转载请自行联系原作者

资源下载

更多资源
Nacos

Nacos

Nacos /nɑ:kəʊs/ 是 Dynamic Naming and Configuration Service 的首字母简称,一个易于构建 AI Agent 应用的动态服务发现、配置管理和AI智能体管理平台。Nacos 致力于帮助您发现、配置和管理微服务及AI智能体应用。Nacos 提供了一组简单易用的特性集,帮助您快速实现动态服务发现、服务配置、服务元数据、流量管理。Nacos 帮助您更敏捷和容易地构建、交付和管理微服务平台。

Rocky Linux

Rocky Linux

Rocky Linux(中文名:洛基)是由Gregory Kurtzer于2020年12月发起的企业级Linux发行版,作为CentOS稳定版停止维护后与RHEL(Red Hat Enterprise Linux)完全兼容的开源替代方案,由社区拥有并管理,支持x86_64、aarch64等架构。其通过重新编译RHEL源代码提供长期稳定性,采用模块化包装和SELinux安全架构,默认包含GNOME桌面环境及XFS文件系统,支持十年生命周期更新。

Sublime Text

Sublime Text

Sublime Text具有漂亮的用户界面和强大的功能,例如代码缩略图,Python的插件,代码段等。还可自定义键绑定,菜单和工具栏。Sublime Text 的主要功能包括:拼写检查,书签,完整的 Python API , Goto 功能,即时项目切换,多选择,多窗口等等。Sublime Text 是一个跨平台的编辑器,同时支持Windows、Linux、Mac OS X等操作系统。

WebStorm

WebStorm

WebStorm 是jetbrains公司旗下一款JavaScript 开发工具。目前已经被广大中国JS开发者誉为“Web前端开发神器”、“最强大的HTML5编辑器”、“最智能的JavaScript IDE”等。与IntelliJ IDEA同源,继承了IntelliJ IDEA强大的JS部分的功能。

用户登录
用户注册