首页 文章 精选 留言 我的

精选列表

搜索[Web 应用托管],共10000篇文章
优秀的个人博客,低调大师

DeepLearning.ai学习笔记(四)卷积神经网络 -- week4 特殊应用:人力脸识别和神经风格转换

一、什么是人脸识别 老实说这一节中的人脸识别技术的演示的确很牛bi,但是演技好尴尬,233333 啥是人脸识别就不用介绍了,下面笔记会介绍如何实现人脸识别。 二、One-shot(一次)学习 假设我们发财了,开了一家公司。然后作为老板的我们希望与时俱进,所以想使用人脸识别技术来实现打卡。 假如我们公司只有4个员工,按照之前的思路我们训练的神经网络模型应该如下: 如图示,输入一张图像,经过CNN,最后再通过Softmax输出5个可能值的大小(4个员工中的一个,或者都不是,所以一一共5种可能性)。 看起来好像没什么毛病,但是我们要相信我们的公司会越来越好的啊,所以难道公司每增加一个人就要重新训练CNN以及最后一层的输出数量吗? 这显然有问题,所以有人提出了一次学习(one-shot),更具体地说是通过一个函数来求出输入图像与数据库中的图像的差异度,用\(d(img1,img2)\)表示。 如上图示,如果两个图像之间的差异度不大于某一个阈值 τ,那么则认为两张图像是同一个人。反之,亦然。 下一小节介绍了如何计算差值。 三、Siamese网络 注意:下图中两个网络参数是一样的。 先看上面的网络。记输入图像为\(x^{(1)}\),经过卷积层,池化层和全连接层后得到了箭头所指位置的数据(一般后面还会接上softmax层,但在这里暂时不用管),假设有128个节点,该层用\(f(x^{(1)})\)表示,可以理解为输入\(x^{(1)}\)的编码。 那么下一个网络同理,不再赘述。 因此上一节中所说的差异度函数即为 \(d(x^{(1)},x^{(2)})=||f(x^{(1)})-f(x^{(2)})||^2\) 问题看起来好像解决了,但总感觉还漏了点什么。。。 没错!!! 你没错!!! 神经网络的参数咋确定啊?也就是说\(f(x^{(i)})\)的参数怎么计算呢? 首先我们可以很明确的是如果两个图像是同一个人,那么所得到的参数应该使得\(||f(x^{(1)})-f(x^{(2)})||^2\)的值较小,反之较大。(如下图示) 沿着这个思路我们继续看下一小节内容~~~ 四、Triple损失 1. Learning Objective 这里首先介绍一个三元组,即 (Anchor, Positive, Negative),简写为(A,P,N) Anchor: 可以理解为用于识别的图像 Positive: 表示是这个人 Negative: 表示不是同一个人 由上一节中的思路,我们可以得到如下不等式: \(d(A,P)\leqq d(A,N)\),即\(||f(A)-f(P)||^2-||f(A)-f(N)||^2\leqq0\) (如下图示) 但是这样存在一个问题,即如果神经网络什么都没学到,返回的值是0,也就是说如果\(f(x)=\vec{0}\)的话,那么这个不等式是始终成立的。(如下图示) 为了避免上述特殊情况,而且左边值必须小于0,所以在右边减去一个变量\(α\),但是按照惯例是加上一个值,所以将\(α\)加在左边。 综上,所得到的参数需要满足如下不等式 \(||f(A)-f(P)||^2-||f(A)-f(N)||^2+α\leqq0\) 2. Lost function 介绍完三元组后,我们可以对单个图像定义如下的损失函数(如下图示) \(L(A,P,N)=max(||f(A)-f(P)||^2-||f(A)-f(N)||^2+α,0)\) 解释一下为什么用max函数,因为如果只要满足\(||f(A)-f(P)||^2-||f(A)-f(N)||^2+α\leqq0\),我们就认为已经正确识别出了图像中的人,所以对于该图像的损失值是0. 所以总的损失函数是 : \(J=\sum{L(A^{(i)},P^{(i)},N^{(i)})}\) 要注意的是使用这种方法要保证每一个人不止有一张图像,否则无法训练。另外要注意与前面的One-shot区分开来,这里是在训练模型,所以训练集的数量要多一些,每个人要有多张照片。而One-shot是进行测试了,所以只需一张用于输入的照片即可。 3. Choosing the triplets(A,P,N) 还有一个很重要的问题就是如何选择三元组(A,P,N)。因为实际上要满足不等式\(d(A,P)+α\leqq d(A,N)\)是比较简单的,即只要将Negative选择的比较极端便可,比如anchor是一个小女孩,而Negative选择一个老大爷。 所以还应该尽量满足\(d(A,N)\approx{d(A,N)}\) 五、面部验证与二分类 通过以上内容,我们可以确定下图中的网络的参数了,那么现在开始进行面部验证了。 上面的是测试图,下面的是数据库中的一张照片。 和之前一样假设\(f(x^{(i)})\)有128个节点,之后这两个数据作为输入数据输入到后面的逻辑回归模型中去,即 \(\hat{y}=σ(\sum_{k=1}^{128}w_i|f(x^{(i)})_k-f(x^{(j)})_k|+b_i)\) 若\(\hat{y}=1\),为同一人。反之,不是。 如下图示,绿色下划线部分可以用其他公式替换,即有 \(\hat{y}=σ(\sum_{k=1}^{128}w_i \frac{(f(x^{(i)})_k-f(x^{(j)})_k)^2}{f(x^{(i)})_k+f(x^{(j)})_k}+b_i)\) 当然数据库中的图像不用每次来一张需要验证的图像都重新计算,其实可以提前计算好,将结果保存起来,这样就可以加快运算的速度了。 六、什么是神经风格转换 如下图示,不多赘述。 七、深度卷积网络在学什么? 八、代价函数 如下图示: 左上角的包含Content的图片简称为C,右上角包含Style的简称S,二者融合后得到的图片简称为G。 我们都知道计算问题必须是有限的,所以融合的标准是什么?也就是说Content的保留程度和Style的运用程度如何取舍呢? 此时引入损失函数,并对其进行最优化,这样便可得到最优解。 \(J(G)=αJ_{Content}(C,G)+βJ_{Style}(S,G)\) \(J_{Content}(C,G)\)表示图像C和图像G之间的差异,\(J_{Style}(S,G)\)同理。 计算过程示例: 随机初始化图像G,假设为100*100*3 (如下图右边四个图像最上面那个所示) 使用梯度下降不断优化J(G)。 (优化过程如下图右边下面3个图像所示) 下面一小节将具体介绍损失函数的计算。 九、内容代价函数 首先假设我们使用第\(l\)层隐藏层来计算\(J_{Content}(C,G)\),注意这里的\(l\)一般取在中间层,而不是最前面的层,或者最后层。 原因如下: 假如取第1层,那么得到的G图像将会与图像C像素级别的相似,这显然不行。 假如取很深层,那么该层已经提取出了比较重要的特征,例如图像C中有一条狗,那么得到的图像G会过度的保留这个特征。 然后使用预先训练好的卷积神经网络,如VGG网络。这样我们就可以得到图像C和图像G在第\(l\)层的激活函数值,分别记为\(a^{[l][C]},a^{[l][G]}\) 内容损失函数 \(J_{Content}(C,G)=\frac{1}{2}||a^{[l][C]}-a^{[l][G]}||^2\) 十、风格损失函数 1.什么是“风格” 要计算风格损失函数,我们首先需要知道“风格(Style)”是什么。 我们使用\(l\)层的激活来度量“Style”,将“Style”定义为通道间激活值之间的相关系数。(Define style as correlation between activation across channels) 那么我们如何计算这个所谓的相关系数呢? 下图是我们从上图中所标识的第\(l\)层,为方便说明,假设只有5层通道。 如上图示,红色通道和黄色通道对应位置都有激活项,而我们要求的便是它们之间的相关系数。 但是为什么这么求出来是有效的呢?为什么它们能够反映出风格呢? 继续往下看↓ 2.图像风格的直观理解 如图风格图像有5层通道,且该图像的可视化特征如左下角图所示。 其中红色通道可视化特征如图中箭头所指是垂直条纹,而黄色通道的特征则是橘色背景。 那么通过计算这两层通道的相关系数有什么用呢? 其实很好理解,如果二者相关系数性强,那么如果出现橘色背景,那么就应该很大概率出现垂直条纹。反之,亦然。 3.风格相关系数矩阵 令\(a_{i,j,k}^{[l]}\)表示(i,j,k)的激活项,其中i,j,k分别表示高度值(H),宽度值(W)以及所在通道层次(C)。 风格矩阵(也称为“Gram Matrix”)用\(G^{[l]}\)表示,其大小为\(n_c^{l]}*n_c^{l]}\). 因此风格图像的风格矩阵为: \[G_{kk'}^{[l](S)}=\sum_{i=1}^{n_H^{[l]}}\sum_{j=1}^{n_W^{[l]}}a_{i,j,k}^{[l](S)}a_{i,j,k'}^{[l](S)}\] 生成图像的相关系数矩阵 \[G_{kk'}^{[l](G)}=\sum_{i=1}^{n_H^{[l]}}\sum_{j=1}^{n_W^{[l]}}a_{i,j,k}^{[l](G)}a_{i,j,k'}^{[l](G)}\] 4.风格损失函数 第\(l\)层的风格损失函数为: \[J_{Style}^{[l]}=\frac{1}{(2n_H^{[l]}n_W^{[l]}n_C^{[l]})^2}\sum_{k}\sum_{k'}(G_{kk'}^{[l](S)}-G_{kk'}^{[l](G)})\] 总的风格损失函数: \[J_{Style}(S,G)=\sum_{l}λ^{[l]}J_{Style}^{[l]}(S,G)\] MARSGGBO原创 2018-2-13

优秀的个人博客,低调大师

阿里巴巴iDST+阿里视频云:计算机视觉和机器学习在消费级视频中的应用

在刚刚圆满落幕的杭州云栖大会上,阿里巴巴董事局主席马云宣布成立达摩院,并将在3年内投资1000亿人民币用于新技术研发。而iDST就是达摩院中的一员,她致力于打造涵盖图像视频、语音交互、自然语言理解、智能决策等人工智能核心技术,肩负着在人工智能领域树立阿里巴巴集团世界领先的技术品牌使命。 那iDST的人工智能技术与阿里视频云强强联合,将碰撞出怎样的科技火花呢? 本文邀请iDST高级算法专家刘扬,将从视频云和人工智能技术结合的由来、消费级视频的特点、iDST视频AI技术进展、iDST的VENUS视频分析平台、视频云+人工智能未来展望五个部分,来介绍iDST在视频领域的技术和在视频云上的工作成果。 视频云和人工智能结合的由来 视频AI是由几方面因素组成。最底层是云计算平台,它包括存储、海量视频的分布式计算和流媒体处理能力,这是基础。中间层是人工

优秀的个人博客,低调大师

IDC:第三平台技术的行业应用将推动“新常态”下中国信息通信技术市场的发展

2015年是深化改革的一年,是“十二五”计划的最后一年,也是“十三五”计划的第一年。中国政府制定的政策和措施今后将对中国的经济发展和全球技术市场产生巨大影响。在这种宏观形势下,国际数据公司(IDC)在4月24日于深圳召开的IDC 2015年信息通信技术(ICT)发展方向大会上重点指出了全球和中国ICT市场上主要的企业技术和消费技术发展趋势。大会接下来将登陆北京(5月13日)、上海(5月20日)、贵阳(5月27日),最后一站是大连(6月17日)。那么在第三平台支持并加快技术和商业创新方面,关键发展趋势究竟有哪些?以下是IDC 2015年信息通信技术发展方向大会的主要内容: •每家企业都需要制定物联网业务计划 物联网(IOT)创造了新的商业模式,降低了竞争对手的入市门槛,推动了产品开发过程的剧烈转变,同时也对企业数据的安全性和价值提出了挑战。这一切正令物联网迅速成为每家企业都必须面对的新现实。IDC企业基础设施、消费者、网络、电信与可持续发展研究部高级副总裁Vernon Turner称:“ICT供应商必须调整其传统的IT产品路线图,以纳入工业、政府和消费者等非传统市场。关键信息和新兴产业标准必须实现共享,以便更好地发展供应链、奠定安全数据基础,并取得预期成果。互联性更强的物联网业务计划将帮助用户与其技术伙伴取得更好的经营成果。” •下一轮移动设备发展浪潮 随着移动技术持续改变着人们的日常活动方式,我们用来彼此互动的设备也在产生同样的影响。IDC全球移动设备跟踪项目总监Ryan Reith表示:“随着工作和娱乐设备全面走向移动化,原始设备制造商(OEM)、IT买家、消费者和行业联盟都在绞尽脑汁地思考究竟哪种设备形式和哪种平台能最终胜出。”消费类设备市场当前格局的构成因素包括:消费者购买潮流下的变化态势、产品定价、平台之争,以及PC、平板电脑、可拆分设备、智能手机和可穿戴设备的硬件外观设计。 •新型业务流程在数字化企业中催生新型工作负载 IDC企业平台集团副总裁兼总经理Matt Eastwood说:“第三平台将新技术汇集在一起,同时也为那些渴望在市场上有效开展竞争的企业领导者创造了最有利的综合条件。随着各类组织纷纷开始利用移动、社交、云和分析技术来加强客户互动、改善业务决策制定过程,数字化转型正创造出新型的工作负载。IDC认为,许多公司将来都需要开发全新的技术基础设施,这将对IT部门以及数据中心产生根本性的影响。 •欧洲电信运营商必须有力把握第三平台带来的机遇 IDC欧洲、中东、非洲区电信与网络研究集团副总裁Eric Owen表示:“欧洲通讯市场已经经历了好几年的滑坡。但是,随着ICT行业围绕第三平台实现整合,电信运营商正在考察通讯领域之外的市场机遇。运营商正在关注云、数据中心、安全性和移动性服务等市场,以便找出自己能有效参与竞争的业务领域。”电信运营商无法独立完成这项工作——要想再一次成功完成转型并实现收入增长,他们需要依靠合作伙伴的帮助。 •新常态下的中国:将不确定性转化为机遇 据IDC中国区总裁霍锦洁(Kitty Fok)称,中国政府提出的6个关键词事实上涉及到了第三平台技术以及6大创新加速器。这些举措将在未来若干年内推动中国ICT市场的发展: 1.七大基础设施项目:在这个庞大的计划下,政府斥资10万亿元人民币重点投资七大类基础设施:1)粮食和水利;2)运输;3)生态环保;4)健康与养老服务;5)重大网络工程;6)清洁能源;7)石油、天然气和矿产资源。 IDC预测,这七个领域的基础设施建设将推动超过1000亿元的IT投资。 2.一带一路:解决中国制造业产能过剩的问题,支持中国企业的全球化,推动人民币的国际化——“一带一路”计划总投资超过30万亿人民币,将帮助中国吸引3000亿元人民币的IT投资。 3.中国制造2025:该战略旨在对中国制造业进行升级,以提高竞争力,它将为机器人、物联网、ICT基础设施以及行业解决方案领域带来巨大商机。 4.互联网+:在数字化时代,不断发展演变的传统产业为电子商务、企业移动性、大数据、物联网及社交网站带来了业务机遇。 5.智慧城市:不断发展的中国IT基础设施有利于造福民生、保持经济的稳定增长,这带来了云计算、大数据、移动、社交及物联网领域的商业机会。 6.安全可控:要想保证国家层面的信息安全可控,就需要让外国IT供应商积极与中国IT厂商开展技术转移和协作,借此在这个市场上保持自身的竞争力。 原文发布时间为:2015年7月6日 本文来自云栖社区合作伙伴至顶网,了解相关信息可以关注至顶网

资源下载

更多资源
Mario

Mario

马里奥是站在游戏界顶峰的超人气多面角色。马里奥靠吃蘑菇成长,特征是大鼻子、头戴帽子、身穿背带裤,还留着胡子。与他的双胞胎兄弟路易基一起,长年担任任天堂的招牌角色。

Spring

Spring

Spring框架(Spring Framework)是由Rod Johnson于2002年提出的开源Java企业级应用框架,旨在通过使用JavaBean替代传统EJB实现方式降低企业级编程开发的复杂性。该框架基于简单性、可测试性和松耦合性设计理念,提供核心容器、应用上下文、数据访问集成等模块,支持整合Hibernate、Struts等第三方框架,其适用范围不仅限于服务器端开发,绝大多数Java应用均可从中受益。

Rocky Linux

Rocky Linux

Rocky Linux(中文名:洛基)是由Gregory Kurtzer于2020年12月发起的企业级Linux发行版,作为CentOS稳定版停止维护后与RHEL(Red Hat Enterprise Linux)完全兼容的开源替代方案,由社区拥有并管理,支持x86_64、aarch64等架构。其通过重新编译RHEL源代码提供长期稳定性,采用模块化包装和SELinux安全架构,默认包含GNOME桌面环境及XFS文件系统,支持十年生命周期更新。

WebStorm

WebStorm

WebStorm 是jetbrains公司旗下一款JavaScript 开发工具。目前已经被广大中国JS开发者誉为“Web前端开发神器”、“最强大的HTML5编辑器”、“最智能的JavaScript IDE”等。与IntelliJ IDEA同源,继承了IntelliJ IDEA强大的JS部分的功能。

用户登录
用户注册