首页 文章 精选 留言 我的

精选列表

搜索[flink],共2085篇文章
优秀的个人博客,低调大师

通过Flink实时构建搜索引擎的索引

案例与解决方案汇总页:阿里云实时计算产品案例&解决方案汇总 1.背景介绍 搜索引擎的出现大大降低了人们寻找信息的难度,已经深入到生活与工作的方方面面,简单列举几个应用如下: 互联网搜索,如谷歌,百度等; 垂直搜索,如淘宝、天猫的商品搜索; 站内搜索,各个内容网站提供的站内搜索服务; 企业内部搜索,员工查询企业内部信息; 广告投放,根据投放上下文检索出对应的广告主和广告内容; 搜索引擎的关键是让用户找到其所需信息,其整体架构如下: 从图示可知,一个搜索引擎从大的方面来看主要包括两部分,一部分是提供在线的搜索服务,一部分要把原始数据已离线的方式建立索引,建立索引是信息可搜索的前提。 注:这里的在线与离线主要指的是是否直接服务于用户,直接服务于用户的部分叫在线系统,服务于在线系统的其他系统叫做离线系统。比如搜索是在线系统,APP是在线系统,那么为搜

优秀的个人博客,低调大师

实时计算Flink —— 独享模式 —— Data Lake典型场景

数据湖 Data Lake并不是一个新的概念,早在2011年就被提出,作为数仓的补充。数据湖是一个中心化的存储,能够存储任意规模的结构化与半结构化数据。数据湖中的数据,不必经过结构化过程,即可进行各种类型的分析。如可视化,大数据处理,实时数据分析和机器学习。 数据湖与数仓区别 与数仓相比,数据湖中数据有以下几个特点。 数据存储多样化 RDBMS:RDS/ADS… 数仓:Hive/ODPS… Queue:SLS/MQ/Kafka… 文件存储:OSS/HDFS… 数据格式多样化 RDBMS中结构化数据 JSON/XML/CSV等半结构化数据 图像/音频/视频等非结构化数据 数据计算多样化 数据Schema不固定 异构数据源计算,无需将数据导入统一存储。 支持SQL进行大数据分析,同时也可直接对数据进行全文检索/机器学习等。 在数据湖场景中,实时计算有其独特优势,可完美解决数据湖场景下,结构化和半结构化数据的异构数据源计算和ETL等问题。下面以IoT场景举例说明数据湖的优势。 具体场景 典型工业化IoT场景,传感器采集厂房中各地点的温度,湿度,压力等信息,并上传到云端做环境监控及数据分析。整体业务架构如下。 场景数据流 IoT场景中,整个系统数据分为几类: IoT Device的运行日志,以文件的形式存储在OSS中。 IoT Device采集的数据,上传到SLS,MQ,Kafka等各种数据通道类系统。 MySQL,HBase,Redis等RDBMS,NoSQL中保存的重点监控区域设备白名单。 场景业务逻辑 根据以上三种数据类型,整个数据链路可分为两部分。 实时链路 实时BI 链路:IoT Device -> SLS/MQ/Kafka… -> SC 相关业务指标: 实时查看在线设备状态,设备个数。 实时查看工厂各区域温度/湿度/压力等报警情况。 重要设备的在线情况查看(流式维表Join)。 工厂重要区域指标查看(流式维表Join)。 实时监控(CEP) 链路:IoT Device -> SLS/MQ/Kafka… -> SC 相关业务指标: 设备状态异常报警。 厂区各监控指标(温度/湿度/压力)等报警。 离线链路 DataLake ETL 链路:IoT Device -> SLS/MQ/Kafka… -> SC -> Hive/ODPS 链路作用: 将IoT采集到的数据经过清洗,上传到数仓中做持久存储及分析。 DalaLake分析 链路1:IoT Device -> OSS -> SC。链路作用:直接分析IoT日志,获取小时/天级别设备运行状态报表。 IoT设备日志量大,如果将所有数据导入数仓,会大大增加存储成本,通过数据湖分析功能可直接通过SQL查询OSS上日志文件。 链路2:IoT Device -> OSS -> SC (OSS JOIN HBase)。链路作用:将OSS上设备运行状态日志与Hbase/MySQL中数据关联并聚合,计算出关键设备某段时间的运行状态。 场景下流计算优势 功能丰富 实时计算,数据湖场景下ETL,分析,监控等功能集为一体。 20+种connector,无缝对接各种类数据源。 异构数据源可计算。可使用标准SQL,对异构数据源直接计算。 节省成本 开发成本:实时/离线各种场景中,SQL+UDF即可解决所有问题。一套SQL,实时/离线无缝切换。 运维成本:全托管模式,保证高SLA情况下,减轻您的运维负担。 存储成本:直接分析OSS,RDBMS,NoSQL,Queue,Hive…中结构化,半结构化数据,与传统数仓中,数据集中后才能分析的模式相比,对于低频查询类场景,可以节省存储成本。 计算成本:一个产品,支持多种计算能力,降低您的计算成本。 本文转自实时计算——Data Lake典型场景

优秀的个人博客,低调大师

实时计算Flink > 准备工作——角色授权

您开通实时计算服务时,需要授予一个名称为AliyunStreamDefaultRole的系统默认角色给实时计算的服务账号。当且仅当该角色被正确授予后,实时计算才能正常地调用相关服务,例如RDS等。 注意:实时计算必须提前进行角色授权,否则后续不能正常运行。 自动化角色授予流程 当您创建项目或第一次进入项目时,如果没有正确的授予默认角色给实时计算服务账号,会看到如下视图,此时应该点击前往授权,进行角色授权。 点击AliyunStreamDefaultRole>同意授权,即完成了授权的全部内容。 当完成以上授权步骤后,重新刷新实时计算的控制台,就可以进行操作了。如果想要查看AliyunStreamDefaultRole 相关的详细信息,可以登陆Ram的控制台查看,也可以点击查看链接。 实时计算角色当前授权的权限如下: { "Version": "1", "Statement": [ { "Action": [ "ots:List*", "ots:DescribeTable", "ots:Get*", "ots:*Row" ], "Resource": "*", "Effect": "Allow" }, { "Action": [ "dhs:Create*", "dhs:List*", "dhs:Get*", "dhs:PutRecords", "dhs:DeleteTopic" ], "Resource": "*", "Effect": "Allow" }, { "Action": [ "log:List*", "log:Get*", "log:Post*" ], "Resource": "*", "Effect": "Allow" }, { "Action": [ "mns:List*", "mns:Get*", "mns:Send*", "mns:Publish*", "mns:Subscribe" ], "Resource": "*", "Effect": "Allow" }, { "Action": [ "drds:DescribeDrdsInstance", "drds:ModifyDrdsIpWhiteList" ], "Resource": "*", "Effect": "Allow" }, { "Action": [ "rds:Describe*", "rds:ModifySecurityIps*" ], "Resource": "*", "Effect": "Allow" }, { "Action": [ "vpc:DescribeVpcs", "vpc:DescribeVSwitches" ], "Resource": "*", "Effect": "Allow" }, { "Action": [ "ecs:CreateSecurityGroup", "ecs:AuthorizeSecurityGroup", "ecs:CreateNetworkInterface", "ecs:DescribeNetworkInterfaces", "ecs:AttachNetworkInterface", "ecs:DescribeNetworkInterfacePermissions", "ecs:CreateNetworkInterfacePermission" ], "Resource": "*", "Effect": "Allow" }, { "Action": "oss:*", "Resource": "*", "Effect": "Allow" } ] } 重新初始化 如果您不小心删除了阿里云实时计算在RAM角色”AliyunStreamDefaultRole”,或者您不小心修改了AliyunStreamDefaultRole的授权策略无法恢复。您可以考虑在RAM中删除该角色,并重新进入实时计算WebConsole,让实时计算尝试重新初始化注册RAM角色的流程。 注意: 删除AliyunStreamDefaultRole角色后,可能导致实时计算正在运行的作业瞬间无法读写上下游外部存储,直到后续重新初始化AliyunStreamDefaultRole角色后即可恢复正常。请务必确保这项操作对于线上实时计算业务是否会造成影响。 RAM删除角色和流计算重新初始化操作均需要当前用户的主账号或者经主账号授权的具备RAM权限子账号操作。 在RAM中,找到角色管理>AliyunStreamDefaultRole>删除,即可删除阿里云实时计算的角色。 进入实时计算WebConsole,实时计算此时就会提示用户进行重新授权。 注意:实时计算和RAM对于授权均有不同程度的缓存,有可能在删除角色或者授权角色后,实时计算仍然提示需要授权角色。这种情况实际上已经授权成功,请选择授权完毕按钮即可。 异常问题 子账号在操作数据存储的时候会出现以下错误信息。 主子账号Role授权 进入RAM地址,进行以下操作为子账号赋权。 AliyunRAMFullAccess权限较大,如果您需要控制子账号的权限范围,只需授予PassRole权限,既可以修改授权策略的Action、Resource。如下示例: 说明:其中45643只是示例uid,请以实际uid为准 { "Statement": [ { "Action": "ram:PassRole", "Effect": "Allow", "Resource": "acs:ram::45643:role/AliyunStreamDefaultRole" } ], "Version": "1" } 操作步骤 1.新建授权策略 2.授权子账号 3.搜索名称,授权完成 本文转自实时计算——角色授权

优秀的个人博客,低调大师

实时计算Flink —— 独享模式上下游配置

本页目录 DataHub数据存储注册注意事项 SLS/LogService数据存储注册注意事项 RDS数据存储注册注意事项 OTS数据存储注册注意事项 ADS数据存储注册注意事项 DataHub数据存储注册注意事项 DataHub EndPoint填写 具体内容请您参看DataHub访问域名下的DataHub域名列表。 SLS/LogService数据存储注册注意事项 SLS/LogService EndPoint填写 具体内容请您参看 公网服务入口。 RDS数据存储注册注意事项 RDS产品和VPC名称一致 请您够买与您的VPC名称一致的RDS产品。RDS控制台只会显示名称,所以需要您提前查找VPC的名称。 查找VPC,如下图。 查找VPC的名称,如下图。 在RDS管理控制台,够买VPC名称为rong-sz的产品。 白名单配置 独享模式中您需要在ECS页面找到弹性网卡ENI中对应的IP,配到RDS的白名单中。 在RDS控制台,将IP添加到白名单内。如下图。 添加成功后,显示如下图。 OTS数据存储注册注意事项 绑定VPC 使用OTS管理控制台前,需要先绑定VPC。 填写VPC的信息。 OTS EndPoint填写。 填写OTS控制台中的VPC访问地址,如下图。 ADS数据存储注册注意事项 URL信息填写 URL信息请您查看ADS控制台,如下图。 AccessID、AccessKey信息填写 AccessID、AccessKey信息请您查看阿里云accesskeys页面,如下图。 本文转自实时计算——独享模式上下游配置

资源下载

更多资源
Mario

Mario

马里奥是站在游戏界顶峰的超人气多面角色。马里奥靠吃蘑菇成长,特征是大鼻子、头戴帽子、身穿背带裤,还留着胡子。与他的双胞胎兄弟路易基一起,长年担任任天堂的招牌角色。

Nacos

Nacos

Nacos /nɑ:kəʊs/ 是 Dynamic Naming and Configuration Service 的首字母简称,一个易于构建 AI Agent 应用的动态服务发现、配置管理和AI智能体管理平台。Nacos 致力于帮助您发现、配置和管理微服务及AI智能体应用。Nacos 提供了一组简单易用的特性集,帮助您快速实现动态服务发现、服务配置、服务元数据、流量管理。Nacos 帮助您更敏捷和容易地构建、交付和管理微服务平台。

Spring

Spring

Spring框架(Spring Framework)是由Rod Johnson于2002年提出的开源Java企业级应用框架,旨在通过使用JavaBean替代传统EJB实现方式降低企业级编程开发的复杂性。该框架基于简单性、可测试性和松耦合性设计理念,提供核心容器、应用上下文、数据访问集成等模块,支持整合Hibernate、Struts等第三方框架,其适用范围不仅限于服务器端开发,绝大多数Java应用均可从中受益。

WebStorm

WebStorm

WebStorm 是jetbrains公司旗下一款JavaScript 开发工具。目前已经被广大中国JS开发者誉为“Web前端开发神器”、“最强大的HTML5编辑器”、“最智能的JavaScript IDE”等。与IntelliJ IDEA同源,继承了IntelliJ IDEA强大的JS部分的功能。

用户登录
用户注册