首页 文章 精选 留言 我的

精选列表

搜索[数字经济],共10000篇文章
优秀的个人博客,低调大师

关于人工智能的10个数字

◆◆◆ 导读 在最近Vox Media的编程大会上,微软联合创始人比尔盖茨称人工智能为“计算机科学界,人人都想要摘下的圣杯”。盖茨回顾了语音识别和电脑视觉技术在过去五年里的快速发展,同时指出“梦想终于要成真了”。而一旦这成为现实,科技投资者就需要识别出市场中主要的趋势和玩家。首先,让我们来了解一下人工智能产业的10大惊人事实。 1. 2020年市值达到50.5亿美元 全球第二大市场研究咨询公司Markets and Markets预计,由于媒体、广告、零售、金融和健康行业正在更多地运用机器学习和自然语言处理技术,人工智能市场将从2014年的420百万美元增长到2020年的50.5亿美元。 机器学习中的重要公司包括云端公司如亚马逊,微软和IBM。而NuanceCommunications是顶尖的“纯”自然语言处理玩家。 2. 将有60亿

优秀的个人博客,低调大师

【Spark Summit East 2017】FIS:加速FinTech数字智能

更多精彩内容参见云栖社区大数据频道https://yq.aliyun.com/big-data;此外,通过Maxcompute及其配套产品,低廉的大数据分析仅需几步,详情访问https://www.aliyun.com/product/odps。 本讲义出自Aaron Colcord在Spark Summit East 2017上的演讲,在2017年,60%的美国人都将成为电子银行用户,面对随着银行经验越来越丰富,忠实用户也越来越多的挑战,所以不得不充分利用手中的数据构建可靠的、可行的数据分析来提高用户体验,面对数据量和数据速度,企业业务的复杂性以及过时的技术所带来的巨大挑战,FIS使用Spark和Databricks为千上万的金融机构提供了与客户建立更好的关系的能力。

优秀的个人博客,低调大师

农村网络信息化如何跨越“数字鸿沟”?

【大咖・来了 第7期】10月24日晚8点观看《智能导购对话机器人实践》 《中国农村信息化需求调查研究报告》称,超过四成的农民受认同互联网的重要性,显示互联网的信息渠道地位正在上升,但同时网络信息化有效利用率偏低,中国能上网看信息的农民数量却不到10%。 目前为农村提供信息服务的主要有通信网、电视网、计算机网络。 信息产业部在“十二五”规划中,进一步提出我国农村通信发展要以“村村通电话,乡乡能上网”为目标。在笔者看来,实现农村信息化并不用先走建电话村,再建信息村的老路,甚至可以通过多网融合的方式一步到位,综合接入。 目前为农村提供信息服务的主要有通信网、电视网、计算机网络。 而随着通信技术的发展,光纤的成本急剧下降给新农村信息化建设实现跨越式发展提供了可能,这样做的目的旨在于可有效避免“信息化投入失误”--在偏远的乡村同时建几套信息网络不仅代价极其高昂而且无法分别聚集起足够的用户。 实际上,农村信息化建设应当以逐步推行计算机网络化为主,优化网络结构,“一网多用”自然成为建设的重要核心,同时,“三网(通信网、电视网、计算机网)合一”,拓宽信息提供接入架构和信息服务综合指标。 同时,在信息终端系统方面,为农村、农民开发设计更多更为实用的信息终端,提供更加简便的信息应用解决方案也是值得行业ISV关注的一个重要课题。 方案商可以通过建设农村信息服务平台和开发相应的信息资源,为农民提供产前、产中和产后一条龙信息化服务,整合行业现有资源和成果,集中推进信息技术应用,建立“一站式”服务平台,甚至可实现一站登陆、各站共享的效果,比如,在农民还不能熟练运用电脑和互联网时,“宽带+电视+机顶盒”的IPTV网络信息业务就具备了良好的应用前景,这样,随着终端的不断演化与网络建设快速递进,通过“三网合一”使农村一个个孤岛信息得到有效整合,促进农业发展增长或许不再成为制约地区竞争力发展的瓶颈。

优秀的个人博客,低调大师

Elasticsearch 向量数据库:数分钟内部署,可经济高效地扩展至数千亿规模

Elasticsearch 是全球部署最广泛的向量工作负载平台之一,为 GitHub、Docusign、Seismic 等公司的语义搜索、检索增强生成(RAG)和推荐系统提供支持。今天,我们宣布推出 Elasticsearch 向量数据库——一种针对向量应用优化的全新无服务器产品。您只需提供文档和查询,我们负责处理嵌入与索引调优,以及基础设施。此外,我们还确保其廉价且可扩展。

优秀的个人博客,低调大师

利用英特尔 Gaudi 2 和至强 CPU 构建经济高效的企业级 RAG 应用

检索增强生成 (Retrieval Augmented Generation,RAG) 可将存储在外部数据库中的新鲜领域知识纳入大语言模型以增强其文本生成能力。其提供了一种将公司数据与训练期间语言模型学到的知识分开的方式,有助于我们在性能、准确性及安全隐私之间进行有效折衷。 通过本文,你将了解到英特尔如何通过企业 AI 开放平台 OPEA 开源项目帮助你开发和部署 RAG 应用。你还将通过真实的 RAG 使用案例了解英特尔 Gaudi 2 AI 加速器和至强 CPU 如何助力企业级应用性能的显著飞跃。 OPEA https://opea.dev 导入 在深入了解细节之前,我们先要获取硬件。英特尔 Gaudi 2 专为加速数据中心和云上的深度学习训练和推理而设计。你可在 英特尔开发者云 (IDC) 上获取其公开实例,也可在本地部署它。IDC 是尝试 Gaudi 2 的最简单方法,如果你尚没有帐户,可以考虑注册一个帐户,订阅 “Premium”,然后申请相应的访问权限。 英特尔 Gaudi 2 https://habana.ai/products/gaudi2/ 英特尔开发者云 (IDC) https://www.intel.com/content/www/us/en/developer/tools/devcloud/overview.html 在软件方面,我们主要使用 LangChain 来构建我们的应用。LangChain 是一个开源框架,旨在简化 LLM AI 应用的构建流程。其提供了基于模板的解决方案,允许开发人员使用自定义嵌入模型、向量数据库和 LLM 构建 RAG 应用,用户可通过 LangChain 文档获取其更多信息。英特尔一直积极为 LangChain 贡献多项优化,以助力开发者在英特尔平台上高效部署 GenAI 应用。 在 LangChain 中,我们将使用 rag-redis 模板来创建我们的 RAG 应用。选型上,我们使用 BAAI/bge-base-en-v1.5 作为嵌入模型,并使用 Redis 作为默认向量数据库。下图展示了该应用的高层架构图。 BAAI/bge-base-en-v1.5 https://hf.co/BAAI/bge-base-en-v1.5 在我们的应用中,嵌入模型跑在 英特尔 Granite Rapids CPU 上。英特尔 Granite Rapids 架构专为高核数、性能敏感型工作负载以及通用计算工作负载而优化,并为此类工作负载提供最低的总拥有成本 (Cost Of Ownership,TCO)。GNR 还支持 AMX-FP16 指令集,这会为混合 AI 工作负载带来 2-3 倍的性能提升。 英特尔 Granite Rapids https://www.intel.com/content/www/us/en/newsroom/news/intel-unveils-future-generation-xeon.html#gs.6t3deu 我们将 LLM 跑在英特尔 Gaudi 2 加速器上。至于如何使用 Hugging Face 模型,Optimum Habana 库可将 Hugging Face Transformers 和 Diffusers 库桥接至 Gaudi 加速器。因此,用户可以用它针对各种下游任务在单卡和多卡场景下轻松进行模型加载、训练及推理。 Optimum Habana https://hf.co/docs/optimum/en/habana/index Transformers https://hf.co/docs/transformers/index Diffusers https://hf.co/docs/diffusers/index 我们提供了一个 Dockerfile 以简化 LangChain 开发环境的配置。启动 Docker 容器后,你就可以开始在 Docker 环境中构建向量数据库、RAG 流水线以及 LangChain 应用。详细的分步说明,请参照 ChatQnA 示例。 Dockerfile https://github.com/opea-project/GenAIExamples/tree/main/ChatQnA/langchain/docker ChatQnA https://github.com/opea-project/GenAIExamples/tree/main/ChatQnA 创建向量数据库 我们用耐克的公开财务文件创建一个向量数据库,示例代码如下: #IngestPDFfilesthatcontainEdgar10kfilingsdataforNike.company_name="Nike"data_path="data"doc_path=[os.path.join(data_path,file)forfileinos.listdir(data_path)][0]content=pdf_loader(doc_path)chunks=text_splitter.split_text(content)#Createvectorstoreembedder=HuggingFaceEmbeddings(model_name=EMBED_MODEL)_=Redis.from_texts(texts=[f"Company:{company_name}."+chunkforchunkinchunks],embedding=embedder,index_name=INDEX_NAME,index_schema=INDEX_SCHEMA,redis_url=REDIS_URL,) 定义 RAG 流水线 在 LangChain 中,我们使用 Chain API 来连接提示、向量数据库以及嵌入模型。 你可在 该代码库 中找到完整代码。 该代码库 https://github.com/opea-project/GenAIExamples/blob/main/ChatQnA/langchain/redis/rag_redis/chain.py #EmbeddingmodelrunningonXeonCPUembedder=HuggingFaceEmbeddings(model_name=EMBED_MODEL)#Redisvectordatabasevectorstore=Redis.from_existing_index(embedding=embedder,index_name=INDEX_NAME,schema=INDEX_SCHEMA,redis_url=REDIS_URL)#Retrieverretriever=vectorstore.as_retriever(search_type="mmr")#Prompttemplatetemplate="""…"""prompt=ChatPromptTemplate.from_template(template)#HuggingFaceLLMrunningonGaudi2model=HuggingFaceEndpoint(endpoint_url=TGI_LLM_ENDPOINT,…)#RAGchainchain=(RunnableParallel({"context":retriever,"question":RunnablePassthrough()})|prompt|model|StrOutputParser()).with_types(input_type=Question) 在 Gaudi 2 上加载 LLM 我们在 Gaudi2 上使用 Hugging Face 文本生成推理 (TGI) 服务运行聊天模型。TGI 让我们可以在 Gaudi2 硬件上针对流行的开源 LLM (如 MPT、Llama 以及 Mistral) 实现高性能的文本生成。 无需任何配置,我们可以直接使用预先构建的 Docker 映像并把模型名称 (如 Intel NeuralChat) 传给它。 model=Intel/neural-chat-7b-v3-3volume=$PWD/datadockerrun-p8080:80-v$volume:/data--runtime=habana-eHABANA_VISIBLE_DEVICES=all-eOMPI_MCA_btl_vader_single_copy_mechanism=none--cap-add=sys_nice--ipc=hosttgi_gaudi--model-id$model TGI 默认使用单张 Gaudi 加速卡。如需使用多张卡以运行更大的模型 (如 70B),可添加相应的参数,如 --sharded true 以及 --num_shard 8 。对于受限访问的模型,如 Llama 或 StarCoder,你还需要指定 -e HUGGING_FACE_HUB_TOKEN= <kbd> 以使用你自己的 Hugging Face 令牌 获取模型。 Llama https://hf.co/meta-llama StarCoder https://hf.co/bigcode/starcoder Hugging Face 令牌 https://hf.co/docs/hub/en/security-tokens 容器启动后,我们可以通过向 TGI 终端发送请求以检查服务是否正常。 curllocalhost:8080/generate-XPOST\-d'{"inputs":"WhichNFLteamwontheSuperBowlinthe2010season?",\"parameters":{"max_new_tokens":128,"do_sample":true}}'\-H'Content-Type:application/json' 如果你能收到生成的响应,则 LLM 运行正确。从现在开始,你就可以在 Gaudi2 上尽情享受高性能推理了! TGI Gaudi 容器默认使用 bfloat16 数据类型。为获得更高的吞吐量,你可能需要启用 FP8 量化。根据我们的测试结果,与 BF16 相比,FP8 量化会带来 1.8 倍的吞吐量提升。FP8 相关说明可在 README 文件中找到。 README https://github.com/opea-project/GenAIExamples/blob/main/ChatQnA/README.md 最后,你还可以使用 Meta Llama Guard 模型对生成的内容进行审核。OPEA 的 README 文件提供了在 TGI Gaudi 上部署 Llama Guard 的说明。 Llama Guard https://hf.co/meta-llama/LlamaGuard-7b README https://github.com/opea-project/GenAIExamples/blob/main/ChatQnA/README.md 运行 RAG 服务 我们运行下述命令启动 RAG 应用后端服务, server.py 脚本是用 fastAPI 实现的服务终端。 dockerexec-itqna-rag-redis-serverbashnohuppythonapp/server.py& 默认情况下,TGI Gaudi 终端运行在本地主机的 8080 端口上 (即 http://127.0.0.1:8080 )。如果需将其运行至不同的地址或端口,可通过设置 TGI_ENDPOINT 环境变量来达成。 启动 RAG GUI 运行以下命令以安装前端 GUI 组件: sudoapt-getinstallnpm&&\npminstall-gn&&\nstable&&\hash-r&&\npminstall-gnpm@latest 然后,更新 .env 文件中的 DOC_BASE_URL 环境变量,将本地主机 IP 地址 ( 127.0.0.1 ) 替换为运行 GUI 的服务器的实际 IP 地址。 接着,运行以下命令以安装所需的软件依赖: npminstall 最后,使用以下命令启动 GUI 服务: nohupnpmrundev& 上述命令会运行前端服务并启动应用。 基准测试结果 我们针对不同的模型和配置进行了深入的实验。下面两张图展示了 Llama2-70B 模型在四卡英特尔 Gaudi 2 和四卡英伟达 H100 平台上,面对 16 个并发用户时的相对端到端吞吐量和性价比对比。 在这两种测例中,向量数据库和嵌入模型都运行在相同的英特尔 Granite Rapids CPU 平台上。为了比较每美元的性能,我们使用了与 MosaicML 团队于 2024 年 1 月使用的数据相同的公开定价数据来计算每美元的平均训练性能。 MosaicML https://www.databricks.com/blog/llm-training-and-inference-intel-gaudi2-ai-accelerators 如你所见,与 Gaudi 2 相比,基于 H100 的系统虽然吞吐量提高了 1.13 倍,但每美元性能仅为 0.44 倍。这些比较可能会因云厂商不同以及客户折扣不同而有所不同,我们在文末列出了详细的基准配置。 总结 上例成功演示了如何在英特尔平台上部署基于 RAG 的聊天机器人。此外,英特尔会不断发布成熟的 GenAI 示例,以期通过这些经过验证的工具助力开发人员简化创建、部署流程。这些示例功能多样且易于定制,非常适合用户基于其在英特尔平台上开发各种应用。 运行企业级 AI 应用时,基于英特尔 Granite Rapids CPU 和 Gaudi 2 加速器的系统的总拥有成本更低。另外,还可通过 FP8 优化进一步优化成本。 以下开发者资源应该可以帮助大家更平滑地启动 GenAI 项目。 OPEA GenAI 示例 https://github.com/opea-project/GenAIExamples 基于 Gaudi 2 的 TGI https://github.com/huggingface/tgi-gaudi 英特尔 AI 生态之 Hugging Face https://www.intel.com/content/www/us/en/developer/ecosystem/hugging-face.html Hugging Face hub 英特尔页 https://hf.co/Intel 如果你有任何问题或反馈,我们很乐意在 Hugging Face 论坛 上与你互动。感谢垂阅! Hugging Face 论坛 https://discuss.huggingface.co/ 致谢: 我们要感谢 Chaitanya Khened、Suyue Chen、Mikolaj Zyczynski、Wenjiao Yue、Wenxin Zhu、Letong Han、Sihan Chen、Hanwen Cheng、Yuan Wu 和 Yi Wang 对在英特尔 Gaudi 2 上构建企业级 RAG 系统做出的杰出贡献。 基准测试配置 Gaudi2 配置: HLS-Gaudi2 配备 8 张 Habana Gaudi2 HL-225H 夹层卡及 2 个英特尔至强铂金 8380 CPU@2.30GHz,以及 1TB 系统内存; 操作系统: Ubuntu 22.04.03,5.15.0 内核 H100 SXM 配置: Lambda labs 实例 gpu_8x_h100_sxm5; 8 张 H100 SXM 及 2 个英特尔至强铂金 8480 CPU@2 GHz,以及 1.8TB 系统内存; 操作系统 ubuntu 20.04.6 LTS,5.15.0 内核 Llama2 70B 部署至 4 张卡 (查询归一化至 8 卡)。Gaudi2 使用 BF16,H100 使用 FP16 嵌入模型为 BAAI/bge-base v1.5 。测试环境: TGI-gaudi 1.2.1、TGI-GPU 1.4.5、Python 3.11.7、Langchain 0.1.11、sentence-transformers 2.5.1、langchain benchmarks 0.0.10、redis 5.0.2、cuda 12.2.r12.2/compiler.32965470_0, TEI 1.2.0 RAG 查询最大输入长度 1024,最大输出长度 128。测试数据集: langsmith Q&A。并发客户端数 16 Gaudi2 (70B) 的 TGI 参数: batch_bucket_size=22 , prefill_batch_bucket_size=4 , max_batch_prefill_tokens=5102 , max_batch_total_tokens=32256 , max_waiting_tokens=5 , streaming=false H100 (70B) 的 TGI 参数: batch_bucket_size=8 , prefill_batch_bucket_size=4 , max_batch_prefill_tokens=4096 , max_batch_total_tokens=131072 , max_waiting_tokens=20 , max_batch_size=128 , streaming=false TCO 参考: https://www.databricks.com/blog/llm-training-and-inference-intel-gaudi2-ai-accelerators 英文原文:https://hf.co/blog/cost-efficient-rag-applications-with-intel 原文作者: Julien Simon,Haihao Shen,Antony Vance Jeyaraj,Matrix Yao,Leon Lv,Greg Serochi,Deb Bharadwaj,Ke Ding 译者: Matrix Yao (姚伟峰),英特尔深度学习工程师,工作方向为 transformer-family 模型在各模态数据上的应用及大规模模型的训练推理。 本文分享自微信公众号 - Hugging Face(gh_504339124f0f)。 如有侵权,请联系 support@oschina.cn 删除。 本文参与“OSC源创计划”,欢迎正在阅读的你也加入,一起分享。

资源下载

更多资源
腾讯云软件源

腾讯云软件源

为解决软件依赖安装时官方源访问速度慢的问题,腾讯云为一些软件搭建了缓存服务。您可以通过使用腾讯云软件源站来提升依赖包的安装速度。为了方便用户自由搭建服务架构,目前腾讯云软件源站支持公网访问和内网访问。

Nacos

Nacos

Nacos /nɑ:kəʊs/ 是 Dynamic Naming and Configuration Service 的首字母简称,一个易于构建 AI Agent 应用的动态服务发现、配置管理和AI智能体管理平台。Nacos 致力于帮助您发现、配置和管理微服务及AI智能体应用。Nacos 提供了一组简单易用的特性集,帮助您快速实现动态服务发现、服务配置、服务元数据、流量管理。Nacos 帮助您更敏捷和容易地构建、交付和管理微服务平台。

Spring

Spring

Spring框架(Spring Framework)是由Rod Johnson于2002年提出的开源Java企业级应用框架,旨在通过使用JavaBean替代传统EJB实现方式降低企业级编程开发的复杂性。该框架基于简单性、可测试性和松耦合性设计理念,提供核心容器、应用上下文、数据访问集成等模块,支持整合Hibernate、Struts等第三方框架,其适用范围不仅限于服务器端开发,绝大多数Java应用均可从中受益。

WebStorm

WebStorm

WebStorm 是jetbrains公司旗下一款JavaScript 开发工具。目前已经被广大中国JS开发者誉为“Web前端开发神器”、“最强大的HTML5编辑器”、“最智能的JavaScript IDE”等。与IntelliJ IDEA同源,继承了IntelliJ IDEA强大的JS部分的功能。

用户登录
用户注册