首页 文章 精选 留言 我的

精选列表

搜索[效率],共10004篇文章
优秀的个人博客,低调大师

提高Android开发效率的9个Web工具

在Google的广大支持下,便捷开发Android程序的Native工具层出不穷。其实Android开发涉及到的范围也不小,一些Web工具 有时候也会带来事半功倍的效果。有些甚至是一些native应用无法做到的。本文,将简单列举一下本人正在使用的一些工具,当然也会持续更新。 查找优秀的参考工程 codota是一个查找可供参考的Android工程的网站,它的爬虫已经采集了将近7百万个工程。比如我们想要写一段Android中检测网络可 用性的代码,我们只需要在搜索框中输入network,就会找到已经存在的优秀工程中关于这一逻辑的具体实现,确实为我们编码节省不少重复造轮子的成本。 另外,codeta还有支持Android Studio的插件,让查找源码更快捷。 地址:codota,Find Great Code Examples Android军火库 android-arsenal,中文意思 Android军火库,里面手机了Android中的SDK,Library以及Android开发的工具,满满的干货。有木有一种想见恨晚的赶脚,快来加入书签吧。 地址:The Android Arsenal – A categorized directory of free libraries and tools for Android 注意https协议的地址稍有问题,建议使用http协议的地址。 Grepcode grepcode.com是一个Java源码搜索引擎,对于查看Android代码也不例外。并且支持多个API版本快速切换查看。如果你的IDE关联本地代码后,让机器累的喘不过气来,那么就试一试这个在线的工具吧。 地址:grepcode.com Android Asset Studio 这是一个神奇的网页,里面包含了多个与资源相关的在线工具,比如icon制作(桌面icon,通知栏icon等),9patch图片制作,ActionBar样式等相关的工具。当你有资源相关的工作时,不妨试一试这个网页工具。 地址:Android Asset Studio 快速下载Google Play应用 由于一些你懂的原因,国内无法直接访问Google Play商店。而且下载Google Play商店还是需要登陆谷歌账户,以国内的网络,下载成功简直是太困难了。 这里介绍一款不需要账户国内即可访问的Web工具。可以通过输入包名或者Google Play地址即可下载。 地址:APK Downloader 进制转换 Android中所有的资源都有一个对应的资源ID,资源ID的类型为16进制的整数。有些时候特殊的场合处理资源ID,为了调试需要进行进制转换,比如16进制转常用的10进制。不用自己算,使用下面的工具就可以轻松搞定。 地址:Hex To Decimal Converter UI相关必备 通常UI设计师都会给开花童鞋色值,当疏忽的时候,我们可以使用截图软件得到10进制的三个值,然后将其转换成色值。这里有一个便捷的RGB工具。 地址:RGB Color Wheel/ JSON格式化 在CS应用中,客户端和服务器端通常使用json作为数据交换格式。当分析的时候,我们必然是将raw数据转换成可读性更高的。快来使用这个强大的工具吧。 地址:JSON Parser 查看HTML5,JS,CSS可用情况 caniuse.com是一个检测HTML5,JS,CSS在各个浏览器平台是否可用的web工具。便于我们了解前端方案是否在目标设备上是否有效。 地址:caniuse.com 来源:51CTO

优秀的个人博客,低调大师

Python提取PDF内容,4个方法让效率翻倍!

![](https://developer.qcloudimg.com/http-save/yehe-11081884/46d54d0bd585a61be2d334caf609a874.jpg) 你是不是经常需要从PDF里提取数据? 手动复制粘贴太慢了,格式还乱七八糟。 说实话,我之前也为此头疼。 直到我发现了Python的强大。 今天分享4个提取PDF内容的方法,让你告别复制粘贴。 --- ## **方法一:PyPDF2提取文字** 最简单的方式就是用PyPDF2。 它像个基础版的PDF阅读器,能快速把文字抠出来。 ``` import PyPDF2 def extract_text_pypdf2(pdf_path): """提取PDF中的文字内容""" with open(pdf_path, 'rb') as file: pdf_reader = PyPDF2.PdfReader(file) text = "" for page in pdf_reader.pages: text += page.extract_text() return text ``` 用起来很简单对吧? 打开PDF,一页页读,把文字拼起来就行。 不过它只能提取文字,表格和图片就无能为力了。 > **适合场景**:只需要提取纯文字,PDF结构简单 ## **方法二:pdfplumber(强烈推荐)** 这个库我必须重点推荐。 为什么?因为它能提取文字、表格、图片三种内容。 就像一个全能选手,什么都能干。 ``` import pdfplumber import pandas as pd def extract_pdf_content(pdf_path): """使用 pdfplumber 提取 PDF 的文字、表格、图片信息""" results = { 'text': '', 'tables': [], 'images': [] } with pdfplumber.open(pdf_path) as pdf: for page in pdf.pages: # 1. 文字 text = page.extract_text() if text: results['text'] += text + '\n' # 2. 表格 tables = page.extract_tables() for table in tables: if table: df = pd.DataFrame(table[1:], columns=table[0]) results['tables'].append(df) # 3. 图片 for img in page.images: results['images'].append({ 'page': page.page_number, 'bbox': (img['x0'], img['y0'], img['x1'], img['y1']), 'width': img.get('width'), 'height': img.get('height') }) return results ``` 你看,代码也不复杂。 但功能强大多了,表格提取尤其出色。 > **适合场景**:需要提取文字+表格的PDF,最常用的方案 ## **方法三:PyMuPDF提取图片** PyMuPDF(也叫fitz)的特点是什么? 图片提取效果好,速度快。 如果你需要把PDF里的图片都抠出来,选它准没错。 ``` import fitz from PIL import Image import io def extract_pdf_fitz(pdf_path): doc = fitz.open(pdf_path) results = {'text': '', 'images': []} for page_num in range(len(doc)): page = doc[page_num] # 1. 文字 results['text'] += page.get_text() # 2. 图片 for img in page.get_images(): xref = img[0] pix = fitz.Pixmap(doc, xref) if pix.n - pix.alpha **适合场景**:重点需要提取PDF中的图片 ## **方法四:camelot专门提取表格** camelot是个专才,只干一件事:提取表格。 但这一件事,它做得比谁都好。 特别是那些复杂的表格,它的准确率最高。 ``` import camelot def extract_tables_camelot(pdf_path): """使用camelot专门提取表格(适合复杂的表格)""" tables = camelot.read_pdf(pdf_path, pages='all') results = [] for i, table in enumerate(tables): df = table.df results.append({ 'table_number': i + 1, 'accuracy': table.accuracy, 'dataframe': df, 'shape': df.shape }) return results ``` 它还能告诉你提取的准确率,很贴心。 > **适合场景**:PDF里有大量复杂表格,对准确率要求高 ## **这四个方法怎么选?** 给你一个简单的对比表: |库名称|文字提取|表格提取|图片提取|特点| | --- | --- | --- | --- | --- | |PyPDF2|基础|不支持|不支持|轻量级,简单好用| |pdfplumber|优秀|优秀|基础|推荐,全能选手| |PyMuPDF|优秀|一般|优秀|图片提取快| |camelot|一般|专业|不支持|表格提取专家| **我的建议**: 如果只要文字:PyPDF2够用了 如果要文字+表格:pdfplumber是首选 如果要图片:PyMuPDF 如果表格复杂:camelot > **终极组合**pdfplumber + PyMuPDF,文字、表格、图片全覆盖 --- ## **写在最后** Python处理PDF确实强大。 选对库,事半功倍。 希望这4个方法能帮到你。 如果有其他问题,评论区聊聊~ 💬 你平时用Python处理PDF遇到过什么坑?欢迎分享! 如果这篇文章对你有帮助,点个**在看**让更多人看到吧 **“无他,惟手熟尔”!**有需要的用起来!

资源下载

更多资源
腾讯云软件源

腾讯云软件源

为解决软件依赖安装时官方源访问速度慢的问题,腾讯云为一些软件搭建了缓存服务。您可以通过使用腾讯云软件源站来提升依赖包的安装速度。为了方便用户自由搭建服务架构,目前腾讯云软件源站支持公网访问和内网访问。

Nacos

Nacos

Nacos /nɑ:kəʊs/ 是 Dynamic Naming and Configuration Service 的首字母简称,一个易于构建 AI Agent 应用的动态服务发现、配置管理和AI智能体管理平台。Nacos 致力于帮助您发现、配置和管理微服务及AI智能体应用。Nacos 提供了一组简单易用的特性集,帮助您快速实现动态服务发现、服务配置、服务元数据、流量管理。Nacos 帮助您更敏捷和容易地构建、交付和管理微服务平台。

Rocky Linux

Rocky Linux

Rocky Linux(中文名:洛基)是由Gregory Kurtzer于2020年12月发起的企业级Linux发行版,作为CentOS稳定版停止维护后与RHEL(Red Hat Enterprise Linux)完全兼容的开源替代方案,由社区拥有并管理,支持x86_64、aarch64等架构。其通过重新编译RHEL源代码提供长期稳定性,采用模块化包装和SELinux安全架构,默认包含GNOME桌面环境及XFS文件系统,支持十年生命周期更新。

Sublime Text

Sublime Text

Sublime Text具有漂亮的用户界面和强大的功能,例如代码缩略图,Python的插件,代码段等。还可自定义键绑定,菜单和工具栏。Sublime Text 的主要功能包括:拼写检查,书签,完整的 Python API , Goto 功能,即时项目切换,多选择,多窗口等等。Sublime Text 是一个跨平台的编辑器,同时支持Windows、Linux、Mac OS X等操作系统。

用户登录
用户注册