图片和 PDF 里的字别再手敲,文字提取技能连表格一起搬出来
「PDF和图片文字提取」(pdf-image-text-extractor)是 SkillHub 办公效率类的社区技能,能力来自 RedFoxHub(红狐),累计下载超过 17 万次、星标 183,版本持续迭代。它把「从图片和 PDF 里弄出可编辑文字」这件事做成了 AI 助手的技能:截图、扫描件、报表 PDF 丢进去,出来的是排好结构的文本和表格,而不是一串需要二次整理的乱字符。
它能做什么
- 七种图片格式通吃:PNG、JPG、JPEG、GIF、WebP、BMP、TIFF 全部支持,识别后保留原有排版结构
- PDF 双模式:文字版直接提取、保留段落和标题层级;扫描版自动检测(文字层稀少的页面)并渲染成高清图片,交给 AI 视觉识别——不需要安装任何传统 OCR 引擎
- 表格结构化提取:内置方案直接把 PDF 里的表格转成 Markdown 表格,报表数据可以直接进文档或让 AI 继续分析
- 批量目录处理:整个文件夹的 PDF 加图片混合着来,一次跑完输出合并报告,附成功失败统计
- 关键数字两轮校验:手机号、订单号、金额这类数字串会做第二轮聚焦识别,按字符形状特征交叉验证,两轮不一致的直接标注待确认,而不是悄悄给个错的
- 依赖极轻:整个技能只需要两个 Python 包就能跑,不用装 OCR 引擎和表格库
怎么获取
官方渠道:在 SkillHub 技能市场搜「PDF和图片文字提取」安装,按技能内引导配置依赖。按出品方说明,使用前需在红狐平台注册领取个人 API Key 以获取使用权限,Key 领取与使用本身不产生积分扣费,具体以官方页面为准。
上手怎么用
- 扫描版合同先跑标准模式,它会告诉你哪几页是扫描页并已转图片识别,全文直接变可编辑文本
- 只要表格不要正文,看结果里的表格汇总段,单独复制走
- 拍照笔记、白板照片、快递单截图攒一个文件夹,批量模式一次性转成 Markdown 归档
- 提取出的文本接着让 AI 做摘要、翻译或录入台账,一条链走完
适合谁用
经常处理扫描合同、纸质单据、报表 PDF 的行政、财务、运营岗,以及做资料数字化的中小企业。贵州诚鑫致达科技在整理客户交付文档和项目资料时,扫描件转可编辑文本是高频需求,这类技能把「识别—校验—结构化」整条链固定成了流程,比零散调用工具可靠得多。
注意
加密或带密码的 PDF 不支持;合并单元格、嵌套的复杂表格识别效果可能打折扣;单文件建议在 50MB 以内,单批建议不超过 100 个文件;关键数字串以两轮识别一致的结果为准,标注了待确认的一定要人工复核后再用。