PDF和图片文字提取 / pdf-image-text-extractor
简介
上传图片或 PDF,自动识别并提取其中的文字内容;支持扫描版 PDF 识别、表格结构化提取与批量目录处理,保留原文结构与排版,输出清晰易读的结果。
核心价值
- 即传即识:上传图片或 PDF,无需额外操作,自动完成文字识别与提取。
- 零额外依赖:扫描识别与表格提取无需安装任何 OCR 引擎或表格库,开箱即用。
- 格式保留:尽量保持原文的段落结构、标题层级,提取结果可直接使用。
- 完全免费:仅需免费申请 API Key 用于权限校验,不扣积分。
适用对象
- 📄 办公人员 — 快速从扫描件、合同、报告中提取文字,告别逐字手打。
- 📊 财务 / 运营 — 一键把 PDF 里的表格提取成 Markdown,直接粘贴使用。
- 📚 学生 / 研究者 — 从文献 PDF 中提取内容,方便整理笔记与引用。
- ✍️ 内容创作者 — 从图片素材中获取文字参考,提升创作效率。
功能特性
核心功能
- 图片文字提取:上传图片即可识别其中所有文字,包括标题、正文、注释等。
- PDF 文字提取:自动解析 PDF 页面文字,多页文档一次性处理。
- 扫描版 PDF 识别:自动检测无文字层的扫描页,渲染为高清图片后交由 AI 视觉识别,无需安装 OCR 引擎。
- 表格结构化提取:自动识别 PDF 中的表格,输出 Markdown 表格格式,保留行列结构。
- 批量目录处理:传入目录路径,一次性处理其中所有 PDF 与图片文件。
- 结构化输出:结果以清晰的 Markdown 格式呈现,方便复制或导出。
密钥获取与安全说明
- 本技能需要使用环境变量:
REDFOX_API_KEY。 REDFOX_API_KEY由 红狐 hub (https://redfox.hk)提供。- 请前往 红狐 hub 注册账号,获取
REDFOX_API_KEY。 - 配置设备环境变量
REDFOX_API_KEY后使用本技能。 - 在提供密钥前,请先确认密钥来源、可用范围、有效期及是否支持重置/撤销。
- 禁止在代码、提示词、日志或输出文件中硬编码/明文暴露密钥。
使用指南
直接用自然语言描述需求即可,无需记忆命令。
常用说法速查
| 意图 | 示例话术 | 效果 |
|---|---|---|
| 提取图片文字 | 上传图片后说"提取图片里的文字" | 自动识别并输出图片中的所有文字内容 |
| 提取 PDF 文字 | 上传 PDF 后说"把这个 PDF 转文字" | 自动解析所有页面,保留段落结构输出 |
| 扫描版识别 | 上传扫描件后说"识别这份扫描版的文字" | 自动将扫描页渲染为图片并识别出文字 |
| 提取 PDF 表格 | "把这份 PDF 里的表格提取出来" | 输出结构化 Markdown 表格,可直接粘贴 |
| 批量处理 | "提取这个文件夹里所有文件的文字" | 一次性处理目录下全部 PDF 与图片 |
| 保存提取结果 | "把提取结果保存下来" | 生成 Markdown 文件,方便后续使用 |
输出示例
提取完成后,你将看到类似以下格式的内容:
## 页面 1
所有经历的纠缠
还有难过的遗憾
都不可能没有意义
---
## 页面 2
| 产品 | 数量 | 营收 |
| --- | --- | --- |
| Alpha | 1200 | 36000 |
| Beta | 860 | 25800 |
PDF 多页文档以 --- 分隔不同页面;表格以标准 Markdown 表格输出。
使用场景
| 场景 | 角色 | 示例问法 | 收益 |
|---|---|---|---|
| 文档数字化 | 办公人员 | "把这份合同 PDF 转成文字" | 告别逐字手打,快速完成文档电子化 |
| 扫描件识别 | 办公 / 档案 | "识别这份扫描件里的文字" | 无需安装 OCR 软件,AI 直接识别 |
| 表格提取 | 财务 / 运营 | "把这份报表 PDF 的表格抽出来" | 直接得到 Markdown 表格,便于二次处理 |
| 资料归档 | 个人用户 | "提取这个文件夹里所有文件的文字" | 整目录一次处理,省时省力 |
| 文献整理 | 学生 / 研究者 | "提取这篇论文 PDF 的内容" | 方便做笔记、引用和检索 |