截图里的字不用手敲了,Umi-OCR 全程离线都能识别
看到一张图片里有段文字想用,多数人的路径还是:截图、发到某个在线识别网站、等结果、复制回来——图片上传给了谁不知道,网一断就抓瞎。Umi-OCR 是开发者 hiroi-sora 出品的开源文字识别工具(MIT 协议),基于 PaddleOCR 引擎做成了顺手的全能桌面软件:识别全程在本机离线完成,图片不出电脑,没有网络也能用。软件界面就是中文,Windows 用户下载即用,也有便携版可进 U 盘。
它能做什么
- 截图识别:全局热键一按,屏幕上框选一块,文字结果立刻弹出来,可以编辑、复制、逐行处理——截图片段取字是它最高频的用法。
- 批量识别:整个文件夹的图片拖进去排队识别,结果合并导出为文本文件,几百张扫描件也能挂机跑完。
- PDF 识别:扫描版 PDF 直接转文字,提供忽略排版和保留段落两种模式,按材料类型选着用。
- 二维码:图片里的二维码能识别,也能反过来生成二维码。
- 多语言:默认中文开箱即用,其他语言包按需下载后同样离线运行。
- 结果可编辑:识别结果不是只读的,标点、换行可以手动修完再复制,省得粘到别处再改。
- 纯本地运行:不联网、不注册、不传图,合同截图、内部文档这类敏感材料也能放心往里放。
怎么获取
到 GitHub 官方仓库 hiroi-sora/Umi-OCR 的 Releases 页下载安装版或便携版压缩包,解压即用;仓库主页也挂了官网入口。开源协议 MIT,源代码公开可查。认准官方仓库下载,识别工具类软件在下载站被捆绑安装包是常事。
上手怎么用
- 先把热键设顺手:默认的截图热键如果和别的软件冲突,第一天就换掉,用得顺的截图识别全靠肌肉记忆。
- 贴图取字用全局热键:任何窗口前台,热键框选,两秒出字,比聊天窗口里「图片转文字」的小程序快得多。
- 扫描件走批量:一沓拍照的纸质材料按文件夹丢进去,睡前挂机,早上收一份合并文本。
- PDF 按内容选模式:纯文字扫描选保留段落,表格混杂的选忽略排版,先小样试两页再批量。
- 敏感材料放心离线:合同、证件、内部文件不出本机,这是它相对在线工具最实在的优势。
适合谁用
经常从图片、扫描件、视频画面里取字的办公族;整理大量纸质材料电子化的行政和档案岗;处理合同等敏感材料、坚决不让图片上云的合规敏感团队;还有网络环境不稳定、需要随时随地都能识别的出差人群。开源免费、离线可用的特性让它几乎没有上手门槛,装上就是一个随叫随到的取字小工具。
需要说明:识别精度取决于内置引擎对场景的适应,艺术字、严重倾斜、低分辨率的图片仍需人工校对;批量跑大 PDF 时 CPU 占用不低,挂机跑更合适;具体功能以官方仓库当前版本说明为准。