免费本地 OCR · 21 种语言 · 支持混排 · 不上传
图片转 Markdown(OCR 文字识别)
这是一个图片转 Markdown 的在线工具:把印刷文字的照片或截图变成 Markdown,而且不上传图片。OCR 引擎在你的浏览器里运行,支持 21 种语言,也能处理混排的页面——先选页面的主要语言,需要的话再加第二种;韩语、俄语等语言包单独使用时无法正确识别英文单词,工具会自动把英文包一并加载。图片始终留在你的设备上,引擎和语言包缓存之后,离线也能继续用。
图片 → Markdown
选一张印刷文字的图片
选一张浏览器能读取的照片或截图,拖到这里,或用 Ctrl+V / ⌘V 粘贴。LensUp 不会上传它。
只识别印刷体。一页可以有两种语言:选主要语言,再加第二种,需要英文辅助的文字会自动加上英文。带框线的表格变成 Markdown 表格;手写体、无框线表格、公式和多栏排版只能尽力而为——使用前请核对。
Pro 会把整张图片经 LensUp 服务器发送一次给 Mathpix——专门识别公式和表格的商业引擎——并用它的结果替换这里的 Markdown(公式写成 $…$)。LensUp 不会保存图片;Mathpix 按其自身条款处理。每次修复消耗 1 次;50 次 4.99 美元,一次性购买,没有订阅。
图片转 Markdown 怎么做?
打开图片转 Markdown 工具,选一张印刷文字的照片或截图,确认文字的语言,点「开始识别」。LensUp 在你的设备上完成 OCR——页面混合两种语言时,可以再添加第二种语言,选择韩语、俄语、阿拉伯语等语言时,会自动同时加载英文语言包——段落、项目符号和编号列表会整理成 Markdown 结构,识别结果可以直接修改、复制,或下载成 .md 文件。图片全程不上传。
适合那些你想留成笔记、而不是留成图片的文字:书页、讲义、投影出来的幻灯片、写得工整的白板总结、印刷的菜谱、产品标签、表单,或者海报上的一段话。识别出来的是可编辑的 Markdown,可以直接贴进 Obsidian、Notion、GitHub issue 或任何纯文本笔记里。
它有意把能力范围收窄:只识别印刷体文字,先识别你选择的主要语言,也可以再添加一种语言;能看出来的结构——段落、项目符号列表、编号列表、较大的标题、带框线的表格——会保留成 Markdown;多栏排版、手写体和数学公式只能尽力而为,需要你逐行核对。图片转markdown、图片转md、照片转 Markdown、截图转 Markdown、JPG 转 Markdown、图片文字识别:说法不同,做的是同一件事,结果永远是一份你先检查、再使用的 Markdown。
图片转 Markdown 的步骤
- 选一张图片选一张印刷文字的照片或截图,拖到工具区,或者直接用 Ctrl+V / ⌘V 从剪贴板粘贴。JPG、PNG、WebP、iPhone 的 HEIC 和 TIFF 都在本地读取,页面会显示图片和尺寸,什么都不会上传。
- 确认语言,开始识别确认页面上印的是哪种语言(菜单会按本页语言预选),页面混排时再加一种,然后点「开始识别」。第一次使用会下载 OCR 引擎(约 1.5 MB)和所需的语言包(每个 0.4–3 MB),之后都有缓存;识别在你的设备上进行,带进度条。
- 检查、复制或下载Markdown 会出现在图片旁边的编辑框里,附带字数和平均置信度。把识别错的地方改一改,然后复制到剪贴板,或者下载成 .md 文件。
哪些会变成 Markdown,哪些不会
每个印刷段落变成一个 Markdown 段落:段内换行会合并,行尾的连字符断词会拼回去;中文、日文、泰文按字符计数,行与行之间不插空格。以项目符号开头的行变成无序列表;以 1.、2.、3.,或以“一、二、三”“1、2、3”开头的行变成有序列表;单独一行、明显比正文大或者全是大写的短句,变成二级标题。其余内容按阅读顺序保留为普通文本。
带框线的表格会变成 Markdown 表格:识别前先把格线擦掉,每一行印刷内容成为一行,各行共有的空隙成为列;因此合并单元格和没有框线的表格会变成一行行文本。数学公式不识别——分数、上标和符号会乱掉;双栏排版可能交错;手写体、装饰字体、很小的字和复杂底纹上的文字识别效果差或者被跳过。数字、姓名和编号值得再看一遍,那里错一个字比正文里错一个字要紧得多。结果下方的平均置信度是引擎自己的估计,不是保证。
手机拍照怎么拍得好识别
OCR 最喜欢平整、清晰、光线均匀、正对着拍的文字,清晰度大致相当于 300 dpi 的扫描件。让文字撑满画面,避开阴影和反光,等对焦稳了再按快门。特别大的照片会先缩到长边 2600 像素再识别,普通书页和文档的文字依然清楚,还省内存和时间。
如果页面歪了或者有阴影,先用 LensUp 的扫描工具处理一遍:透视矫正加去阴影能得到一张平整、高对比度的页面,从扫描工具下载的 JPG 或 PNG 拿到这里识别效果很好。截图也可以直接识别,通常是最省事的情况。
本地引擎不够用时:用 Pro 修复
免费路径背后的开源引擎 Tesseract 不认识数学公式,遇到没有框线的表格或合并单元格也会吃力。对这类页面,结果区可以提供「用 Pro 修复」——这是站点开通支付后才会出现的付费选项:整张图片经 LensUp 服务器发送一次给 Mathpix(专门做公式和表格的商业识别引擎),用它返回的 Markdown 替换本地结果,公式以美元符号包裹的 LaTeX 呈现,表格是 Markdown 表格。LensUp 在传输过程中不保存任何内容(Mathpix 按其自身条款处理),本地结果随时一键恢复。
Pro 按次付费,正是为了让免费路径永远免费、永远本地:使用 Pro 时,通过邮箱链接登录(无需密码),一次性购买 50 次(4.99 美元),每次 Pro 识别用掉一次。识别在服务商那边失败的话,不扣次数。
多语言混排,在设备上完成,有意为之
页面提供 21 种语言:英语、法语、德语、西班牙语、葡萄牙语、意大利语、波兰语、土耳其语、印尼语、越南语、中文(简体和繁体)、日语、韩语、俄语、阿拉伯语、波斯语、乌尔都语、印地语、孟加拉语和泰语——也就是 LensUp 本身支持的语言。每种语言是一个独立的识别包,选到才下载:一页法文只需要 0.7 MB 的包,一页中文大约 1.7 MB,从不整套下载。选页面上真正印着的语言,混排时再加一种;韩语、俄语、阿拉伯语、波斯语、乌尔都语、印地语、孟加拉语和泰语会自动搭配英文包,因为这些包单独工作时会把英文单词认成长得像的字母。语言选错了会得到碎片而不是 Markdown,状态行会提示,「检测语言」会按文字系统逐个试包找到对的那个——所以混排的页面照样能得到干净的 Markdown。
一切都在本地用开源引擎完成,和 LensUp 处理其他图片的方式一样:不上传、不注册、服务器上没有你的图片和文字的副本。引擎文件和语言包从 lensup.ai 下载并由浏览器缓存,同一种语言第二次识别立刻开始。扫描工具本身依然不含 OCR,也不生成可搜索的 PDF。
常见问题
图片转 Markdown 的时候,图片会离开我的设备吗?
免费路径不会:OCR 引擎和你选的语言包下载到浏览器里,识别在本地进行,照片、识别出的文字和 .md 文件都不会到达 LensUp 的服务器。唯一的例外是需要你明确选择并主动点击的 Pro 功能——当结果区提供「用 Pro 修复」(站点开通支付后才出现的付费选项)时,点它会把整张图片经 LensUp 发给 Mathpix(做公式和表格的商业识别引擎)并拿回 Markdown;LensUp 在传输过程中不保存(Mathpix 按其自身条款处理),需要邮箱登录和付费次数(50 次 4.99 美元,一次性),本地结果可以恢复。
图片转markdown 支持哪些语言?
21 种印刷体语言:英语、法语、德语、西班牙语、葡萄牙语、意大利语、波兰语、土耳其语、印尼语、越南语、中文(简体和繁体)、日语、韩语、俄语、阿拉伯语、波斯语、乌尔都语、印地语、孟加拉语和泰语。一页可以含两种:选主要语言,混排时加第二种;韩语、俄语、阿拉伯语、波斯语、乌尔都语、印地语、孟加拉语和泰语会自动连同英文一起识别,因为这些包单独工作会把英文单词认成长得像的字母。任何语言的手写体都不支持。
为什么有的文字识别错了或者缺了?
先检查语言包是不是选对了:Markdown 下方的提示里有「检测语言」,它会按文字系统各试一个包,留下最好的结果。然后是照片本身:模糊、反光、阴影、歪斜、字太小、装饰字体和花哨的背景都会降低识别质量,表格和多栏页面可能顺序错乱。把照片重新拍平拍清楚,或者先用扫描工具处理,再核对 Markdown 之后使用。