技术科普
漫画 OCR 引擎横向对比:谁才是真正的「读漫神器」?
更新于 2026-08-01

通用 OCR 为什么读不懂漫画?对比专用引擎在竖排日文、拟声词与气泡检测上的真实表现。
你以为 OCR 就是拍个照、认个字?放到漫画上,这事儿可没那么简单。
如果你用过手机拍照提取文档文字,大概率会觉得 OCR(光学字符识别)已经是个「搞定」的技术了。但一旦把场景换成日文漫画,整个问题的难度就直接上了好几个台阶。
为什么?因为漫画文字跟你平时见到的文档文字完全是两回事:
- 横排竖排混着来:一页漫画里,对白可能是竖排的,旁白可能是横排的,拟声词甚至是斜着飞的。
- 气泡里的多行文本:角色说话被塞在不规则的气泡里,字号忽大忽小,行间距随心所欲。
- 拟声词/拟态词是「画」出来的:那些「ドーン」「ゴゴゴ」根本不是标准字体,手绘感极强,扭曲、拉长、带阴影——传统 OCR 看了直摇头。
- 小字注释堪称地狱难度:页边小字、角色内心独白,有些字号换算下来连 8pt 都不到。
- 背景干扰无处不在:文字叠在画面上,网点和速度线直接穿过文字区域。
所以,「文档 OCR」和「漫画 OCR」本质上是两个问题。拿处理扫描件的思路去啃漫画,结果就是识别率惨不忍睹。
那么,市面上到底有哪些 OCR 引擎能打?各自适合什么场景?今天我们就来一次不讲废话的硬核横向对比。
参赛选手一览
本次对比覆盖 7 款主流/常见 OCR 方案,按类型分为三组:
🌐 云端商用 API
| 引擎 | 一句话定位 |
|---|---|
| Google Vision OCR | Google 出品,文档/手写通吃,开箱即用最稳 |
| Azure Read OCR | 微软 Azure 系,手写体支持出色,可容器部署 |
| AWS Rekognition | AWS 的图片文字识别——但别指望它认日文漫画 |
🛠️ 开源通用引擎
| 引擎 | 一句话定位 |
|---|---|
| PaddleOCR | 百度出品,开源可微调天花板最高,但零调参表现一般 |
| Tesseract | OCR 界老牌开源,竖排日文有特殊支持,但漫画适配差 |
| EasyOCR | 上手最简单的开源 OCR,但不支持真正的日文纵书 |
🎯 漫画专用方案
| 引擎 | 一句话定位 |
|---|---|
| manga-ocr | 专门为日文漫画训练的 OCR,对白气泡的神器 |
核心对比:一张表看懂
下表是综合官方文档、公开基准测试和日文社区实测后得出的工程选型评分(5 分制,5=最强)。注意这是综合评估,不是实验室统一跑分——因为目前压根不存在一套覆盖所有这些引擎的统一漫画测试基准。
| 引擎 | 竖排日文 | 气泡文字 | 手写拟声词 | 小字≤8pt | 开箱即用 | 可定制性 | 综合评分 |
|---|---|---|---|---|---|---|---|
| manga-ocr | 4.4 | 4.6 | 2.0 | 3.5 | 4.2 | 3.0 | 4.3 |
| Google Vision | 4.5 | 4.0 | 3.0 | 4.0 | 4.0 | 1.5 | 4.1 |
| Azure Read | 4.0 | 3.8 | 3.2 | 4.2 | 4.0 | 1.5 | 3.7 |
| PaddleOCR | 3.4 | 3.2 | 2.4 | 3.0 | 3.0 | 5.0 | 3.2 |
| Tesseract | 2.2 | 2.0 | 1.2 | 2.0 | 1.5 | 4.0 | 2.4 |
| EasyOCR | 1.8 | 2.2 | 1.8 | 2.2 | 2.0 | 4.0 | 2.3 |
| AWS Rekognition | 1.0 | 1.8 | 1.0 | 2.0 | 3.0 | 1.0 | 1.7 |
一眼就能看出的结论:
- manga-ocr 和 Google Vision 是第一梯队,前者赢在对白气泡,后者赢在通用稳定性。
- Azure Read 是第三名,各方面都不差,企业合规场景尤其加分。
- PaddleOCR 综合分不高但潜力最大——它的 3.2 是「没训练过的裸分」。一旦针对性微调,天花板远高于所有云 API。
- Tesseract 和 EasyOCR 只能做基线,分别卡在「漫画排版不友好」和「竖排日文根本不支持」上。
- AWS Rekognition 垫底,不是它技术差,而是压根就不是干这个的——官方明确说支持的语种里没有日语。
实测数据:不吹不黑,看真实跑分
下面是公开可查的几组定量测试。注意不同来源的测试集和硬件条件不同,不能直接横向比大小,但趋势非常清晰。
日语手写 Memo 测试(NLS 越高越好,Avg Time 越低越好)
| 引擎 | NLS ↑ | CER ↓ | 平均耗时 |
|---|---|---|---|
| Azure Read | 0.830 | 0.332 | 4.2s |
| Google Vision | 0.820 | 0.509 | 2.2s |
| PaddleOCR(原生) | 0.353 | 0.784 | 12.8s |
这组数据说明什么?在零调参的前提下,云 API 确实强于开源通用引擎。Azure 和 Google 的 NLS(归一化编辑距离相似度,越高越好)都在 0.82 以上,而原生 PaddleOCR 只有 0.353。差距不是一点点。
竖排日文视觉小说样本测试
日文社区开发者 q7z 用同一张竖排日文样本做了定性对比:
- Google Vision:正确率 100%,一个字不差。
- Tesseract:大约一半正确。
- PaddleOCR:大约一半正确。
又是 Google 在竖排日文上的一骑绝尘。
PaddleOCR 微调后的逆袭
但 PaddleOCR 并不是没有翻盘点。公开的 PaddleOCR-VL-For-Manga 项目在 Manga109-s 数据集上做漫画域微调后:
- 整句正确率:从 27% → 70%
- 字符错误率(CER):从 ~89% → ~10%
这就是开源可训练框架的真正价值——底子不差,只要肯喂数据,能直接拉到商业可用水平。
PaddleOCR 官方多场景基准(V100 GPU)
| 模型版本 | 日文识别分 | 竖排文字识别分 |
|---|---|---|
| PP-OCRv5 | 0.7372 | 0.9314 |
| PP-OCRv4 | 0.4623 | 0.5455 |
PP-OCRv5 比 v4 在日文和竖排上都翻了近一倍,进步幅度很大。但 0.7372 的日文分跟云 API 的 0.8+ NLS 仍然有距离——再次印证那句话:不用域数据微调,它就是「还行」;微调之后,它就是「很强」。
逐个深挖:每个引擎的「神」与「坑」
Google Vision OCR —— 开箱即用的王者
神在哪里: 如果你今天就要接漫画翻译流程,而且不想折腾训练,Google Vision 是最稳妥的选择。它的 DOCUMENT_TEXT_DETECTION 接口专门面向密集文本,支持日语自动检测、手写体识别,还能输出 page → block → paragraph → word → symbol 的层级结构。日文社区实测中,竖排样本能做到 100% 正确。
坑在哪里: Cloud Vision 不提供 OCR 引擎本身的微调入口。Google 的可训练路线是 Vertex AI / AutoML 的图像分类,或者 Document AI 的字段抽取——都不是让你重新训练 OCR 识别器。换句话说,Google 是最佳通用服务,不是最佳可塑平台。用久了你会发现天花板就在那里,过不去。
价格参考: 每月前 1,000 单位免费,之后 $1.50/1,000 单位起。
Azure Read OCR —— 企业级靠谱之选
神在哪里: 它是所有云 API 里文档写得最清楚的。官方直接告诉你:在 1024×768 图像上,可提取文本的最小高度约 12 像素(≈150 DPI 下的 8pt)。这条信息对漫画小字比对至关重要——你知道边界在哪。此外支持容器化部署,对企业内网场景非常友好。手写测试中 NLS 0.830,甚至略高于 Google 的 0.820。
坑在哪里: 和 Google 一样,Azure 的「自定义模型」面向的是字段抽取,不是重训 OCR 识别器本身。碰到极端风格化的拟声词和画面覆盖文字,它不会因为「多标几百页」就质变。价格在大批量时才有竞争力。
价格参考: 免费层 5,000 transactions/月。
PaddleOCR —— 开源天花板,但需要你「养」
神在哪里: PaddleOCR 是本次对比里工程可塑性最强的引擎。PP-OCRv5 的管线由方向分类、去畸变、文本行方向分类、检测、识别五个模块组成,每个模块都可以独立微调。对于漫画这种需要把「整页检测」「气泡顺序」「拟声词识别」「小字增强」拆开处理的场景,这种架构比单一黑盒 API 有价值得多。而且它是 Apache-2.0 开源,商用完全免费。
坑在哪里: 原生模型只是「还行」,不是「神」。日语手写测试 NLS 只有 0.353,跟云 API 差距巨大。结论很直白:PaddleOCR 的上限很高,但需要你用漫画域数据去解锁。 如果你不愿意投入数据标注和训练,它打不过 Google 和 Azure。
manga-ocr —— 对白气泡专精,漫画党的白月光
神在哪里: 这是唯一一个为日文漫画而生的 OCR。它原生支持横排、竖排、带振假名、叠图文字、低质量图片,而且一次前向就能识别整个气泡里的多行文字,不需要先把气泡切成单行。被 mokuro 等漫画阅读工具直接采用,社区生态成熟。对台词气泡的识别精度,所有通用引擎都得往后稍一稍。
坑在哪里: 官方自己承认:大概率处理不好真正的手写体,而且长文本下会「脑补」——也就是出现幻觉(hallucination),凭空编造不存在的文字。所以它最适合当「对白分支」,不适合做「全场景总引擎」。拟声词和手写体另找帮手。
Tesseract —— 老牌开源,但你得伺候它
神在哪里: 真·开源、离线、可细调、Apache-2.0。官方提供 jpn_vert 竖排日文语言包,--psm 5 专门对应竖排文本块。而且支持 LSTM 微调,理论上可以自己训。速度飞快,四线程就能跑。
坑在哪里: Tesseract 本质上是个「规则感较强」的文本行识别器,而漫画最麻烦的地方恰恰是文本边界不稳定、背景干扰强、字形风格离散。官方文档提醒:图像倾斜会严重破坏分行,必须先 deskew。日文社区测试中,即使用了 jpn_vert + --psm 5,正确率也只有大约一半。结论:用它做裁剪后、较干净的单块竖排可以,直接吞整页漫画不行。
EasyOCR —— 最好上手的,最不适合漫画
神在哪里: 安装简单,语言覆盖广,Apache-2.0,支持自定义模型训练。做一般 OCR 原型很快。
坑在哪里: 官方的 release note 写得明明白白:所谓的「vertical text support」其实是旋转后的横排文本,不是中日文的真正纵书。这相当于官方自己把漫画 OCR 的第一核心维度给否了。日文社区测试者因为它给出致命误识别,直接放弃深入评估。结论:够用的通用 OCR 库,不是严肃的日文漫画引擎。
AWS Rekognition —— 选错赛道了
不是它差,是它根本就不是干这个的。 Rekognition 的 DetectText 定位是 scene text(场景文字)检测,官方文档列出的支持语言是英语、阿拉伯语、俄语、德语、法语、意大利语、葡萄牙语、西班牙语——没有日语。单图最多 100 个词。拿着 scene text API 去啃日文漫画,本身就是产品选型跑偏了。如果你必须在 AWS 体系内做文档 OCR,正确姿势是去看 Textract,而不是死磕 Rekognition。
场景化推荐:你的情况该选谁
别急着选「最强」,先看看你是哪种情况:
🚀 「我要尽快上线,不想折腾训练」
→ Google Vision OCR
对密集文本支持完整,日语自动检测成熟,社区竖排实测表现极强,单价不高。缺点是后期可塑性差——但「先跑起来」阶段,不折腾反而是优点。
🔧 「我要离线、开源、持续优化识别率」
→ PaddleOCR 作为主干 + 漫画域微调
不建议只用原生 PP-OCRv5。正确做法是把它当可训练骨架,在 Manga109-s、COO 和自己标注的样本上,分「对白」「拟声词」「小字」三类数据,检测和识别拆开调。已有公开项目证明:漫画域微调能把整句正确率从 27% 拉到 70%。
💬 「我主要处理对白气泡,想要本地阅读/翻译体验」
→ manga-ocr
天生适合多行气泡,不需要先切单行,对台词识别精度无敌。搭配 comic-text-detector 做气泡检测,是大批漫画党验证过的最佳本地方案。但要防着它对手写拟声词和长文本的 hallucination。
🏢 「企业环境、容器化部署、合规要求高」
→ Azure Read OCR
公开代理基准不弱,小字号边界有官方说明,容器化部署对企业内网非常友好。可能不是最准的,但工程边界最清楚,企业 IT 最放心。
💰 「极低预算、简单裁剪、离线单块识别」
→ Tesseract(仅做 fallback)
只用于已裁剪、已校正、方向单一的文本块,搭配 jpn_vert + --psm 5 + deskew。不是整页解法,做基线和兜底合适。
❌ 「千万别:把 AWS Rekognition 当日文漫画 OCR 主力」
官方产品边界已经说明它不适合。如果必须在 AWS 体系,请重新评估 Textract 或自建 Paddle/manga-ocr 管线。
工具推荐:好的翻译工具,OCR 只是第一步
如果你不想自己折腾 OCR 选型和管线搭建,市面上也有不少直接可用的漫画翻译工具。在选择工具时,可以留意它底层用了什么 OCR 引擎——这直接影响翻译质量的天花板。
以 AI Manga Translator 为例,这类工具的价值在于把 OCR 识别 → 翻译 → 气泡还原 串成了一条完整流水线。你不需要自己纠结该用 Google 还是 manga-ocr,也不需要手写气泡分割和文字回填,上传漫画页面就能拿到保留原始版式的翻译结果。新用户有 10 credits 免费试用,可以作为体验漫画 AI 翻译的起点。
当然,无论选什么工具,了解背后的技术原理总是有用的——至少下次别人跟你聊「OCR 选型」时,你可以拍出上面那张表:「这张图的含金量,懂的都懂。」
写在最后
回到最核心的问题:漫画 OCR 应该怎么选?
答案是——没有万能引擎,只有对的组合。
- 对白气泡 → manga-ocr
- 整页通用 & 快速上线 → Google Vision
- 企业合规 & 容器化 → Azure Read
- 长期自建能力 → PaddleOCR + 域微调
- 廉价基线/fallback → Tesseract
- 千万别碰 → AWS Rekognition(用于日文漫画)
漫画 OCR 的难点不在于「哪个引擎名气大」,而在于「哪个引擎在你最关心的维度上不掉链子」。竖排、气泡、拟声词、小字——把这四个坑踩明白了,你的漫画翻译管线就差不到哪去。
本文技术对比数据综合自各引擎官方文档、公开基准测试(nyosegawa/ocr-comparison)、日文技术社区实测(q7z、Zenn)及 Manga109-s 相关研究。