Comic Translate

Comic Translate

Comic Translate是一款开源的漫画与图像文本翻译软件,由开发者 ogkalu2 在 GitHub 上发布,提供桌面应用与浏览器扩展两种形态。它把计算机视觉、光学字符识别、图像修复与大语言模型翻译组合成一条自动流水线,可处理图片、PDF、EPUB、CBR、CBZ 等格式的漫画,并支持英语、日语、韩语、中文、法语、德语、西班牙语、俄语、意大利语等语言之间的互译。

目录
  1. 定义
  2. 原理
  3. 发展历程
  4. 应用
  5. 局限
  6. 参见

定义

Comic Translate 是一套面向漫画、连环画与条漫的自动翻译工具,项目以开源方式托管在 GitHub 上,同时提供 Windows 与 macOS 桌面程序以及面向 Chromium 内核浏览器的扩展[1]。它既可以处理单张图片,也可以批量处理 PDF、EPUB、CBR、CBZ 等打包格式,把其中的外文对话替换成目标语言后再重新排版回画面之中[1]。

该项目的定位与常见的日漫翻译器有所不同:作者指出,已有的自动翻译工具大多只针对日文漫画,而对其他语种的漫画支持不足,因此该项目的目标是借助 GPT 等前沿大语言模型,处理来自世界各地、语种各异的漫画作品[1]。

原理

Comic Translate 的工作流程被拆分为若干个前后衔接的阶段,依次为文字区域检测、光学字符识别、图像修复、文本翻译与文字重新渲染[2]。检测阶段负责在画面中定位对话气泡与文字块;识别阶段把定位到的区域转换成纯文本;修复阶段擦除原有的文字并重建被遮盖的背景;翻译阶段产出目标语言文本;渲染阶段再把译文按原有版式写回画面[2]。

在具体模型选择上,各阶段会依据语种与质量要求挂接不同的组件。有评测文章提到,识别英文使用 EasyOCR,识别日文使用 manga-ocr,识别韩文使用 Pororo,识别中文使用 PaddleOCR,而法语、德语、西班牙语等语种则较多依赖 GPT-4 直接从图像生成文本[3]。翻译环节同样交给语言模型完成,目的是产出读起来自然、而非逐字直译的译文[3]。文字擦除与背景重建使用 lama 模型完成,使新填入的文字与原有画风相协调[3]。

其中检测环节使用的模型在不同资料中记载不一,有资料称其采用 YOLO 系列模型完成气泡检测与文字分割,也有技术文档记录为 RT-DETR-v2,识别与修复模块则分别可选 MangaOCR、Pororo、PPOCRv5 与 LaMa、AOT-GAN[4][5]。

发展历程

项目由开发者 ogkalu2 创建,公开仓库显示其持续开发时间已超过 2 年,主要使用 Python 编写,累计获得的收藏数在 2900 以上,并被派生 300 余次[4][6]。

早期版本以从源码运行为主要使用方式,需要安装 Python 3.10 或更低版本、克隆仓库并自行安装依赖[3]。后续版本改用 Python 3.12 与 uv 包管理器管理依赖,并提供了 Windows、macOS 桌面安装包和浏览器扩展[1]。v2.0 版本引入了手动模式,允许在自动流程出错时撤销画面并手动修正[1]。

仓库说明中提到,随着版本演进,界面、批处理能力与项目文件格式也在调整,出现了基于 SQLite 的项目文件用于保存图像、文本块与设置[2]。项目在介绍中列出了若干使用 GPT-4 翻译的漫画样张,包括《西游记》《葬送的芙莉莲》等作品[1]。

应用

该工具的主要用途是让读者越过语言障碍阅读尚未有官方译本的海外漫画,涵盖日式漫画、韩式条漫、美式漫画以及欧洲连环画等多种类型[1]。它支持译入与译出的语种包括英语、韩语、日语、简体中文、繁体中文、法语、俄语、德语、荷兰语、西班牙语和意大利语,另外还支持译入土耳其语、波兰语、葡萄牙语与巴西葡萄牙语[1]。

在使用方式上,桌面程序可导入图片、PDF、EPUB、CBR 与 CBZ 等文件进行整章批处理;浏览器扩展则可在漫画阅读网站上直接对页面内容发起翻译[1]。此外,程序中设有手动模式,用户可以对检测框、识别文本与排版样式进行修改后再导出结果[5]。

局限

项目的高级功能依赖外部接口密钥。使用 GPT-4o 等模型进行翻译、以及调用云端 OCR 服务都需要自行配置 API 密钥并承担费用,有资料给出的价格约为每页 0.01 美元[1][3]。若使用本地开源识别模型,则不需要这部分支出,但识别与修复的精度会受到模型本身能力的限制[3]。

运行环境方面也存在若干前置条件:处理 CBR 格式需要系统安装 WinRAR、7-Zip 等解压工具并写入 PATH,否则程序会报错;带 GPU 加速的运行方式在当前版本中仅支持从源码启动[1]。渲染环节要求所选字体覆盖目标语言的字符集,若字体不含相应字形就无法正确显示译[1]。

自动流程本身并不保证成功。仓库提示,在未检测到文字、识别结果有误或背景清理不充分等情况下,需要切换到手动模式进行修正[1]。也有评测指出,此类工具的使用会牵涉到著作权以及人工译者角色的问题[3]。

参见

  • 光学字符识别 —— Comic Translate 提取画面文字的必经环节

  • 计算机视觉 —— 气泡与文字区域检测所依托的技术领域

  • 大语言模型 —— 承担译文生成任务的核心组件

  • 图像修复 —— 擦除原文并重建漫画背景所用的处理技术

  • 机器翻译 —— 该工具所属的更广泛技术范畴

  • PySide6 —— 桌面应用界面所采用的图形界面框架

参考资料

  1. comic-translate . github.com [引用日期2026-10-08]
  2. ogkalu2/comic-translate | DeepWiki . deepwiki.com [引用日期2026-10-08]
  3. comic-translate-automatically-translate-comics-manga . korben.info [引用日期2026-10-08]
  4. comic-translate by ogkalu2 . sourcepulse.org [引用日期2026-10-08]
  5. Getting Started | ogkalu2/comic-translate | DeepWiki . deepwiki.com [引用日期2026-10-08]
  6. ogkalu2-comic-translate . olud.ai [引用日期2026-10-08]
词条评价
词条统计

浏览次数:3 次

阅读量:0 次 · 阅读完成量:0 次

最近更新:2026-10-08T12:36:15Z

历史版本

完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。

本条目引用的词条
光学字符识别 计算机视觉 大语言模型 图像修复 机器翻译 PySide6
红色的还不存在。红链不是错误——它标出"这个概念被引用了但还没人写"。