爱意满满的作品展示区。
hankeyyh

做了一个漫画翻译的工具网站,分享下实现思路

  •  
  •   hankeyyh · 6h 14m ago · 461 views

    从很早开始看漫画,一直追的是各种汉化组的翻译。感觉修图嵌字都是辛苦活,最近想看看用 AI 能做到哪一步。调研了一下 github ,开源项目还不少。

    总体来说,翻译步骤一般包括:

    • 文字定位(包括气泡文字+嵌在画面中的文字)
    • OCR
    • 翻译
    • 擦字
    • 重绘

    文字定位感觉是最重要的一步,是否找齐所有文字段,框定的范围是否完整,直接决定后续 OCR 的质量和擦字是否干净。很多文字边缘会有振假名的情况,一开始测试总是会漏掉它们,导致擦字有残留。

    OCR+翻译其实可以用视觉大模型一次完成,不过测试下来感觉成本有些高,所以还是分成两步。

    试用下来效果比较好的模型:

    • 文字检测:YOLOv8-seg 用于气泡检测,RT-DETR-v2 用于气泡外文字定位;

    • OCR:manga-ocr 专门为漫画场景训练的 OCR 模型;

    • 翻译:deepseek 或任何大模型,设定好 prompt 就行;

    • 擦字:气泡有明确边界,所以气泡内直接用 OpenCV 根据阈值来擦。气泡外用 lama_large ;

    • 重绘:不需要模型,根据之前检查得到区域算出安全区,用 skia 画上去;

    目前这个工具主要用于翻译日漫,做了个在线版本: https://mangasense.xyz

    有兴趣可以试试,不用登录。

    ps. 感觉 GPU 成本还是挺高的,用的 A10 ,一天 20 多刀...有类似经验的朋友,能讲讲有什么便宜点的办法吗?

    5 replies  •  2026-09-28 15:52:41 +08:00
    orion1
        1
    orion1  
       6h 6m ago
    挺厉害的,
    但我试了下漫画直接扔给 AI 也能做到把文字翻译过来镶嵌了
    miniliuke
        2
    miniliuke  
       5h 43m ago
    @orion1 是的不追求自动化直接打包发给 gpt 网页就行了...如果没有大模型,是很好的产品,但是被降维打击了,除非成本上面有很大优势
    hankeyyh
        3
    hankeyyh  
    OP
       5h 1m ago
    @orion1 是的,不过我用 gpt 测试发现,大模型返回的图片,一些细节会和原图不同,翻译质量上也差点。估计图片处理的 pipeline 不能很好适配
    laurent
        4
    laurent  
       4h 34m ago
    和开源的 koharu-rs/koharu 有什么优势呢?
    alie123
        5
    alie123  
       3h 47m ago
    腾讯云的 A10 你去找渠道商说不定能拿到 2000 以内的价格,量大的话能到 1500 以下(带宽 5M )
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   3030 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 103ms · UTC 11:40 · PVG 19:40 · LAX 04:40 · JFK 07:40
    ♥ Do have faith in what you're doing.