基础入门

什么是图片翻译?和只「看懂图上的字」有什么不同

图片翻译的产出是一张替换了文字的新图,不是一段摘录。本文只讲定义、内部五步,以及哪些图不适合走这条路。

阅读约 5 分钟
图片中的文字被检出后写回原图的示意图
直接回答

图片翻译会定位图上的字、译成目标语言,再画回原位置,得到可直接使用的译图。只要摘文字,用 OCR;只要自己看懂,用手机镜头翻译即可。

搜索「图片翻译」时,结果经常混着三件事:抄出文字、当场看懂、以及换一张能上架的图。LibImg 做的是第三件。

图片翻译的交付物是译图。OCR 的交付物是文本。

一次翻译在后台走完哪五步

经典模式 为例,不是把整张图丢进聊天机器人,而是按区域处理:

  1. 检测文字框:包装说明、气泡、标题各占一块。
  2. OCR 读出框内原文,源语言可自动判断。
  3. 译成你选的目标语言。
  4. 擦掉原文像素,并尽量补上被字挡住的背景。
  5. 按对齐、描边、溢出策略把译文画回去。

所以看结果时,句子通顺只是第一项。字有没有出框、背景有没有破洞、笔画粗细还像不像原来的设计,都算质量。

什么时候不该用图片翻译

  • 你只要复制文字:走 OCR
  • 你站在路牌前面,只想立刻读懂:手机镜头更快。
  • 图上的字是构图本身(大幅艺术字、拟声词图形):译完可能毁画面。
  • 需要对外负责的合同、药品、安全警告:译图只能辅助阅读。

电商主图、漫画页怎么设参数,分别写在 产品图漫画,这里不重复。三种工具怎么选,见 对比

看界面怎么点

操作步骤在教程里,不在这篇概念文里。

常见问题

图片翻译最后给我的是什么?
一张新图片。原文被擦掉,译文按原来的位置写回去,分辨率尽量保持。
为什么有的图译完会破版?
中英日韩句子长度差很大。回填时若不能换行、扩框或缩小字号,字就会挤出原来的区域。
哪些图几乎译不好?
反光、遮挡、极度变形的艺术字,以及字和背景糊成一团的照片。合同扫描件也不该用译图代替正式译文。

继续阅读