Real-ESRGAN:开源超分辨率放大,细节是猜出来的

2026-08-25
Real-ESRGAN 又称 Real-ESRGAN、ESRGAN、超分辨率、AI 图像放大、AI 无损放大
分类
图像处理
平台
Windows、macOS、Linux
许可证
BSD-3-Clause
许可证说明
主仓库 xinntao/Real-ESRGAN 为 BSD-3-Clause;官方另维护的 NCNN 可执行文件仓库 Real-ESRGAN-ncnn-vulkan 为 MIT;人脸修复用到的可选依赖 GFPGAN 为 Apache-2.0。三份许可证均未见非商业限制条款。第三方 GUI 封装(如 Upscayl)各自独立授权,不在上述三份之内,使用前需单独核查。
是否开源
开源
收费模式
免费
适用工序
播控与内容
选型结论:甲方素材分辨率不够时能救场,放大后的细节是模型"猜"出来的而不是原件真实内容;史料、文物、人物肖像这类要求准确性的素材,用之前先想清楚这条边界,别的场合可以放心用。
官方下载
版本 0.3.0 · 发布于 2022-09-20
前往官网下载 ↗

它到底解决什么

Real-ESRGAN 是腾讯 ARC 实验室的研究员做的一个开源图像/视频放大模型,官方仓库简介把它定位成"面向真实世界的通用图像/视频复原实用算法"——在经典 ESRGAN 的基础上,改用纯合成数据训练,专门去对付"现实中真实存在、五花八门的画质问题",而不是只在实验室干净数据上表现好看。

要弄懂它跟展厅里常见的"直接拉伸放大"有什么本质区别,得先分清两件事。把一张 500×500 的图硬拉成 2000×2000,电脑做的事情很朴素:在已有的像素之间插值补点,结果是一张更大但更糊的图,因为原来没有的信息,插值算法变不出来。Real-ESRGAN 走的是另一条路:它是一个训练过的神经网络,见过海量"清晰图故意做糊、再让模型学着补回来"的样本,学会了"糊图对应的清晰图大概长什么样"这套统计规律。你给它一张糊图,它不是简单地把像素撑大,而是照着学到的规律,把它认为该在那里的边缘、纹理、颗粒感重新画出来。

放大效果确实会比插值好看得多——这也是它被到处引用的原因。但"画出来"这三个字才是本篇要讲透的关键,第五节会展开。

展厅哪道工序会用到它

第一种,甲方给的素材原始分辨率就那么大。 历史照片、企业早年的影像资料、老档案的翻拍件——原件当年就是按胶片或者早期数码设备的分辨率留下来的,没有更高清的版本可要。现在要铺到 4K 屏、拼接墙,甚至几千像素宽的环幕上,直接拉伸就是一片糊。这是最高频的一种需求。

第二种,甲方给的 LOGO、产品图是从网页上抠下来的小图。 品牌墙、展项界面里要用到合作方 Logo 或产品图,甲方那边往往只能提供官网截图这种分辨率的素材,装进大屏边缘发虚,观众近看能看出锯齿。这类图形状规整、边界清晰,是相对更适合处理的一类。

第三种,老视频素材要在大屏播放。 早年拍的活动记录、宣传片母带分辨率不够,要在大屏上循环播放。这条工序风险更高,涉及逐帧处理的额外问题,第五节详细说。

怎么获取,该下哪个包

先说清楚一件容易搞错的事:Real-ESRGAN 是一个模型和一套算法实现,不是一个装完就有图形界面、双击就能用的软件。 官方仓库给的是命令行/Python 工具,这一点必须跟甲方和现场同事说明白,别让人误以为是个像图片查看器一样点点鼠标就行的东西。

官方 README 给出三条路:

  • 在线体验:官方托管的演示页面和 Colab 在线笔记本,不用装任何东西,适合先看效果再决定要不要往下投入,但不适合处理大批量或敏感素材(数据会经过第三方服务器)。
  • NCNN 可执行文件(推荐给不写代码的实施人员):官方另发布了一套用 NCNN + Vulkan 实现的便携版,分 Windows / Linux / macOS 三个包,解压即用,不需要装 CUDA 或 PyTorch 环境,在 Intel、AMD、Nvidia 的独立显卡上都能跑。这是三条路里对现场实施人员最现实的一条——但依然是在命令行/终端里敲参数运行,不是打开就有窗口点按钮的程序,操作步骤见下一节。
  • Python 脚本:功能最全(支持任意倍率输出、人脸修复等选项),但要先装 Python 环境和一堆依赖包,这部分建议交给团队里懂开发环境的人处理,不建议售前或现场人员自己摸索。

还有一条路值得知道:README 里"使用本项目的项目"一节挂了好几个第三方做的图形界面封装,其中 Upscayl 是目前用户量比较大的一个开源桌面 GUI,装完打开就是普通软件的样子,能省掉命令行这一步。但要注意,这类第三方封装是独立项目、独立授权(Upscayl 用的是 AGPL-3.0,跟 Real-ESRGAN 本身的 BSD-3-Clause 不是一回事),选型和采购报备时要按它自己的条款单独核查,不能直接套用 Real-ESRGAN 的授权结论。

授权本身这块可以放心:核实过官方仓库、官方 NCNN 可执行文件仓库、可选依赖 GFPGAN 这三份 LICENSE 原文,分别是 BSD-3-Clause、MIT、Apache-2.0,三份都没有看到"仅限非商业使用"一类的限制条款。也就是说,用官方这三样东西本身不存在商用障碍;真正需要单独把关的是各个第三方 GUI 封装各自的授权,装哪个用哪个的条款,别混着套。

最短可用路径

以最贴近现场实施人员的 NCNN 可执行文件为例:

  1. 到官方仓库的 Releases 页,按现场机器的系统下载对应的压缩包(Windows / Linux / macOS 三选一),解压到任意目录。压缩包里是一个可执行文件加一个装模型的文件夹,不需要安装步骤。
  2. 打开命令行/终端,切到解压出来的目录里。
  3. 敲一条类似这样的命令:指定输入文件、输出文件、要用哪个模型、放大几倍。压缩包自带的说明文件里列了每个参数的写法,照着抄改路径和文件名就行。
  4. 官方随包提供了几种模型可选,默认是面向普通照片的通用模型;此外还有专门给二次元插画用的、给动漫视频用的、以及一个更轻量但降噪能力弱一些的小模型,具体该选哪个模型,看第五节"什么素材适合"那一段。
  5. 命令跑完,输出目录里会出现一张(或一批)尺寸变大、看起来更清晰的图。这就是成功的标志。跑的过程中终端会打印进度,卡住不动通常是这台机器没有能跑得动的独立显卡,参考第五节的硬件判断方法。

Python 脚本那条路径多两步:先装好 Python 与依赖包,再用命令行跑推理脚本;额外能开启"人脸修复"这个开关,把图里的真人脸单独再修一遍——但这个开关有明确的适用范围限制,第五节会说。

展厅工程里真正要弄明白的那几件事

这一节是全篇最该记住的部分,读完至少要能跟同事和甲方讲清楚下面几条,尤其是第一条。

它是"猜"出来的细节,不是"恢复"出来的

回到第一节的机制说明:Real-ESRGAN 是一个训练过的神经网络,靠"见过很多糊图和对应清晰图的样本"学会了一套统计规律,然后照着这套规律把糊图里缺失的细节补出来。这里的关键是——一张照片原始分辨率不够,意味着当年拍摄或压缩的时候,那些更细的纹理、更清楚的边缘信息就已经永久丢失了,任何算法都不可能把丢失的信息真的"找回来"。 Real-ESRGAN 干的不是考古式的复原,而是根据"这一类图糊了大概率是因为缺了这样的细节"这套统计经验,重新生成一份看起来合理、但不保证与原件真实内容一致的画面。

放到实际操作里,这意味着:处理前那张脸上模糊的一小块,处理后可能变成了一道清晰的皱纹——这道皱纹是模型认为"这个位置大概率长这样",不代表原件上真的有这道皱纹。多数场合这种"猜"是无害的,甚至是加分的(观众根本不知道也不关心这个像素级细节从哪来),但放到下面这条场景里,就不是无害的了。

展厅里的史实红线

历史照片、文物影像、人物肖像、有考据要求的档案资料,用超分辨率处理是有真实风险的。你把一张模糊的老照片"修清楚"了,修出来的字迹、纹样、面部细节可能根本不是原件的样子。放进博物馆、纪念馆、党史馆一类对内容准确性有严格要求的展项里,这不只是一个技术瑕疵,而是史实准确性问题——观众会把大屏上"清晰"的画面当成历史真实记录来看待,一旦细节经不起考据推敲,追责的方向是"内容失实"而不是"图片模糊",性质完全不一样。这类展厅的内容审核尺度,可以看纪念馆解决方案博物馆解决方案里对内容准确性的要求。

要不要告知甲方,这里给个明确判断:处理过的史料类素材应当告知甲方"使用了 AI 超分辨率处理",重要场合(如纪念馆核心展项、需要专家评审的文物影像)建议保留原始素材留档对照。 这不是画蛇添足,是给项目留一道证据链——将来有人质疑某个细节的真实性,你能拿出"处理前是这样、经过 AI 放大处理"的书面说明,而不是被动地被问"这照片怎么跟档案馆的原件不一样"。氛围渲染类的素材(比如展厅背景墙上装饰性使用的老照片,不涉及具体史实陈述)风险要低得多,可以正常使用。

硬件够不够用,怎么判断

官方没有给出具体的显卡型号或显存数字要求,这里给一个不依赖具体配置的判断方法:NCNN 可执行文件基于 Vulkan,能在 Intel、AMD、Nvidia 的独立显卡上跑,机器上如果平时能剪辑视频、跑得动大型三维软件或者游戏,大概率能处理;纯办公用的迷你主机、老旧工控机没有独立显卡,也能跑,但会明显慢,处理一张图可能要等上一段时间,批量处理一整批素材前,先拿一两张图实测一下耗时,再决定要不要连夜跑一批。

官方 FAQ 里也印证了这一点:Python 脚本默认用半精度(一种更省显存、跑得更快的计算方式)做推理,但 CPU 模式不支持这种半精度运算,会直接报错,需要额外加一个参数切回全精度——这本身就是一个信号,说明这条路径是照着"有独立显卡"设计的,CPU 硬跑属于"能跑但明显不是为它优化的"状态。

什么素材适合,什么素材不适合

官方模型库明确分成两条产品线:一套面向通用真实照片,一套专门针对二次元/插画做过优化,还有给动漫视频单独训练的小模型。官方自己把这两类图分开对待,说明它们的画面特征差异大到需要用不同模型处理——拿通用模型处理动漫图,或者反过来,效果都会明显打折扣。选型时先看素材是真实照片类还是插画类,再挑对应模型。

文字、界面截图这类以文字笔画为主的素材要格外小心。官方训练数据针对的是自然图像和插画的纹理、边缘特征,不是文字笔画的规则结构,拿去处理容易把清晰的笔画"脑补"成扭曲变形的纹理——说明书扫描件、图表类素材、带大段文字的宣传物料,不建议用它处理。

人脸修复是个可选开关,能力上专门针对真人面部做二次修复,但官方 FAQ 说得很直接:这个功能只认真实人脸,明确不建议在二次元图像或动画视频上使用,用错了脸会变形,还会白白多耗一份显卡资源。

视频超分的额外问题

官方给的视频处理路子是三步:先用视频处理工具把视频拆成一张张单独的画面帧,再对每一帧分别跑一遍图像放大模型,最后把处理完的帧重新拼回一条视频。这里有一个工程判断,官方文档没有直接写明,但从这套"拆帧—单张处理—拼回"的流程能推出来:模型处理每一帧的时候,是把它当成一张孤立的静态图片来"猜"细节的,帧与帧之间没有强制保持一致的机制。 理论上,两帧内容非常接近的画面,模型生成出来的细节可能存在细微差异,连续播放时看起来像是背景纹理在轻微跳动或闪烁,纹理密集的画面(比如砖墙、草地、密集人群)更容易出现这种情况。这不是软件故障,是这套逐帧独立处理方式本身决定的。

批量处理一整条视频之前,先剪一小段几秒钟的片段跑出来实际连续播放看一眼,比处理完整条几分钟的视频再发现闪烁问题划算得多——返工成本差得不是一星半点。

踩坑与排错清单

现象 原因 处置
放大后画面像被"抹了一层油",细节糊成一片涂抹感 素材类型超出模型训练范围(比如拿它处理文字截图、图表) 换回传统放大方式,或者不用它处理这类素材
Python 脚本在 CPU 上跑报错,提示某个运算不支持半精度 默认用半精度加速推理,CPU 模式不支持 命令里加上切换到全精度的参数
处理二次元/插画图,出来的效果发灰发糊 用错了模型——拿通用照片模型处理插画类素材 换成官方标注的二次元专用模型
开了人脸修复选项处理动漫图或动画视频,脸变形走样 官方明确这个选项只认真实人脸 处理二次元素材时把人脸修复开关关掉
一批史料照片处理完,个别照片的字迹、纹样细节跟旁人回忆或档案记录对不上 模型在"猜"细节,原始信息本就已经丢失,猜测有猜错的可能 涉及史实、考据的素材必须逐张人工核对,原图务必留档
视频放大完连起来播放,个别画面背景纹理有轻微跳动 逐帧独立处理,帧与帧之间没有强制保持一致(工程推断,官方未明说) 先跑几秒钟的测试片段实际看效果,再决定要不要整条处理
处理超大尺寸原图时直接报错或者卡得很久 显卡显存或内存撑不住整图一次性处理 用分块处理参数把大图切成小块分别处理,或者先把过大的原图缩到合理范围
双击可执行文件没反应,或一闪而过 这是命令行工具,不是双击就能用的图形界面程序 在命令行/终端里带参数运行;不想碰命令行就换用第三方 GUI 封装,但要单独核查其授权条款

什么时候别用它

历史照片、文物、人物肖像、有考据要求的档案资料,别拿它当"修复"工具用。 前面已经讲透——它生成的是看起来合理的细节,不是对原件真实内容的还原。这类素材如果确实需要提高清晰度用于展示,应当走专业的文物影像修复流程,由具备相应资质的机构或人员参与,而不是用一个通用生成模型批量处理完就上墙。

对画质有明确验收标准、需要逐像素还原原始信号的场合,别用它。 安防取证影像、医学影像、需要精确复现色彩和线条的印刷出片,验收看的是"跟原始信号一致",Real-ESRGAN 的工作方式恰恰是生成式的"合理但不保证一致",方向就对不上。

现场没有能操作命令行的人,也没打算装第三方 GUI,别指望它"装完就能用"。 官方仓库给的是命令行/Python 工具,这一点前面反复强调过,纯粹指望有个软件图标点开就能处理图片,用官方原生的三条路径都会卡在第一步。

素材以文字、图表、UI 截图为主时,别用它处理。 训练数据面向自然图像和插画,文字笔画容易被处理成扭曲的纹理,得不偿失。

与本站的衔接

补缺可以,越界要慎重

集成商在图形和素材上的定位应该是补缺——能让项目不因一个小图标卡住,但不承接整套设计。越界的代价是承担了本不该承担的修改义务。

企服君在交付规范上建议把「谁做什么」在项目启动时就明确,包括素材交付标准和变更流程。见集成商年费方案

出处

本文所述的功能边界、模型分类与授权条款均来自上述官方材料;文中"逐帧独立处理可能导致轻微闪烁"一条为基于官方处理流程的工程推断,官方文档未直接说明,具体表现请以实际测试为准。展厅工程中的史实准确性判断、内容审核尺度属于工程与内容管理经验,具体项目请结合甲方要求与专业机构意见处理。

做展厅项目,软件授权不必每次重走采购

企服君有九款自研展厅软件。集成商年费一次备好全年额度,接到项目直接激活;已激活项目的授权永久有效。

留言讨论

评论发布后会被人工复核,违规内容将被删除。

    还没有人评论,来说说你的看法

    如果发表没有反应,可以前往联系我们告诉我们。

    这个页面有问题?

    提交时会附带当前页面地址和浏览器信息,帮助我们定位问题。不填联系方式即为匿名。