当前市场上最知名的AI图像生成工具,莫过于Midjourney和Stable Diffusion。两者各有鲜明优缺点:Midjourney每月收费30美元,价格不菲;Stable Diffusion则对硬件配置要求较高,操作流程也相对复杂。
今天要介绍的这款开源项目,不仅效果出色,更重要的是大幅降低了AI绘画的门槛。它就是:Fooocus。
Fooocus是什么
Fooocus 是一款基于Gradio构建的图像生成软件。它在设计时重新审视了Stable Diffusion和Midjourney的优缺点,致力于实现高质量的文本到图像转换,同时让操作流程变得极其简单。
具体来说,Fooocus吸收了Stable Diffusion离线、开源、免费的特点,也借鉴了Midjourney无需用户手动调整参数的优势。
它将众多内部优化与质量改进集成并自动化。用户完全可以忘记那些复杂的技术参数,只需专注于提示词与图像之间的交互,去探索新的创作可能。最关键的是,它完全免费,而且对硬件配置要求不高——仅需4GB显存即可运行,比Stable Diffusion的门槛低了不少。
下面是一组在相对低端笔记本上的测试数据:16GB系统内存,6GB显存(Nvidia 3060笔记本)。在这台机器上,每次迭代的速度大约为1.35秒。这个表现相当令人印象深刻——要知道,如今配备3060的笔记本价格已经非常亲民。
对比Midjourney
虽然操作被简化了,但Fooocus的功能并未缩水。两者在功能上的对比如下:
| Midjourney | Fooocus |
| 高质量的文本到图像,无需大量提示工程或参数调整。 | 高质量的文本到图像,无需大量提示工程或参数调整。它内置了基于GPT-2的离线提示处理引擎和大量采样改进,无论你的提示是短至“花园中的房子”,还是长到1000个单词,结果都足够精美。 |
| V1 V2 V3 V4 | 输入图像 -> 高档或变化 -> 变化(微妙)/变化(强) |
| U1 U2 U3 U4 | 输入图像 -> 放大或变化 -> 放大 (1.5x) / 放大 (2x) |
| 修复/上/下/左/右(平移) | 输入图像 -> Inpaint 或 Outpaint -> Inpaint / 上 / 下 / 左 / 右。它使用了自己的修复算法和修复模型,因此结果比所有其他使用标准SDXL修复方法/模型的软件更令人满意。 |
| 图片提示 | 输入图像 -> 图像提示。同样采用了自研的图像提示算法,在结果质量和提示理解上,比标准SDXL方法(如标准IP适配器或修订版)更胜一筹。 |
| –style | Advanced -> Style |
| –stylize | Advanced -> Advanced -> Guidance |
| —niji | 支持Civitai上的SDXL模型(搜索“Civitai”即可找到)。 |
| – 质量 | 高级 -> 质量 |
| – 重复 | 高级 -> 图像编号 |
| 多重提示 (::) | 只需使用多行提示即可。 |
| Prompt重量 | 支持“我是(快乐:1.5)”这种写法。它使用A1111的重新加权算法,如果用户直接从Civitai复制提示,结果会比ComfyUI更好。要使用嵌入,可以用“(embedding:file_name:1.1)”。 |
| – no | 高级 -> 否定提示 |
| –ar | 高级 -> 宽高比 |
| 洞察面 | 输入图像 -> 图像提示 -> 高级 -> FaceSwap |
| 描述 | 输入图像 -> 描述 |
安装 Fooocus
Windows
- 首先,从GitHub的下载链接直接获取Fooocus。
- 下载后解压缩,然后运行“run.bat”。
- 首次运行时,会自动下载模型文件,需要等待一段时间。如果你的电脑已经存有模型文件,可以提前复制到以下路径,启动速度会快很多:
.\Fooocus\models\checkpoints\
Linux
- 克隆Fooocus的GitHub仓库,切换到Fooocus目录,并创建一个新的conda环境:
gitclone
cdFooocus
condaenv create -f environment.yaml
- 激活新创建的conda环境,安装所需的Python包:
condaactivate fooocus
pipinstall -r requirements_versions.txt
- 运行以下命令启动Fooocus:
pythonentry_with_update.py
以下是安装的最低硬件资源需求,可对照自己的平台确认。
使用 Fooocus
下载完成后,会自动打开绘图界面。默认是极简模式,只有一个输入框、生成图片区域和生成按钮。勾选“Advanced”会弹出高级设置窗口,可调整画面宽高比、风格、图像数量、种子值、反向提示词、模型、lora权重、图像锐利程度等。
直接在文本框输入提示词,点击“Generate”按钮即可生成图像。勾选“Advanced”可以进行更多高级设置。生成的图像会自动保存在根目录的 outputs 文件夹内。
Fooocus 根目录的 models 文件夹,很多内容与SD WebUI相似,用于放置checkpoints、lora、Vae等各种模型。如果你有其他基于SDXL 1.0训练的风格化大模型或lora模型,同样可以放入对应文件夹,然后在Fooocus中使用。
再来看一个与DALL-E3、Midjourney对比例子:
Prompt:beautiful landscape with a lake in the foreground, with a dock, and mountains in the background, in the early morning with sunrise and mist on the lake.
Fooocus
DALL-E 3
Midjourney
项目特点
- 离线和开源:Fooocus完全离线运行,无需联网,同时保持开源特性。
- 简化安装和使用:安装过程极简,从下载到生成第一张图片,鼠标点击次数严格控制在3次以内。最小GPU内存需求仅为4GB(Nvidia)。
- 自动化优化:自动化了许多内部优化(包括采样改进等),确保结果始终美观,无论你的提示是简短还是详细。
- 易于使用:界面和提示系统设计得非常友好,用户无需进行繁琐的参数调整,只需关注提示和生成的图像。
总结
总的来说,Fooocus是一个强大的图像生成工具。它生成的图片质量高、细节丰富,完全不输给Midjourney。更重要的是,它把操作简化到了极致,为用户提供了一个既易于上手又功能强大的平台。无论是艺术家、设计师,还是普通爱好者,都可以利用Fooocus来创造出令人惊叹的视觉作品。
