Stable Diffusion WebUI:开源 AI 绘画的起点

AUTOMATIC1111/stable-diffusion-webui 是目前使用最广泛的 Stable Diffusion 图形界面工具,Star 数超过 16 万。

正文顶部截图

这个项目基于 Gradio 构建,提供了完整的 Web 界面,用户不用写代码就能完成从文本生成图片、图片生成图片、局部重绘等操作。安装过程也做了简化,运行一个脚本就能启动。

README区域截图

核心功能

WebUI 支持 txt2img(文生图)和 img2img(图生图)两种基本模式。在此基础上,还提供 Outpainting(画面扩展)、Inpainting(局部重绘)、Color Sketch 等进阶操作。

Prompt Matrix 功能允许把多个提示词拆解组合,一次性生成多张不同配置的图片,方便对比效果。X/Y/Z Plot 能绘制三维参数对比图,直观展示不同参数对生成结果的影响。

模型与扩展

项目集成了多种后处理模型:GFPGAN 和 CodeFormer 用于修复人脸,RealESRGAN、SwinIR、LDSR 用于图片超分辨率放大。Extras 标签页里可以一键调用这些模型。

Textual Inversion 训练在界面中集成,支持在 8GB 显存下训练自定义 Embedding。Hypernetwork 和 LoRA 训练同样内置,训练标签页提供了图片预处理、自动打标签(BLIP / DeepDanbooru)等辅助功能。

通过 Custom Scripts 和扩展系统,社区贡献了大量插件。History Tab 扩展可以直接在界面内浏览和管理历史图片,Aesthetic Gradients 扩展可以用 CLIP 图片嵌入生成特定风格的图片。

模型兼容

WebUI 支持 Stable Diffusion 2.0、Alt-Diffusion、Segmind SSD 等多种模型。Checkpoint Merger 功能可以把最多三个模型合并为一个,方便做模型混合实验。

Prompt 输入没有 token 数量限制(原版 SD 限制 75 个 token),配合 Attention 语法可以精确控制不同词组的权重。DeepDanbooru 集成对动漫类图片的提示词生成比较友好。

硬件与性能

项目最低支持 2GB 显存的显卡,常见配置在 4GB 以上都能正常运行。通过 --xformers 参数可以开启 xformers 加速,对部分显卡有明显的速度提升。还支持通过独立的轻量神经网络生成预览图,几乎不占用额外显存。

安装方式

Windows 用户可以直接下载预编译包,解压后运行 update.batrun.bat 即可。也可以安装 Python 3.10.6 和 Git 后克隆仓库,运行 webui-user.bat 自动安装。

Linux 用户通过包管理器安装依赖后,下载 webui.sh 脚本或直接克隆仓库就能启动。项目也支持在 Google Colab 等在线服务上运行。Apple Silicon 用户可以参考项目 Wiki 中的专用安装指南。

写在最后

Stable Diffusion WebUI 是目前生态最完整的 SD 前端工具,从基础的文生图到训练自定义模型,功能覆盖面广。社区活跃,扩展丰富,16 万以上的 Star 数说明了它的流行程度。对于想用 Stable Diffusion 但不想写代码的用户来说,这是最直接的选择。

对于想用 Stable Diffusion 但不想写代码的用户来说,这是最直接的选择。

Logo

脑启社区是一个专注类脑智能领域的开发者社区。欢迎加入社区,共建类脑智能生态。社区为开发者提供了丰富的开源类脑工具软件、类脑算法模型及数据集、类脑知识库、类脑技术培训课程以及类脑应用案例等资源。

更多推荐