📊 9B vs 4B 模型对比报告

2026-07-18 14:11:11 | 3 张图 × 5 种发型 = 15 组对比
9.06s
Plan A 平均
(9B 不带 --gpu-only)
7.72s
Plan B+ 平均
(4B + --gpu-only)
+1.34s
B+ 相对 A 提升
15/15 vs 15/15
成功率
耗时对比(全部 15 组)
图片发型Plan A (9B)Plan B+ (4B)差值胜者
girl1.jpg椭圆9.41s7.69s-1.72sB+ 快
girl1.jpg花瓣10.51s8.77s-1.74sB+ 快
girl1.jpg心形10.49s9.07s-1.42sB+ 快
girl1.jpg直线10.45s8.73s-1.72sB+ 快
girl1.jpg波浪10.85s8.81s-2.04sB+ 快
girl7.jpg椭圆7.91s7.04s-0.87sB+ 快
girl7.jpg花瓣7.81s6.67s-1.14sB+ 快
girl7.jpg心形7.74s6.73s-1.01sB+ 快
girl7.jpg直线8.17s6.96s-1.21sB+ 快
girl7.jpg波浪7.92s6.74s-1.18sB+ 快
girl13.jpg椭圆8.95s7.62s-1.33sB+ 快
girl13.jpg花瓣9.07s7.84s-1.23sB+ 快
girl13.jpg心形8.82s7.83s-0.99sB+ 快
girl13.jpg直线8.84s7.59s-1.25sB+ 快
girl13.jpg波浪8.96s7.77s-1.19sB+ 快
配置差异
Plan A (9B)Plan B+ (4B)
ComfyUI 模型flux-2-klein-9b-fp8flux-2-klein-4b-fp8
文本编码器qwen_3_8b_fp8mixedqwen_3_4b
模型大小8.8GB + 7.7GB = 16.5GB3.8GB + 7.5GB = 11.3GB
ComfyUI --gpu-only❌ 关闭(开则 OOM)✓ 开启
工作流 steps44
SEG_DEVICEcudacuda
平均耗时9.06s7.72s
VRAM 稳态26-28GB(模型频繁换出)25-28GB(稳态)
关键问题开 --gpu-only 会 OOM(webui:57860 推理失败)稳定
📷 图片 1: girl1.jpg
发型 1: 椭圆 | 9B=9.4s vs 4B=7.7s
发型 2: 花瓣 | 9B=10.5s vs 4B=8.8s
发型 3: 心形 | 9B=10.5s vs 4B=9.1s
发型 4: 直线 | 9B=10.4s vs 4B=8.7s
发型 5: 波浪 | 9B=10.8s vs 4B=8.8s
📷 图片 2: girl7.jpg
发型 1: 椭圆 | 9B=7.9s vs 4B=7.0s
发型 2: 花瓣 | 9B=7.8s vs 4B=6.7s
发型 3: 心形 | 9B=7.7s vs 4B=6.7s
发型 4: 直线 | 9B=8.2s vs 4B=7.0s
发型 5: 波浪 | 9B=7.9s vs 4B=6.7s
📷 图片 3: girl13.jpg
发型 1: 椭圆 | 9B=8.9s vs 4B=7.6s
发型 2: 花瓣 | 9B=9.1s vs 4B=7.8s
发型 3: 心形 | 9B=8.8s vs 4B=7.8s
发型 4: 直线 | 9B=8.8s vs 4B=7.6s
发型 5: 波浪 | 9B=9.0s vs 4B=7.8s
结论

✅ 出图质量:9B 和 4B 在视觉上几乎无差异(5 种发型 × 3 张图共 15 组对比)

✅ 出图速度:4B 平均 7.72s,9B 平均 9.06s,4B 快 1.34s

✅ 显存稳定性:9B 必须关闭 --gpu-only 才能跑通(否则 swapHair 调用链中 webui:57860 推理 OOM),4B 可开启 --gpu-only 实现稳态常驻

✅ 综合建议:使用 Plan B+(4B + --gpu-only + SegFormer GPU),既保证出图质量又最大化性能

⚠ 9B 局限:9B 必须关闭 --gpu-only → 每次调用 9B 模型都要 GPU↔CPU 换出 → 稳态下 VRAM 抖动 26-28GB,且接口3 步骤多时会 OOM