「圖像生成 AI」就是能把輸入的文字、圖片,甚至多種訊號(例如聲音、動作指令)轉換成新的影像或圖片的模型。這一塊其實是目前生成式 AI 發展最活躍的領域之一,從研究到商業應用都有很多成果。以下整理成幾大類,並且舉代表性模型:
🔹 一、以文字生成圖片(Text-to-Image)
這是最常見的「圖像合成」,輸入一段文字描述,就能生成一張符合描述的圖片。
- Stable Diffusion(Stability AI):開源,社群應用廣泛,可自由微調,支援 ControlNet、LoRA 等技術。
Stable Diffusion 在線:有免費方案。背景移除器功能優良。Stable Diffusion 提示搜索引擎,可探索數百萬個由AI生成的圖像並創建提示集合(測試無效)。
Stable diffusion online
是使用 Stable Diffusion 模型建立的線上服務。 - DALL·E 3(OpenAI):ChatGPT 內建的繪圖模型,擅長生成貼近文字敘述的圖片,適合廣告、插畫。可以處理圖像去背,做成背景透明圖像。
- MidJourney(獨立團隊):Midjourney是一款AI圖像生成工具,由同名研究實驗室開發,以 Discord 伺服器頻道為媒介,使用者只要輸入指令及關鍵字,即可根據文字生成圖像。使用官方圖像生成必須付費使用,最低方案每月8\10美元起。可每月生成200張圖片。官方教學說明線上文件。
Artlist AI:可以試作圖像生成,若要下載圖片檔案,則需要付費訂閱方案。
Pollo.ai:服務包含 Midjourney、GPT-4o、Nano Banana、Imagen、Dall-E、Recraft、Stable Diffusion 等圖片生成模型。有提供免費方案。
CapCut:CapCut Web 將 Midjourney 式的 AI 圖像生成器帶到您的瀏覽器,讓視覺創作快速且毫不費力。
您需要了解的Midjourney AI圖像生成器的一切(有介紹如何透過 Discord 使用 Midjourney 生成圖片 )
Midjourney AI 繪圖全攻略,新手指令教學。
2025年版Midjourney教學:完整指南含實際試用的方法與範例
Midjourney 教學】怎麼用AI生成圖片?新手3分鐘馬上就學會 - Google 圖像模型 Nano Banana(Gemini 2.5 Flash Image)
Gemini AI:
Google AI Studio: - Raphael AI:完全免費,沒有註冊也可以生成圖像。一次生成4張不同視角的圖像。生成高品質圖像必須升級至終極方案,解鎖高品質圖片生成,顯著提升細節。
🔹 二、以圖片生成圖片(Image-to-Image)
在已有的圖片上進行改造、延伸或修復。
- Stable Diffusion Inpainting:補齊缺失區域、去除物件。
- Adobe Firefly:針對 Photoshop、Illustrator 使用者,強調「生成式填色(Generative Fill)」。
- Runway Gen-2:除了文字轉圖,也能基於圖片進行風格轉換。
🔹 三、結合條件控制的生成(Conditional Generation)
可以用姿勢、草圖、深度圖來「約束」AI 生成結果。
- ControlNet(擴充 Stable Diffusion):支援邊緣偵測、人體姿勢、深度感知等多種控制。
- Pix2Pix / CycleGAN:早期 GAN 模型,能把草圖轉換成彩圖,或把照片轉換成另一種風格(如白天變黑夜)。
🔹 四、2D → 3D 或多模態圖像合成
近年發展快速,能把平面圖片合成立體模型,甚至做動畫。
- DreamFusion(Google):用文字生成 3D 模型。
- Luma AI:可用手機拍攝,AI 幫你生成 3D 場景。
- GET3D(NVIDIA):從影像生成高品質 3D 模型。
🔹 五、影片生成與影像合成延伸
這其實是「圖像合成」的進階版。
- Runway Gen-2:輸入文字或圖片生成短影片。
- Pika Labs:專門做動畫影片合成,社群非常活躍。
- Sora(OpenAI,開發中):文字生成影片,畫質與細節極高,未全面開放。
🔹 六、專用領域應用
- 醫學影像合成(例如 GAN 應用於 MRI 或 CT 資料增強)。
- 遊戲與虛擬世界(如 NVIDIA GauGAN,可把草圖變成擬真景觀)。
- 時尚設計與室內設計(透過 DreamStudio、Interior AI 做風格合成)。
✅ 總結來說:
如果你想 自由度高、能自己實驗 → Stable Diffusion + ControlNet。
如果你想 操作簡單、畫面美術感強 → MidJourney 或 Firefly。
如果你想 追求研究最前沿 → Imagen、Sora、DreamFusion。
📊 圖像合成生成式 AI 功能比較表
| 模型 / 工具 | 開源 or 商業 | 主要用途 | 優點 | 缺點 | 適合對象 |
|---|---|---|---|---|---|
| Stable Diffusion | ✅ 開源 | 文字 → 圖像、圖像 → 圖像 | 免費可用、社群資源多、可用 ControlNet / LoRA 微調 | 初始圖可能品質不如商業版,需要調參 | 想要 高度自訂 的進階玩家、研究者 |
| ControlNet (擴充) | ✅ 開源 | 姿勢控制、深度圖控制、草圖上色 | 精準控制圖像生成,適合專業設計 | 需搭配 Stable Diffusion,門檻較高 | 想要 精準生成 的設計師 / 研究者 |
| DALL·E 3(OpenAI) | 商業 | 文字 → 圖像 | 與 ChatGPT 整合、理解文字細節佳 | 可用性受限於平台,生成風格偏固定 | 想要 快速出結果 的一般用戶 |
| MidJourney | 商業 | 文字 → 圖像 | 畫風強烈、藝術感佳、社群活躍 | 只能在 Discord 使用、缺乏細節控制 | 適合 插畫、藝術風格設計 |
| Adobe Firefly | 商業 | 圖像編修、填色、合成 | 與 Photoshop 整合,操作直覺 | 訂閱制、輸出有授權限制 | 適合 平面設計師、攝影師 |
| Runway Gen-2 | 商業 | 文字 → 圖像、文字 → 影片 | 支援影片生成,操作簡單 | 輸出時間較久、需付費 | 適合 短影音、廣告創作 |
| Imagen 系列(Google) | 封閉(研究) | 文字 → 高品質圖像 | 畫質極高、細節自然 | 尚未全面開放 | 適合 前沿研究觀察 |
| DreamFusion / GET3D | 研究 | 2D → 3D 物件生成 | 3D 建模自動化 | 還在早期研究階段 | 適合 3D、遊戲、AR/VR 開發 |
| Sora(OpenAI) | 研究 / 商業準備中 | 文字 → 影片 | 畫質與細節目前最強 | 尚未公開 | 適合 前瞻研究 & 等待商業化 |
🔑 總結建議:
- 想玩免費 & 自訂性高 → Stable Diffusion + ControlNet
- 想快速得到「漂亮結果」→ MidJourney、DALL·E 3
- 做專業設計 & 修圖 → Adobe Firefly
- 玩影音合成 → Runway Gen-2 / Sora(未來)
- 研究 & 教學用途 → Imagen、DreamFusion、Stable Diffusion 開源社群