Google Gemini(圖像生成採用Imagen 4)截至2025年8月,是最受矚目的圖像生成AI之一。透過文字生成模型Gemini 2.5(Pro/Flash)與圖像生成後端Imagen 4的組合,能透過自然的對話生成高品質圖像。
本文將從基本理解、運作原理、使用方法、應用案例到注意事項,全面解說新手到中階使用者能立即在實務上運用的內容。
新聞:代號「nano banana」模型「Gemini 2.5 Flash Image Preview」正式發布 – 圖像生成AI的全新進化(2025/8/27)
什麼是Gemini圖像生成?基本理解
Google Gemini概覽與Imagen 4的定位
Google Gemini(圖像生成採用Imagen 4)是Google開發的多模態AI系統。負責文字生成的Gemini 2.5(Pro或Flash)與圖像生成專用引擎Imagen 4彼此協同運作,透過自然的對話生成高品質圖像。
截至2025年8月,Imagen 4相較於前一代的Imagen 3,在文字生成品質上有大幅提升,圖像中的文字呈現有了飛躍性的改善。最高支援2048×2048像素的2K解析度,並較前一版本達成最多10倍的速度提升。
與其他服務的差異與優勢
Gemini圖像生成最大的特色,在於對話式的反覆圖像生成。相較於ChatGPT的DALL-E 3或Midjourney是透過一次性指示生成圖像,Gemini則能透過對話逐步調整圖像。
如下方文章所提及,Gemini能夠生成非常自然的圖像。
【就算是AI新手也能真正上手】圖像生成AI服務・工具整理總覽【2025年8月版】
與主要競爭對手的比較:
| 服務 | 優勢 | 適用場景 |
|---|---|---|
| Gemini + Imagen 4 | 對話式調整、支援日文、成本效益佳 | 反覆製作、商業用途 |
| Midjourney | 藝術性品質 | 高品質藝術創作 |
| ChatGPT (4o) | 英語圈的精準度 | 文字整合應用 |
免費使用的限制與特色
Gemini的圖像生成,其魅力在於即使是免費使用者也能製作出高品質的圖像。免費版雖有每日使用次數限制,但並未明確公布具體上限值。官方表示這在一般日常使用範圍內不成問題,即使達到限制,只要稍作等待即可再次使用。
使用Gemini生成圖像的方法
基本使用方法
使用Google帳號登入
用瀏覽器造訪 gemini.google.com,並使用你的Google帳號登入。
輸入提示(Prompt)

登入後,在顯示的聊天畫面文字輸入欄中,以日文輸入具體的圖像生成指示。
生成圖像
點擊傳送按鈕。AI會在數秒至數十秒內生成原創圖像。
儲存圖像

點擊生成圖像下方的「下載」按鈕即可儲存圖像。若使用智慧型手機,也可以長按圖像來儲存。
撰寫提示的技巧
要生成有效的圖像,具體的描述十分重要。例如:
提示(Prompt)
夏日祭典的夜晚,一位身穿色彩鮮豔浴衣的日本女性,抬頭仰望著在夜空中綻放的大型煙火。頭髮整齊地盤起,浴衣上繪有花朵圖案。背景是排列著河岸與燈籠的景色,夜空中閃耀著五顏六色的煙火。以具臨場感的寫實描繪,呈現溫暖氛圍的高解析度寫真風格。
負面提示(Negative Prompt)
模糊、低解析度、不自然的表情、多餘的四肢、扭曲的臉部、透明的浴衣、文字或浮水印、過度的光暈
透過提示的巧思,從簡單的圖畫到複雜的構圖,都能生成範圍廣泛的圖像,這正是其魅力所在。
使用ChatGPT撰寫提示
在製作如上述般冗長的提示時,可以造訪ChatGPT,並依下列方式請它協助撰寫提示。
範例:請為「正在看煙火的日本女性」這張圖像,製作一段日文提示。
