Google Gemini (tạo hình ảnh bằng Imagen 4) tính đến tháng 8/2025 là một trong những AI tạo hình ảnh được chú ý nhất. Nhờ sự kết hợp giữa mô hình tạo văn bản Gemini 2.5 (Pro / Flash) và backend tạo hình ảnh Imagen 4, bạn có thể tạo ra hình ảnh chất lượng cao thông qua hội thoại tự nhiên.
Bài viết này giải thích toàn diện từ kiến thức cơ bản, cơ chế hoạt động, cách sử dụng, ví dụ ứng dụng cho đến các lưu ý — nội dung mà người mới bắt đầu đến trình độ trung cấp có thể áp dụng ngay vào công việc.
Tin tức: Mô hình mang mã danh "nano banana" — "Gemini 2.5 Flash Image Preview" được phát hành – Bước tiến hóa mới của AI tạo hình ảnh (27/8/2025)
Tạo hình ảnh với Gemini là gì? Kiến thức cơ bản
Tổng quan về Google Gemini và vị trí của Imagen 4
Google Gemini (tạo hình ảnh bằng Imagen 4) là hệ thống AI đa phương thức do Google phát triển. Gemini 2.5 (Pro hoặc Flash) đảm nhận việc tạo văn bản phối hợp với Imagen 4 — engine chuyên tạo hình ảnh — để tạo ra hình ảnh chất lượng cao thông qua hội thoại tự nhiên.
Tính đến tháng 8/2025, so với Imagen 3 trước đây, Imagen 4 đã cải thiện đáng kể chất lượng đặc biệt ở khả năng tạo chữ, đạt bước tiến vượt bậc trong việc thể hiện văn bản bên trong hình ảnh. Nó hỗ trợ độ phân giải 2K tối đa 2048×2048 pixel và đạt tốc độ nhanh hơn tối đa 10 lần so với phiên bản trước.
Khác biệt và ưu thế so với các dịch vụ khác
Đặc điểm lớn nhất của tính năng tạo hình ảnh Gemini là khả năng tạo hình ảnh lặp đi lặp lại theo kiểu hội thoại. Trong khi DALL-E 3 của ChatGPT hay Midjourney tạo hình ảnh chỉ từ một lần chỉ thị, Gemini cho phép điều chỉnh hình ảnh từng bước thông qua hội thoại.
Như đã đề cập trong bài viết dưới đây, Gemini có thể tạo ra những hình ảnh hết sức tự nhiên.
So sánh với các đối thủ chính:
| Dịch vụ | Điểm mạnh | Bối cảnh phù hợp |
|---|---|---|
| Gemini + Imagen 4 | Điều chỉnh qua hội thoại, hỗ trợ tiếng Nhật, hiệu quả chi phí | Sáng tác lặp nhiều lần, mục đích kinh doanh |
| Midjourney | Chất lượng nghệ thuật | Sáng tác nghệ thuật chất lượng cao |
| ChatGPT (4o) | Độ chính xác trong môi trường tiếng Anh | Liên kết với văn bản |
Giới hạn và đặc điểm khi sử dụng miễn phí
Sức hấp dẫn của tính năng tạo hình ảnh Gemini là ngay cả người dùng miễn phí cũng tạo được hình ảnh chất lượng cao. Bản miễn phí có giới hạn số lần sử dụng mỗi ngày, nhưng con số cụ thể không được công bố. Mức giới hạn này được cho là đủ cho nhu cầu sử dụng hằng ngày thông thường, và nếu chạm giới hạn thì chỉ cần chờ một lúc là có thể sử dụng lại.
Cách tạo hình ảnh với Gemini
Cách sử dụng cơ bản
Đăng nhập bằng tài khoản Google
Truy cập gemini.google.com trên trình duyệt và đăng nhập bằng tài khoản Google của bạn.
Nhập prompt

Trên màn hình chat hiển thị sau khi đăng nhập, hãy nhập chỉ thị tạo hình ảnh cụ thể vào ô nhập văn bản.
Tạo hình ảnh
Nhấn nút gửi. AI sẽ tạo ra hình ảnh nguyên bản trong vài giây đến vài chục giây.
Lưu hình ảnh

Nhấn nút "Tải xuống" phía dưới hình ảnh được tạo để lưu lại. Trên điện thoại, bạn cũng có thể nhấn giữ hình ảnh để lưu.
Mẹo viết prompt
Để tạo được hình ảnh hiệu quả, việc mô tả cụ thể là rất quan trọng. Ví dụ:
Prompt
Đêm lễ hội mùa hè, một cô gái Nhật Bản mặc yukata rực rỡ sắc màu đang ngước nhìn màn pháo hoa lớn trải rộng trên bầu trời đêm. Tóc được búi gọn gàng, trên yukata có họa tiết hoa. Phía sau là bờ sông và những dãy đèn lồng, bầu trời đêm rực sáng với pháo hoa đủ màu. Phong cách ảnh chụp độ phân giải cao với lối miêu tả chân thực, sống động và bầu không khí ấm áp.
Prompt phủ định (negative prompt)
Mờ nhòe, độ phân giải thấp, biểu cảm thiếu tự nhiên, thừa tay chân, khuôn mặt méo mó, yukata xuyên thấu, chữ hay watermark, ánh sáng lóa quá mức
Sức hấp dẫn nằm ở chỗ, tùy vào cách trau chuốt prompt, bạn có thể thu được đủ loại hình ảnh từ tranh vẽ đơn giản đến bố cục phức tạp.
Tạo prompt bằng ChatGPT
Khi cần viết prompt dài như trên, hãy truy cập ChatGPT và yêu cầu tạo prompt như sau.
Ví dụ: Hãy tạo một prompt tiếng Nhật để tạo hình ảnh "cô gái Nhật Bản đang ngắm pháo hoa".
