Trình tạo hình ảnh AI tốt nhất năm 2024

By
Jugo Mobile
Jugo Mobile is a platform dedicated to high-quality content in gaming, sports, and tech. Engage with high-quality content and connect with fellow enthusiasts and experts. Explore...
Đọc 18 phút

Tạo hình ảnh từ một lời nhắc văn bản đơn giản là một trong những cách sử dụng phổ biến nhất cho trí tuệ nhân tạo tổng hợp và có hàng chục trình tạo hình ảnh AI trên thị trường cung cấp nhiều tùy chọn, tính năng và kiểu dáng đa dạng như nhau.

Trong vòng chưa đầy hai năm, chúng tôi đã chuyển từ các công cụ như Midjourney có khả năng tạo ra hình ảnh mô tả con người có độ phân giải thấp, khó nhận ra sang những hình ảnh chân thực, có độ phân giải cao mà bạn khó có thể phân biệt được với những hình ảnh được chụp bằng máy ảnh.

Hiện tại, chúng tôi cũng có các công cụ nâng cấp, nhân vật nhất quán và inpainting từ StabilityAI, được các công ty như Leonardo và Quán cà phê đêmcũng như văn bản trên hình ảnh từ OpenAI trong DALL-E 3 và Ideogram, công ty khởi nghiệp AI của các cựu kỹ sư Google.

Tôi dành phần lớn thời gian trong tuần và thậm chí vào cuối tuần để sử dụng một hoặc nhiều trình tạo hình ảnh AI, đẩy chúng đến giới hạn, xem chúng có thể đạt được những gì và mức độ dễ sử dụng của chúng. Đây là những trình tạo hình ảnh AI tốt nhất mà bạn có thể truy cập ngay bây giờ và mỗi trình tạo hình ảnh trong danh sách này có gì đó hơi khác một chút hoặc hoạt động theo một cách khác.

Trình tạo hình ảnh AI tốt nhất nói chung

Leonardo

(Tín dụng hình ảnh: Leonardo)

Leonardo cốt lõi là một trình bao bọc được thực hiện rất tốt cho nhiều mô hình Khuếch tán ổn định giống như một số mô hình khác trong cùng danh mục nhưng nó còn tiến xa hơn rất nhiều. Với các kiểu tùy chỉnh và các phiên bản mô hình được tinh chỉnh cũng như các công cụ hình ảnh AI khác — đây là một sản phẩm nổi bật trong lĩnh vực này.

Khả năng tạo ra hình ảnh chân thực của nó, nhờ vào mô hình PhotoReal được tinh chỉnh, gần như đạt tiêu chuẩn Midjourney và nó có thể tạo ra nhiều kiểu dáng với tính năng Elements.

Những phần tử này là một mô hình được tinh chỉnh có thể được áp dụng trước khi tạo và điều khiển hình ảnh được tạo ra với hình thức đặc biệt như bản phác thảo hoặc tác phẩm điêu khắc. Bạn cũng có khả năng thiết lập một phong cách như điện ảnh, đồ ăn hoặc phơi sáng lâu.

Điều thực sự khiến Leonardo nổi bật đối với tôi là sự kết hợp giữa giao diện người dùng dễ sử dụng, kết hợp với khả năng kiểm soát đáng kinh ngạc. Bạn có thể thêm hình ảnh tham chiếu và đặt cách AI nên sử dụng chúng, kiểm soát kích thước và bố cục, thậm chí thêm nền trong suốt.

Hầu hết các tính năng này đều có sẵn trên các nền tảng khác, nhưng Leonardo có tất cả chúng cũng như một loạt các tính năng khác như nâng cấp hình ảnh, tạo hình ảnh trực tiếp và một trong những công cụ sáng tạo nhất – khả năng vẽ phác thảo và điều khiển AI nó thành một hình ảnh đầy đủ.

Tốt nhất cho chủ nghĩa hiện thực

giữa hành trình

(Tín dụng hình ảnh: Giữa cuộc hành trình)

Ngồi lì bên trong máy chủ Discord, giữa hành trình là một trong những trình tạo hình ảnh AI ấn tượng và cao cấp nhất hiện có. Nó thất bại ở một số mặt, bao gồm cả tính dễ sử dụng nhưng điều khiến nó khó sử dụng hơn cũng khiến nó trở nên ấn tượng hơn.

Nó đặc biệt tốt trong việc tạo ra những hình ảnh chân thực, với một số người dùng tài năng hơn có thể sử dụng nó để tạo ra những bức ảnh trông giống như được chụp trực tiếp từ camera điện thoại. Midjourney là một trong những người đầu tiên giải quyết vấn đề về ngón tay và luôn có những người trông thật.

Midjourney gây tranh cãi phần nào vì từ chối thảo luận về nguồn dữ liệu đào tạo của mình. Nhiều người nghi ngờ phần lớn lỗi này xuất phát từ việc loại bỏ bất kỳ hình ảnh nào có sẵn công khai mà nó có thể tìm thấy bất kể nó có được sự cho phép của người tạo hình ảnh hay không.

Tuy nhiên, điều khiến Midjourney thực sự nổi bật đối với tôi là mức độ kiểm soát mà bạn có đối với mọi khía cạnh của thế hệ. Bạn có thể sử dụng các lệnh tham số để tham chiếu kiểu hoặc ký tự trong các hình ảnh khác hoặc sử dụng các lệnh khác để thay đổi hoàn toàn cách hình ảnh xuất hiện.

Bản cập nhật phiên bản sáu mới nhất cũng đi kèm với khả năng thêm văn bản dễ đọc vào hình ảnh và tạo hình ảnh sản phẩm siêu thực, mặc dù điều này không nhất quán hoặc luôn đáng tin cậy.

Tốt nhất cho văn bản trên hình ảnh

chữ tượng hình

(Tín dụng hình ảnh: Chữ tượng hình)

chữ tượng hình là một trong những trình tạo hình ảnh AI yêu thích của tôi để sử dụng cho cá nhân tôi. Nó không phải là tốt nhất về mặt bộ tính năng nhưng nó tuân theo lời nhắc rất tốt và có thể thêm văn bản mà không có kiểu máy nào khác có được. Tôi đã có thể tạo áp phích phim, tờ rơi và thiệp chúc mừng đầy đủ với văn bản chính xác.

Được truy cập thông qua hộp nhắc đơn giản tuyệt vời, với tùy chọn tự động nâng cao lời nhắc của bạn để có được hình ảnh đẹp hơn, nó vừa dễ sử dụng vừa mạnh mẽ.

Mặc dù việc thêm văn bản vào hình ảnh là tốt nhất, nhưng nó cũng có một chút điểm nhấn giữa cuộc hành trình đối với phong cách tác phẩm mà nó tạo ra. Bạn có thể tắt lời nhắc kỳ diệu và tạo những hình ảnh đơn giản mang tính nghệ thuật hơn hoặc thậm chí thêm các thẻ kiểu tùy chỉnh.

Lời nhắc kỳ diệu của Ideogram là một tính năng hấp dẫn. Nếu tính năng này được bật thì một mô hình ngôn ngữ lớn sẽ phân tích lời nhắc của bạn và viết lại để mang tính mô tả nhiều hơn nhằm tiến gần hơn đến tầm nhìn của bạn.

Bạn có thể xem lời nhắc ban đầu cũng như lời nhắc kỳ diệu cho bất kỳ hình ảnh nào, điều chỉnh nó hoặc sử dụng nó để tạo một hình ảnh mới. Bạn cũng có thể sử dụng bất kỳ hình ảnh nào được tạo làm nguồn cho hình ảnh mới.

Tốt nhất cho sự sáng tạo

Phi công phụ của Microsoft

(Tín dụng hình ảnh: Microsoft Copilot)

Một số trình tạo hình ảnh hoàn toàn độc lập như Midjourney và một số khác được tích hợp vào một sản phẩm khác như Microsoft’s Designer, một phần của Phi công phụ chatbot. Nó cũng có sẵn miễn phí mà không phải trả tiền cho Copilot Pro.

Được xây dựng trên cùng một mô hình DALL-E 3 cơ bản được sử dụng trong ChatGPT, Microsoft đã tạo ra thứ gì đó thực sự ấn tượng với Designer. Nó cho phép bạn tùy chỉnh bất kỳ khía cạnh nào của hình ảnh, thậm chí kéo ra các phần tử riêng lẻ trong ảnh.

Bạn có thể thực hiện một số thay đổi tinh tế trong giao diện người dùng trò chuyện hoặc bạn có thể chỉnh sửa trong Designer, mở trình chỉnh sửa hình ảnh đầy đủ của Microsoft. Điều này vượt xa những thay đổi AI đơn giản và cho phép bạn thay đổi nền, thêm bộ lọc, văn bản hoặc hình ảnh khác.

Một trong những tính năng yêu thích của tôi là màu sắc nổi bật. Bạn có thể chọn bất kỳ một hoặc nhiều đối tượng trong hình ảnh được tạo, nhấp vào màu nổi và nó sẽ làm cho nền có thang độ xám cao hơn.

Ngoài việc thực hiện các thay đổi trong giao diện Nhà thiết kế, chẳng hạn như thay đổi tỷ lệ khung hình hoặc tạo kiểu mới, bạn có thể làm việc trong cuộc trò chuyện Copilot để thêm các thành phần hoặc thực hiện các thay đổi quan trọng khác. Điều này có thể bao gồm việc thay đổi quần áo của một nhân vật hoặc một loại ô tô.

Tốt nhất cho sự tương tác

Trò chuyệnGPT

(Tín dụng hình ảnh: ChatGPT)

DALL-E 3 chỉ có ở Trò chuyệnGPT cho những người có tài khoản Plus. Có một số cách để sử dụng DALL-E trong ChatGPT. Bạn chỉ có thể truy cập nó thông qua giao diện chính, thông qua chatbot tùy chỉnh DALL-E GPT hoặc bằng cách gắn thẻ DALL-E trong cuộc trò chuyện chính.

DALL-E ban đầu là một trong những công cụ hình ảnh AI mang tính thương mại cao cấp đầu tiên. Ban đầu có sẵn dưới dạng API hoặc thông qua trang DALL-E chuyên dụng, OpenAI đã tích hợp nó với chatbot của mình. Đây cũng là điểm bán hàng chính của nó – khả năng nói chuyện qua hình ảnh.

Mọi thứ đều dựa trên lời nhắc bằng văn bản và nó sử dụng ngôn ngữ hoàn toàn tự nhiên để tạo. Ví dụ: bạn có thể yêu cầu nó tạo hình ảnh một con mèo, sau đó yêu cầu nó thêm một chiếc mũ.

Với bản cập nhật mới nhất, giờ đây bạn có thể nhấp vào chính hình ảnh đó và thực hiện các chỉnh sửa trong ảnh. Điều này được thực hiện bằng cách vẽ lên phần bạn muốn thay đổi và cho ChatGPT biết cách thay đổi phần đó — một lần nữa dựa vào tính chất hội thoại của người chỉnh sửa.

Tôi không nghĩ DALL-E là trình tạo hình ảnh AI tốt nhất nhưng nó là một công cụ tốt về mọi mặt. Nó có thể tạo văn bản, nó có thể tạo ra những hình ảnh chân thực (với một chút thung lũng kỳ lạ) và tạo ra tác phẩm nghệ thuật nhưng khả năng suy luận và hợp lý hóa hình ảnh bằng văn bản là lợi ích lớn.

Sáng tạo nhất

Google ImageFX

(Tín dụng hình ảnh: Google)

Mô hình tạo hình ảnh AI Imagen 2 của Google là một trong những mô hình tốt nhất hiện nay. Nó tạo ra những hình ảnh hấp dẫn và độc đáo, đồng thời có thể xử lý văn bản trên hình ảnh cũng như chữ tượng hình. Có một số cách để truy cập nó nhưng cách sáng tạo nhất là Hình ảnhFX thử nghiệm từ Google Labs.

Điều khiến ImageFX hấp dẫn là cách nó xử lý lời nhắc. Bạn cung cấp cho nó một đoạn văn hoặc một lời nhắc dài và nó sẽ chọn ra các từ khóa cụ thể, biến chúng thành các menu thả xuống. Sau đó, mỗi menu sẽ có ba hoặc bốn lựa chọn thay thế tương tự với từ bạn đã sử dụng.

Ví dụ: nếu bạn yêu cầu hình ảnh một con khỉ đột đeo kính đang thuyết trình trong khi mặc bộ đồ, nó có thể gắn thẻ bộ đồ, khỉ đột, kính và bài giảng. Sau đó, bạn có thể, chỉ cần chạm vào nút, đổi kính thành kính râm hoặc giảng bài học lái xe.

Mặc dù đây chỉ là một thử nghiệm và những hình ảnh tương tự có thể được tìm thấy trong Google Gemini (không có trong danh sách của tôi), nhưng tính linh hoạt và cách tiếp cận mới lạ trong việc nhắc nhở đã giúp nó giành chiến thắng.

Nhược điểm lớn nhất của ImageFX là nó chỉ có thể tạo hình ảnh vuông – vấn đề tương tự mà Meta’s Imagine và Google Gemini gặp phải. Hầu hết đều cung cấp nhiều hướng khác nhau nhưng cách thú vị để gợi ý mô hình, chất lượng hình ảnh và khả năng tạo nhanh chóng từ ImageFX đã bù đắp cho điều đó.

Tốt nhất cho việc đào tạo đạo đức

Adobe đom đóm

(Tín dụng hình ảnh: Adobe Firefly)

Adobe đom đóm có một số công cụ ấn tượng bao gồm các đề xuất nhanh chóng, các tùy chỉnh sâu để tạo hình ảnh và tập dữ liệu đào tạo hầu như chỉ được đào tạo trên hình ảnh Adobe Stock.

Điểm cuối cùng này có nghĩa là nó có một bộ đào tạo có đạo đức hơn hầu hết các trình tạo hình ảnh trên thị trường, thậm chí khiến Adobe phải bồi thường tài chính trước các khiếu nại về bản quyền đối với các hình ảnh được tạo bằng Firefly. Ngoài ra còn có Firefly thế hệ thứ hai sắp ra mắt.

Tôi thấy rằng Firefly không giỏi tạo ra những hình ảnh chân thực như Midjourney hay Ideogram nhưng kỹ năng nghệ thuật của nó thuộc hàng tốt nhất. Nó cũng tạo ra đồ họa hấp dẫn, tất cả đều có ý nghĩa nhờ tính chất nghệ thuật hơn của thư viện Adobe Stock.

Adobe cung cấp một số tính năng AI tổng quát bao gồm tạo vectơ, tạo mẫu và điền tổng quát trong Photoshop, tất cả đều được cung cấp bởi mô hình Firefly.

Một trong những tính năng hay nhất của Firefly cũng là một trong những tính năng mới nhất. Nó được gọi là Tham chiếu cấu trúc và cho phép bạn chuyển bố cục của hình ảnh này sang hình ảnh khác.

  • Cửa hàng GPT của OpenAI hiện đang hoạt động với hơn 3 triệu chatbot tùy chỉnh để dùng thử
  • Chatbot tùy chỉnh OpenAI – đây là cách chúng hoạt động và những gì chúng có thể làm
  • Quên ChatGPT đi – OpenAI hiện cho phép bạn xây dựng chatbot của riêng mình cho mọi tác vụ
Chia sẻ bài viết này
Theo dõi
Jugo Mobile is a platform dedicated to high-quality content in gaming, sports, and tech. Engage with high-quality content and connect with fellow enthusiasts and experts. Explore the latest trends and innovations in our vibrant community. Join us and experience the future today!