OpenAI ra mắt công nghệ tạo ảnh GPT-4o

Tháng 28, 2025

OpenAI đã công bố ra mắt khả năng tạo hình ảnh tiên tiến nhất từ ​​trước đến nay, hiện đã được tích hợp sẵn vào mô hình đa phương thức GPT-4o. Trong một động thái xóa nhòa ranh giới giữa ngôn ngữ và biểu đạt trực quan, trình tạo hình ảnh mới kết hợp vẻ đẹp với tiện ích, mang đến cho người dùng khả năng tạo ra hình ảnh chân thực, chính xác về văn bản và có nhận thức về ngữ cảnh từ các lời nhắc dựa trên trò chuyện đơn giản.

Tạo hình ảnh GPT-4o

Từ Nghệ thuật đến Đồ họa thông tin: Tạo hình ảnh đáp ứng nhu cầu sử dụng trong thế giới thực

Không giống như các mô hình hình ảnh truyền thống ưu tiên chủ nghĩa siêu thực nghệ thuật, chức năng tạo hình ảnh mới của GPT-4o được thiết kế để ứng dụng thực tế. Cho dù tạo sơ đồ giáo dục, thực đơn nhà hàng, đồ họa thông tin hay tài sản trò chơi điện tử, công cụ này cung cấp hình ảnh với độ chính xác và nhận thức ngữ cảnh, một bước tiến vượt bậc cho AI hình ảnh tạo sinh.

OpenAI cho biết sự phát triển này của mô hình sẽ "biến việc tạo hình ảnh thành một công cụ giao tiếp", cho phép người dùng không chỉ xác định bố cục và phong cách mà còn cả các yếu tố chức năng như vị trí văn bản, ý nghĩa tượng trưng và tính liên tục của cảnh trong các lần lặp lại.

"Chúng tôi đã xây dựng trình tạo hình ảnh tiên tiến nhất của mình vào GPT-4o", công ty thông báo. "Kết quả là tạo ra hình ảnh không chỉ đẹp mà còn hữu ích".

Một nền tảng mới cho sự hiểu biết trực quan

Cốt lõi của bước đột phá này là kiến ​​trúc đa phương thức gốc của GPT-4o, tích hợp tầm nhìn và ngôn ngữ trong một bộ chuyển đổi thống nhất. Điều này cho phép mô hình tham chiếu hình ảnh đã tải lên, duy trì tính nhất quán trong các chỉnh sửa nhiều bước và phản hồi thông minh với các lời nhắc tiếp theo, khiến nó phù hợp với mọi thứ từ tinh chỉnh thiết kế tương tác đến tạo mẫu đàm thoại.

Các trường hợp sử dụng được OpenAI giới thiệu bao gồm:

  • Một bộ truyện tranh bốn khung với nhịp độ tường thuật chính xác
  • Đồ họa thông tin về thí nghiệm lăng kính Newton có hình ảnh minh họa và bối cảnh thực tế
  • Một cảnh đường phố ở Williamsburg, NY với những biển báo chi tiết, đáng tin cậy (và sự hài hước tinh tế)
  • Thực đơn của một nhà hàng Hàn Quốc, có hình ảnh minh họa món ăn trang nhã và định dạng văn bản chính xác

Hướng dẫn sau đây và độ chính xác của ngữ cảnh

Trong các thử nghiệm, GPT-4o đã chứng minh khả năng kết xuất tối đa 20 đối tượng riêng biệt với các mối quan hệ chính xác, một lĩnh vực mà các mô hình trước đây thường gặp khó khăn. Nó cũng xử lý các thành phần văn bản phức tạp, chẳng hạn như thiệp mời, biển báo và mô hình UI tương tác, với khả năng sắp chữ và kiểm soát bố cục đáng tin cậy.

Ví dụ, người dùng có thể yêu cầu:

  • Một thám tử mèo trong bối cảnh RPG bí ẩn, với lớp phủ giao diện người dùng trò chơi
  • Một quảng cáo về một chiếc cưa máy dùng để cắt gà tây trong Lễ Tạ ơn, với khẩu hiệu hài hước
  • Biểu đồ giáo dục chi tiết về cá voi theo phong cách màu nước

An toàn, Nguồn gốc và Minh bạch

Trong khi thể hiện khả năng sáng tạo ấn tượng, OpenAI nhấn mạnh cam kết của mình về tính an toàn và tính toàn vẹn của nội dung. Tất cả hình ảnh được tạo ra đều bao gồm siêu dữ liệu C2PA, cho biết chúng được tạo bằng GPT-4o. Hệ thống cũng tích hợp một công cụ tìm kiếm hình ảnh nội bộ để giúp xác minh tính xác thực.

OpenAI đã đào tạo một mô hình kiểm duyệt dựa trên lý luận để đảm bảo tuân thủ các chính sách an toàn, sử dụng các quy tắc do con người viết ra có thể diễn giải được để xác định các trường hợp ngoại lệ và chặn nội dung không phù hợp, chẳng hạn như deepfake hoặc bạo lực.

Vẫn còn tồn tại những hạn chế, bao gồm:

  • Các vấn đề cắt xén thỉnh thoảng
  • Khóculty kết xuất văn bản đa ngôn ngữ hoặc toán học dày đặc
  • Chỉnh sửa không nhất quán đối với các vùng hình ảnh cụ thể (ví dụ: chi tiết khuôn mặt)

Công ty cho biết những cải tiến đang được tiến hành và phản hồi của người dùng sẽ đóng vai trò quan trọng trong các bản cập nhật trong tương lai.

Tính khả dụng và quyền truy cập

Trình tạo hình ảnh GPT-4o hiện đã có sẵn cho người dùng Chat Free, Plus, Pro và Team từ hôm nay, và sẽ sớm được cung cấp cho khách hàng Enterprise và Education. Việc truy cập thông qua API dự kiến ​​sẽ diễn ra trong vài tuần tới, mở khóa khả năng sử dụng theo chương trình cho các nhà phát triển.

Người dùng có thể tạo và lặp lại hình ảnh thông qua các lời nhắc đàm thoại đơn giản, chỉ định:

  • Tỷ lệ khung hình (ví dụ: 16:9)
  • Màu nền hoặc độ trong suốt
  • Phong cách hình ảnh (thực tế, đồ họa thông tin, truyện tranh, v.v.)
  • Các thành phần bố cục cụ thể (văn bản, biểu tượng, vị trí)

Mặc dù thời gian kết xuất lâu hơn – thường lên đến một phút – OpenAI vẫn cho rằng sự đánh đổi này là xứng đáng để có được độ chi tiết và độ chính xác cao hơn.

Một bước nhảy vọt về mặt thị giác cho các mô hình ngôn ngữ

Với khả năng tạo hình ảnh gốc, GPT-4o thực hiện bước đi quyết định hướng tới tương lai của AI đa phương thức, nơi giao tiếp vượt qua văn bản. Từ sơ đồ khoa học đến nhãn dán, nguyên mẫu trò chơi điện tử đến lời mời đám cưới đầy chất thơ, GPT-4o đang chứng minh rằng trí tưởng tượng thực sự không có giới hạn.

Khi ranh giới giữa hình ảnh và ngôn ngữ không còn nữa, cải tiến mới nhất của OpenAI có thể không chỉ thay đổi cách chúng ta tạo ra hình ảnh mà còn thay đổi cách chúng ta suy nghĩ về việc sử dụng chúng.