OpenAI تطلق برنامج توليد الصور GPT-4o

مارس 28 ،2025

أعلنت شركة OpenAI عن إطلاق أحدث قدراتها في توليد الصور، وهي الآن مدمجة بشكل أصلي في نموذجها متعدد الوسائط GPT-4o. في خطوة تمحو الحدود بين اللغة والتعبير البصري، يجمع مُولّد الصور الجديد بين الجمال والفائدة، مما يتيح للمستخدمين توليد صور واقعية، دقيقة النص، ومتوافقة مع السياق، من خلال توجيهات دردشة بسيطة.

إنشاء صورة GPT-4o

من الفن إلى الرسوم البيانية: توليد الصور يلتقي بالاستخدام في العالم الحقيقي

بخلاف نماذج الصور التقليدية التي تُعطي الأولوية للسريالية الفنية، صُممت وظيفة توليد الصور الجديدة في GPT-4o للتطبيق العملي. سواءً كنت تُنشئ مخططات تعليمية، أو قوائم مطاعم، أو رسومًا بيانية، أو مواد ألعاب فيديو، تُقدم الأداة صورًا بدقة ووعيًا بالسياق، مما يُمثل نقلة نوعية في مجال الذكاء الاصطناعي البصري التوليدي.

وتقول شركة OpenAI إن هذا التطور في نموذجها "يحول توليد الصور إلى أداة للتواصل"، مما يسمح للمستخدمين بتحديد ليس فقط التركيب والأسلوب، ولكن أيضًا العناصر الوظيفية مثل وضع النص والمعنى الرمزي واستمرارية المشهد عبر التكرارات.

أعلنت الشركة: "لقد طوّرنا مُولّد الصور الأكثر تطورًا لدينا حتى الآن في GPT-4o. والنتيجة هي توليد صور ليس فقط جميلة، بل مفيدة أيضًا".

أساس جديد للفهم البصري

يكمن جوهر هذا الاختراق في بنية GPT-4o متعددة الوسائط، والتي تدمج الرؤية واللغة ضمن مُحوّل موحد. يتيح هذا للنموذج الرجوع إلى الصور المُحمّلة، والحفاظ على الاتساق خلال عمليات التحرير متعددة الخطوات، والاستجابة بذكاء للمطالبات اللاحقة، مما يجعله مناسبًا تمامًا لجميع الأغراض، من تحسين التصميم التفاعلي إلى النمذجة الأولية التفاعلية.

تتضمن حالات الاستخدام التي عرضتها OpenAI ما يلي:

  • شريط هزلي مكون من أربعة أجزاء يتميز بإيقاع سردي دقيق
  • تجربة منشور نيوتن مع رسومات توضيحية مدمجة وسياق واقعي
  • مشهد شارع في ويليامزبيرج، نيويورك، مليء بالعلامات التفصيلية والقابلة للتصديق (والفكاهة اللطيفة)
  • قائمة طعام لمطعم كوري، كاملة برسومات أطباق أنيقة وتنسيق نصي صحيح

متابعة التعليمات ودقة السياق

في الاختبارات، أثبت GPT-4o قدرته على عرض ما يصل إلى 20 عنصرًا مختلفًا بعلاقات صحيحة، وهي نقطة غالبًا ما واجهتها النماذج السابقة. كما يتعامل مع عناصر نصية معقدة، مثل بطاقات الدعوة واللافتات ونماذج واجهة المستخدم التفاعلية، مع دقة عالية في الطباعة والتحكم في التخطيط.

على سبيل المثال، يمكن للمستخدمين طلب:

  • محقق قطة في بيئة RPG غامضة، مع تراكبات واجهة المستخدم للعبة
  • إعلان عن منشار كهربائي يستخدم لتقطيع ديك الرومي في عيد الشكر، مع شعار فكاهي
  • مخطط تعليمي مفصل عن الحيتان بأسلوب الألوان المائية

السلامة والمنشأ والشفافية

مع استعراض قدراتها الإبداعية المذهلة، تُؤكد OpenAI التزامها بالسلامة وسلامة المحتوى. جميع الصور المُولّدة تتضمن بيانات تعريفية C2PA، مما يُشير إلى أنها أُنشئت باستخدام GPT-4o. كما يُدمج النظام أداة بحث داخلية عن الصور للمساعدة في التحقق من صحتها.

قامت OpenAI بتدريب نموذج تعديل قائم على المنطق لضمان الامتثال لسياسات السلامة، باستخدام قواعد مكتوبة من قبل الإنسان وقابلة للتفسير لتحديد الحالات الهامشية وحظر المحتوى غير المناسب، مثل التزييف العميق أو العنف الرسومي.

لا تزال القيود قائمة، بما في ذلك:

  • مشاكل المحاصيل العرضية
  • صعبcultتقديم نص كثيف متعدد اللغات أو رياضي
  • تعديلات غير متسقة لمناطق معينة من الصورة (على سبيل المثال، تفاصيل الوجه)

وتقول الشركة إن التحسينات جارية، وأن آراء المستخدمين ستلعب دورًا حاسمًا في التحديثات المستقبلية.

التوافر والوصول

مُولِّد الصور GPT-4o متاحٌ ابتداءً من اليوم لمستخدمي Chat المجانيين، وPlus، وPro، وTeam، وسيُتاح قريبًا لعملاء Enterprise وEducation. من المتوقع الوصول عبر واجهة برمجة التطبيقات (API) خلال الأسابيع المقبلة، مما يُتيح للمطورين استخدامًا برمجيًا.

يمكن للمستخدمين إنشاء الصور وتكرارها من خلال مطالبات محادثة بسيطة، مع تحديد:

  • نسبة العرض إلى الارتفاع (على سبيل المثال، 16:9)
  • لون الخلفية أو الشفافية
  • نمط الصورة (واقعية، رسومية، كوميدية، إلخ.)
  • عناصر تخطيط محددة (النص، الأيقونات، الموضع)

على الرغم من أن أوقات العرض أطول - غالبًا ما تصل إلى دقيقة واحدة - إلا أن OpenAI تؤكد أن المقايضة تستحق الحصول على تفاصيل ودقة أعلى.

قفزة بصرية لنماذج اللغة

بفضل توليد الصور الأصلية، يخطو GPT-4o خطوةً حاسمةً نحو مستقبل الذكاء الاصطناعي متعدد الوسائط، حيث يتجاوز التواصل حدود النص. من المخططات العلمية إلى الملصقات، ومن نماذج ألعاب الفيديو إلى دعوات الزفاف الشاعرية، يُثبت GPT-4o أن الخيال لا حدود له.

مع ذوبان الخط الفاصل بين الصورة واللغة، فإن أحدث ابتكارات OpenAI قد لا تغير فقط كيفية توليدنا للصور، بل أيضًا كيفية تفكيرنا في استخدامها بشكل عام.