جيميني أومني من غوغل: تحويل أي نص أو صورة أو صوت إلى فيديو بالذكاء الاصطناعي

كشفت غوغل في مؤتمر I/O 2026 عن نموذج جيميني أومني متعدد الوسائط القادر على توليد الفيديو من أي مزيج من المدخلات، مع علامة مائية رقمية لمكافحة التزييف العميق.

تحرير
ألمعي · هيئة التحرير
النشر
٢٠ مايو ٢٠٢٦
المصدر
TechCrunch ↗
القراءات
٠
الوقت
قراءة دقيقتين
نموذج جيميني أومني من غوغل لتوليد الفيديو بالذكاء الاصطناعي

كشفت شركة غوغل في مؤتمر المطورين السنوي I/O 2026 عن نموذج جديد يُعدّ الأكثر طموحاً في تاريخ الشركة؛ إذ أطلقت "جيميني أومني"، وهو النموذج متعدد الوسائط الذي يجمع بين فهم النصوص والصور والصوت والفيديو وتوليدها في آنٍ واحد.

وصف الرئيس التنفيذي لغوغل سوندار بيتشاي الهدف من النموذج بأنه "إنشاء أي شيء من أي مدخل"، مضيفاً أن الجديد لا يكتفي بدمج المدخلات تقنياً، بل يفهم السياق العلمي والثقافي والتاريخي المحيط بها. وهذا ما جعل جلسة الإطلاق مثيرةً بشكل استثنائي: طُلب من النموذج توليد مقطع فيديو بأسلوب الصلصال يشرح ظاهرة طيّ البروتينات، فأنتج مقطعاً بالحركة الإطارية مرفقاً بتعليق علمي دقيق.

النموذج متاح اليوم في نسختين: "جيميني أومني فلاش" الموجّهة للمستخدمين العامين، وتُدمج مع تطبيق جيميني ومنصة يوتيوب شورتس واستوديو الإبداع Flow. أما نسخة "أومني برو" المخصصة للمحترفين، فلا تزال قيد التطوير. وستُتاح واجهة برمجة التطبيقات للمطورين خلال أسابيع.

من الناحية التقنية، يُولّد النموذج مقاطع فيديو بمدة تصل إلى عشر ثوانٍ مع إمكانية التوسيع مستقبلاً. ويدعم النموذج أيضاً تحرير الصور بأوامر نصية بسيطة، وإنشاء صور رمزية رقمية مزوّدة بالتحقق الصوتي لمنع إساءة الاستخدام. وتتراوح الاستخدامات بين إنشاء مشاهد افتراضية للسفر في الفضاء وتوليد إعلانات تجارية احترافية.

غير أن الإضافة الأبرز ربما تكون نظام SynthID للعلامة المائية الرقمية الذي يُضمّنه غوغل في كل محتوى يُولّده الذكاء الاصطناعي التوليدي، مما يتيح التحقق من مصدر أي محتوى ويُضيّق الخناق على التزييف العميق. في عصر تتكاثر فيه مخاوف تزوير المحتوى الرقمي، يمثّل هذا النظام خطوةً تشغيلية حقيقية لا رمزية.

يأتي جيميني أومني في سياق سباق محتدم؛ فشركة OpenAI أطلقت نموذج Sora لتوليد الفيديو، وتدمج أدوبي قدرات مشابهة في Firefly، فيما تواصل ميتا تطوير نماذجها متعددة الوسائط. إلا أن ما يميّز جيميني أومني هو عمق تكامله مع منظومة غوغل الكاملة: من يوتيوب إلى غوغل درايف إلى غوغل لينز، مما يعني أن ملايين المستخدمين سيصطدمون بهذا النموذج دون قصد حين يبدأون في تصفح شورتس أو تحرير صورهم.

ثمة تحدٍّ عملي يُذكره المختبرون الأوائل: التعليمات التحريرية الدقيقة ضرورة لا ترف. إذا جاءت أوامر التحرير مبهمة، أحدث النموذج تغييرات غير مقصودة في الصورة أو الفيديو. وهذا يعني أن المستخدم العادي قد يحتاج وقتاً للتكيّف مع لغة المطالبات التي يفهمها النموذج.

في العالم العربي يفتح جيميني أومني أفقاً إبداعياً ضخماً، إذ يُمكّن المحتوى العربي من مزاحمة المنصات العالمية بأدوات إنتاج بصري متقدمة: من شركات الإعلانات في القاهرة ودبي، إلى صنّاع المحتوى المستقلين على «يوتيوب» و«تيك توك»، إلى استوديوهات الأنيميشن في الأردن والمغرب. غير أن التحدي الموازي حقيقي: يحتاج النموذج إلى تدريب أعمق على اللهجات والثقافات البصرية العربية كي يُنتج محتوى أصيلاً لا نسخةً متفرنجة بأرقام عربية. وفي الوقت ذاته تتنامى المخاوف من التزييف العميق لأصوات وصور سياسيين وفنانين عرب، ما يجعل العلامة المائية SynthID خط دفاع أول ضمن منظومة تشريعية إقليمية لا تزال غائبة.

المصدر الأصلي
TechCrunch
قراءة المقال الأصلي ↗
قصة اليوم · كل صباح

أعجبك التقرير؟ استلم واحداً كل صباح.

قصةٌ تقنية واحدة تستحقّ وقتك، بالعربية. بلا إعلانات، بلا إزعاج.

بلا إعلانات · إلغاء الاشتراك بنقرة واحدة · بياناتك آمنة

اقرأ أيضًا

المزيد من ذكاء اصطناعي

شون باركر، أحد مؤسسي نابستر ومستثمر في Stability AI

شون باركر يعيد بناء Stability AI حول صناعة الموسيقى بدعم سوني ووارنر

يقود مؤسس نابستر السابق تحولاً استراتيجياً لشركة Stability AI نحو أدوات ذكاء اصطناعي موسيقية، بتمويل جديد وشراكة مع كبرى شركات التسجيلات العالمية.

TechCrunch
شعار OpenAI على خلفية من الشيفرة البرمجية

استقالة مسؤول سلامة في OpenAI وسط اتهامات بانهيار ثقافة السلامة

استقال ديفيد روبنسون من فريق سلامة OpenAI متهماً الشركة بثقافة مؤسسية مهتزة غير مؤهلة لتطوير ذكاء اصطناعي متقدم بأمان، وسط حادثة اختراق Hugging Face.

TechCrunch
رسم تصويري لرقعة لعبة غو إلى جانب نمط متشابك من السلالم في اتجاهات مختلفة

لا تنخدعوا: النماذج اللغوية الكبيرة لا تفكر فعلاً كما تبدو

يرى باحث في الذكاء الاصطناعي أن النماذج اللغوية الكبيرة تنجح بفضل التنبؤ السريع بالأنماط لا الاستدلال المنهجي الحقيقي، مستشهداً بحركة ألفاغو الأسطورية رقم 37 كمثال على الاستدلال الفعلي الذي تفتقر إليه هذه النماذج.

MIT Technology Review
حاسوب ماك بوك إير مفتوح على مكتب يرمز إلى نظام ماك أو إس من آبل

آبل تشدد ضوابط الوصول الكامل للقرص في ماك مواجهةً لمخاطر وكلاء الذكاء الاصطناعي

أعلنت آبل تشديد صلاحية الوصول الكامل للقرص في نظام ماك أو إس، بعد تنامي المخاوف من وكلاء الذكاء الاصطناعي القادرين على الوصول غير المقيّد إلى ملفات المستخدمين ورسائلهم وسجل تصفحهم.

TechCrunch
تصور للمعالج الضوئي العصبي المستخدم لكشف مقاطع فيديو التزييف العميق

معالج ضوئي يكتشف التزييف العميق في الفيديو بدقة تقارب 98%

باحثون في جامعة كاليفورنيا لوس أنجلوس يطورون معالجاً عصبياً ضوئياً يفحص عشرات مقاطع الفيديو في آنٍ واحد باستخدام الضوء بدلاً من الكهرباء، لكشف التزييف العميق بدقة واستهلاك طاقة منخفضين.

ScienceDaily
صورة معاد بناؤها بالذكاء الاصطناعي من بيانات مسح دماغي وظيفي

علماء يطورون نظام ذكاء اصطناعي يعيد بناء الصور من مسح الدماغ في ساعة واحدة

باحثون في معهد وايزمان يطورون مُفسِّراً دماغياً بالذكاء الاصطناعي يعيد بناء ما يراه الشخص من بيانات التصوير الوظيفي، ويخفض زمن المعايرة اللازم من 40 ساعة إلى ساعة واحدة فقط.

MIT Technology Review