
كان Veo 3 نموذج Google DeepMind الذي جعل توليد الفيديو مسموعًا: أُعلن عنه في مؤتمر Google I/O في 20 مايو 2025، وكان يولّد الحوار والمؤثرات الصوتية والأجواء مع الصورة. أما Veo 3.1، الذي صدر في 15 أكتوبر 2025، فيحتفظ بذلك ويطوّره. تقول Google إنه يقدّم «صوتًا أغنى، وتحكّمًا سرديًا أكبر، وواقعية محسّنة»، و«التزامًا أقوى بالوصف»، وصورة وصوتًا أفضل عند تحويل الصور إلى فيديو.
هل يستحق الترقية؟ بالنسبة إلى معظم الناس حُسم السؤال بالفعل: فـ Google تُدرج Veo 3 الآن بوصفه متقادمًا (deprecated) في Gemini API، وتقدّم Veo 3.1 مكانه بثلاث فئات: Veo 3.1 و Veo 3.1 Fast و Veo 3.1 Lite. ما يبقى مفيدًا معرفته هو ما الذي تغيّر فعلًا، حتى تعرف ما تتوقعه حين تنقل أوصافك إليه.
الجواب المختصر
- الصوت: كلاهما يولّد الصوت مع الفيديو؛ وتصف Google صوت Veo 3.1 بأنه أغنى.
- الالتزام بالوصف: يلتزم Veo 3.1 بما تكتبه التزامًا أدق، من ترتيب الأحداث إلى حركة الكاميرا.
- تحويل الصورة إلى فيديو: خصّت Google بالذكر تحسّن الصورة والصوت حين تبدأ من صورة فوتوغرافية.
- أدوات تحكّم جديدة: وصل الإطاران الأول والأخير، وما يصل إلى ثلاث صور مرجعية، مع Veo 3.1.
- الدقة: أضاف Veo 3.1 خيار 4K في يناير 2026؛ بينما يتوقف Veo 3 عند 1080p.
- أوصافك: يقرأ Veo 3.1 بنية الوصف نفسها، فيمكنك لصق أوصافك من Veo 3 كما هي. توقّع لقطة جديدة، لا المقطع نفسه الذي حصلت عليه من قبل.
Veo 3 مقابل Veo 3.1 في لمحة
| Veo 3 | Veo 3.1 | |
|---|---|---|
| الإعلان | 20 مايو 2025 (Google I/O) | 15 أكتوبر 2025 |
| الحالة في واجهة Google البرمجية | متقادم | حالي، بثلاث فئات (Veo 3.1 و Fast و Lite) |
| صوت يُولَّد مع الفيديو | نعم | نعم، وأغنى |
| الالتزام بالوصف | نعم | بدقة أكبر من Veo 3 |
| تحويل الصورة إلى فيديو | نعم | نعم، بصورة وصوت أفضل |
| الإطاران الأول والأخير | — | نعم |
| الصور المرجعية | — | حتى 3 |
| طول المقطع في واجهة Google البرمجية | 8 ثوانٍ | 4 أو 6 أو 8 ثوانٍ (8 ثوانٍ لدقة 1080p و 4K) |
| الدقة | 720p و 1080p | 720p و 1080p و 4K (مُكبَّرة) |
| نسب العرض | 16:9؛ وأضافت Google نسبة 9:16 في سبتمبر 2025 | 16:9 و 9:16 |
| التمديد في أدوات Google | — | نعم (+7 ثوانٍ في كل خطوة عبر الواجهة البرمجية؛ دقيقة أو أكثر في Flow) |
الصوت: الميزة التي قدّمها Veo 3
قبل Veo 3 كانت مقاطع Veo صامتة، وكان لا بد من إضافة أي صوت أو حوار في المونتاج. ثم غيّر Veo 3 ذلك: صار بوسع الشخصيات أن تنطق العبارات المكتوبة في الوصف، وصارت المؤثرات وضوضاء الخلفية تصل مع الصورة.
يحتفظ Veo 3.1 بالصوت الأصلي في كل الفئات، ويقدّم بتعبير Google «صوتًا أغنى». أما طريقة طلب الصوت فلم تتغيّر:
- ضع العبارات المنطوقة بين علامتي تنصيص، وحدّد من يقولها؛
- سمِّ المؤثرات الصوتية التي تريدها، مثل "a door slams" (باب يُصفَق) و "rain on the window" (مطر على النافذة)؛
- صِف الأجواء، مثل "café chatter" (ثرثرة مقهى) و "distant traffic" (حركة مرور بعيدة).
وإذا لم تذكر الصوت، فسيبني النموذج مع ذلك شريطًا صوتيًا للمشهد. للاطلاع على شرح مفصّل، راجع دليل كتابة الأوصاف لـ Veo 3.1.
التزام أدق بالوصف
أبرز ما تعد به Google في Veo 3.1 هو «التزام أقوى بالوصف». وعمليًا، يظهر أثر ذلك أكثر ما يظهر في الأوصاف التي تصف عدة أشياء بترتيب معيّن: حدث ثم ردّ فعل، أو حركة كاميرا محددة، أو أسلوب مسمّى. وكلما كتبت اللقطة بدقة أكبر، استعدت منها في النتيجة قدرًا أكبر، ولهذا يستحق الوصف الدقيق الجهد المبذول فيه.
وهذا أيضًا سبب انتقال أوصاف Veo 3 القديمة بسلاسة. فـ Veo 3.1 يقرأ النوع نفسه من الأوصاف، لذا يمكنك لصقها دون تغيير، ثم إحكام الأجزاء التي كان Veo 3 يتجاهلها.
تحويل أفضل للصورة إلى فيديو
أشارت Google تحديدًا في إصدار Veo 3.1 إلى «تحسين الجودة السمعية البصرية عند تحويل الصور إلى فيديوهات». فحين تبدأ من صورة، تكون تلك الصورة هي الإطار الأول، ولا يحتاج الوصف إلا إلى شرح الحركة والكاميرا والصوت. هذا هو الوضع المناسب للقطات المنتجات والصور الشخصية وأي صورة ثابتة تحتاج إلى الحفاظ عليها.
أدوات تحكّم جديدة في Veo 3.1
الإطاران الأول والأخير
أعطِ Veo 3.1 صورة بداية وصورة نهاية، وسيبني الحركة بينهما مع الصوت. استخدم ذلك حين يجب أن تنتهي اللقطة عند تكوين معروف: لحظة كشف، أو منتج يستدير ليواجه الكاميرا، أو انتقال من مشهد إلى آخر. لم يكن في Veo 3 ما يقابل ذلك.
الصور المرجعية
ما يصل إلى ثلاث صور لشخص أو شخصية أو منتج تُعرّف النموذج بهيئته، ثم يضعه النموذج في مشهد جديد. تسمّي Google هذه الميزة Ingredients to Video، وقد وسّعتها في يناير 2026 لتشمل الفيديو العمودي الأصلي بنسبة 9:16. وهي أكثر الطرق مباشرةً للحفاظ على ثبات شخصية أو منتج عبر عدة مقاطع.
التمديد
في أدوات Google نفسها يمكن تمديد مقاطع Veo 3.1: إذ يضيف Gemini API سبع ثوانٍ في كل خطوة، حتى 20 مرة، بدقة 720p، بينما تبني ميزة Extend في Flow فيديوهات متصلة مدتها دقيقة أو أكثر.
الدقة: 4K تصل في يناير 2026
يولّد Veo 3 بدقة 720p أو 1080p؛ وكانت Google قد أضافت دقة 1080p ونسبة 9:16 العمودية إلى Veo 3 في سبتمبر 2025. وفي 13 يناير 2026 أضافت Google خيار 4K إلى Veo 3.1، ووصفته بأنه «تكبير متطور». تعامل مع 4K على أنها نسخة رئيسية أكثر حدّة للشاشات الكبيرة، لا على أنها تفاصيل إضافية مولَّدة.
هل يستحق الانتقال إلى Veo 3.1؟
في معظم الحالات الخيار محسوم سلفًا: Veo 3 متقادم في واجهة Google البرمجية، فالعمل الجديد مكانه Veo 3.1. والسؤال المفيد هو كيف تنتقل بسلاسة:
- أعد استخدام أوصافك. البنية واحدة (المشهد، والكاميرا، والحوار بين علامتي تنصيص، والصوت)، فالصق أوصافك من Veo 3 نقطةَ انطلاق.
- أحكِم ما كان Veo 3 يتجاهله. لأن Veo 3.1 يلتزم بالوصف بدقة أكبر، فإن التفاصيل التي تخلّيت عنها، كالترتيب الدقيق للأحداث أو حركة كاميرا محددة، تستحق أن تعيد كتابتها.
- جرّب أدوات التحكّم الجديدة. إذا كان يجب أن تنتهي اللقطة عند إطار معيّن، فأضف إطار نهاية. وإذا كان يجب أن تبدو شخصية بالمظهر نفسه عبر المقاطع، فاستخدم الصور المرجعية.
- اختر الفئة بحسب المهمة. صُغ المسودات على Veo 3.1 Lite، واستخدم Veo 3.1 Fast للمقاطع اليومية والصور المرجعية، والفئة الكاملة Veo 3.1 للّقطة التي ستنشرها.
استخدام Veo 3.1 على Veo Video
كل فيديو Veo تصنعه على Veo Video يعمل على Veo 3.1، بما في ذلك المولّد الموجود في صفحة Veo 3 لدينا. لا يوجد هنا نموذج Veo 3.0 منفصل. كل عملية توليد تنتج مقطعًا مدته 8 ثوانٍ مع الصوت، بنسبة 16:9 أو 9:16، وبدقة 720p أو 1080p أو 4K. يمكنك البدء من نص أو صورة، وإضافة إطار نهاية في أي فئة. أما الصور المرجعية فتعمل على Veo 3.1 Fast، بما يصل إلى ثلاث صور لكل مقطع.
تحصل الحسابات الجديدة على 30 رصيدًا مجانيًا، تكفي لمقطع واحد من Veo 3.1 Lite بدقة 720p، وهي طريقة سريعة لمعرفة كيف يبدو أحد أوصافك القديمة من Veo 3 على Veo 3.1. وحين ينجح، أخرج اللقطة التي تريد الاحتفاظ بها على Veo 3.1 بدقة 1080p أو 4K.
