
الجواب المختصر: لا يتصدّر أيّ من النموذجين في كل شيء. Veo 3.1 هو الخيار الأفضل للّقطات القصيرة المصقولة التي يقودها وصف مكتوب بإتقان: حتى 8 ثوانٍ، بنسبة 16:9 أو 9:16، وبدقة تصل إلى 4K، مع الصوت. أما Kling 3.0 فهو الخيار الأفضل حين تريد مقطعًا أطول (حتى 15 ثانية)، أو عدة لقطات داخل عملية توليد واحدة، أو تحكّمًا مباشرًا في طريقة حركة الشخصية، باستخدام أداتي Motion Control و Elements في Kling.
تعتمد هذه المقارنة على Kling 3.0، وهو الجيل الحالي من Kling، الذي صدر في فبراير 2026 إلى جانب Kling 3.0 Omni، وهو نسخة يقدّمها Kling للعمل المعتمد على المراجع مع عناصر الفيديو والتحكّم بأصوات العناصر. رُوجعت المواصفات في 28 سبتمبر 2026 مقابل وثائق Veo في Gemini API من Google، وأدلّة المستخدم الخاصة بـ Video 3.0 و Motion Control من Kling نفسها.
Veo 3.1 مقابل Kling 3.0 في لمحة
| Veo 3.1 (Google DeepMind) | Kling 3.0 (Kuaishou) | |
|---|---|---|
| الإصدار | أكتوبر 2025، وحُدّث في يناير 2026 | فبراير 2026 |
| طول المقطع | 4 أو 6 أو 8 ثوانٍ | من 3 إلى 15 ثانية |
| الدقة | 720p و 1080p و 4K | 720p و 1080p في دليل نموذج Kling؛ وصفحة منتج Kling تروّج لدقة 4K أصلية |
| نسب العرض | 16:9 و 9:16 | غير مذكورة في دليل نموذج Kling |
| صوت أصلي | نعم، مفعّل دائمًا | نعم، مع مزامنة الشفاه؛ والكلام بالصينية والإنجليزية واليابانية والكورية والإسبانية |
| عدة لقطات في مقطع واحد | لا يوجد وضع مخصّص؛ ويمكن طلب القطعات في الوصف | وضعا Multi-Shot و Custom Multi-Shot |
| المراجع | صورة بداية، وصورة نهاية اختيارية، وحتى 3 صور مرجعية | مراجع من عدة صور أو من فيديو بوصفها "Elements"، بما في ذلك شخصيات مرتبطة بصوت |
| نقل الحركة من فيديو | لا | Motion Control (أداة منفصلة) |
| تسلسلات أطول | التمديد: +7 ثوانٍ في كل خطوة، حتى نحو 148 ثانية بدقة 720p | حتى 15 ثانية في كل عملية توليد |
ملاحظتان. تصف Google خياري 1080p و 4K في Veo 3.1 بأنهما «تكبير متطور»، لذا قارن مخرجات 4K على لقطاتك أنت لا على التسمية. أما معلومات الدقة لدى Kling فتختلف بين صفحاته: إذ يذكر دليل نموذج Video 3.0 دقتي 720p و 1080p، بينما تروّج صفحة ميزات Video 3.0 لـ «4K أصلية»؛ لذا تحقّق من الوضع والخطة التي توفّر 4K قبل أن تعتمد عليها.
طول المقطع ورواية القصة بعدة لقطات
أوضح نقاط تفوّق Kling هي البنية. فعملية توليد واحدة من Kling 3.0 يمكن أن تمتد حتى 15 ثانية، وتتيح لك أوضاع Multi-Shot وصف عدة إعدادات للكاميرا، من حجم اللقطة والزاوية والحدث وحركة الكاميرا، ينتقل النموذج بينها بالقطع داخل مقطع واحد. وبالنسبة إلى لحظة سردية قصيرة أو إعلان فيه تمهيد ثم ذروة، يوفّر ذلك عليك وصل عمليات توليد منفصلة على أمل أن تتطابق.
أما Veo 3.1 فيعمل بوحدات أقصر. كل عملية توليد تمتد حتى 8 ثوانٍ؛ ويمكنك طلب قطعات داخلها، لكن المساحة المتاحة لها أقل. وللأعمال الأطول تولّد لقطةً لقطة ثم تجمعها في المونتاج، أو تستخدم التمديد في أدوات Google نفسها. وميزة الوحدات القصيرة هي التحكّم: إذا فشلت لقطة واحدة، تعيد توليد تلك اللقطة وحدها لا التسلسل كله.
ثبات الشخصية والتحكّم بالحركة
يمنحك النموذجان طرقًا للحفاظ على شخص أو منتج بالهيئة نفسها عبر المقاطع، لكنهما يتعاملان مع ذلك بطريقتين مختلفتين.
يعتمد Veo 3.1 على الصور. ابدأ من صورة ثابتة فيثبت الإطار الأول، وأضف إطار نهاية لتحدّد أين تنتهي اللقطة، أو قدّم ما يصل إلى ثلاث صور مرجعية لشخصية أو جسم أو مكان.
ويضيف Kling 3.0 أداتين لمن يريد توجيه الأداء:
- Elements: شخصيات أو أجسام قابلة لإعادة الاستخدام تُبنى من عدة صور أو من فيديو، ويمكن أن تحمل صوتًا مطابقًا؛ ويقول دليل Kling إن Video 3.0 يتعامل مع مشاهد يتحدث فيها ثلاث شخصيات أو أكثر، فيطابق كل عبارة مع الشخصية الصحيحة.
- Motion Control: ارفع فيديو لشخص يتحرك (من 3 إلى 30 ثانية) وصورة شخصية، فينقل Kling الحركة وتعابير الوجه إلى تلك الشخصية. ويطابق طول المخرجات طول الفيديو المرجعي.
إذا كنت تحتاج إلى أن تؤدي شخصية رقصة أو إيماءة أو تموضعًا محددًا على المسرح، فإن Motion Control في Kling هو الطريق الأكثر مباشرة. أما إذا كنت تحتاج أساسًا إلى أن يبدو الوجه نفسه أو المنتج نفسه صحيحًا عبر بضع لقطات، فإن الصور المرجعية في Veo 3.1 أبسط استخدامًا.
الصوت والحوار
يولّد النموذجان الشريط الصوتي مع الصورة. تقول Google إن Veo 3.1 ينتج المؤثرات الصوتية وضوضاء الأجواء والحوار بشكل أصلي. ويضيف Kling 3.0 مزامنة الشفاه على مستوى الشخصية، ويذكر خمس لغات للكلام. فإذا كنت تحتاج إلى حوار باليابانية أو الكورية أو الإسبانية، فإن Kling يوثّق هذا الدعم صراحة؛ بينما تقول Google إن أوصاف Veo تعمل على أفضل وجه بالإنجليزية، وإن اللغات الأخرى لم تُقيَّم تقييمًا كاملًا.
ومع أيّ من النموذجين، اكتب الصوت في الوصف: صوت الغرفة أو الأجواء، والمؤثر الأساسي، وكل عبارة منطوقة بين علامتي تنصيص. وأبقِ الحوار قصيرًا بما يكفي ليتّسع له المقطع.
الدقة والتسليم
إذا كنت تحتاج اليوم إلى 4K من خيار موثّق، فإن Veo 3.1 يقدّمها في فئتي Veo 3.1 و Veo 3.1 Fast (لا في Veo 3.1 Lite، بحسب Google). أما 4K لدى Kling فتتوقف على الصفحة التي تثق بها، فتأكّد منها في خطتك. ويدعم Veo 3.1 نسبتي 16:9 و 9:16، وهذا يكفي لـ YouTube و Shorts و Reels و TikTok.
أيّهما تختار؟
| مهمتك | الأنسب | السبب |
|---|---|---|
| لقطة رئيسية واحدة مصقولة أو جزء من إعلان | Veo 3.1 | التزام قوي بالوصف وتسليم بدقة 1080p/4K في 8 ثوانٍ |
| لحظة من 10 إلى 15 ثانية فيها عدة قطعات | Kling 3.0 | مقاطع أطول و Multi-Shot مدمج |
| شخصية تحاكي حركة حقيقية | Kling 3.0 | ينقل Motion Control الحركة من فيديو مرجعي |
| المنتج نفسه أو الوجه نفسه عبر بضع لقطات | أيّهما | الصور المرجعية في Veo 3.1 أو Elements في Kling |
| حوار بالصينية أو اليابانية أو الكورية أو الإسبانية | Kling 3.0 | هذه اللغات موثّقة |
| مقاطع عمودية للشبكات الاجتماعية | أيّهما | كلاهما يولّد بنسبة 9:16 |
طريقة العمل العملية هي أن تخطّط للفيديو على شكل لقطات، ثم تسند كل لقطة إلى النموذج الذي يناسبها، بدل أن تفرض كل شيء على أداة واحدة.
تجربة Veo 3.1 هنا
يشغّل Veo Video كلًّا من Veo 3.1 و Veo 3.1 Fast و Veo 3.1 Lite. كل عملية توليد تنتج مقطعًا مدته 8 ثوانٍ مع الصوت، بنسبة 16:9 أو 9:16، وبدقة 720p أو 1080p أو 4K، انطلاقًا من نص أو من صورة مع إطار نهاية اختياري. ويقبل Veo 3.1 Fast أيضًا ما يصل إلى ثلاث صور مرجعية في المولّد الكامل، والفئات الثلاث كلها توفّر 4K هنا. أما التمديد والمدد الأقصر فغير متاحة هنا، ولا يتوفر Kling على هذا الموقع.
تحصل الحسابات الجديدة على 30 رصيدًا، تكفي لمقطع واحد من Veo 3.1 Lite بدقة 720p، وهي طريقة رخيصة لاختبار وصفك قبل الانتقال إلى Veo 3.1. وإذا احتاج مشهدك إلى لقطة متصلة واحدة أطول من 8 ثوانٍ، فإن مولّد الفيديو بالذكاء الاصطناعي يشغّل أيضًا MiniMax H3 Max لإنتاج مقاطع أطول دفعة واحدة.
مقارنات أخرى: Veo 3.1 مقابل Grok Imagine و HappyHorse 1.0 مقابل Veo 3.1.
