أصبحت الروبوتات التي تدعمها نماذج Gemini AI من Google أكثر قدرة الآن. مع ظهور Gemini Robotics 2 لأول مرة، يمكن لهذه الروبوتات المادية الآن إنجاز مهام أكثر تعقيدًا، وتحليل البيئات المتغيرة بشكل مستمر، والتعاون مع الروبوتات الأخرى. ويعود الفضل في ذلك إلى ثلاثة نماذج فرعية جديدة، أحدها متاح للعامة للمطورين بدءًا من اليوم.

لقد كانت مقاطع الفيديو التي تصور الروبوتات وهي تركض وترقص وتقفز على الظهر من العناصر الأساسية على الإنترنت لسنوات، ولكن تمت برمجة هذه الآلات لأداء هذه المهام الضيقة جدًا. الهدف من شركة Gemini Robotics هو إنشاء روبوت عام، يمكنه فعل أي شيء يمكن أن يفعله الإنسان. يطلق علماء Google DeepMind أحيانًا على هذا اسم “الذكاء الاصطناعي العام المادي”. في الأساس، أنت تخبر الروبوت بما يجب عليه فعله، وهو يفعل ذلك. مع الإصدار 2.0، تقول جوجل إن الذكاء الاصطناعي الروبوتي الخاص بها يمكنه التحكم في روبوت كامل يشبه الإنسان ببراعة محسنة، حتى بالنسبة للآلات ذات الأيدي البشرية المعقدة.

تقدم Gemini Robotics 2 ذكاء الجسم بالكامل للروبوتات.

يبدأ هذا بـ Gemini Robotics ER 2، وهو نموذج “استدلال مجسد” مطور تدعي شركة DeepMind أنه يمثل قفزة كبيرة مقارنة بالإصدار 1.6 السابق. إنه متكامل مع Gemini Live API، مما يمنح المطورين الفرصة لتجربة تلك القفزة المفترضة إلى الأمام.

Gemini Robotics ER 2 هو ما يُعرف بنموذج لغة الرؤية (VLM). لقد تم تصميمه لفهم التعليمات والعالم من حوله. الترقية الكبيرة هنا هي أن ER 2 يمكنه معالجة بث الفيديو المباشر من كاميرات الروبوت، مما يسمح للنظام بتتبع التقدم أثناء تحرك الروبوت من خطوة إلى أخرى. تشير Google إلى أن Gemini Robotics ER 2 يمكنه تصنيف اكتمال إطار الفيديو بدقة تصل إلى 60 بالمائة تقريبًا. لا يزال هذا بعيدًا عن الكمال، ولكنه أفضل بكثير من الإصدار 1.6 أو ما يمكنك الحصول عليه من خلال الفهم البصري لنماذج الذكاء الاصطناعي المنافسة.

شاركها.
اترك تعليقاً