→ العودة للأخبار EN
AIResearch

التدريب المسبق للتخيل والتعديل الدقيق للتنفيذ: صعود نماذج World-Action

تستكشف NVIDIA نماذج Vision-Language-Action (VLA) ونماذج World-Action (WAM) التي تستفيد من الأُطُر الكبيرة المدربة مسبقاً في VLM لتمكين الروبوتات من توليد الأفعال بناءً على المدخلات البصرية واللغوية.

1 دقيقة قراءة

تقدم NVIDIA قاموس مصطلحات للقراء الجدد على مفاهيم VLA وWAM. نموذج Vision-Language-Action (VLA) هو سياسة روبوت تبدأ من هيكل أساسي pretrained لنموذج رؤية-لغة (VLM) ويتم تكييفه لتوليد الأفعال بناءً على الملاحظات البصرية والتعليمات اللغوية. ويُعد التدريب المسبق واسع النطاق لنماذج VLM أساسياً لهذا النهج. بالمثل، نموذج World-Action Model (WAM) هو سياسة تبدأ من نموذج عالمي pretrained أو نموذج فيديو، يتم تعديله بدقة للعمل في السيناريوهات الواقعية. تمثل هذه النماذج نموذجاً جديداً في مجال الروبوتات والذكاء الاصطناعي، حيث تستفيد من التخيل المدرب مسبقاً لتمكين الروبوتات من أداء مهام معقدة من خلال فهم والتفاعل مع المدخلات متعددة الوسائط.

اقرأ من المصدر الأصلي ↗