توسيع نطاق استدلال الذكاء الاصطناعي عبر عدة وحدات معالجة رسومية باستخدام NVIDIA TensorRT مع دعم الاستدلال متعدد الأجهزة
تقدم NVIDIA دعم الاستدلال متعدد الأجهزة في TensorRT لمساعدة توسيع أحمال عمل الذكاء الاصطناعي التوليدي عبر عدة وحدات معالجة رسومية دون فقدان التحسينات الأساسية، مع معالجة قيود الذاكرة والحوسبة لوحدات المعالجة الرسومية الفردية.
تشهد أحمال عمل الذكاء الاصطناعي التوليدي نموًا سريعًا يتجاوز ميزانية الذاكرة والحوسبة لوحدات المعالجة الرسومية الفردية. بالنسبة لمطوري الاستدلال الذين يبنون خطوط إنتاج لإنشاء الوسائط، يتمثل التحدي في التوسع عبر عدة أجهزة دون التضحية بالتحسينات الحيوية مثل دمج النوى، تخطيط الذاكرة، والتكميم التي يوفرها NVIDIA TensorRT للنشر الإنتاجي. يتيح دعم الاستدلال متعدد الأجهزة في TensorRT للمطورين توزيع أحمال عمل استدلال الذكاء الاصطناعي بكفاءة عبر عدة وحدات معالجة رسومية، متجاوزًا قيود الذاكرة والحوسبة للأجهزة الفردية. هذه القدرة ضرورية لتوسيع نماذج الذكاء الاصطناعي التوليدية في بيئات الإنتاج، مما يضمن أداءً عاليًا واستخدامًا مثاليًا للموارد.