چکیده
از آنجایی که هوش مصنوعی (AI) به سرعت پیشرفت میکند، شبکههای مرکز داده سنتی هنگام حمل ترافیک هوش مصنوعی با چالشهای بزرگی روبرو هستند. استفاده از پهنای باند بالا و تعداد کمی از جریان های فیل می تواند تعادل بار معمولی در هر{1}}جریان را بی اثر کند و در نتیجه ازدحام و از دست دادن بسته منجر شود که به طور قابل توجهی آموزش مدل هوش مصنوعی و زمان تکمیل کار را افزایش می دهد. این کاغذ سفید یک فناوری مسیریابی هوشمند پویا را بررسی میکند که-آگاهی زمان واقعی را با تصمیمگیری{4}}هوشمند ترکیب میکند. از مسیر-سنجش کیفیت، BGP توسعه یافته-همگامسازی ویژگی، وزن پویا-هزینه چند مسیری (WCMP)، حذف غیرعادی-مسیر و
تعادل بار خودکار (ALB) برای بهبود زمانبندی ترافیک در محیطهای هوش مصنوعی. این طرح همچنین از مجازی سازی برای ارائه انزوای چند- مستاجر استفاده می کند و سناریوهای کاربردی و راهنمایی برنامه ریزی را برای شبکه های مرکز داده هوش مصنوعی کارآمد، پایدار و هوشمند ارائه می دهد.
مقدمه: تکامل شبکه در هوش مصنوعی دوران
چرا شبکه های سنتی با هوش مصنوعی مبارزه می کنند؟ ترافیک
در شبکههای مرکز داده سنتی، تعداد زیادی جریان کوچک در هر{0}}تعادل بار جریان را قادر میسازد تا توزیع قابل قبول و اجتناب از ازدحام را حتی بدون آگاهی{1}زمانی واقعی از شرایط شبکه به دست آورد. ترافیک هوش مصنوعی بسیار متفاوت است: استفاده از پهنای باند بسیار زیاد است و ترافیک اغلب تنها تحت سلطه چند جریان فیل است. بنابراین برخورد هش می تواند چندین جریان بزرگ را در یک مسیر قرار دهد در حالی که سایر مسیرها کم استفاده می مانند. زمانی که بسته ها از دست می روند، زمان تکمیل کل بار کاری هوش مصنوعی ممکن است به میزان قابل توجهی افزایش یابد. به همین دلیل، صنعت به طور فزایندهای بر الگوریتمهای متعادلسازی بار{6} بهینه برای پارچههای هوش مصنوعی تمرکز میکند تا ترافیک به طور یکنواخت در مسیرهای متعدد توزیع شود.

شکل 1. مقایسه ترافیک جریان-جریان فیل هوش مصنوعی و ترافیک جریان کوچک- سنتی.
ترکیب آگاهی پویا با تصمیم گیری هوشمند-
مسیریابی هوشمند پویا یک فناوری متعادل کننده-بار-بر اساس آگاهی است. از کیفیت مسیری که توسط سوئیچها در پارچه حس میشود برای تنظیم انتخاب مسیر محلی استفاده میکند و از تعادل بار با وزن پویا پشتیبانی میکند. این فناوری که بر اساس BGP ساخته شده است، یک ویژگی جدید{4}}جامعه توسعه یافته را تعریف می کند.
اندازهگیریهای چند بعدی با دقت بالا{{1} برای ارزیابی کیفیت مسیر استفاده میشود و نتیجه از طریق BGP منتشر میشود تا هدایت ترافیک بعدی را هدایت کند. این کار توزیع بار گسترده شبکه را بهبود می بخشد و زمان پاسخگویی برنامه را کاهش می دهد [1].

شکل 2. آگاهی پویا، تصمیم گیری، و گردش کار اجرا.
فناوری های اصلی: برنامه ریزی هوشمند ترافیک
رویکردهای متوازن{0} بار شبکه اصلی عبارتند از:
- ECMP به ازای{0}}جریان: رایجترین رویکرد، بر اساس هش پنج-تبلی. هنگامی که جریانهای زیادی وجود دارد، به خوبی کار میکند و نظم بسته را حفظ میکند، اما برخورد هش میتواند تعادل ضعیفی را ایجاد کند، زمانی که تعداد جریان کم است، مانند آموزش هوش مصنوعی [1].
- تعادل مبتنی بر جریان: بستگی به پیکربندی صحیح شکاف بین- جریان دارد. پیکربندی دقیق زمانی که تأخیر سطح جهانی مسیر-ناشناخته است [1] دشوار است.
- ECMP در هر بسته: تعادل نظری عالی را ارائه میکند اما ممکن است مرتبسازی مجدد بستهها را در گیرنده ایجاد کند [1].
رویکرد مسیریابی هوشمند پویا که توسط سوئیچهای RoCE سری XingRongyuan CX-N (مبتنی بر SONiC{-) استفاده میشود، در هر-جریان ECMP و فلوولت-تعادل پایه ترکیب میشود. WCMP پویا (چند مسیر هزینه وزنی) و ALB مبتنی بر جریان{5} (توازن بار خودکار) [1] را معرفی می کند.
اندازه گیری کیفیت مسیر
این سیستم کیفیت مسیر شبکه را با استفاده از عواملی که به شدت بر بافتهای خوشه هوش مصنوعی تأثیر میگذارند، ارزیابی میکند، از جمله استفاده از پهنای باند، استفاده از صف و تأخیر ارسال.
شمارنده های آماری
پهنای باند و استفاده از صف از طریق شمارندههای سختافزار ASIC با دقت در سطح صد-میلیثانیه اندازهگیری میشوند. ASIC درگاههای-بازارسال و صف- شمارندههای ارسال را در زمان واقعی ضبط میکند. صفحه کنترل SONiC شمارندهها را از طریق رابط SAI با دقت کمتر-ثانیه میخواند و آنها را در Redis ذخیره میکند. فرآیند کنترل مسیریابی{7}}کیفیت رابط را با استفاده از این شمارنده ها ارزیابی می کند و نتیجه را از طریق BGP تبلیغ می کند. برای محدود کردن کنترل-بار هواپیما، تبلیغات در حال حاضر در فواصل{10}سطح دوم ارسال میشوند، با میانگین وزنی که برای نمونههای متعدد اعمال میشود. نمونه های جدیدتر وزن بیشتری دریافت می کنند.
در-تله متری باند
اندازهگیری تأخیر ارسال-بر اساس INT (در باند شبکه تلهمتری) است و میتواند به دقت نانوثانیه- برسد. HDC (High Delay Capture) بسته هایی را می گیرد که تاخیر بالایی را در داخل ASIC تجربه می کنند. هنگامی که یک بسته از آستانه تاخیر تعریف شده توسط کاربر فراتر می رود، سوئیچ 150 بایت اول بسته اصلی را همراه با ابرداده، از جمله درگاه ورودی، درگاه خروج و تاخیر، به جمع کننده ارسال می کند. در این طراحی، CPU بهعنوان جمعکننده و تجزیهکننده HDC عمل میکند و اندازهگیریهای با تأخیر را با دقت بالا و ارزیابی کیفیت مسیر{10}}را امکانپذیر میسازد.

شکل 3. انتشار کیفیت مسیر-و نصب WCMP.
این فناوری از یک ویژگی انجمن توسعهیافته{0} BGP، Path Bandwidth Extended Community، برای نشان دادن کیفیت کلی یک مسیر به مقصد استفاده میکند. بایت مرتبه بالا-در فیلد نوع گسترده-0x00 و بایت مرتب-پایین 0x05 است. در قسمت مقدار، زیرفیلد Global Administrator نشان دهنده شماره AS است. کیفیت مسیر در چهار بایت با استفاده از قالب{10}مقطع شناور IEEE کدگذاری میشود و در گیگابایت بر ثانیه بیان میشود.
هنگامی که NIC1 با NIC2 ارتباط برقرار می کند، NIC2 ابتدا آدرس IP خود را به Leaf2 تبلیغ می کند. Leaf2 آدرس را به ستون فقرات همراه با مقدار کیفیت پیوند به NIC2 ضربدر وزن لینک پایین Leaf2 تبلیغ میکند. Spine کیفیت پیوند وزنی خود را اضافه می کند و مقدار انباشته شده را به Leaf1 منتقل می کند. Leaf1 کیفیت مسیر را خلاصه می کند و مسیرهایی را نصب می کند که مسیر را هدایت می کند. در یک پارچه-دو لایه-Spine، درگاهها بهعنوان پیوندهای بالابر برگ، پیوندهای پایین برگ، و درگاههای ستون فقرات با ضرایب محاسبه قابل تنظیم برای هر کلاس طبقهبندی میشوند.
WCMP پویا
تعادل بار ترافیک را در چندین پیوند توزیع می کند. در محیطهای هوش مصنوعی، این برای ساخت یک پارچه اترنت بدون تلفات با حداقل از دست دادن بسته، تأخیر و کاهش توان عملیاتی ضروری است. ECMP مکانیزم مرسوم در مراکز داده است. WCMP ECMP را با توزیع گسترش می دهد
ترافیک متناسب بین پیوندها در مسیریابی هوشمند پویا، وزن WCMP در زمان واقعی با توجه به کیفیت مسیر تنظیم می شود. برای مثال، اگر دو مسیر بین NIC1 و NIC2 وجود داشته باشد، سیستم ممکن است نسبت 3:7 را محاسبه کند. با تغییر ترافیک، اطلاعات کیفیت مسیر{7}بهروزرسانی شده از طریق BGP به هر سوئیچ برگ منتشر میشود، جایی که مسیرهای WCMP پویا برای هدایت حمل و نقل ایجاد میشوند.
حذف مسیر غیر طبیعی
هنگامی که کیفیت کلی مسیر به زیر آستانه توافق شده میرسد، مسیر برای بار کاری هوش مصنوعی غیرقابل استفاده در نظر گرفته میشود و از ارسال حذف میشود. مسیرهای باقی مانده به حمل ترافیک از طریق WCMP پویا ادامه می دهند. پس از بازگشت مسیر به حالت عادی، بازیابی می شود. اگرچه این ممکن است به طور موقت مقداری از ظرفیت را بدون استفاده باقی بگذارد، اما از ازدحام جدی تر و از دست دادن بسته ها جلوگیری می کند [1].
تعادل بار هوشمند (ALB)
ALB توزیع بار مبتنی بر Flowlet{0}}را ارائه میکند. ASIC بار و تأخیر در پورت های مختلف را در زمان واقعی اندازه گیری می کند و هر Flowlet را با بار کمتر یا تاخیر کمتر به پیوند هدایت می کند. این برنامه زمانبندی دقیقتر- را در بالای ECMP سنتی اضافه میکند. ALB همچنین از خطای پورت پشتیبانی میکند و بهطور خودکار ترافیک را هنگامی که یک پیوند خروجی خراب میشود، توزیع میکند [1].
مجازی سازی
شبکههای جلو{0}}اغلب به پشتیبانی چند{1} مستأجر نیاز دارند تا بتوان منابع GPU مختلف را به کاربران مختلف تخصیص داد. این راه حل از VRF (مسیریابی و ارسال مجازی) برای ایزوله کردن مستاجرین استفاده می کند و یک VRF به هر کاربر اختصاص داده می شود. زیرشبکههای مربوط به GPU در VRF کاربر قرار میگیرند و PRE ACL در ASIC ترافیک ورودی را طبقهبندی میکند تا ترافیک هر کاربر فقط در VRF مربوطه ارسال شود [1].
سناریوهای کاربردی
1.WCMP دینامیک چگونه موج های ترافیک را جذب می کند
برای پارچهای با پورتهای GPU 256 x 400G، میتوان یک معماری دو لایه Clos با نسبت همگرایی پایینپیوند-به{6} 1:1 برای حفظ توان عملیاتی، پهنای باند بالا و ظرفیت متقارن طراحی کرد. مدلهای محصول مناسب شامل XingRongyuan CX864E-N یا CX732Q{11}}N [1] است. تحت ECMP معمولی، تعداد کمی از جریانهای فیل هوش مصنوعی ممکن است به همان Spine هش کنند و باعث ازدحام یا از دست دادن بستهها شوند. پویا WCMP به طور پیوسته توزیع ترافیک را بر اساس کیفیت مسیر واقعی تنظیم میکند، افزایش ترافیک را کاهش میدهد و از ازدحام جلوگیری میکند [1].
2.Flowlet{1}}سطح تعادل بار
در همان پارچه GPU 256 x 400G، هر دستگاه یا حجم کاری به بهترین وجه توسط WCMP پویا ارائه نمی شود. سوئیچ می تواند به صورت پویا ALB مبتنی بر Flowlet-را انتخاب کند. ALB بار و تأخیر پیوندها را در گروه ECMP اندازه گیری می کند و Flowlet ها را به پیوندهایی با استفاده کمتر یا تأخیر ارسال می کند. اگر یک اینترفیس بیش از حد بارگذاری شود یا تأخیر ارسال آن افزایش یابد، ASIC به طور خودکار از این خروجی جلوگیری می کند تا زمانی که شرایط به حالت عادی بازگردد [1].
برنامه ریزی و طراحی شبکه هوش مصنوعی
خدمات هوش مصنوعی به طور کلی شامل سه مرحله است: جمع آوری و پیش پردازش داده ها، آموزش مدل و استنتاج هوش مصنوعی. هر مرحله الزامات مختلفی را بر روی شبکه تحمیل می کند.
1. جمع آوری داده ها و پیش پردازش
یک شبکه آموزشی جهانی{0}}جمع آوری و پیش پردازش داده ها باید منابع IP عمومی و پهنای باند بزرگ مقیاس- را فراهم کند تا بتوان مجموعه داده های خام عظیم را به طور موثر از اینترنت جهانی جمع آوری کرد. طراحی باید انتقال امن و پایدار را تضمین کند و در عین حال تجمیع داده ها و عملکرد پیش پردازش را بهبود بخشد [2].
1.1 تقسیم بندی VPC
طراحی VPC برای جمعآوری دادههای مبتنی بر ابر{0}}باید حداقل از اصول-امتیاز، جداسازی لایهای، کنترل امنیتی و مقیاسپذیری الاستیک پیروی کند. ممکن است از چندین VPC یا چندین زیرشبکه در داخل یک VPC استفاده شود [2].
- بخش به مرحله سرویس: جمع آوری داده ها، پیش پردازش، ذخیره سازی، آموزش و استنتاج را در زیرشبکه های جداگانه یا VPC ها مستقر کنید. نقاط ورودی مجموعه را در یک DMZ VPC یا زیرشبکه عمومی قرار دهید. قرار دادن پیش پردازش و داده های موقت در یک VPC پردازش اختصاصی. دادههای خام حساس و آموزش هوش مصنوعی را در یک VPC{1}}با امنیت بالا و بدون دسترسی عمومی مستقیم قرار دهید.
- جداسازی بر اساس سطح امنیتی: VPCها یا زیرشبکههای امنیتی بالا-، متوسط{1}} و-و-پایین ایجاد کنید و از گروههای امنیتی، ACLهای شبکه و اتصال خصوصی برای کنترل ترافیک متقابل{{3}VPC و{4} زیر شبکه استفاده کنید.
- Lsolate توسط مستاجر یا پروژه: برای جداسازی منابع، شبکه ها و داده ها، VPC های جداگانه را به مستاجران یا پروژه های مختلف اختصاص دهید.
1.2 شبکه خروجی جمع آوری داده ها
دروازه NAT: از مجموعه ای از EIP ها و SNAT از طریق دروازه NAT استفاده کنید، که به برنامه های مجموعه اجازه می دهد از آدرس های IP عمومی انتخاب شده به طور تصادفی به اینترنت دسترسی داشته باشند.
پروکسی خود-ساختشده: سرورهای پراکسی را مستقر کنید که نگاشتها را بین فرآیندهای مجموعه و آدرسهای IP عمومی حفظ میکنند و یک درخواست مجموعه واحد را بین چندین پراکسی توزیع میکنند.
ارائهدهنده خدمات IP: برای هزینه کمتر، امنیت کنترلشده و کیفیت پایدار به یک ارائهدهنده خدمات IP از طریق شبکه خصوصی ابری متصل شوید [2].
1.3 تجمیع و پیش پردازش دادههای منطقهای{1}
منطقه OSS را با توجه به طرح خوشهای{0}پیش پردازش انتخاب کنید و یک VPC جمعآوری داده{1}}در همان منطقه ایجاد کنید. یک مسیریاب ترانزیت (TR) در هر منطقه ایجاد کنید، VPC های محلی را متصل کنید، و TR ها را به هم متصل کنید تا VPC های مجموعه منطقه ای بتوانند مستقیماً به OSS مرکزی دسترسی داشته باشند. خدماتی مانند PAI{4}}iTAG، MaxCompute و Flink سپس میتوانند برچسبگذاری و پیشپردازش دادهها را در منطقه OSS انجام دهند [2].
2. شبکه آموزش مدل
مدل{0}}شبکه آموزشی کاملاً با شبکه جمعآوری و پیش پردازش یکپارچه شده است تا یک بافت جهانی را تشکیل دهد که مراکز داده ابری، گرههای لبه و IDCهای موجود در-محل را به هم متصل میکند.
سرعت بالا-اتصال دادهها با تأخیر کم-و{2}}حرکت داده میشود، در حالی که پهنای باند، خطمشیهای امنیتی، کنترلهای دسترسی و بازیابی فاجعه باید از سر تا سر طراحی شوند [2].
- در{0}}منطقه متقاطع-مجموعه محاسباتی خوشهای: یک مسیریاب ترانزیت چندین VPC را در یک منطقه به هم متصل میکند. ENI های سرور به سوئیچ های VPC متصل می شوند و می توانند برای خروجی مورد نیاز و RDMA پیکربندی شوند.
- Cloud Compute Pool: مدارهای اختصاصی یک IDC یا ابر دیگر را به یک منطقه-VPC متصل میکنند. Alibaba Cloud VBR در لایه 3 به دستگاه همتا، با BGP، BFD و failover سریع برای همگرایی سریع متصل می شود.
استخر محاسباتی جهانی: پیوندهای متقابل{0}منطقه ای بین TR بر اساس اوج ترافیک{1}منطقه ای، با کیفیت سرویس بین{2}}منطقه ای اختیاری برای ایجاد یک استخر محاسباتی یکپارچه در سراسر مناطق [2] ارائه می شود.
3. استنتاج جهانی{1}}شبکه خدمات
یک شبکه استنتاج جهانی مدلهای استقرار را با توجه به منابع و خدمات ابری موجود در هر منطقه انتخاب میکند و توزیع و دسترسی کارآمد خدمات را فراهم میکند [2].
- استقرار مدل یا عامل: از استقرار Model Studio MaaS، PAI-EAS یا Function Compute PaaS یا استقرار IaaS در زیرساختهای فلزی EGS، ACK، ACS، یا Lingjun bare-در داخل VPC مشتری استفاده کنید.
- توزیع سرویس: یک VPC استنتاج ایجاد کنید و شبکههای خصوصی را با استفاده از VPC Peering، VPCهای ابری مرتبط{1}}یا PrivateLink متصل کنید. ALB یا ALB پیشرفته را به عنوان نقطه دسترسی و درخواست های پراکسی به مدل ها یا نمایندگی های مختلف مستقر کنید.
- دسترسی به خدمات: کاربران محلی اینترنت می توانند مستقیماً به ALB پیشرفته دسترسی داشته باشند. کاربران از راه دور می توانند از شتاب دهنده جهانی (GA) استفاده کنند. کاربران داخلی یا خارجی Alibaba Cloud سازمانی می توانند به صورت خصوصی از طریق PrivateLink متصل شوند.
نتیجه گیری و چشم انداز
این مقاله سفید چالشهای پیش روی شبکههای IDC در عصر هوش مصنوعی و چگونگی مسیریابی هوشمند پویا را توضیح میدهد. آگاهی پویا، تصمیم گیری هوشمند-، مجازی سازی WCMP، ALB، و VRF کارایی تعادل بار را بهبود می بخشد، ازدحام و از دست دادن بسته را کاهش می دهد و آموزش و استنتاج هوش مصنوعی را تسریع می بخشد. بخش برنامه ریزی بر تقسیم بندی VPC، مجموعه{4}}طراحی خروجی، تجمیع و پیش پردازش منطقه ای متقابل، آموزش مدل، و تحویل استنتاج جهانی تأکید دارد. با ادامه تکامل هوش مصنوعی، شبکه های مرکز داده با الزامات سخت گیرانه تری مواجه خواهند شد. مسیریابی هوشمند پویا برای هوش مصنوعی لبه، یادگیری فدرال و دیگر سناریوهای پیچیده به بهبود ادامه خواهد داد. شبکههای IDC آینده تأکید بیشتری بر همگرایی شبکه محاسباتی، کارایی انرژی، و عملیات خودکار خواهند داشت و پایهای هوشمندتر، کارآمدتر و قابل اعتمادتر برای اقتصاد دیجیتال ایجاد میکنند.
مراجع
سند منبع فنی-ارائه شده توسط کاربر.
مقاله سفید شبکه هوش مصنوعی علی بابا ابری. بازدید در 27 مه 2026.
کاغذ https://help.aliyun.com/zh/cloud

