چکیده

از آنجایی که هوش مصنوعی (AI) به سرعت پیشرفت می‌کند، شبکه‌های مرکز داده سنتی هنگام حمل ترافیک هوش مصنوعی با چالش‌های بزرگی روبرو هستند. استفاده از پهنای باند بالا و تعداد کمی از جریان های فیل می تواند تعادل بار معمولی در هر{1}}جریان را بی اثر کند و در نتیجه ازدحام و از دست دادن بسته منجر شود که به طور قابل توجهی آموزش مدل هوش مصنوعی و زمان تکمیل کار را افزایش می دهد. این کاغذ سفید یک فناوری مسیریابی هوشمند پویا را بررسی می‌کند که-آگاهی زمان واقعی را با تصمیم‌گیری{4}}هوشمند ترکیب می‌کند. از مسیر-سنجش کیفیت، BGP توسعه یافته-همگام‌سازی ویژگی، وزن پویا-هزینه چند مسیری (WCMP)، حذف غیرعادی-مسیر و

تعادل بار خودکار (ALB) برای بهبود زمان‌بندی ترافیک در محیط‌های هوش مصنوعی. این طرح همچنین از مجازی سازی برای ارائه انزوای چند- مستاجر استفاده می کند و سناریوهای کاربردی و راهنمایی برنامه ریزی را برای شبکه های مرکز داده هوش مصنوعی کارآمد، پایدار و هوشمند ارائه می دهد.

 

مقدمه: تکامل شبکه در هوش مصنوعی دوران

 

چرا شبکه های سنتی با هوش مصنوعی مبارزه می کنند؟ ترافیک

در شبکه‌های مرکز داده سنتی، تعداد زیادی جریان کوچک در هر{0}}تعادل بار جریان را قادر می‌سازد تا توزیع قابل قبول و اجتناب از ازدحام را حتی بدون آگاهی{1}زمانی واقعی از شرایط شبکه به دست آورد. ترافیک هوش مصنوعی بسیار متفاوت است: استفاده از پهنای باند بسیار زیاد است و ترافیک اغلب تنها تحت سلطه چند جریان فیل است. بنابراین برخورد هش می تواند چندین جریان بزرگ را در یک مسیر قرار دهد در حالی که سایر مسیرها کم استفاده می مانند. زمانی که بسته ها از دست می روند، زمان تکمیل کل بار کاری هوش مصنوعی ممکن است به میزان قابل توجهی افزایش یابد. به همین دلیل، صنعت به طور فزاینده‌ای بر الگوریتم‌های متعادل‌سازی بار{6} بهینه برای پارچه‌های هوش مصنوعی تمرکز می‌کند تا ترافیک به طور یکنواخت در مسیرهای متعدد توزیع شود.

1

 

شکل 1. مقایسه ترافیک جریان-جریان فیل هوش مصنوعی و ترافیک جریان کوچک- سنتی.

 

ترکیب آگاهی پویا با تصمیم گیری هوشمند-

مسیریابی هوشمند پویا یک فناوری متعادل کننده-بار-بر اساس آگاهی است. از کیفیت مسیری که توسط سوئیچ‌ها در پارچه حس می‌شود برای تنظیم انتخاب مسیر محلی استفاده می‌کند و از تعادل بار با وزن پویا پشتیبانی می‌کند. این فناوری که بر اساس BGP ساخته شده است، یک ویژگی جدید{4}}جامعه توسعه یافته را تعریف می کند.

اندازه‌گیری‌های چند بعدی با دقت بالا{{1} برای ارزیابی کیفیت مسیر استفاده می‌شود و نتیجه از طریق BGP منتشر می‌شود تا هدایت ترافیک بعدی را هدایت کند. این کار توزیع بار گسترده شبکه را بهبود می بخشد و زمان پاسخگویی برنامه را کاهش می دهد [1].

 

2

 

شکل 2. آگاهی پویا، تصمیم گیری، و گردش کار اجرا.

 

فناوری های اصلی: برنامه ریزی هوشمند ترافیک

 

رویکردهای متوازن{0} بار شبکه اصلی عبارتند از:

  • ECMP به ازای{0}}جریان: رایج‌ترین رویکرد، بر اساس هش پنج-تبلی. هنگامی که جریان‌های زیادی وجود دارد، به خوبی کار می‌کند و نظم بسته را حفظ می‌کند، اما برخورد هش می‌تواند تعادل ضعیفی را ایجاد کند، زمانی که تعداد جریان کم است، مانند آموزش هوش مصنوعی [1].
  • تعادل مبتنی بر جریان: بستگی به پیکربندی صحیح شکاف بین- جریان دارد. پیکربندی دقیق زمانی که تأخیر سطح جهانی مسیر-ناشناخته است [1] دشوار است.
  • ECMP در هر بسته: تعادل نظری عالی را ارائه می‌کند اما ممکن است مرتب‌سازی مجدد بسته‌ها را در گیرنده ایجاد کند [1].

رویکرد مسیریابی هوشمند پویا که توسط سوئیچ‌های RoCE سری XingRongyuan CX-N (مبتنی بر SONiC{-) استفاده می‌شود، در هر-جریان ECMP و فلوولت-تعادل پایه ترکیب می‌شود. WCMP پویا (چند مسیر هزینه وزنی) و ALB مبتنی بر جریان{5} (توازن بار خودکار) [1] را معرفی می کند.

 

اندازه گیری کیفیت مسیر

این سیستم کیفیت مسیر شبکه را با استفاده از عواملی که به شدت بر بافت‌های خوشه هوش مصنوعی تأثیر می‌گذارند، ارزیابی می‌کند، از جمله استفاده از پهنای باند، استفاده از صف و تأخیر ارسال.

شمارنده های آماری

پهنای باند و استفاده از صف از طریق شمارنده‌های سخت‌افزار ASIC با دقت در سطح صد-میلی‌ثانیه اندازه‌گیری می‌شوند. ASIC درگاه‌های-بازارسال و صف- شمارنده‌های ارسال را در زمان واقعی ضبط می‌کند. صفحه کنترل SONiC شمارنده‌ها را از طریق رابط SAI با دقت کمتر-ثانیه می‌خواند و آنها را در Redis ذخیره می‌کند. فرآیند کنترل مسیریابی{7}}کیفیت رابط را با استفاده از این شمارنده ها ارزیابی می کند و نتیجه را از طریق BGP تبلیغ می کند. برای محدود کردن کنترل-بار هواپیما، تبلیغات در حال حاضر در فواصل{10}سطح دوم ارسال می‌شوند، با میانگین وزنی که برای نمونه‌های متعدد اعمال می‌شود. نمونه های جدیدتر وزن بیشتری دریافت می کنند.

 

در-تله متری باند

اندازه‌گیری تأخیر ارسال-بر اساس INT (در باند شبکه تله‌متری) است و می‌تواند به دقت نانوثانیه- برسد. HDC (High Delay Capture) بسته هایی را می گیرد که تاخیر بالایی را در داخل ASIC تجربه می کنند. هنگامی که یک بسته از آستانه تاخیر تعریف شده توسط کاربر فراتر می رود، سوئیچ 150 بایت اول بسته اصلی را همراه با ابرداده، از جمله درگاه ورودی، درگاه خروج و تاخیر، به جمع کننده ارسال می کند. در این طراحی، CPU به‌عنوان جمع‌کننده و تجزیه‌کننده HDC عمل می‌کند و اندازه‌گیری‌های با تأخیر را با دقت بالا و ارزیابی کیفیت مسیر{10}}را امکان‌پذیر می‌سازد.

 

3

شکل 3. انتشار کیفیت مسیر-و نصب WCMP.

 

این فناوری از یک ویژگی انجمن توسعه‌یافته{0} BGP، Path Bandwidth Extended Community، برای نشان دادن کیفیت کلی یک مسیر به مقصد استفاده می‌کند. بایت مرتبه بالا-در فیلد نوع گسترده-0x00 و بایت مرتب-پایین 0x05 است. در قسمت مقدار، زیرفیلد Global Administrator نشان دهنده شماره AS است. کیفیت مسیر در چهار بایت با استفاده از قالب{10}مقطع شناور IEEE کدگذاری می‌شود و در گیگابایت بر ثانیه بیان می‌شود.

هنگامی که NIC1 با NIC2 ارتباط برقرار می کند، NIC2 ابتدا آدرس IP خود را به Leaf2 تبلیغ می کند. Leaf2 آدرس را به ستون فقرات همراه با مقدار کیفیت پیوند به NIC2 ضربدر وزن لینک پایین Leaf2 تبلیغ می‌کند. Spine کیفیت پیوند وزنی خود را اضافه می کند و مقدار انباشته شده را به Leaf1 منتقل می کند. Leaf1 کیفیت مسیر را خلاصه می کند و مسیرهایی را نصب می کند که مسیر را هدایت می کند. در یک پارچه-دو لایه-Spine، درگاه‌ها به‌عنوان پیوندهای بالابر برگ، پیوندهای پایین برگ، و درگاه‌های ستون فقرات با ضرایب محاسبه قابل تنظیم برای هر کلاس طبقه‌بندی می‌شوند.

 

WCMP پویا

تعادل بار ترافیک را در چندین پیوند توزیع می کند. در محیط‌های هوش مصنوعی، این برای ساخت یک پارچه اترنت بدون تلفات با حداقل از دست دادن بسته، تأخیر و کاهش توان عملیاتی ضروری است. ECMP مکانیزم مرسوم در مراکز داده است. WCMP ECMP را با توزیع گسترش می دهد

ترافیک متناسب بین پیوندها در مسیریابی هوشمند پویا، وزن WCMP در زمان واقعی با توجه به کیفیت مسیر تنظیم می شود. برای مثال، اگر دو مسیر بین NIC1 و NIC2 وجود داشته باشد، سیستم ممکن است نسبت 3:7 را محاسبه کند. با تغییر ترافیک، اطلاعات کیفیت مسیر{7}به‌روزرسانی شده از طریق BGP به هر سوئیچ برگ منتشر می‌شود، جایی که مسیرهای WCMP پویا برای هدایت حمل و نقل ایجاد می‌شوند.

 

حذف مسیر غیر طبیعی

هنگامی که کیفیت کلی مسیر به زیر آستانه توافق شده می‌رسد، مسیر برای بار کاری هوش مصنوعی غیرقابل استفاده در نظر گرفته می‌شود و از ارسال حذف می‌شود. مسیرهای باقی مانده به حمل ترافیک از طریق WCMP پویا ادامه می دهند. پس از بازگشت مسیر به حالت عادی، بازیابی می شود. اگرچه این ممکن است به طور موقت مقداری از ظرفیت را بدون استفاده باقی بگذارد، اما از ازدحام جدی تر و از دست دادن بسته ها جلوگیری می کند [1].

 

تعادل بار هوشمند (ALB)

ALB توزیع بار مبتنی بر Flowlet{0}}را ارائه می‌کند. ASIC بار و تأخیر در پورت های مختلف را در زمان واقعی اندازه گیری می کند و هر Flowlet را با بار کمتر یا تاخیر کمتر به پیوند هدایت می کند. این برنامه زمان‌بندی دقیق‌تر- را در بالای ECMP سنتی اضافه می‌کند. ALB همچنین از خطای پورت پشتیبانی می‌کند و به‌طور خودکار ترافیک را هنگامی که یک پیوند خروجی خراب می‌شود، توزیع می‌کند [1].

 

مجازی سازی

شبکه‌های جلو{0}}اغلب به پشتیبانی چند{1} مستأجر نیاز دارند تا بتوان منابع GPU مختلف را به کاربران مختلف تخصیص داد. این راه حل از VRF (مسیریابی و ارسال مجازی) برای ایزوله کردن مستاجرین استفاده می کند و یک VRF به هر کاربر اختصاص داده می شود. زیرشبکه‌های مربوط به GPU در VRF کاربر قرار می‌گیرند و PRE ACL در ASIC ترافیک ورودی را طبقه‌بندی می‌کند تا ترافیک هر کاربر فقط در VRF مربوطه ارسال شود [1].

 

سناریوهای کاربردی

 

1.WCMP دینامیک چگونه موج های ترافیک را جذب می کند

برای پارچه‌ای با پورت‌های GPU 256 x 400G، می‌توان یک معماری دو لایه Clos با نسبت همگرایی پایین‌پیوند-به{6} 1:1 برای حفظ توان عملیاتی، پهنای باند بالا و ظرفیت متقارن طراحی کرد. مدل‌های محصول مناسب شامل XingRongyuan CX864E-N یا CX732Q{11}}N [1] است. تحت ECMP معمولی، تعداد کمی از جریان‌های فیل هوش مصنوعی ممکن است به همان Spine هش کنند و باعث ازدحام یا از دست دادن بسته‌ها شوند. پویا WCMP به طور پیوسته توزیع ترافیک را بر اساس کیفیت مسیر واقعی تنظیم می‌کند، افزایش ترافیک را کاهش می‌دهد و از ازدحام جلوگیری می‌کند [1].

 

2.Flowlet{1}}سطح تعادل بار

در همان پارچه GPU 256 x 400G، هر دستگاه یا حجم کاری به بهترین وجه توسط WCMP پویا ارائه نمی شود. سوئیچ می تواند به صورت پویا ALB مبتنی بر Flowlet-را انتخاب کند. ALB بار و تأخیر پیوندها را در گروه ECMP اندازه گیری می کند و Flowlet ها را به پیوندهایی با استفاده کمتر یا تأخیر ارسال می کند. اگر یک اینترفیس بیش از حد بارگذاری شود یا تأخیر ارسال آن افزایش یابد، ASIC به طور خودکار از این خروجی جلوگیری می کند تا زمانی که شرایط به حالت عادی بازگردد [1].

 

برنامه ریزی و طراحی شبکه هوش مصنوعی

 

خدمات هوش مصنوعی به طور کلی شامل سه مرحله است: جمع آوری و پیش پردازش داده ها، آموزش مدل و استنتاج هوش مصنوعی. هر مرحله الزامات مختلفی را بر روی شبکه تحمیل می کند.

 

1. جمع آوری داده ها و پیش پردازش

یک شبکه آموزشی جهانی{0}}جمع آوری و پیش پردازش داده ها باید منابع IP عمومی و پهنای باند بزرگ مقیاس- را فراهم کند تا بتوان مجموعه داده های خام عظیم را به طور موثر از اینترنت جهانی جمع آوری کرد. طراحی باید انتقال امن و پایدار را تضمین کند و در عین حال تجمیع داده ها و عملکرد پیش پردازش را بهبود بخشد [2].

 

1.1 تقسیم بندی VPC

طراحی VPC برای جمع‌آوری داده‌های مبتنی بر ابر{0}}باید حداقل از اصول-امتیاز، جداسازی لایه‌ای، کنترل امنیتی و مقیاس‌پذیری الاستیک پیروی کند. ممکن است از چندین VPC یا چندین زیرشبکه در داخل یک VPC استفاده شود [2].

  • بخش به مرحله سرویس: جمع آوری داده ها، پیش پردازش، ذخیره سازی، آموزش و استنتاج را در زیرشبکه های جداگانه یا VPC ها مستقر کنید. نقاط ورودی مجموعه را در یک DMZ VPC یا زیرشبکه عمومی قرار دهید. قرار دادن پیش پردازش و داده های موقت در یک VPC پردازش اختصاصی. داده‌های خام حساس و آموزش هوش مصنوعی را در یک VPC{1}}با امنیت بالا و بدون دسترسی عمومی مستقیم قرار دهید.
  • جداسازی بر اساس سطح امنیتی: VPCها یا زیرشبکه‌های امنیتی بالا-، متوسط{1}} و-و-پایین ایجاد کنید و از گروه‌های امنیتی، ACLهای شبکه و اتصال خصوصی برای کنترل ترافیک متقابل{{3}VPC و{4} زیر شبکه استفاده کنید.
  • Lsolate توسط مستاجر یا پروژه: برای جداسازی منابع، شبکه ها و داده ها، VPC های جداگانه را به مستاجران یا پروژه های مختلف اختصاص دهید.

 

1.2 شبکه خروجی جمع آوری داده ها

دروازه NAT: از مجموعه ای از EIP ها و SNAT از طریق دروازه NAT استفاده کنید، که به برنامه های مجموعه اجازه می دهد از آدرس های IP عمومی انتخاب شده به طور تصادفی به اینترنت دسترسی داشته باشند.

پروکسی خود-ساخت‌شده: سرورهای پراکسی را مستقر کنید که نگاشت‌ها را بین فرآیندهای مجموعه و آدرس‌های IP عمومی حفظ می‌کنند و یک درخواست مجموعه واحد را بین چندین پراکسی توزیع می‌کنند.

ارائه‌دهنده خدمات IP: برای هزینه کمتر، امنیت کنترل‌شده و کیفیت پایدار به یک ارائه‌دهنده خدمات IP از طریق شبکه خصوصی ابری متصل شوید [2].

 

1.3 تجمیع و پیش پردازش داده‌های منطقه‌ای{1}

منطقه OSS را با توجه به طرح خوشه‌ای{0}پیش پردازش انتخاب کنید و یک VPC جمع‌آوری داده{1}}در همان منطقه ایجاد کنید. یک مسیریاب ترانزیت (TR) در هر منطقه ایجاد کنید، VPC های محلی را متصل کنید، و TR ها را به هم متصل کنید تا VPC های مجموعه منطقه ای بتوانند مستقیماً به OSS مرکزی دسترسی داشته باشند. خدماتی مانند PAI{4}}iTAG، MaxCompute و Flink سپس می‌توانند برچسب‌گذاری و پیش‌پردازش داده‌ها را در منطقه OSS انجام دهند [2].

 

2. شبکه آموزش مدل

مدل{0}}شبکه آموزشی کاملاً با شبکه جمع‌آوری و پیش پردازش یکپارچه شده است تا یک بافت جهانی را تشکیل دهد که مراکز داده ابری، گره‌های لبه و IDC‌های موجود در-محل را به هم متصل می‌کند.

سرعت بالا-اتصال داده‌ها با تأخیر کم-و{2}}حرکت داده می‌شود، در حالی که پهنای باند، خط‌مشی‌های امنیتی، کنترل‌های دسترسی و بازیابی فاجعه باید از سر تا سر طراحی شوند [2].

  • در{0}}منطقه متقاطع-مجموعه محاسباتی خوشه‌ای: یک مسیریاب ترانزیت چندین VPC را در یک منطقه به هم متصل می‌کند. ENI های سرور به سوئیچ های VPC متصل می شوند و می توانند برای خروجی مورد نیاز و RDMA پیکربندی شوند.
  • Cloud Compute Pool: مدارهای اختصاصی یک IDC یا ابر دیگر را به یک منطقه-VPC متصل می‌کنند. Alibaba Cloud VBR در لایه 3 به دستگاه همتا، با BGP، BFD و failover سریع برای همگرایی سریع متصل می شود.

استخر محاسباتی جهانی: پیوندهای متقابل{0}منطقه ای بین TR بر اساس اوج ترافیک{1}منطقه ای، با کیفیت سرویس بین{2}}منطقه ای اختیاری برای ایجاد یک استخر محاسباتی یکپارچه در سراسر مناطق [2] ارائه می شود.

 

3. استنتاج جهانی{1}}شبکه خدمات

یک شبکه استنتاج جهانی مدل‌های استقرار را با توجه به منابع و خدمات ابری موجود در هر منطقه انتخاب می‌کند و توزیع و دسترسی کارآمد خدمات را فراهم می‌کند [2].

  • استقرار مدل یا عامل: از استقرار Model Studio MaaS، PAI-EAS یا Function Compute PaaS یا استقرار IaaS در زیرساخت‌های فلزی EGS، ACK، ACS، یا Lingjun bare-در داخل VPC مشتری استفاده کنید.
  • توزیع سرویس: یک VPC استنتاج ایجاد کنید و شبکه‌های خصوصی را با استفاده از VPC Peering، VPCهای ابری مرتبط{1}}یا PrivateLink متصل کنید. ALB یا ALB پیشرفته را به عنوان نقطه دسترسی و درخواست های پراکسی به مدل ها یا نمایندگی های مختلف مستقر کنید.
  • دسترسی به خدمات: کاربران محلی اینترنت می توانند مستقیماً به ALB پیشرفته دسترسی داشته باشند. کاربران از راه دور می توانند از شتاب دهنده جهانی (GA) استفاده کنند. کاربران داخلی یا خارجی Alibaba Cloud سازمانی می توانند به صورت خصوصی از طریق PrivateLink متصل شوند.

 

نتیجه گیری و چشم انداز

 

این مقاله سفید چالش‌های پیش روی شبکه‌های IDC در عصر هوش مصنوعی و چگونگی مسیریابی هوشمند پویا را توضیح می‌دهد. آگاهی پویا، تصمیم گیری هوشمند-، مجازی سازی WCMP، ALB، و VRF کارایی تعادل بار را بهبود می بخشد، ازدحام و از دست دادن بسته را کاهش می دهد و آموزش و استنتاج هوش مصنوعی را تسریع می بخشد. بخش برنامه ریزی بر تقسیم بندی VPC، مجموعه{4}}طراحی خروجی، تجمیع و پیش پردازش منطقه ای متقابل، آموزش مدل، و تحویل استنتاج جهانی تأکید دارد. با ادامه تکامل هوش مصنوعی، شبکه های مرکز داده با الزامات سخت گیرانه تری مواجه خواهند شد. مسیریابی هوشمند پویا برای هوش مصنوعی لبه، یادگیری فدرال و دیگر سناریوهای پیچیده به بهبود ادامه خواهد داد. شبکه‌های IDC آینده تأکید بیشتری بر همگرایی شبکه محاسباتی، کارایی انرژی، و عملیات خودکار خواهند داشت و پایه‌ای هوشمندتر، کارآمدتر و قابل اعتمادتر برای اقتصاد دیجیتال ایجاد می‌کنند.

 

مراجع

سند منبع فنی-ارائه شده توسط کاربر.

مقاله سفید شبکه هوش مصنوعی علی بابا ابری. بازدید در 27 مه 2026.

کاغذ https://help.aliyun.com/zh/cloud

 

 

ارسال درخواست