زیرساخت رک‌های هوش مصنوعی: تغییر پارادایم معماری و الزامات مهندسی

  • فیدار کوثر
  • 1405/7/13
چالش‌های استقرار رک هوش مصنوعی چیست؟
زیرساخت رک‌های هوش مصنوعی: تغییر پارادایم معماری و الزامات مهندسی

 

تجاری‌سازی پرشتاب هوش مصنوعی مولد (Generative AI)، مدل‌های زبانی بزرگ (LLMs) و یادگیری ماشین در مقیاس وسیع، بحرانی بی‌سابقه در زیرساخت فیزیکی دیتاسنترها ایجاد کرده است. از نظر تاریخی، معماری دیتاسنترها روندی تکاملی داشت و برای پردازشگرهای استاندارد x86 در رک‌های استاندارد ۱۹ اینچی با مصرف توانی بین ۵ تا ۱۰ کیلووات (kW) بهینه‌سازی می‌شد.

اما ظهور ابررایانه‌های مبتنی بر رک، که توسط معماری‌های سیلیکونی نظیر NVIDIA GB200 NVL72 و AMD Helios هدایت می‌شوند، این استانداردهای تاریخی را در هم شکسته است. گذر از یک رک استاندارد IT به یک رک بومی هوش مصنوعی (AI-Native Rack)، صرفاً یک ارتقای ساده در ظرفیت سرور نیست؛ بلکه یک تغییر پارادایم بنیادین در مهندسی برق، ترمودینامیک و طراحی مکانیکی محسوب می‌شود.

یک رک مدرن هوش مصنوعی می‌تواند تا ۱۳۲ کیلووات برق مصرف کند (معادل مصرف تقریبی ۸۰ واحد مسکونی) و بار حرارتی متناسبی تولید کند که از محدودیت‌های فیزیکی فناوری‌های خنک‌کننده بادی فراتر می‌رود.

با توجه به اینکه هزینه سرمایه‌ای (CAPEX) یک رک هوش مصنوعی مجهز در سال ۲۰۲۵ به طور متوسط ۳.۹ میلیون دلار است، زیرساخت دربرگیرنده این سیستم‌ها باید با تحمل خطای صفر (Zero Tolerance) در برابر فرار حرارتی، قوس الکتریکی یا آلودگی مایع خنک‌کننده مهندسی شود.

این مقاله با ارائه یک تحلیل مهندسی جامع، تغییرات معماری مورد نیاز را بررسی کرده و تفاوت‌های دقیق مکانیکی، الکتریکی و حرارتی بین رک‌های سنتی ۱۹ اینچی و سیستم‌های مدرن و پرتراکم هوش مصنوعی را کالبدشکافی می‌کند.

 

۱. تکامل معماری برق: گذر از PDUهای AC به شینه‌های 48V DC

فوری‌ترین گلوگاهی که در استقرار سخت‌افزارهای هوش مصنوعی در محیط‌های قدیمی با آن مواجه می‌شویم، معماری توزیع برق است. دیتاسنترهای سنتی برای توزیع برق متناوب (AC) به واحدهای توزیع برق (PDU) که به صورت عمودی در پشت رک نصب می‌شوند، متکی هستند.

این معماری برای بارهایی تا حدود ۳۰ کیلووات به طور پایدار عمل می‌کند. اما مقیاس‌پذیری این مدل برای رسیدن به ۱۳۲ کیلووات، موانع فیزیکی و الکتریکی غیرقابل عبوری ایجاد می‌کند. انتقال بیش از ۱۰۰ کیلووات جریان AC نیازمند کابل‌های مسی با ضخامت و سختی بسیار بالاست که مدیریت کابل را غیرممکن کرده و با مسدود کردن کامل جریان هوای خروجی، خفگی حرارتی شدیدی در پشت رک ایجاد می‌کند.

برای رفع این مشکل، صنعت دیتاسنترهای مقیاس‌پذیر (Hyperscale) به طور گسترده‌ای استاندارد Open Rack V3 (ORv3) پروژه محاسبات باز (OCP) را پذیرفته است که گذر به توزیع برق متمرکز 48V DC را الزام‌آور می‌کند. در معماری ORv3، PDUهای سنتی و منابع تغذیه (PSU) اختصاصی هر سرور حذف می‌شوند[طراحی توزیع برق داخل دیتاسنتر کانتینری]

در عوض، برق AC به قفسه‌های متمرکز برق در داخل رک منتقل می‌شود. این قفسه‌ها دارای ماژول‌های یکسوساز (Rectifier) عظیمی هستند که تبدیل AC به 48V DC را به صورت تک‌مرحله‌ای و با راندمان بالا انجام می‌دهند. سپس جریان 48V DC به یک شینه (Busbar) مسی یکپارچه که به صورت عمودی در قاب پشتی رک تعبیه شده، تزریق می‌گردد.

ارتباط بین تجهیزات IT و شینه مسی از طریق کانکتورهای بسیار پیشرفته‌ای موسوم به Blind-Mate برقرار می‌شود. این کانکتورها برای تحمل ۵۰۰ آمپر جریان پیوسته به ازای هر قطب طراحی شده‌اند و به طور خودکار هنگام قرارگیری سرور در رک، بدون نیاز به اتصال دستی کابل، با شینه درگیر می‌شوند.

 

معماری توزیع برق 48V DC در رک‌های ORv3

 

نتیجه‌گیری مهندسی: انتقال از 12V DC به 48V DC یک الزام قطعی مبتنی بر قانون اهم و قانون اول ژول است. توزیع ۱۰۰ کیلووات توان در ولتاژ ۱۲ ولت به بیش از ۸۳۰۰ آمپر جریان نیاز دارد که تلفات حرارتی وحشتناکی ایجاد می‌کند. با افزایش ولتاژ به ۴۸ ولت، شدت جریان به یک‌چهارم و تلفات توزیع (که با مجذور جریان متناسب است) به یک‌شانزدهم کاهش می‌یابد. این تغییر معماری، اتکا به کابل‌های حجیم را از بین برده و پایداری انتقال جریان در مقیاس هوش مصنوعی را تضمین می‌کند.

 

۲. بازطراحی مکانیکی و سازه‌ای: استاندارد OCP ORv3 در برابر EIA-310

تغییر به سمت بارهای کاری هوش مصنوعی نیازمند بازطراحی کامل مکانیکی ساختار رک [طراحی Rack و Cabinet] برای جا دادن هیت‌سینک‌های بزرگ‌تر، مانیفولدهای پیچیده خنک‌کننده مایع و جرم عظیم پردازنده‌های گرافیکی (GPUs) است. برای دهه‌ها، استاندارد EIA-310 با تعریف رک‌های ۱۹ اینچی و واحد اندازه‌گیری RU (معادل ۴۴.۴۵ میلی‌متر)، بر مکانیک دیتاسنترها حاکم بود.

اما این ابعاد با واقعیت‌های فیزیکی شتاب‌دهنده‌های مدرن در تضاد هستند. استاندارد ORv3 این محدودیت‌ها را با افزایش عرض داخلی قابل استفاده به ۲۱ اینچ و بازتعریف واحد عمودی به عنوان واحد باز (Open Unit - OU) به میزان دقیق ۴۸ میلی‌متر برطرف می‌کند.

افزایش عرض، حدود ۱۵ درصد فضای جانبی بیشتری فراهم می‌کند که برای نصب بردهای اصلی وسیع‌تر GPU و مسیریابی لوله‌های رفت و برگشت مایع خنک‌کننده حیاتی است.

پارامتر مشخصات استاندارد سنتی EIA-310 (رک ۱۹ اینچی) استاندارد بومی هوش مصنوعی OCP ORv3 پیامد معماری و مهندسی
عرض فضای داخلی تجهیزات ۱۷.۷ اینچ (۴۵۰ میلی‌متر) ۲۱ اینچ (۵۳۹ یا ۶۱۰ میلی‌متر) افزایش ۱۵ درصدی عرض برای گره‌های متراکم GPU و نصب مانیفولدهای مایع جانبی.
ارتفاع واحد عمودی Rack Unit (RU) = ۴۴.۴۵ میلی‌متر Open Unit (OU) = ۴۸ میلی‌متر فراهم کردن فضای عمودی بیشتر برای فن‌های بزرگ‌تر و هیت‌سینک‌های بلندتر.
توزیع نیروی برق PDUهای عمودی AC نصب شده در کنار قفسه مرکزی AC-DC و شینه مسی 48V در پشت حذف کامل کابل‌های مزاحم AC، بهبود آیرودینامیک و امکان‌پذیری بارهای بالای ۱۰۰ کیلووات.
حداکثر ظرفیت تحمل بار معمولاً ۵۰۰ تا ۱۰۰۰ کیلوگرم حداقل ۱۴۰۰ کیلوگرم (۳۰۸۶ پوند) نیازمند شاسی‌های تقویت‌شده و چرخ‌های صنعتی (Casters) برای تحمل وزن سرورهای پر از مایع.
توپولوژی خنک‌کننده صرفاً جریان هوای جلو به عقب پشتیبانی بومی از مانیفولدهای توزیع مایع در پشت رک طراحی اختصاصی برای نصب سیستم توزیع سیال بدون انسداد مسیر تعمیر و نگهداری تجهیزات.
هشدار ایمنی: بحرانی‌ترین چالش مکانیکی معرفی شده توسط رک‌های هوش مصنوعی، وزن سازه است. یک رک ORv3 پر از تجهیزات به همراه مایع خنک‌کننده می‌تواند بیش از ۱۴۰۰ کیلوگرم وزن داشته باشد. کف‌های کاذب سنتی (Raised Floors) معمولاً برای تحمل بارهای استاتیک ۱۰۰۰ تا ۱۲۰۰ کیلوگرم بر متر مربع مهندسی شده‌اند. قرار دادن رک‌های هوش مصنوعی بر روی کف کاذب قدیمی، خطر فروریزش فاجعه‌بار سازه‌ای و گسیختگی پایه‌های کف را به همراه دارد. دیتاسنترهای هوش مصنوعی باید مستقیماً بر روی دال‌های بتنی تقویت‌شده مستقر شوند.

 

۳. گذار ترمودینامیکی به خنک‌کننده مایع مستقیم (Direct Liquid Cooling)

قوانین انتقال حرارت دیکته می‌کنند که هوا به دلیل ظرفیت گرمایی ویژه پایین و هدایت حرارتی ضعیف، رسانه بسیار ناکارآمدی برای دفع بارهای حرارتی متمرکز است. زمانی که توان طراحی حرارتی (TDP) تراشه‌های GPU به بالای ۱۰۰۰ وات می‌رسد، حجم هوای مورد نیاز برای جلوگیری از اختلال حرارتی (Thermal Throttling) از نظر فیزیکی غیرممکن می‌شود.

تلاش برای خنک‌سازی بادیِ یک رک ۱۰۰ کیلوواتی به فن‌هایی با چنان سرعتی نیاز دارد که نویز کرکننده‌ای ایجاد کرده و لرزش‌های مخربی به تجهیزات نوری (Optical) شبکه وارد می‌کنند. ضرورت مطلق استفاده از خنک‌کننده مایع مستقیم (DLC)، به ویژه خنک‌کننده مستقیم روی تراشه (Direct-to-Chip)، شالوده ترمودینامیکی دیتاسنترهای AI را تشکیل می‌دهد.

ظرفیت حرارتی حجمی آب حدود ۳۲۰۰ برابر و هدایت حرارتی آن تقریباً ۲۵ برابر هواست. با گردش سیال خنک‌کننده از طریق صفحات سرد (Cold Plates) دارای میکروکانال که مستقیماً روی پردازنده‌ها نصب شده‌اند، ۸۰ تا ۹۵ درصد حرارت تولیدی دفع می‌شود.

اتصال بین صفحات سرد سرور و مانیفولد رک با استفاده از قطع‌کننده‌های سریع و ایمن (Universal Quick Disconnects - UQDs) انجام می‌شود که برای تعمیر و نگهداری بدون چکه و تعویض در حالت روشن (Hot-swappable) مهندسی شده‌اند.

اجرای این سیستم نیازمند جداسازی دقیق دو حلقه ترمودینامیکی مجزا است:

  • سیستم آب تأسیسات (FWS): حلقه اولیه‌ای که آب را از برج‌های خنک‌کننده یا چیلرها به دیتاسنتر می‌آورد. این آب ممکن است حاوی مواد شیمیایی خشن و ذرات معلق باشد.
  • سیستم خنک‌کننده تکنولوژی (TCS): حلقه‌ای که سیال تصفیه‌شده و شیمیاییِ بسیار خالصی را مستقیماً از میان مانیفولدهای رک و تجهیزات IT عبور می‌دهد.

پُل ارتباطی بین این دو سیستم، واحد توزیع خنک‌کننده (CDU) است که به عنوان مبدل حرارتی عمل کرده و علاوه بر تبادل گرما، وظیفه پمپاژ سیال TCS و نظارت بر دمای آن برای جلوگیری از تقطیر (Condensation) رطوبت درون رک را بر عهده دارد.

 

معماری جداسازی حلقه‌های خنک‌کننده مایع (FWS و TCS)

 

۳.۱ شیمی سیالات، خوردگی گالوانیک و استانداردهای ASHRAE TC 9.9

پویایی سیالات و تعادل شیمیایی درون سیستم TCS یکی از بحرانی‌ترین بردارهای ریسک در دیتاسنترهای هوش مصنوعی است. از آنجا که سیال در تماس مستقیم با فلزات ترکیبی (آلومینیوم، مس، برنج) در سرتاسر حلقه خنک‌کننده قرار دارد، سیستم به شدت در معرض خوردگی گالوانیک (Galvanic Corrosion) است.

پارامتر کیفیت آب (ASHRAE TC 9.9 / OCP TCS) مشخصات هدف پیامد عملیاتی انحراف از استاندارد
پتانسیل هیدروژن (pH) ۶.۸ تا ۸.۵ (سیالات پایه آب) مقادیر زیر ۶.۸ خوردگی اسیدی را تسریع می‌کنند؛ مقادیر بالای ۸.۵ خطر حملات قلیایی به Cold Plateهای آلومینیومی را به همراه دارند.
رسانایی الکتریکی (Conductivity) کمتر از ۱۰۰ µS/cm (برای سیستم‌های آب تصفیه‌شده) * رسانایی بالاتر تنها در مخلوط‌های پایه گلیکول (PG/EG) قابل تحمل است. رسانایی بالا نشان‌دهنده آلودگی یونی است که در حلقه‌های آب خالص، خطر خوردگی گالوانیک و اتصال کوتاه الکتریکی را به شدت افزایش می‌دهد.
سختی کل (کلسیم/منیزیم به عنوان CaCO₃) کمتر از ۲۰ میلی‌گرم در لیتر آب سخت باعث رسوب کربنات کلسیم می‌شود. تنها ۰.۲۵ میلی‌متر رسوب، راندمان انتقال حرارت را ۱۰٪ کاهش داده و موجب افت عملکرد GPU می‌شود.
بازدارنده‌های خوردگی (آزول‌ها - Azoles) بیشتر از ۱۰۰ ppm (نظیر TTA) عدم وجود آزول‌ها، فلزات زرد (مس، برنج) را در برابر تخریب اکسیداتیو و گالوانیک کاملاً بی‌دفاع می‌گذارد.
فیلتراسیون ذرات معلق کمتر از ۵۰ میکرون به طور مطلق ناتوانی در فیلتر ذرات زیر ۵۰ میکرون منجر به گرفتگی میکروکانال‌ها شده و سخت‌افزارهای چند میلیون دلاری را از کار می‌‌اندازد.
استاندارد مرجع: کمیته فنی ASHRAE TC 9.9 کلاس‌های خنک‌کننده مایع (W17, W27, W32, W40, W45) را برای حلقه‌های TCS تعریف کرده است. برای استقرارهای فوق‌متراکم هوش مصنوعی، صفحات سرد مدرن عموماً از دستورالعمل‌های دمای بالای W32 یا W40 پیروی می‌کنند، در حالی که الزامات خنک‌سازی هوای محیطیِ باقی‌مانده در دیتاسنتر تحت کلاس پرفشار هوای H1 قرار می‌گیرند. در تمامی این کلاس‌ها، ASHRAE به صراحت الزام می‌کند که دمای تامینی سیال TCS حداقل ۲ درجه سانتی‌گراد (۳.۶ درجه فارنهایت) بالاتر از نقطه شبنم (Dew Point) محیط باشد تا از تقطیر مخرب رطوبت روی قطعات الکترونیکی جلوگیری شود.
هشدار ایمنی: در طراحی شبکه‌های توزیع سیال، استفاده از لوله‌ها و شیلنگ‌های سیلیکونی استاندارد به شدت ممنوع است. سیلیکون نسبت به گازهای اتمسفری نفوذپذیر (Gas Permeable) است. نفوذ اکسیژن از طریق دیواره‌های لوله به طور مداوم اکسیژن محلول در سیال خنک‌کننده را تجدید کرده و واکنش‌های الکتروشیمیایی و خوردگی را در سطوح فلزی تسریع می‌کند. الزامات مهندسی، استفاده از مواد با نفوذپذیری پایین (مانند شیلنگ‌های ترکیبی با پوشش نایلون یا FEP) را دیکته می‌کند.

 

۴. تراکم شبکه، محدودیت‌های تاخیر و مدیریت کابل

آموزش مدل‌های زبانی بزرگ بر روی سرورهای ایزوله انجام نمی‌شود؛ بلکه به قدرت محاسباتی توزیع‌شده هزاران GPU متکی است که به صورت همگام به عنوان یک ابررایانه واحد عمل می‌کنند.

این معماری نیازمند یک شبکه بک‌اند (Backend) با توان عملیاتی بی‌سابقه و تاخیر در حد میکروثانیه است (مانند معماری‌های InfiniBand یا شبکه‌های RoCE). از آنجایی که تاخیر شبکه مستقیماً با فاصله فیزیکی و تعداد پرش‌های نوری (Optical Hops) در ارتباط است، رک‌های هوش مصنوعی باید در کلاسترهای بسیار متراکم (Pods) مستقر شوند.

طراحان زیرساخت نمی‌توانند سرورهای پرتراکم را برای کاهش تراکم حرارتی در چندین ردیف پراکنده کنند؛ این کار محدودیت‌های سخت‌گیرانه طول کابل برای همگام‌سازی کلاستر را نقض می‌کند. این تراکم شدید منجر به ازدحام صدها کابل فیبر نوری پرسرعت (به‌ویژه فیبرهای OM4 و OM5 برای فواصل کوتاه و OS2 برای ارتباطات Spine-and-Leaf) می‌شود.

عرض ۲۱ اینچی معماری ORv3 کانال‌های مسیریابی عمودی اختصاصی را فراهم می‌کند تا اطمینان حاصل شود که دسته‌های بزرگ کابل فیبر باعث انسداد مسیر هوای خروجی قطعات باقی‌مانده یا ایجاد مانع در دسترسی به مانیفولدهای خنک‌کننده مایع نمی‌شوند.

 

سوییچ شبکه دیتاسنتر

 

۵. اقتصاد بهره‌وری: PUE، پایداری و استفاده مجدد از حرارت

در حالی که مصرف مطلق برق در دیتاسنترهای AI به شدت بالاتر از تسهیلات سنتی است، تغییر معماری به خنک‌کننده مایع فرصت‌های چشمگیری برای بهینه‌سازی راندمان مصرف انرژی (PUE) باز می‌کند. جذب حرارت در سطح سیلیکون، نیاز به فن‌های با سرعت بالا در سرورها را که تا ۱۵ درصد برق کل شاسی را مصرف می‌کنند، از بین می‌برد.

البته باید توجه داشت: در حالی که حذف این فن‌ها، ورود گردوغبار و لرزش مکانیکی را از بین می‌برد، تاب‌آوری و قابلیت اطمینان سیستم اکنون کاملاً به تحمل خطای پمپ‌های افزونه CDU و یکپارچگی بدون نشتی اتصالات UQD وابسته است.

مهم‌تر از آن، بر اساس دستورالعمل‌های کلاس W32 یا W40 در ASHRAE، می‌توان پردازنده‌های گرافیکی ۱۰۰۰ واتی را با دمای آب تامین‌کننده بین ۳۲ تا ۴۵ درجه سانتی‌گراد خنک کرد. از آنجایی که این سیال می‌تواند در بیشتر ایام سال گرم‌تر از هوای محیط بیرون باشد، دیتاسنتر می‌تواند چیلرهای مکانیکی را به طور کامل از مدار خارج کرده (Chiller-less design) و منحصراً به سیستم‌های خنک‌کننده تبخیری یا درای کولرها (Dry Coolers) تکیه کند.

این رویکرد، شاخص PUE را به کمتر از ۱.۲ کاهش می‌دهد. افزون بر این، به دلیل اینکه دمای آب برگشتی به راحتی از ۵۰ درجه سانتی‌گراد فراتر می‌رود، این حرارتِ هدررفته قابلیت بازیابی و استفاده مجدد در سیستم‌های گرمایش شهری یا فرایندهای صنعتی را دارا است.

نتیجه‌گیری مدیریتی: گذر از خنک‌سازی بادی به خنک‌کننده مایع در محیط‌های هوش مصنوعی صرفاً یک الزام تکنیکال نیست، بلکه یک استراتژی اقتصادی حیاتی است. حذف چرخه‌های تبرید فشرده (Mechanical Chilling) و کاهش مصرف برق فن‌های تجهیزات، به طرز چشمگیری هزینه‌های عملیاتی (OPEX) را کاهش داده و اهداف پایداری سازمان (Sustainability) را تحقق می‌بخشد.

 

۶. استراتژی استقرار: نوسازی (Retrofit) در برابر معماری ماژولار (MDC)

مدیران زیرساخت برای میزبانی از تجهیزات جدید AI دو مسیر پیش رو دارند: نوسازی دیتاسنتر موجود یا استفاده از دیتاسنترهای ماژولار (Modular Data Centers).

نوسازی یک دیتاسنتر در حال کار برای پشتیبانی از رک‌های ۱۰۰ کیلوواتی، نیازمند تخریب گسترده، تقویت سازه‌های بتنی، تغییر سایز کامل تابلوهای برق (Switchgear) و ژنراتورها، و لوله‌کشی‌های خطرناک مایعات در مجاورت تجهیزات سنتی (Legacy IT) است.

به دلیل هزینه‌های سرسام‌آور سرمایه‌ای و خطرات بالای عملیاتیِ چنین تغییراتی در محیط زنده، صنعت به سرعت به سمت استقرار زیرساخت [طراحی AI Pod در دیتاسنتر ماژولار]در قالب دیتاسنترهای پیش‌ساخته و ماژولار (MDC) حرکت کرده است.

معیار تصمیم‌گیری نوسازی تسهیلات سنتی (Retrofit) دیتاسنترهای ماژولار بومی هوش مصنوعی (MDC)
ظرفیت سازه‌ای نیازمند تخریب کف کاذب و تقویت دال بتنی است که ریسک توقف سرویس را به شدت بالا می‌برد. دارای شاسی بتنی یا فولادی یکپارچه؛ از پیش طراحی‌شده برای تحمل وزن خیره‌کننده رک‌های ORv3.
زیرساخت خنک‌کننده ریسک بالای اضافه‌کردن لوله‌کشی‌های FWS در مجاورت تجهیزات حساس فعلی شبکه. حلقه‌های FWS و TCS به همراه CDUهای یکپارچه از پیش در کارخانه نصب و تست فشار شده‌اند.
زمان پیاده‌سازی پروژه‌های ساخت‌وساز چند ساله با تداخل عملیاتی شدید. استقرار سریع و مقیاس‌پذیر در عرض چند ماه، کاملاً مستقل از محدودیت‌های ساختمان اصلی.
زیرساخت توزیع توان محدودیت ترانسفورماتورها و UPSهای قدیمی در تامین بارهای مستمر بالا بدون افت ولتاژ. یکپارچه‌سازی با ترانسفورماتورهای فشار متوسط مختص بارهای پیوسته ۱۰۰ کیلووات به بالا.

 

زیرساخت پیش‌ساخته دیتاسنتر

 

۷. چک‌لیست ارزیابی زیرساخت برای رک‌های AI

پیش از هرگونه سرمایه‌گذاری بر روی سخت‌‌افزارهای پردازش هوش مصنوعی نظیر پلتفرم‌های NVIDIA یا AMD، مدیران زیرساخت باید موارد زیر را با دقت ارزیابی کنند:

  • بررسی بار استاتیک: آیا دال بتنی دیتاسنتر توانایی تحمل بارهای نقطه‌ای معادل حداقل ۱۴۰۰ کیلوگرم بر یک رک منفرد (یا بیشتر) را دارد؟
  • ارزیابی ظرفیت مدار و ولتاژ: آیا زیرساخت برق فعلی می‌تواند از توزیع متمرکز 48V DC پشتیبانی کرده و آمپراژ مورد نیاز را به صورت ایمن و پیوسته تامین کند؟
  • برنامه‌ریزی حلقه‌های خنک‌کننده (TCS/FWS): آیا زیرساخت لازم برای نصب، مانیتورینگ و جداسازی قطعی حلقه‌های اولیه و ثانویه آب از طریق CDU و اتصالات ضدچکه UQD فراهم است؟
  • رژیم نگهداری شیمیایی آب: آیا پروتکل‌های دقیقی برای کنترل pH، مانیتورینگ رسانایی و تزریق مواد ضدخوردگی (Azole-based) تدوین شده است؟
  • محدودیت‌های تاخیر شبکه: آیا چیدمان فیزیکی رک‌ها در کلاستر به گونه‌ای طراحی شده که محدودیت‌های شعاع خمش فیبر نوری و طول کابل‌های InfiniBand/RoCE جهت حفظ تاخیر میکروثانیه‌ای رعایت شود؟

 

۸. سوالات متداول (FAQ)

  1. استاندارد OCP ORv3 چه تفاوتی با رک‌های استاندارد ۱۹ اینچی (EIA-310) دارد؟ استاندارد ORv3 عرض داخلی قابل استفاده را به ۲۱ اینچ افزایش داده و واحد اندازه‌گیری عمودی را از RU (۴۴.۴۵ میلی‌متر) به OU (۴۸ میلی‌متر) تغییر می‌دهد تا فضای کافی برای مانیفولدهای مایع، کانکتورهای Blind-mate و بردهای وسیع GPU فراهم شود.
  2. چرا از توزیع برق 48V DC به جای ولتاژ سنتی AC در رک‌های هوش مصنوعی استفاده می‌شود؟ توزیع بارهای بالای ۱۰۰ کیلووات از طریق کابل‌های AC به جریان و ضخامت کابل بسیار بالایی نیاز دارد که مدیریت کابل را غیرممکن می‌کند. توزیع 48V DC از طریق شینه‌های مسی (Busbars)، اتلاف حرارتی را به شدت کاهش داده و انتقال ایمن ۵۰۰ آمپر جریان پیوسته را ممکن می‌سازد.
  3. تفاوت کلاس‌های خنک‌کننده در استانداردهای ASHRAE برای هوش مصنوعی چیست؟ در معماری‌های نوین AI، الزامات خنک‌کننده مایع (سیال داخل صفحات سرد) عموماً بر اساس کلاس‌های W32 یا W40 استاندارد ASHRAE طراحی می‌شوند، در حالی که بار حرارتی محیطیِ باقی‌مانده و خنک‌سازی رک‌های شبکه تابع کلاس جریان هوای متراکم یعنی H1 است.
  4. خوردگی گالوانیک در سیستم‌های خنک‌کننده مایع چگونه رخ می‌دهد و چگونه کنترل می‌شود؟ هنگامی که فلزات غیرهمسان (مانند مس مانیفولدها و آلومینیوم صفحات سرد) در تماس با یک سیال الکترولیت قرار می‌گیرند، واکنش الکتروشیمیایی باعث تجزیه فلز ضعیف‌تر می‌شود. حفظ رسانایی آب به زیر ۱۰۰ µS/cm (در سیستم‌های فاقد گلیکول) و استفاده از بازدارنده‌های خوردگی آزول برای جلوگیری از این مشکل الزامی است.

 

لوله‌های حرارتی دیتاسنتر

 

۹. نتیجه‌گیری و مشاوره با فیدار کوثر

ادغام هوش مصنوعی در معماری‌های سازمانی صرفاً یک استقرار نرم‌‌افزاری نیست؛ بلکه یک الزام سخت‌افزاری است که پارامترهای فیزیکی دیتاسنتر را به طور کامل از نو تعریف می‌کند. عصر رک‌های کم‌تراکم ۱۹ اینچی با خنک‌کننده بادی و شبکه‌ای از کابل‌های آشفته AC، به پایان محدودیت‌های ترمودینامیکی و الکتریکی خود رسیده است.

استقرار موفقیت‌آمیز شتاب‌دهنده‌های هوش مصنوعی نیازمند پذیرش استانداردهای نوینی نظیر OCP ORv3، توزیع برق 48V DC، خنک‌کننده‌های مایع مستقیم (DLC) مجهز به اتصالات UQD و مدیریت دقیق شیمی سیالات بر اساس الزامات سخت‌گیرانه ASHRAE است.

تلاش برای گنجاندن این سخت‌افزارهای فوق‌پیشرفته، بسیار سنگین و پرتراکم در دیتاسنترهای قدیمی، به دلیل عدم توانایی زیرساخت در مهار حرارت و وزن، تنها به افزایش خطرات عملیاتی و کاهش محسوس بازگشت سرمایه منجر خواهد شد. در این مسیر پرخطر، اتخاذ رویکرد استفاده از دیتاسنترهای ماژولار (MDC) راه‌حلی مهندسی‌شده، ایمن، مقیاس‌پذیر و پایدار ارائه می‌دهد.

آماده‌سازی زیرساخت شما برای انقلاب هوش مصنوعی

تیم متخصص مهندسی در فیدار کوثر آماده است تا با ارزیابی دقیق توان زیرساختی فعلی، مشاوره تخصصی در انتخاب تجهیزات خنک‌کننده مایع و طراحی نسل جدید دیتاسنترهای ماژولار هوش مصنوعی (AI-Native MDC)، سازمان شما را در گذری ایمن و بدون توقف سرویس یاری دهد. مقیاس‌پذیری زیرساخت خود را از همین امروز تضمین کنید.

درخواست مشاوره مهندسی زیرساخت AI

 

نظرات :
ارسال نظر :

بعد از ورود به حساب کاربری می توانید دیدگاه خود را ثبت کنید