انقلاب هوش مصنوعی مولد (Generative AI) و توسعه مدلهای زبانی بزرگ (LLM) نظیر سریهای Llama، DeepSeek، Mistral و Qwen، استانداردهای زیرساخت سختافزاری را در سراسر جهان زیر و رو کرده است. اگر چند سال پیش برای راهاندازی یک چتبات ساده به یک هاست اشتراکی و یک دیتابیس کوچک اکتفا میکردید، امروز اجرای حتی یک مدل زبانی متوسط، نیازمند دهها گیگابایت حافظه گرافیکی، صدها گیگابایت رم سرور و خنککاری حرفهای است.
در ایران نیز بسیاری از شرکتها، استارتاپها، سازمانهای دولتی و تیمهای نرمافزاری با یک دوراهی مهم روبهرو هستند: استفاده از سرویسهای پردازش ابری یا راهاندازی زیرساخت فیزیکی اختصاصی (On-Premise)؟
در این مقاله تخصصی، چالشهای زیرساخت هوش مصنوعی در ایران را واکاوی میکنیم، معماری مناسب سرور برای بارهای کاری (Workload) هوش مصنوعی را تشریح میکنیم و راهنمای کاملی برای انتخاب و کانفیگ شاسیهای قدرتمند سرور HPE جهت پیادهسازی پروژههای Deep Learning ارائه میدهیم.
هرچند راهاندازی سریع اولیه در سرویسهای ابری جذاب به نظر میرسد، اما میزبانی مدلهای زبانی و آموزش (Training) یا حتی پاسخدهی به پرامپتها (Inference) در مقیاس عملیاتی، روی زیرساخت ابری با چند گلوگاه اساسی مواجه است:
اجاره سرورهای ابری مجهز به کارتهای گرافیک قدرتمند (مانند سری A100 یا H100) در ارائهدهندگان خارجی، با توجه به نوسانات ارز و مدل پرداخت ساعتی/ماهانه، در یک بازه ۶ تا ۱۲ ماهه هزینهای فراتر از خرید مالکانه یک سرور فیزیکی سازمانی ایجاد میکند. به عبارت دیگر، هزینه ابری یک «قسط همیشگی» است، در حالی که سرور فیزیکی یک «سرمایهگذاری یکباره» با عمر مفید ۵ تا ۷ سال محسوب میشود.
دسترسی به APIهای سرویسهای هوش مصنوعی خارجی همواره در معرض محدودیتهای بینالمللی و مسدودسازی ناگهانی IPهاست. از سوی دیگر، ارسال دادههای حساس سازمانی — اسناد مالی، اطلاعات مشتریان، مکاتبات داخلی — به سرورهای خارج از کشور، ریسکهای جدی حریم خصوصی و امنیت سایبری به دنبال دارد. بسیاری از سازمانهای ایرانی به همین دلیل به دنبال راهکارهای RAG و مدلهای متنباز میزبانیشده در داخل کشور هستند.
برای مدلهای حجیم که بهصورت محلی اجرا میشوند، انتقال مداوم دیتاستها و وزن مدلها (Weight Files) در بستر اینترنت بینالمللی، هم کندی و هم ناپایداری ایجاد میکند؛ در حالی که روی سرور داخلی، پاسخدهی با تاخیری در حد چند میلیثانیه انجام میشود.
به همین دلیل، شرکتهای آیندهنگر به سمت خرید سرور هوش مصنوعی و پیادهسازی زیرساخت داخلی رفتهاند تا علاوه بر استقلال و امنیت کامل، هزینه تمامشده زیرساخت را در بلندمدت مهار کنند.
در کاربردهای هوش مصنوعی، مهمترین بخش سرور صرفاً پردازنده مرکزی نیست. یک سرور AI واقعی باید در چهار محور طراحی شده باشد:
کمپانی HPE از دیرباز در زمینه پایداری، طراحی ماژولار شاسی و سیستمهای مدیریت سلامت سختافزار (مانند iLO) پیشرو بوده است. شاسیهای رکمونت 2U سری DL380 به دلیل طراحی بهینه رایزرها و خنککاری پیشرفته، استاندارد طلایی این حوزه به شمار میروند.
شاسی Gen10 با پشتیبانی از پردازندههای Intel Xeon Scalable نسل اول و دوم (Skylake و Cascade Lake)، امکان میزبانی حافظههای DDR4 تا ظرفیت ۳ ترابایت را فراهم میکند. این سرور قادر است همزمان ۲ تا ۳ کارت گرافیک دبلاسلات (Double-Wide) را در خود جای دهد و برای پیادهسازی پایپلاینهای Inference، اجرای مدلهای زبانی کوانتیزهشده و Fine-tuning مدلهای متوسط، انتخابی فوقالعاده پایدار است. از آنجا که این نسل در بازار استوک با کیفیت عالی و قیمت رقابتی عرضه میشود، بالاترین نسبت «کارایی به ریال» را برای پروژههای AI ارائه میدهد.
اگر قصد میزبانی و پردازش مدلهای سنگین چند دهمیلیاردی پارامتری را دارید، نسل Gen11 با پردازندههای نسل ۴ و ۵ زئون (Sapphire Rapids و Emerald Rapids)، استاندارد حافظه فوقسریع DDR5 و اسلاتهای PCIe Gen5، پهنای باند بدون گلوگاهی در اختیار کارتهای گرافیک محاسباتی قرار میدهد. پشتیبانی از RAMهای CXL و دسترسی PCIe بالاتر، این نسل را برای کلاسترهای آموزش چند GPU ایدهآل میکند.
برای شرکتهایی که قصد راهاندازی سرویسهای تجاری هوش مصنوعی با کمترین نرخ قطعی و بیشترین راندمان انرژی را دارند، بررسی دقیق مشخصات فنی و خرید سرور HP در این ردهها، پایهای محکم برای توسعه چندین ساله فراهم میکند.
نسل جدید ProLiant Gen12 با پردازندههای Xeon 6 و معماری بهینهشده برای کاربردهای AI، بهتازگی وارد بازار شده است و برای سازمانهایی که آیندهنگری بلندمدت و پشتیبانی رسمی چند ساله برایشان اولویت دارد، گزینهای آیندهدار محسوب میشود.
انتخاب GPU بسته به نوع کاربرد متفاوت است:
مدلهای LLM پیش از انتقال به VRAM، در رم سیستم بارگذاری و آمادهسازی (Preload) میشوند. در معماری Inference سختافزاری و روشهایی مانند CPU Offloading، حجم رم سیستم نقش تعیینکننده در اندازه مدل قابل اجرا دارد. برای کارهای هوش مصنوعی حرفهای، حداقل ۱۲۸ تا ۲۵۶ گیگابایت رم ECC با چیدمان چند کاناله (Multi-Channel) ضروری است. به یاد داشته باشید که رمهای استاندارد سرور (Registered ECC) با کلاس حرارتی بالا، پایداری سیستم زیر بار سنگین چند روزه را تضمین میکنند.
دیتاستهای آموزشی، وزن مدلها و لاگهای پردازش، حجمهای چند ترابایتی ایجاد میکنند. ترکیب بهینه برای سرور AI شامل موارد زیر است:
کارتهای گرافیک در زمان اوج پردازش (Peak Load) کشش توان بسیار بالایی دارند. در سرورهای AI حتماً باید از پاورهای ۱۶۰۰ وات پلاتینیوم یا تیتانیوم HPE بهصورت دوال (Redundant/Hot-Plug) استفاده شود تا در صورت بروز نوسان برق، پایداری سختافزار مختل نشود و پروسههای آموزش چند روزه از بین نروند.
| کاربرد | کانفیگ پیشنهادی |
|---|---|
| تست و یادگیری (شروع کار) | DL380 G10 استوک + ۲۵۶GB DDR4 + یک کارت RTX 4090 |
| سرویس Inference تجاری | DL380 G10/G11 + ۵۱۲GB رم + دو کارت L40S |
| آموزش مدل (Training) حرفهای | DL380 Gen11 + رم DDR5 + کلاستر چند GPU دیتاسنتری |
این چیدمانها را حتماً با یک متخصص زیرساخت بازبینی کنید؛ زیرا تنوع رایزرها و پروفایلهای حرارتی شاسیهای HPE، جزئیات مهمی دارد که در یک مقاله عمومی نمیگنجد.
یکی از دغدغههای اصلی استارتاپها، دانشگاهها و تیمهای فنی نوپا، هزینه اولیه سرورهای نسل جدید است. واقعیت این است که برای مراحل تحقیق و توسعه (R&D)، آموزش اولیه مدلهای سبک، ارزیابی الگوریتمها و راهاندازی هوملبهای تست، نیازی به پرداخت مبالغ سنگین نیست.
شاسیهای پایدار نسلهای قبل مانند DL380 G9 و DL380 G10، گزینههای ایدهآلی برای این مرحله هستند. استفاده از یک سرور استوک hp تمیز و تستشده به شما اجازه میدهد با کسری از هزینه یک سیستم نو، زیرساختی با حجم رم بالا (۲۵۶ تا ۵۱۲ گیگابایت رم ECC) و شاسی سروری واقعی در اختیار داشته باشید و بودجه آزادشده را صرف تهیه شتابدهندههای گرافیکی — که تاثیر مستقیمی بر سرعت مدلها دارند — نمایید.
نکته کلیدی در خرید استوک، اطمینان از سلامت قطعات است: بررسی ساعت کارکرد هارد، تست کامل سلولهای رم، سلامت ریدکنترلر و وضعیت خنککاری شاسی. به همین دلیل خرید از مراکز متخصصی که تستهای Diagnostics سختگیرانه انجام میدهند، ریسک پروژه را تقریباً به صفر میرساند.
پیادهسازی یک سرور هوش مصنوعی نیازمند تحلیل دقیق توازن میان توان پردازنده، حجم کش، توان خروجی پاورها، نوع رایزرهای PCIe و سیستم خنککاری است. هرگونه عدم تطابق میتواند به داغ شدن کارتها (Thermal Throttling)، افت ناگهانی سرعت یا حتی ریستارت سرور زیر بار سنگین ختم شود — اتفاقی که در میانه یک پروسه آموزش چند روزه، هفتهها زمان و هزینه را نابود میکند.
مجموعه ولکان سرور به عنوان یکی از مراجع تخصصی واردات، تأمین و کانفیگ سرورهای اورجینال HPE در ایران، خدماتی جامع را در این حوزه ارائه میدهد:
جهت دریافت مشاوره فنی، بررسی موجودی کانفیگهای بهینهشده برای هوش مصنوعی و استعلام قیمت لحظهای، میتوانید به وبسایت ولکان سرور مراجعه کرده یا با کارشناسان فنی این مجموعه در ارتباط باشید.