مدل ۵۵۲ میلیارد پارامتر DeepSeek V4.1-Flash روی چهار NVIDIA DGX Spark با سرعت ۴۹۴ توکن در هر ثانیه اجرا می شود.
به گزارش سرویس هوش مصنوعی مجرددر همین راستا، مدل DeepSeek V4.1-Flash با 552 میلیارد پارامتر اخیراً هنگام اجرا بر روی یک سیستم خانگی متشکل از چهار دستگاه NVIDIA DGX Spark به سرعت استنتاج نزدیک به سطح سیستم های Cerebras دست یافته است.
خوشه چهار گره NVIDIA DGX Spark قادر به دستیابی به حداکثر سرعت خروجی نزدیک به 500 توکن در ثانیه بدون استفاده از روتر نوری یا سوئیچ اترنت بود.
پاتریک مورهد، متخصص فناوری و متخصص صنعت AMD اخیراً از سیستم هوش مصنوعی خانگی خود رونمایی کرده است.
این سیستم از چهار دستگاه NVIDIA DGX Spark تشکیل شده که در مجموع 512 گیگابایت حافظه یکپارچه دارند.
Morehead این چهار دستگاه را در یک قفسه فشرده tec MOJO قرار داده و فن های خنک کننده اضافی را در قسمت زیرین نصب کرده است.
مشخصات سخت افزاری چهار دستگاه DGX Spark
هر دستگاه NVIDIA DGX Spark مورد استفاده در این سیستم شامل اجزای زیر است:
- پردازنده 20 هسته ای Arm شامل 10 هسته قدرتمند Cortex-X925 و 10 هسته کم مصرف Cortex-A725. هر هسته کش L2 مخصوص به خود را دارد و هر خوشه به 16 مگابایت حافظه نهان L3 مجهز شده است که در مجموع 32 مگابایت حافظه نهان L3 را ارائه می دهد.
- GPU یکپارچه GB10 مجهز به هسته های Tensor نسل پنجم، پشتیبانی از هسته های DLSS 4 و RTX برای ردیابی اشعه. این تراشه تا 31 ترافلاپس قدرت پردازش FP32 و 1000 تریلیون عملیات در ثانیه یا TOPS را در محاسبات NVFP4 یا FP4 ارائه می دهد.
- حافظه یکپارچه 128 گیگابایتی LPDDR5X که بین پردازنده و GPU مشترک است و پهنای باندی در حدود 273 گیگابایت بر ثانیه دارد. این حافظه از رابط 256 بیتی استفاده می کند.
- شبکه هوشمند ConnectX-7 با دو درگاه QSFP با سرعت 200 گیگابیت در ثانیه برای خوشه بندی پرسرعت، به همراه 10 گیگابیت اترنت، Wi-Fi 7، بلوتوث، HDMI 2.1a و چندین پورت USB-C.
- حافظه ذخیره سازی NVMe SSD با ظرفیت معمولی 1 تا 4 ترابایت.
- مصرف برق با آداپتور موجود در حدود 140 تا 240 وات است.
- سیستم عامل NVIDIA DGX مبتنی بر اوبونتو و مجموعه کامل نرم افزار CUDA AI.
نکته مهم در مورد این سیستم نحوه اتصال چهار دستگاه DGX Spark به یکدیگر است. این دستگاه ها بدون استفاده از سوئیچ و از طریق کابل های QSFP به صورت توپولوژی حلقه ای به یکدیگر متصل می شوند.
در این سازه اسپارک 1 به اسپارک 2 و اسپارک 4 وصل می شود. اسپارک 2 به اسپارک 1 و اسپارک 3 وصل می شود. اسپارک 3 نیز به اسپارک 2 و اسپارک 4 و اسپارک 4 به اسپارک 3 و اسپارک 1 وصل می شود.
البته، انویدیا استفاده از سوئیچ اترنت 200 گیگابیتی و توپولوژی ستاره را برای اتصال چهار دستگاه DGX Spark توصیه می کند. استفاده از سوئیچ هزینه نهایی چنین سیستمی را افزایش می دهد.
بیشتر بخوانید: نتایج یک تست فنی ادعای ارزان بودن دیپسیک را رد کرد
DeepSeek V4.1-Flash چطور روی این سیستم اجرا شد؟
برای این خوشه چهار گره، Morehead مدل کم مصرف DeepSeek V4.1-Flash را انتخاب کرده است. این مدل دارای 552 میلیارد پارامتر است، اما تنها 8 میلیارد پارامتر در مرحله پیش پردازش و 16 میلیارد پارامتر در مرحله رمزگشایی فعال هستند.
این مدل همچنین دارای یک کارشناس مشترک و 384 کارشناس روت شده است که از این تعداد 6 مورد فعال هستند.
DeepSik در معماری جدید خود از چندین فناوری مختلف مانند Causal Encoder-Decoder (CED)، Compact Thin Attention 2 (CSA2)، Quantization FP4 و SWA Bounded Replay استفاده کرده است. این فناوری ها اندازه کش KV را تنها به 890 بایت در هر توکن کاهش می دهند.
ترکیب مدل DeepSeek V4.1-Flash با خوشه چهار گره NVIDIA DGX Spark نتایج قابل توجهی را به همراه داشته است:
- حداکثر سرعت خروجی: 494 توکن در ثانیه در کدنویسی با 32 درخواست همزمان
- حداکثر سرعت تولید متن: 280 توکن در ثانیه با 32 درخواست همزمان
- سرعت در درخواست: حدود 58 توکن در ثانیه برای متن و 96 توکن در ثانیه برای کد
- سرعت پردازش سریع: حدود 4764 توکن در ثانیه
- زمان تولید اولین توکن: حدود 0.2 ثانیه در حالت بیکار
- میزان مصرف حافظه: 476 گیگابایت
بیشتر بخوانید: هشدار مهندس دیپسیک در مورد آینده هوش مصنوعی
هزینه ساخت سیستم خانه DeepSeek
از نظر هزینه، هر دستگاه NVIDIA DGX Spark با 128 گیگابایت حافظه در حال حاضر بین 5500 دلار تا بیش از 9000 دلار بسته به ظرفیت ذخیره سازی و در دسترس بودن قیمت دارد.
بنابراین هزینه قطعه اصلی این سیستم برای چهار دستگاه حدود 22 تا 36 هزار دلار خواهد بود.
کابل های QSFP چندین صد دلار هزینه برای ایجاد توپولوژی حلقه دارند. یک رک یا رک، فنهای اضافی، تجهیزات توزیع برق و سایر لوازم جانبی نیز صدها دلار به هزینه اضافه میکنند.
در مجموع هزینه ساخت چنین سیستمی حدود 25 تا 40 هزار دلار خواهد بود. اگرچه این رقم زیاد است، اما می توان از چنین سیستمی در شبانه روز استفاده کرد و هزینه برق آن نیز نسبتاً محدود است.
طبق متن، هر دستگاه در هنگام کار حدود 400-600 وات مصرف می کند. برعکس، استفاده از این سیستم کاربر را از هزینههای API و محدودیتهای بار پردازشی سرویسهایی مانند OpenAI یا Entropic مستقل میکند.
















گفتگو در مورد این post