ارزیابی فنی The Call Center Doctors نشان می دهد که ادعای کاهش 80 برابری هزینه استفاده از مدل DeepSeek در محیط های عملیاتی کدگذاری چندان دقیق نیست.
به گزارش سرویس هوش مصنوعی تکناک، شرکت مشاوره The Call Center Doctors که متخصص در طراحی و مدیریت مراکز تماس برای سایر مشاغل است، نتایج یک تست عملیاتی را در گزارشی فنی و تفصیلی منتشر کرد که دیدگاه های رایج در مورد برتری اقتصادی مدل های زبان جدید را به چالش می کشد. برای آزمایش ادعاهایی مبنی بر اینکه DeepSeek تا 80 برابر ارزان تر از Claude است، این شرکت تصمیم گرفت یک سرور مجهز به چهار پردازنده گرافیکی Nvidia H200 AI اجاره کند تا مدل DeepSeek V4.1 Flash را با مدل Claude Opus 5.5 در نمایندگی های برنامه نویسی خود جایگزین کند. این آزمایش نه تنها محدودیتهای زیرساختی، بلکه پیچیدگیهای پنهان در هزینههای عملیاتی استفاده از هوش مصنوعی در محیطهای تولیدی را نیز آشکار کرد.
در ابتدای این عملیات سرور اجاره ای با هزینه 440.88 دلار در روز و با نرخ درخواستی توانست به سرعت خروجی حدود 213 توکن در ثانیه دست یابد. اگرچه این رقم در نگاه اول قابل توجه به نظر می رسید، اما در مقایسه با هزینه های استفاده از رابط برنامه نویسی API مدل DeepSeek که بین 184 تا 223 دلار در روز تخمین زده می شود، مشخص شد که چندان مقرون به صرفه نیست. در نهایت، پس از بررسی کل هزینههای جاری و مقایسه آن با نرخهای ثابت مبتنی بر اشتراک، مرکز تماس تصمیم گرفت به Claude Opus 5.5 برگردد، زیرا هزینههای متحمل شده در آن مدل به طور قابلتوجهی کمتر بود.
پیچیدگی بازیابی مداوم توکن ها
یکی از نکات کلیدی که در این گزارش مورد توجه قرار گرفت، ساختار متفاوت عوامل کدگذاری است. این عوامل، بر خلاف رباتهای گفتگو، برای عملکرد صحیح به خواندن مداوم تاریخچه مکالمه نیاز دارند. داده های ثبت شده نشان می دهد که 96 درصد از محتوای ارائه شده توسط عوامل به مدل، متون قدیمی و تکراری بوده است. در واقع برای تولید هر توکن جدید باید حدود 1000 توکن قدیمی توسط سیستم خوانده شود. این فرآیند بازخوانی، اگرچه از نظر محاسباتی ارزانتر است، اما حجم آن به قدری زیاد است که منابع سختافزاری را به شدت درگیر میکند و فرصت کمتری برای تولید محتوای جدید باقی میگذارد. این باعث شد که سرور قدرتمند در تلاش های مجدد بی پایان شرکت کند و در واقع بهره وری تولید کد را کاهش دهد.
پایداری مدل نیز چالش های خاص خود را در این آزمایش داشت. اجرای موفقیت آمیز مدل به پنج تلاش متوالی نیاز داشت که هر بار بین 10 تا 15 دقیقه صرف بارگذاری اولیه می شد. نکته مهم این بود که سرور بدون توجه به مشغول بودن یا نبودن صورتحساب می شد که برای یک محیط عملیاتی وضعیتی غیر بهینه محسوب می شود. محاسبات نشان داد که در یک ماه کاری با طول استاندارد و با نرخ 18.37 دلار در ساعت هزینه این سرور به حدود 13200 دلار می رسد. این بیش از دو برابر هزینه اشتراک Claude Code برای شرکت در ماه سپتامبر بود. علاوه بر این، ظرفیت پردازش یک سرور در این شرایط حدود 20 میلیارد توکن در روز برآورد شد، در حالی که نمایندگان این شرکت در شلوغ ترین روزهای خود به 51 میلیارد توکن نیاز داشتند.

این بررسی با هدف شفاف سازی ادعاهای تبلیغاتی در مورد پس انداز 80 برابری DeepSeek انجام شد. بین 1 تا 27 سپتامبر، سیستم آزمایش شده 2.03 میلیون تماس مدل، 388.5 میلیارد توکن خوانده شده و 393 میلیون توکن نوشته شده را ثبت کرده است. هزینه اشتراک Claude Code برای این شرکت در همان ماه حدود 5500 دلار بود. بسته به نوسانات قیمت در ساعات اوج مصرف، با استفاده از DeepSeek API، همین مقدار پردازش بین 3500 تا 7000 دلار هزینه خواهد داشت. میانگین برآورد در صورت توزیع یکنواخت مصرف در طول هفته حدود 4200 دلار تعیین شد.
تبلیغات گمراه کننده ادعا می کنند 80 برابر ارزان تر است
نوشته شده است تامز هاردورتفاوت قیمت 80 برابری ذکر شده در برخی گزارش ها عمدتاً به دلیل مقایسه قیمت های ذکر شده برای Claude Opus 5.5 با هزینه های واقعی استفاده در مقیاس بالا است. با محاسبات انجام شده، هزینه همین تعداد توکن در Claude Opus 5.5 حدود 140000 دلار برآورد شد که بیش از 25 برابر هزینه اشتراک فعلی شرکت است. این شکاف عمیق بین قیمت فهرست و هزینه اشتراک منبع اصلی اعداد تبلیغاتی است. همچنین، شرکت هزینه هر تغییر را که در کد گنجانده شده بود، بررسی کرد. حدود 1 دلار برای هر آیتم در Claude و حدود 0.63 دلار در DeepSeek (اگر عملکرد برابر باشد). تخمینی از 1.15 تا 4.90 دلار برای DeepSeek با این فرض انجام شد که توکن های بیشتری برای دستیابی به دقت مشابه و استفاده از Claude برای نهایی کردن کار مورد نیاز است.
در نهایت امنیت و عملکرد عوامل یکی از بزرگترین موانع بود. در طول آزمایش، بازبینان به طور مداوم راه هایی را کشف کردند که کد عامل می تواند از محیط جعبه شنی فرار کند. به عنوان مثال، از طریق یک فایل پیکربندی در پوشه موقت مشترک که به کد اجازه می دهد تا با دسترسی سرپرست اجرا شود. به همین دلیل، عوامل برنامه نویسی هرگز اجازه نداشتند کد واقعی را در محیط اصلی بنویسند، و در عوض، مدل به عنوان تنها 48-64 عامل بازبینی فقط خواندنی که وظیفه خواندن 2377 پوشه و ثبت 38 گزارش خطا را داشتند، به کار گرفته شد. در پایان آزمایش، سرور اجاره شده با نرخ 9.19 دلار در ساعت توسط ارائه دهنده تنها چند دقیقه پس از آخرین آزمایش بازپس گرفته شد و این تجربه عملیاتی در استفاده از مدل های منبع باز برای کارهای حساس کدنویسی را به پایان رساند.















گفتگو در مورد این post