رسانه تخصصی هوش مصنوعی سیمرغ

معرفی مدل دیپ‌سیک V۴.۱ با پنجره ۱ میلیونی و کاهش شدید هزینه کش

معرفی مدل دیپ‌سیک V4.1 با پنجره ۱ میلیونی و کاهش شدید هزینه کش

شرکت دیپ‌سیک از جدیدترین مدل هوش مصنوعی خود با نام DeepSeek-V4.۱ Flash رونمایی کرد؛ مدلی قدرتمند که با بهره‌گیری از معماری(MoE)، و دارای ۵۵۲ میلیارد پارامتر می‌تواند حجم بسیار بزرگی از اطلاعات (تا یک میلیون توکن) را درک و پردازش کند. این مدل همچنین از قابلیت‌های پیشرفته بینایی محلی برای تحلیل بهتر داده‌های تصویری و محتوایی بهره می‌برد؛ ساختاری که هدف اصلی آن کاهش هزینه‌های بازخوانی مکرر محتواهای متنی طولانی است. وزن‌های باز این مدل تحت مجوز نرم‌افزاری آسان‌گیر و مناسب برای شرکت‌ها یعنی MIT در پلتفرم هاگینگ فیس (Hugging Face) قرار گرفته است تا توسعه‌دهندگان و بنگاه‌های اقتصادی بتوانند از آن برای کاربردهای تجاری و محلی استفاده کنند. با این حال، بارزترین ویژگی این مدل برای توسعه‌دهندگانی که بر روی عامل‌های هوشمند (Agents) و گردش‌های کاری طولانی کار می‌کنند، نرخ بسیار پایین رابط برنامه‌نویسی کاربردی (API) آن است.

ساختار قیمت‌گذاری و تفاوت هزینه در حافظه موقت

دیپ‌سیک قیمت‌گذاری V4.۱-Flash را در ساعات غیر اوج مصرف (Off-Peak) به ازای هر یک میلیون توکن ورودی بازخوانی‌شده از حافظه موقت (Cache Hit) معادل ۰.۰۰۳ دلار تعیین کرده است. این هزینه برای ورودی‌های ثبت‌نشده در کش (Cache Miss) برابر ۰.۱۵ دلار و برای توکن‌های خروجی ۰.۶۰ دلار در هر میلیون توکن است. در ساعات اوج مصرف، نرخ‌های اعلام‌شده دقیقاً دو برابر می‌شوند (۰.۰۰۶ دلار برای ورودی کش‌شده، ۰.۳۰ دلار ورودی کش‌نشده و ۱.۲۰ دلار برای خروجی). ساعات اوج مصرف دیپ‌سیک، روزهای دوشنبه تا جمعه در بازه‌های زمانی ۰۱:۰۰ تا ۰۴:۰۰ و ۰۶:۰۰ تا ۱۰:۰۰ به وقت UTC تعریف شده و تمامی ساعات دیگر خارج از اوج مصرف محسوب می‌شوند.

این تغییر رویکرد به‌ویژه برای عامل‌های برنامه‌نویسی که مکرراً مخازن کد، تعاریف ابزارها، دستورالعمل‌های سیستمی یا تاریخچه گفتگوها را بازخوانی می‌کنند اهمیت دارد؛ چرا که دیپ‌سیک می‌گوید هزینه‌های دسترسی به حافظه موقت می‌تواند بخش قابل‌توجهی از مخارج کل یک عامل هوشمند را تشکیل دهد. در مثالی ساده، اگر یک عامل هوشمند یک پیش‌وند ۵۰۰ هزار توکنی را نگه دارد و در ۱۰۰ درخواست پیاپی از کش استفاده کند (معادل ۵۰ میلیون توکن کش‌شده)، بدون احتساب هزینه نوشتن کش و تولید خروجی، هزینه خواندن از کش در V4.۱-Flash در ساعات غیراوج حدود ۰.۱۵ دلار خواهد بود؛ در حالی که این رقم با نرخ‌های رسمی برای Kimi K3 حدود ۱۵ دلار، برای GPT-۵.۶ Sol برابر ۲۰ دلار و برای Claude Opus ۵ نزدیک به ۲۵ دلار می‌شود.

معماری فنی CED و کاهش حجم حافظه KV

از نظر معماری، این مدل از ساختار اختصاصی Causal Encoder-Decoder یا CED بهره می‌برد که ۴۰ لایه ترنسفورمر آن را به ۲۰ لایه انکودر علی و ۲۰ لایه دیکودر تقسیم می‌کند. این طراحی در مرحله پیش‌پردازش و خواندن ورودی (Prefill) تنها ۸ میلیارد پارامتر را فعال می‌کند و در مرحله تولید متن (Decode) میزان پارامترهای فعال به ۱۶ میلیارد می‌رسد. دیپ‌سیک این معماری را با نسخه دوم توجه پراکنده فشرده (CSA2)، نمایه‌سازی سلسله‌مراتبی پراکنده و ذخیره‌سازی حافظه موقت کلید-مقدار (FP4 KV Caching) ترکیب کرده است.

به ادعای این شرکت، تدابیر مذکور باعث شده است که حجم کش کلید-مقدار سراسری به ۸۹۰ بایت در ازای هر توکن کاهش یابد که تقریباً یک‌چهارم مدل قبلی V4-Flash بوده و فضای ذخیره‌سازی دائمی آن نیز به حدود یک‌هشتم تقلیل پیدا کرده است. طبق توضیحات فنی شرکت، کش سراسری حداقل به مدت ۷۲ ساعت پایداری تضمین‌شده دارد، در حالی که حافظه کش کوتاه‌مدت پنجره لغزنده (SWA) در استخری از ۱۰ درصد حافظه DRAM نگهداری می‌شود و طول عمر آن چند دقیقه‌ای است؛ در صورت از بین رفتن وضعیت SWA، مدل با اجرای مجدد آخرین پنجره و بدون بازخوانی کل تاریخچه، وضعیت را بازسازی می‌کند.

بزرگ‌تر شدن مدل و چالش‌های میزبانی محلی

بر خلاف نامگذاری «Flash»، ابعاد این مدل کاهش نیافته بلکه افزایش یافته است. در حالی که V4-Flash قبلی از ستون فقرات ۲۸۴ میلیارد پارامتری با ۱۳ میلیارد پارامتر فعال بهره می‌برد، مدل جدید V4.۱-Flash دارای ستون فقرات ۵۵۲ میلیارد پارامتری است که رشدی حدود ۹۴ درصدی را نشان می‌دهد. علاوه بر این، دیپ‌سیک در گزارش فنی خود به ۱۹۶ میلیارد پارامتر مجزا در ماژول‌های حافظه شرطی Engram اشاره کرده است. دیپ‌سیک اعلام کرده شرکت‌هایی که به دنبال اجرای این مدل در مقیاس بزرگ هستند، نیازمند دسترسی به زیرساختی با مقیاس حدود ۲ هزار پردازنده گرافیکی (GPU) همراه با یک کلاستر ذخیره‌سازی هستند.

با اینکه دیپ‌سیک می‌گوید معماری CED محاسبات Prefill را برای توالی‌های طولانی تقریباً نصف می‌کند و با افزایش زمینه از ۴ هزار به ۱ میلیون توکن میزان FLOPs پردازش توکن دیکود تنها ۲۵ درصد رشد می‌کند، اما خود شرکت اذعان داشته که معماری جدید مرزهای پایداری دارد که هنوز به‌طور کامل شناسایی نشده‌اند و خطاهای گزینش در CSA2 یا بازسازی تقریبی در SWA Bounded Replay ممکن است در برخی موارد مرزی به افت عملکرد منجر شود، هرچند افت سیستماتیکی در آزمون‌ها دیده نشده است.

نتایج بنچمارک‌ها - مدل دیپ‌سیک V4.1
نتایج بنچمارک‌ها – مدل دیپ‌سیک V4.۱

نتایج بنچمارک‌ها و تغییر شناسه‌های نسخه در تولید

بر اساس بنچمارک‌های ارائه‌شده توسط دیپ‌سیک، این مدل در DeepSWE v1.۱ با بیشینه تلاش استدلال (Effort ۱۰۰) امتیاز ۷۴.۲ را ثبت کرده که در مقایسه با ۷۴.۰ برای Claude Opus ۵ و ۷۳.۰ برای GPT-۵.۶ Sol قرار می‌گیرد. همچنین امتیاز V4.۱-Flash در CyberGym به ۸۸.۱ و در AutomationBench به ۵۴.۸ رسیده است. با این حال، در بنچمارک‌های Terminal-Bench ۳.۰ و ۴.۰ مدل Claude Opus ۵ با امتیازهای ۴۳.۳ و ۵۱.۸ در برابر امتیازهای ۳۰.۰ و ۳۱.۲ این مدل پیشتاز است، و در GPQA Diamond و SEC-Bench Pro نیز برتری با GPT-۵.۶ Sol بوده است.

شرکت دیپ‌سیک مدل‌های V4-Flash و نسخه آزمایشی تصویری آن را بازنشسته کرده و شناسه‌های فعلی آن‌ها را به V4.۱-Flash منتقل نموده است. همچنین مستندات نشان می‌دهد که از تاریخ ۱۴ سپتامبر ۲۰۲۶، درخواست‌های ارسالی به deepseek-v4-pro نیز تا زمان عرضه نسخه V4.۱-Pro به V4.۱-Flash هدایت خواهند شد؛ موضوعی که در کنار ارزش‌گذاری احتمالی شرکت تا سقف ۵۰۰ میلیارد یوان (حدود ۷۵ میلیارد دلار) برای عرضه عمومی احتمالی در بازار STAR شانگهای بر اساس گزارش رویترز، توجه تحلیل‌گران زیرساخت را به خود جلب کرده است.

این خبر بر اساس گزارش منتشرشده در venturebeat تهیه شده است.

سهراب اسکندری
دنبال‌کردن در لینکدین
نظرت چیه؟
Exit mobile version