شرکت دیپسیک از جدیدترین مدل هوش مصنوعی خود با نام DeepSeek-V4.۱ Flash رونمایی کرد؛ مدلی قدرتمند که با بهرهگیری از معماری(MoE)، و دارای ۵۵۲ میلیارد پارامتر میتواند حجم بسیار بزرگی از اطلاعات (تا یک میلیون توکن) را درک و پردازش کند. این مدل همچنین از قابلیتهای پیشرفته بینایی محلی برای تحلیل بهتر دادههای تصویری و محتوایی بهره میبرد؛ ساختاری که هدف اصلی آن کاهش هزینههای بازخوانی مکرر محتواهای متنی طولانی است. وزنهای باز این مدل تحت مجوز نرمافزاری آسانگیر و مناسب برای شرکتها یعنی MIT در پلتفرم هاگینگ فیس (Hugging Face) قرار گرفته است تا توسعهدهندگان و بنگاههای اقتصادی بتوانند از آن برای کاربردهای تجاری و محلی استفاده کنند. با این حال، بارزترین ویژگی این مدل برای توسعهدهندگانی که بر روی عاملهای هوشمند (Agents) و گردشهای کاری طولانی کار میکنند، نرخ بسیار پایین رابط برنامهنویسی کاربردی (API) آن است.
ساختار قیمتگذاری و تفاوت هزینه در حافظه موقت
دیپسیک قیمتگذاری V4.۱-Flash را در ساعات غیر اوج مصرف (Off-Peak) به ازای هر یک میلیون توکن ورودی بازخوانیشده از حافظه موقت (Cache Hit) معادل ۰.۰۰۳ دلار تعیین کرده است. این هزینه برای ورودیهای ثبتنشده در کش (Cache Miss) برابر ۰.۱۵ دلار و برای توکنهای خروجی ۰.۶۰ دلار در هر میلیون توکن است. در ساعات اوج مصرف، نرخهای اعلامشده دقیقاً دو برابر میشوند (۰.۰۰۶ دلار برای ورودی کششده، ۰.۳۰ دلار ورودی کشنشده و ۱.۲۰ دلار برای خروجی). ساعات اوج مصرف دیپسیک، روزهای دوشنبه تا جمعه در بازههای زمانی ۰۱:۰۰ تا ۰۴:۰۰ و ۰۶:۰۰ تا ۱۰:۰۰ به وقت UTC تعریف شده و تمامی ساعات دیگر خارج از اوج مصرف محسوب میشوند.
این تغییر رویکرد بهویژه برای عاملهای برنامهنویسی که مکرراً مخازن کد، تعاریف ابزارها، دستورالعملهای سیستمی یا تاریخچه گفتگوها را بازخوانی میکنند اهمیت دارد؛ چرا که دیپسیک میگوید هزینههای دسترسی به حافظه موقت میتواند بخش قابلتوجهی از مخارج کل یک عامل هوشمند را تشکیل دهد. در مثالی ساده، اگر یک عامل هوشمند یک پیشوند ۵۰۰ هزار توکنی را نگه دارد و در ۱۰۰ درخواست پیاپی از کش استفاده کند (معادل ۵۰ میلیون توکن کششده)، بدون احتساب هزینه نوشتن کش و تولید خروجی، هزینه خواندن از کش در V4.۱-Flash در ساعات غیراوج حدود ۰.۱۵ دلار خواهد بود؛ در حالی که این رقم با نرخهای رسمی برای Kimi K3 حدود ۱۵ دلار، برای GPT-۵.۶ Sol برابر ۲۰ دلار و برای Claude Opus ۵ نزدیک به ۲۵ دلار میشود.
معماری فنی CED و کاهش حجم حافظه KV
از نظر معماری، این مدل از ساختار اختصاصی Causal Encoder-Decoder یا CED بهره میبرد که ۴۰ لایه ترنسفورمر آن را به ۲۰ لایه انکودر علی و ۲۰ لایه دیکودر تقسیم میکند. این طراحی در مرحله پیشپردازش و خواندن ورودی (Prefill) تنها ۸ میلیارد پارامتر را فعال میکند و در مرحله تولید متن (Decode) میزان پارامترهای فعال به ۱۶ میلیارد میرسد. دیپسیک این معماری را با نسخه دوم توجه پراکنده فشرده (CSA2)، نمایهسازی سلسلهمراتبی پراکنده و ذخیرهسازی حافظه موقت کلید-مقدار (FP4 KV Caching) ترکیب کرده است.
به ادعای این شرکت، تدابیر مذکور باعث شده است که حجم کش کلید-مقدار سراسری به ۸۹۰ بایت در ازای هر توکن کاهش یابد که تقریباً یکچهارم مدل قبلی V4-Flash بوده و فضای ذخیرهسازی دائمی آن نیز به حدود یکهشتم تقلیل پیدا کرده است. طبق توضیحات فنی شرکت، کش سراسری حداقل به مدت ۷۲ ساعت پایداری تضمینشده دارد، در حالی که حافظه کش کوتاهمدت پنجره لغزنده (SWA) در استخری از ۱۰ درصد حافظه DRAM نگهداری میشود و طول عمر آن چند دقیقهای است؛ در صورت از بین رفتن وضعیت SWA، مدل با اجرای مجدد آخرین پنجره و بدون بازخوانی کل تاریخچه، وضعیت را بازسازی میکند.
بزرگتر شدن مدل و چالشهای میزبانی محلی
بر خلاف نامگذاری «Flash»، ابعاد این مدل کاهش نیافته بلکه افزایش یافته است. در حالی که V4-Flash قبلی از ستون فقرات ۲۸۴ میلیارد پارامتری با ۱۳ میلیارد پارامتر فعال بهره میبرد، مدل جدید V4.۱-Flash دارای ستون فقرات ۵۵۲ میلیارد پارامتری است که رشدی حدود ۹۴ درصدی را نشان میدهد. علاوه بر این، دیپسیک در گزارش فنی خود به ۱۹۶ میلیارد پارامتر مجزا در ماژولهای حافظه شرطی Engram اشاره کرده است. دیپسیک اعلام کرده شرکتهایی که به دنبال اجرای این مدل در مقیاس بزرگ هستند، نیازمند دسترسی به زیرساختی با مقیاس حدود ۲ هزار پردازنده گرافیکی (GPU) همراه با یک کلاستر ذخیرهسازی هستند.
با اینکه دیپسیک میگوید معماری CED محاسبات Prefill را برای توالیهای طولانی تقریباً نصف میکند و با افزایش زمینه از ۴ هزار به ۱ میلیون توکن میزان FLOPs پردازش توکن دیکود تنها ۲۵ درصد رشد میکند، اما خود شرکت اذعان داشته که معماری جدید مرزهای پایداری دارد که هنوز بهطور کامل شناسایی نشدهاند و خطاهای گزینش در CSA2 یا بازسازی تقریبی در SWA Bounded Replay ممکن است در برخی موارد مرزی به افت عملکرد منجر شود، هرچند افت سیستماتیکی در آزمونها دیده نشده است.

نتایج بنچمارکها و تغییر شناسههای نسخه در تولید
بر اساس بنچمارکهای ارائهشده توسط دیپسیک، این مدل در DeepSWE v1.۱ با بیشینه تلاش استدلال (Effort ۱۰۰) امتیاز ۷۴.۲ را ثبت کرده که در مقایسه با ۷۴.۰ برای Claude Opus ۵ و ۷۳.۰ برای GPT-۵.۶ Sol قرار میگیرد. همچنین امتیاز V4.۱-Flash در CyberGym به ۸۸.۱ و در AutomationBench به ۵۴.۸ رسیده است. با این حال، در بنچمارکهای Terminal-Bench ۳.۰ و ۴.۰ مدل Claude Opus ۵ با امتیازهای ۴۳.۳ و ۵۱.۸ در برابر امتیازهای ۳۰.۰ و ۳۱.۲ این مدل پیشتاز است، و در GPQA Diamond و SEC-Bench Pro نیز برتری با GPT-۵.۶ Sol بوده است.
شرکت دیپسیک مدلهای V4-Flash و نسخه آزمایشی تصویری آن را بازنشسته کرده و شناسههای فعلی آنها را به V4.۱-Flash منتقل نموده است. همچنین مستندات نشان میدهد که از تاریخ ۱۴ سپتامبر ۲۰۲۶، درخواستهای ارسالی به deepseek-v4-pro نیز تا زمان عرضه نسخه V4.۱-Pro به V4.۱-Flash هدایت خواهند شد؛ موضوعی که در کنار ارزشگذاری احتمالی شرکت تا سقف ۵۰۰ میلیارد یوان (حدود ۷۵ میلیارد دلار) برای عرضه عمومی احتمالی در بازار STAR شانگهای بر اساس گزارش رویترز، توجه تحلیلگران زیرساخت را به خود جلب کرده است.
این خبر بر اساس گزارش منتشرشده در venturebeat تهیه شده است.