زمستان ۲۰۲۴ نام “دیپ سیک” آرامآرام بر سر زبانها افتاد؛ معرفی DeepSeek-V3 در ۲۶ دسامبر ۲۰۲۴ جرقهای بود که به فاصله کوتاهی با انتشار R1 در ۲۰ ژانویه ۲۰۲۵ و سپس نسخه “V3-0324” در ۲۵ مارس ۲۰۲۵ مسیری پیوسته از ارتقا را رقم زد و سرانجام در ۲۱ آگوست ۲۰۲۵ به “DeepSeek v3.1” رسید؛ نسخهای که با هدف افزایش کارایی استدلال، سرعت استنتاج و توانمندی عاملها عرضه شد. این خط سیر زمانی، نهفقط روند تکامل یک پلتفرم، بلکه ظهور رقیبی جدی برای مدلهای جریانساز غربی را نشان میدهد.
اکنون “مدل دیپ سیک v3.1” در کانون توجه است؛ مدلی که مقاله حاضر به شکلی فشرده اما دقیق معرفی میکند: از “معماری مدل دیپ سیک v3.1” بر پایه Mixture-of-Experts با مقیاس ۶۷۱ میلیارد پارامتر (۳۷ میلیارد فعال در هر توکن) و استفاده از MLA و پنجره کانالی (Context Window) ۱۲۸هزار توکنی، تا “قابلیت مدل دیپ سیک v3.1” همچون حالت تفکر ترکیبی (Hybrid Thinking Mode)، فراخوانی ابزار و الگوهای عاملمحور برای کدنویسی و جستجو. علاوه بر این، انتشار وزنها با مجوز MIT و دستورالعملهای استقرار، دسترسپذیری کمهزینه و آزمونپذیر این نسخه را برای پژوهشگران و کسبوکارها تقویت میکند. در ادامه، ضمن واکاوی نقاط قوت و کاربردهای واقعی DeepSeek v3.1، خواهیم دید این معماری چگونه با ترکیب دقت، سرعت و بازبودن، معیارهای جدیدی برای مدلهای زبانی تعریف میکند.
فهرست مطالب
استارتاپ چینی DeepSeek، که یک شرکت پیشرو در زمینه هوش مصنوعی مولد به شمار میرود، اخیراً از جدیدترین مدل زبان پرچمدار خود با نام DeepSeek v3.1 رونمایی کرده است. این مدل DeepSeek v3.1 که بر پایه معماری مدل DeepSeek v3 بنا نهاده شده، پیشرفتهای چشمگیری در زمینههای استدلال، بهرهگیری از ابزار و کدنویسی داشته است. مدلهای دیپ سیک بهطور گستردهای به دلیل توانایی ارائه عملکردی همسطح با مدلهای پیشرفته شرکتهایی مانند شرکت OpenAI و Anthropic، با کسری از هزینه، مورد توجه قرار گرفته و شهرت یافتهاند.
معماری مدل و قابلیت های DeepSeek V3.1
- قابلیت مدل DeepSeek v3.1 با یک ویژگی برجسته به نام “حالت تفکر ترکیبی” (Hybrid Thinking Mode)” همراه است. این قابلیت به مدل دیپ سیک v3.1 اجازه میدهد تا هم از تولید محتوای “متفکرانه” (با استفاده از استدلال زنجیره-فکر و فرآیندی سنجیدهتر) و هم “غیرمتفکرانه” (با ارائه پاسخهای مستقیم و سریع) پشتیبانی کند. این حالتها بهراحتی از طریق الگوی چت قابل تغییر هستند. این ویژگی، تمایزی اساسی با نسخههای پیشین ایجاد کرده و انعطافپذیری قابل ملاحظهای را برای طیف وسیعی از کاربردها فراهم میآورد.
- معماری مدل دیپ سیک v3.1 برای انجام وظایف مرتبط با فراخوانی ابزار و ایجنت (از جمله استفاده از APIها، اجرای کد و جستجو) بهینهسازی شده است. فراخوانیهای ابزار با بهرهگیری از یک فرمت ساختاریافته صورت میگیرند و مدل DeepSeek v3.1 از ایجنتهای اختصاصی برای کد و جستجو پشتیبانی میکند که الگوهای دقیق آنها در مخزن (repository) مربوطه ارائه شده است.
- مدل DeepSeek v3.1 دارای مقیاسی عظیم با مجموع ۶۷۱ میلیارد پارامتر است. این در حالی است که به لطف معماری مدل دیپ سیک v3.1 که بر اساس رویکرد “ترکیبی از متخصصان (Mixture-of-Experts یا MoE)” طراحی شده، تنها ۳۷ میلیارد پارامتر به ازای هر توکن فعال میشود. این رویکرد به کاهش هزینههای استنتاج (inference) کمک کرده و در عین حال ظرفیت مدل را در سطح بالایی حفظ میکند. همچنین، پنجره زمینه (context window) این مدل به ۱۲۸ هزار توکن میرسد که نسبت به بسیاری از مدلهای رقیب، بسیار بزرگتر است.
- قابلیت مدل DeepSeek v3.1 با بهرهگیری از یک رویکرد دو مرحلهای برای گسترش کانال طولانی (Long Context Extension) توسعه یافته است. در مرحله نخست، آموزش مدل بر روی ۶۳۰ میلیارد توکن صورت گرفت که این میزان ۱۰ برابر بیشتر از نسخه V3 است. در مرحله دوم، آموزش بر روی ۲۰۹ میلیارد توکن انجام شد که این حجم نیز ۳.۳ برابر نسخه V3 محسوب میشود. همچنین، این مدل با استفاده از FP8 microscaling آموزش داده شده است تا محاسبات بر روی سختافزارهای نسل جدید به شکلی بهینه انجام گیرد.
- الگوی چت در مدل DeepSeek v3.1 به گونهای طراحی شده که از مکالمات چند نوبتی با استفاده از توکنهای مشخص برای اعلانهای سیستمی، پرسشهای کاربر و پاسخهای دستیار پشتیبانی میکند. حالتهای “متفکرانه” و “غیرمتفکرانه” از طریق افزودن توکنهای <think> و <think/> در توالی پرامپت (prompt sequence) فعال میشوند.

معیارهای عملکرد مدل DeepSeek v3.1
عملکرد مدل دیپ سیک v3.1 در مجموعهای گسترده از معیارهای ارزیابی (بنچمارکها) مورد سنجش قرار گرفته است. این ارزیابیها حوزههای متنوعی همچون دانش عمومی، کدنویسی، ریاضیات و همچنین استفاده از ابزار و وظایف مرتبط با ایجنتها را شامل میشود. نتایج برجسته این ارزیابیها در ادامه مورد بحث قرار میگیرد.
| معیار | V3.1-NonThinking | V3.1-Thinking | رقبا |
| MMLU-Redux (EM) | 91.8 | 93.7 | 93.4 |
| MMLU-Pro (EM) | 83.7 | 84.8 | 85 |
| GPQA-Diamond (Pass@1) | 74.9 | 80.1 | 81 |
| LiveCodeBench (Pass@1) | 56.4 | 74.8 | 73.3 |
| AIME 2025 (Pass@1) | 49.8 | 88.4 | 87.5 |
| SWE-bench (حالت عامل) | 54.5 | – | 30.5 |
قابلیت مدل DeepSeek v3.1 در حالت متفکرانه (Thinking Mode) همواره عملکردی معادل یا برتر از جدیدترین مدلهای پیشرفته (state-of-the-art) در بازار از خود نشان داده است. این برتری بهویژه در زمینههای کدنویسی و حل مسائل ریاضی مشهود است. در مقابل، حالت غیرمتفکرانه (Non-thinking Mode) با وجود سرعت بالاتر، دقت کمی پایینتری دارد که این ویژگی، آن را برای کاربردهایی که به سرعت پاسخدهی (latency) حساس هستند، به گزینهای ایدهآل تبدیل میکند.

ادغام عامل کد نویسی و ابزارها
قابلیت مدل DeepSeek v3.1 شامل پشتیبانی از “فراخوانی ابزار (Tool Calling)” در حالت غیرمتفکرانه است. این ویژگی به مدل امکان میدهد تا از فراخوانیهای ساختاریافته برای ارتباط با ابزارها و سرویسهای خارجی استفاده کند. این امر به کاربران اجازه میدهد تا گردشهای کاری خود را با استفاده از APIها و منابع برونسازمانی به صورت اسکریپتنویسی شده و خودکار مدیریت کنند.
معماری مدل دیپ سیک v3.1 به گونهای طراحی شده که توسعهدهندگان قادر به ساخت ایجنتهای کد سفارشی هستند. این امکان با دنبال کردن “الگوهای مسیر (trajectory templates)” که پروتکلهای دقیق برای تعاملات مرتبط با تولید، اجرا و اشکالزدایی کد را تشریح میکنند، فراهم میشود. همچنین، مدل دیپ سیک v3.1 قادر به استفاده از ابزارهای جستجوی خارجی برای بهروزرسانی اطلاعات خود است؛ این ویژگی برای کاربردهای تخصصی در حوزههای تجاری، مالی و تحقیقات فنی، بسیار ضروری و کارآمد است.
استقرار مدل مدل DeepSeek v3.1
شرکت چینی DeepSeek تمامی وزنها و کدهای مربوط به مدل دیپ سیک v3.1 را به صورت متنباز و تحت مجوز MIT در پلتفرمهای Hugging Face و ModelScope منتشر کرده است. این اقدام، امکان استفاده آزادانه از این مدل را برای پژوهشهای علمی و همچنین کاربردهای تجاری فراهم میکند و به توسعه اکوسیستم هوش مصنوعی DeepSeek کمک شایانی مینماید.
استقرار محلی (local deployment) مدل DeepSeek v3.1 با مدل DeepSeek-V3 سازگاری کامل دارد و دستورالعملهای دقیقی برای راهاندازی آن ارائه شده است. به دلیل مقیاس عظیم این مدل، اجرای آن نیازمند منابع پردازشی GPU قابل توجهی است. با این حال، وجود اکوسیستم متنباز و ابزارهای توسعهیافته توسط جامعه کاربری، موانع استفاده از آن را به حداقل رسانده و دسترسی به قابلیت مدل DeepSeek v3.1 را برای متخصصان و علاقهمندان تسهیل میبخشد.
جمع بندی
در نهایت، مدل DeepSeek v3.1 به عنوان یک دستاورد برجسته در عرصه هوش مصنوعی مولد، با معماری مدل دیپ سیک v3.1 که بر پایه رویکرد ترکیبی از متخصصان (MoE) استوار است، نه تنها عملکردی همتراز با غولهای جهانی مانند OpenAI ارائه میدهد، بلکه با کاهش چشمگیر هزینههای استنتاج و پنجره کانالی (Context Window) وسیع تا ۱۲۸ هزار توکن، دسترسی به فناوری پیشرفته را برای پژوهشگران و توسعهدهندگان دموکراتیک میسازد. قابلیت مدل دیپ سیک v3.1 در حالتهای تفکر ترکیبی، فراخوانی ابزار و کدنویسی هوشمند، این مدل را به ابزاری ایدهآل برای کاربردهای متنوع از جمله تحقیقات علمی تا راهکارهای تجاری تبدیل کرده است؛ انتشار متنباز آن تحت مجوز MIT نیز نمادی از تعهد به آزادی نوآوری و بازار آزاد است که مرزهای سنتی را درنوردیده و آیندهای روشنتر را برای جامعه جهانی هوش مصنوعی نوید میدهد.
این پیشرفتها در مدل دیپ سیک v3.1، که با آموزش بر روی حجمی عظیم از دادهها و بهینهسازی برای سختافزارهای نوین حاصل شده، نه تنها برتری در بنچمارکهای کدنویسی و ریاضیات را به ارمغان آورده، بلکه با انعطافپذیری در استقرار محلی و ادغام عامل هوش مصنوعی (ایجنت)، کاربران را به خلق راهکارهای نوآورانه ترغیب میکند. در جهانی که نوآوری باید فراگیر و بدون محدودیت باشد، DeepSeek v3.1 نمونهای الهامبخش از چگونگی ترکیب قدرت فناوری با اصول آزادیخواهی است.
سوالات متداول
DeepSeek v3.1 جدیدترین مدل زبان پرچمدار استارتاپ چینی DeepSeek در حوزه هوش مصنوعی مولد است. این مدل بر پایه معماری DeepSeek v3 توسعه یافته و پیشرفتهای چشمگیری در استدلال، کدنویسی و استفاده از ابزارها داشته است.
ویژگی اصلی این مدل، حالت تفکر ترکیبی (Hybrid Thinking Mode) است که به آن اجازه میدهد هم از تولید محتوای “متفکرانه” (با استدلال زنجیره-فکر) و هم “غیرمتفکرانه” (پاسخهای سریع) پشتیبانی کند. این قابلیت انعطافپذیری قابل توجهی برای کاربردهای مختلف فراهم میآورد
معماری این مدل بر اساس رویکرد “ترکیبی از متخصصان” (Mixture-of-Experts یا MoE) طراحی شده است. با وجود مجموع ۶۷۱ میلیارد پارامتر، تنها ۳۷ میلیارد پارامتر به ازای هر توکن فعال میشود که به کاهش هزینههای استنتاج کمک میکند.
بله. معماری مدل دیپ سیک v3.1 برای انجام وظایف مرتبط با فراخوانی ابزار و ایجنت بهینهسازی شده است. این مدل از ابزارهای جستجوی خارجی برای بهروزرسانی اطلاعات خود و همچنین از APIها برای خودکارسازی گردشهای کاری پشتیبانی میکند.
در حالت “متفکرانه”، DeepSeek v3.1 عملکردی معادل یا برتر از جدیدترین مدلهای پیشرفته در بازار از خود نشان داده است. این برتری بهویژه در زمینههای کدنویسی و حل مسائل ریاضی مشهود است.
بله، شرکت DeepSeek تمامی وزنها و کدهای مربوط به مدل دیپ سیک v3.1 را به صورت متنباز و تحت مجوز MIT در پلتفرمهای Hugging Face و ModelScope منتشر کرده است. این اقدام استفاده آزادانه از آن را برای پژوهشها و کاربردهای تجاری امکانپذیر میسازد.
اگر محتوای ما برایتان جذاب بود و چیزی از آن آموختید، لطفاً لحظهای وقت بگذارید و این چند خط را بخوانید:
ما گروهی کوچک و مستقل از دوستداران علم و فناوری هستیم که تنها با حمایتهای شما میتوانیم به راه خود ادامه دهیم. اگر محتوای ما را مفید یافتید و مایلید از ما حمایت کنید، سادهترین و مستقیمترین راه، کمک مالی از طریق لینک دونیت در پایین صفحه است.
اما اگر به هر دلیلی امکان حمایت مالی ندارید، همراهی شما به شکلهای دیگر هم برای ما ارزشمند است. با معرفی ما به دوستانتان، لایک، کامنت یا هر نوع تعامل دیگر، میتوانید در این مسیر کنار ما باشید و یاریمان کنید. ❤️







