هوش مصنوعی

بزرگ‌مردان کوچک OpenAI؛ بررسی کامل GPT-5.4 mini و nano در سال ۲۰۲۶

در سال ۲۰۲۶، دوران سلطه بی‌چون و چرای مدل‌های زبانی بزرگ (LLMs) و متمرکز در حوزه هوش مصنوعی (AI) سپری شده و جای خود را به الگوی جدیدی تحت عنوان “کارایی توزیع‌شده” داده است. در این پارادایم نوین، قدرت واقعی سیستم‌ها دیگر صرفاً در تعداد پارامترهای میلیاردی خلاصه نمی‌شود، بلکه در ایجاد توازنی هوشمندانه میان سرعت استنتاج (Inference Speed) و شکوفایی اقتصاد هوش مصنوعی (AI Economics) نهفته است. امروزه شاخص “تأخیر” (Latency) تنها یک متغیر فنی ساده در زیرساخت‌های API به شمار نمی‌رود، بلکه به جزئی حیاتی از هویت محصول تبدیل شده که مرز میان تجربه کاربری روان در تعامل با کامپیوتر (Computer Use) و شکست پروژه‌های اتوماسیون را تعیین می‌کند. از منظر تحلیل‌های زیرساختی، این تکامل تکنولوژیک به معنای تمرکززدایی از قدرت محاسباتی و انتقال ابزارهای تولید به دست توسعه‌دهندگان و کارآفرینان مستقلی است که به دنبال بیشترین خروجی با کمترین هزینه در محیط‌های رایانش ابری هستند.

در این گذار استراتژیک، عرضه مدل‌های GPT-5.4 mini و nano توسط شرکت OpenAI در مارس ۲۰۲۶، فراتر از یک به‌روزرسانی معمولی، به عنوان بازتعریفی بنیادین از نسبت “هزینه-اثربخشی” در سیستم‌های هوشمند قلمداد می‌شود. این مدل‌های زبانی کوچک (Small Language Models) یا SLM، با نزدیک شدن به سطح عملکرد مدل‌های پرچم‌دار در بنچمارک‌های عملیاتی نظیر SWE-bench Pro، ثابت کرده‌اند که برای مدیریت معماری زیر-عامل‌ها (Subagents) و اتوماسیون کدنویسی در مقیاس کلان، الزامی به مصرف منابع پردازشی بی‌پایان وجود ندارد. تیم نویسندگان هامیا ژورنال با تحلیل دقیق این دو مدل نوظهور، به بررسی این موضوع خواهند پرداخت که چگونه سیستم‌های ایجنتیک (Agentic Systems) و بهینه‌سازی برای موتورهای پاسخگو (GEO) در خانواده GPT-5.4، مسیر را برای کارایی و بهینه‌سازی هرچه بیشتر در اجرای پروژه‌های پیچیده هموار کرده و وابستگی به زیرساخت‌های سنگین را به حداقل رسانده است.

تحلیل فنی و معرفی GPT-5.4 mini و nano: توانمندترین مدل‌های کوچک OpenAI

در ماه مارس سال 2026، فرآیند معرفی GPT-5.4 mini و nano توسط شرکت OpenAI کلید خورده است؛ مدل‌هایی که به عنوان مدل‌های کوچک توانمند و بی‌رقیب تا به امروز شناخته می‌شوند. این نسخه‌های نوظهور، بسیاری از قابلیت‌های کلیدی و نقاط قوت نسخه پایه GPT-5.4 را در ساختاری بسیار سریع‌تر و بهینه‌تر ارائه می‌دهند. طراحی این مدل‌های زبانی کوچک (Small Language Models) یا SLM به‌گونه‌ای انجام شده است که به‌طور ویژه برای مدیریت حجم کاری بالا (High-volume workloads) در پروژه‌های اتوماسیون و مهندسی نرم‌افزار ایده‌آل باشند.

در مدل GPT-5.4 mini، پیشرفت‌های خیره‌کننده‌ای در حوزه‌های تخصصی نظیر کدنویسی، استدلال منطقی، هوش مصنوعی چندوجهی (Multimodal AI) و تعامل با ابزارهای جانبی نسبت به نسخه پیشین (GPT-5 mini) اعمال شده است؛ این در حالی است که مدل مذکور با سرعت (Speed) پردازشی بیش از دو برابر نسخه قبلی اجرا می‌گردد. شایان ذکر است که در ارزیابی‌های فنی و معتبر بین‌المللی، به‌ویژه در بنچمارک‌های SWE-Bench Pro و OSWorld-Verified، این مدل توانسته است به عملکرد مرزی (Frontier performance) و سطح کیفی مدل‌های بزرگ‌محور نزدیک شود که گواهی بر کارایی و بهینه‌سازی فوق‌العاده آن در سیستم‌های ایجنتیک است.

مدل GPT-5.4 nano به عنوان کوچک‌ترین و اقتصادی‌ترین ویرایش از خانواده GPT-5.4، برای انجام مأموریت‌هایی توسعه یافته است که در آن‌ها بهینه‌سازی تأخیر و مدیریت هزینه‌های اقتصاد هوش مصنوعی (AI Economics) اولویت نخست را دارند. این نسخه ارتقای ساختاری قابل‌توجهی را نسبت به نسل گذشته تجربه کرده است؛ لذا از سوی تیم اوپن ای‌آی استفاده از این مدل برای فرآیندهایی نظیر دسته‌بندی (Classification)، استخراج داده‌های حجیم، رتبه‌بندی و همچنین هدایت زیر-عامل‌ها (Subagents) در وظایف پشتیبانی ساده، به شدت توصیه می‌شود تا بهره‌وری در زیرساخت‌های API به حداکثر برسد.

این معماری‌های نوین به‌طور اختصاصی برای سناریوهایی طراحی شده‌اند که در آن‌ها میزان تأخیر (Latency) مستقیماً کیفیت تجربه کاربری و تعامل با کامپیوتر (Computer Use) را تحت تأثیر قرار می‌دهد. به عنوان مثال، در دستیارهای هوشمند کدنویسی که نیازمند پاسخ‌دهی آنی (Responsive) هستند، یا در سیستم‌های ایجنتیک که وظایف پشتیبانی را با سرعت بالا به سرانجام می‌رسانند، کارایی این مدل‌ها مشهود است. همچنین در اپلیکیشن‌های چندوجهی که به تحلیل لحظه‌ای تصاویر و اسکرین‌شات‌ها می‌پردازند، این مدل‌ها درخشان ظاهر می‌شوند. در چنین اکوسیستمی، لزوماً بزرگ‌ترین مدل، بهترین انتخاب نیست؛ بلکه برتری از آنِ مدلی است که در کنار سرعت بالا، توانایی استفاده دقیق از ابزارها را داشته و در انجام وظایف پیچیده تخصصی، پایداری عملیاتی خود را حفظ کند.

بنچمارک / مدلGPT-5.4 (xhigh)GPT-5.4 mini (xhigh)GPT-5.4 nano (xhigh)GPT-5 mini (high)
SWE-Bench Pro (Public)57.70%54.40%52.40%45.70%
Terminal-Bench 2.075.10%60.00%46.30%38.20%
Toolathlon54.60%42.90%35.50%26.90%
GPQA Diamond93.00%88.00%82.80%81.60%
OSWorld-Verified75.00%72.10%39.00%42.00%

تحول در مهندسی نرم‌افزار: دستیابی به توازن عملکرد و سرعت در کدنویسی با GPT-5.4 mini

در اکوسیستم مدرن توسعه نرم‌افزار، فرآیند معرفی GPT-5.4 mini و nano تحولی بنیادین در گردش‌کارهای کدنویسی ایجاد کرده است که به طور ویژه از استراتژی تکرار سریع (Fast iteration) بهره می‌برند. این مدل‌های زبانی کوچک (Small Language Models) یا SLM با تکیه بر کارایی و بهینه‌سازی فوق‌العاده خود، وظایف حساسی نظیر ویرایش‌های هدفمند (Targeted editsپیمایش در بدنه کد (Codebase navigation) و تولید بخش‌های رابط کاربری (Front-end generation) را با کمترین میزان تأخیر (Latency) ممکن به سرانجام می‌رسانند. علاوه بر این، تسریع در حلقه‌های عیب‌یابی (Debugging loops) توسط این مدل‌ها، آن‌ها را به یک دستیار کدنویسی (Coding assistant) بی‌رقیب برای پروژه‌هایی تبدیل کرده است که در آن‌ها دستیابی به سرعت (Speed) بالاتر در کنار مدیریت بهینه هزینه‌های زیرساختی، اولویت استراتژیک محسوب می‌شود.

نتایج حاصل از بنچمارک‌های فنی نشان می‌دهد که مدل GPT-5.4 mini به طور مستمر و در شرایطی که سطح تأخیر مشابهی با نسل‌های قبل دارد، عملکردی به مراتب قدرتمندتر از نسخه قبلی ارائه می‌دهد. با وجود اینکه اجرای این مدل توسط شرکت OpenAI با سرعت بسیار بالاتری بهینه شده است، نرخ‌های موفقیت (Pass rates) آن در حل مسائل پیچیده مهندسی به سطح عملکردی مدل پرچم‌دار نزدیک شده است. این دستاورد بزرگ در حوزه هوش مصنوعی (AI)، یکی از مستحکم‌ترین نمونه‌های توازن عملکرد-تأخیر (Performance-per-latency) را برای تیم‌های فنی فراهم آورده است. از این رو، تیم نویسندگان هامیا بر این باورند که این توازن هوشمندانه، مرزهای جدیدی را در بهره‌وری ایجنت‌های کدنویس جابه‌جا کرده است.

معماری سیستم‌های ایجنتیک: نقش GPT-5.4 mini به عنوان زیر-عامل (Subagent) در Codex

در ساختار مدرن هوش مصنوعی (AI)، مدل GPT-5.4 mini به عنوان گزینه‌ای بسیار کارآمد برای توسعه سیستم‌های چند-عاملی (Multi-agent systems) شناخته می‌شود که مدل‌هایی با ابعاد و توانمندی‌های متفاوت را با یکدیگر ترکیب می‌کنند. به عنوان یک نمونه عینی در پلتفرم Codex، یک مدل قدرتمندتر مانند نسخه اصلی GPT-5.4 می‌تواند وظایف کلان مدیریتی از جمله برنامه‌ریزی و هماهنگی و همچنین قضاوت نهایی را عهده‌دار شود؛ این در حالی است که فرآیند اجرای موازی (Parallel execution) زیر-وظایف محدودتر به مجموعه‌ای از زیر-عامل‌ها (Subagents) مبتنی بر GPT-5.4 mini واگذار می‌گردد. این زیر-عامل‌ها وظایفی تخصصی نظیر جست‌وجوی دقیق در بدنه کد، پیمایش در فایل‌های حجیم یا پردازش اسناد پشتیبان را با کمترین میزان تأخیر (Latency) به انجام می‌رسانند. جهت درک عمیق‌تر از نحوه عملکرد این ساختار در محیط‌های عملیاتی، مطالعه مستندات مربوطه در پنجره‌ای جدید توصیه می‌شود.

این الگوی معماری با افزایش سرعت (Speed) و توانمندی مدل‌های زبانی کوچک (Small Language Models) یا SLM، بیش از پیش جنبه کاربردی به خود گرفته است. در این رویکرد نوین، توسعه‌دهندگان به جای اتکا به یک مدل واحد برای تمامی پردازش‌ها، اقدام به ترکیب (Compose) سیستم‌هایی می‌کنند که در آن‌ها مدل‌های بزرگ‌تر وظیفه تصمیم‌گیری استراتژیک را بر عهده دارند و مدل‌های کوچک‌تر، عملیات اجرایی را با کارایی بالا و در مقیاس کلان به ثمر می‌رسانند. این استراتژی علاوه بر بهبود کارایی و بهینه‌سازی منابع، پدیده “پوسیدگی بافتار” (Context rot) را به شدت کاهش داده و پایداری اطلاعات را در طول پروژه حفظ می‌کند. طبق بررسی‌های صورت گرفته، GPT-5.4 mini قدرتمندترین ابزار ارائه شده توسط شرکت OpenAI تا به امروز برای مدیریت این سبک از گردش‌کارهای پیچیده محسوب می‌شود.

قابلیت Computer Use: تعامل آنی با رابط کاربری و درک چندوجهی در مدل mini

مدل GPT-5.4 mini در اجرای وظایف مبتنی بر درک چندوجهی (Multimodal)، به‌ویژه در سناریوهای پیچیده مربوط به تعامل با کامپیوتر (Computer use)، توانمندی‌های خیره‌کننده‌ای از خود نشان داده است. این مدل زبانی کوچک (Small Language Model) یا SLM قادر است با دقت و سرعت (Speed) بالا، فرآیند تفسیر اسکرین‌شات تهیه شده از یک رابط کاربری متراکم (Dense UI)؛ مانند محیط‌های نرم‌افزاری حسابداری ایرانی یا سامانه‌های اداری شلوغ؛ را انجام داده و تراکنش‌های عملیاتی را در کوتاه‌ترین زمان ممکن به سرانجام برساند. در ارزیابی‌های فنی صورت گرفته در بنچمارک OSWorld-Verified، مشاهده شده است که عملکرد این نسخه به سطح کیفی مدل پرچم‌دار شرکت OpenAI یعنی GPT-5.4 بسیار نزدیک شده است؛ این در حالی است که از نظر کارایی و بهینه‌سازی و همچنین کاهش نرخ تأخیر (Latency)، نتایجی به مراتب درخشان‌تر از نسل پیشین (GPT-5 mini) در حوزه هوش مصنوعی (AI) ارائه می‌دهد.

راهنمای قیمت‌گذاری API و دسترسی: چرا GPT-5.4 nano ارزان‌ترین گزینه است؟

فرآیند معرفی GPT-5.4 mini و nano از مارس 2026 وارد فاز عملیاتی شده و دسترسی به این مدل‌ها در رابط برنامه‌نویسی کاربردی (API)، سرویس تخصصی Codex و پلتفرم ChatGPT فراهم شده است. این اقدام شرکت OpenAI گام مهمی در راستای در دسترس‌سازی هوش مصنوعی (AI) کارآمد برای طیف گسترده‌ای از توسعه‌دهندگان محسوب می‌شود.

در محیط رابط برنامه‌نویسی (API)، مدل GPT-5.4 mini از قابلیت‌های متنوعی نظیر ورودی‌های متنی و تصویری، استفاده از ابزارها (Tool use)، فراخوانی توابع (Function calling)، جست‌وجوی وب و فایل و همچنین تعامل با کامپیوتر (Computer use) پشتیبانی می‌کند. این مدل زبانی کوچک (SLM) با بهره‌گیری از یک پنجره کانالی ۴۰۰ هزار توکنی (400k context window)، امکان پردازش حجم عظیمی از داده‌ها را فراهم می‌آورد. از منظر اقتصاد هوش مصنوعی، هزینه توکن ورودی/خروجی در این مدل بسیار مقرون‌به‌صرفه تعیین شده است؛ به طوری که مبلغ ۰.۷۵ دلار به ازای هر یک میلیون توکن ورودی و ۴.۵۰ دلار به ازای هر یک میلیون توکن خروجی محاسبه می‌گردد.

در سرویس Codex، دسترسی به مدل GPT-5.4 mini در تمامی بخش‌ها اعم از اپلیکیشن، واسط خط فرمان (CLI)، افزونه‌های محیط توسعه (IDE) و نسخه وب امکان‌پذیر گشته است. این مدل با هدف کارایی و بهینه‌سازی منابع، تنها از ۳۰ درصد سهمیه (Quota) مدل بزرگ‌تر استفاده می‌کند؛ این ویژگی به توسعه‌دهندگان اجازه می‌دهد وظایف کدنویسی را با حدود یک‌سوم هزینه و با سرعت (Speed) بسیار بالا به سرانجام برسانند. همچنین سیستم می‌تواند وظایف اجرایی را به زیر-عامل‌های (Subagents) مبتنی بر این مدل واگذار (Delegate) کند تا فرآیندهایی که نیاز به استدلال کمتری دارند، با هزینه‌ای ناچیز اجرا شوند.

در پلتفرم ChatGPT، مدل GPT-5.4 mini برای کاربران طرح‌های رایگان و ChatGPT GO از طریق قابلیت Thinking در منوی کاربری در دسترس قرار گرفته است. برای سایر سطوح کاربری، این مدل به عنوان یک جایگزین رزرو (Fallback) عمل می‌کند تا در صورت اتمام سهمیه استفاده (Rate limit) از مدل اصلی، از بروز وقفه و افزایش تأخیر (Latency) در پاسخگویی جلوگیری شود.

مدل GPT-5.4 nano منحصراً در محیط رابط برنامه‌نویسی (API) ارائه شده است و به عنوان ارزان‌ترین عضو این خانواده شناخته می‌شود. با قیمت‌گذاری ۰.۲۰ دلار به ازای هر یک میلیون توکن ورودی و ۱.۲۵ دلار به ازای هر یک میلیون توکن خروجی، این مدل قیمت توکن API را به حداقل ممکن رسانده و گزینه‌ای فوق‌العاده برای پروژه‌های با حجم تراکنش بالا است.

جهت کسب اطلاعات تکمیلی در خصوص پروتکل‌های امنیتی (Safeguards) و استانداردهای حفاظتی این مدل‌ها، مراجعه به ضمیمه شناسنامه سیستم (System Card) در مرکز ایمنی استقرار شرکت منتشرکننده توصیه می‌گردد. تیم نویسندگان هامیا امیدوارند این بازنگری در ساختار هزینه‌ها، مسیر را برای نوآوری‌های بیشتر در جامعه نرم‌افزاری ایران هموار سازد.

جمع بندی

تکامل خانواده GPT-5.4 و معرفی GPT-5.4 mini و nano، نشان‌دهنده نقطه عطفی در تاریخ هوش مصنوعی (AI) است که در آن پارادایم “بزرگی ابعاد” جای خود را به مفهوم “هوشمندیِ کارآمد” داده است. تیم نویسندگان هامیا با کالبدشکافی بنچمارک‌های فنی نظیر SWE-Bench Pro و تحلیل دقیق ساختار زیر-عامل‌ها (Subagents)، به روشنی ترسیم کرده‌اند که چگونه می‌توان با صرف هزینه‌ای ناچیز در حوزه اقتصاد هوش مصنوعی، به عملکردی در سطح مدل‌های پیشتاز دست یافت. این مدل‌های زبانی کوچک (Small Language Models) یا SLM در حقیقت ابزارهایی برای تمرکززدایی از قدرت محاسباتی محسوب می‌شوند؛ چرا که با در اختیار قرار دادن قدرت استنتاج بالا در ابعادی بهینه، انحصار ساختارهای متمرکز را شکسته و به هر توسعه‌دهنده مستقل یا استارتاپ نوپای ایرانی اجازه می‌دهند بدون وابستگی به زیرساخت‌های گران‌قیمت، سیستم‌های ایجنتیک پیچیده و پاسخگو بنا کنند.

در نهایت، انتخاب میان GPT-5.4 mini و nano، فراتر از یک تصمیم فنی ساده، یک استراتژی اقتصادی برای پیشتازی در بازار رقابتی مهندسی نرم‌افزار است. همان‌طور که در این تحلیل جامع توسط تیم نویسندگان هامیا مشاهده شد، در اکوسیستم هوش مصنوعی سال ۲۰۲۶، پیروز میدان لزوماً نهادی نیست که سنگین‌ترین مدل را در اختیار دارد، بلکه کسی است که می‌تواند با کارایی و بهینه‌سازی دقیق، شاخص تأخیر (Latency) را به نفع بهبود تجربه کاربری و تعامل با کامپیوتر (Computer Use) مهار کند. این مقاله با ارائه نقشه راهی برای بهره‌برداری از قابلیت‌های نوین و پنجره بافت ۴۰۰ هزار توکنی، همراهان هامیا را مجهز به دانشی کرد که مرزهای میان فرضیات فنی و اجرای عملیاتی را در هم می‌شکند؛ دانشی که با افزایش سرعت (Speed) فرآیندها، به عنوان یک سند مرجع راهگشای متخصصانی خواهد بود که در بستر رایانش ابری و زیرساخت‌های API به دنبال بیشترین خروجی با کمترین هزینه هستند.

سوالات متداول

تفاوت اصلی GPT-5.4 mini با نسل قبلی (GPT-5 mini) در چیست؟

مدل GPT-5.4 mini با وجود حفظ پنجره کانالی ۴۰۰ هزار توکنی، بیش از ۲ برابر سریع‌تر از نسل قبلی خود اجرا می‌شود. مضاف بر این، قدرت استدلال و کدنویسی این مدل به شدت ارتقا یافته و در بنچمارک‌های دشوار، عملکردی نزدیک به مدل پرچم‌دار ارائه می‌دهد.

آیا GPT-5.4 mini برای پروژه‌های حرفه‌ای کدنویسی قابل اعتماد است؟

بله؛ این مدل با کسب امتیاز ۵۴.۴٪ در بنچمارک SWE-Bench Pro، یکی از قوی‌ترین توازن‌های “عملکرد در برابر تأخیر” را برای مهندسان نرم‌افزار فراهم کرده است. این مدل برای پیمایش در بدنه کد (Codebase navigation) و حلقه‌های عیب‌یابی (Debugging loops) بسیار کارآمدتر و ارزان‌تر از مدل‌های غول‌پیکر عمل می‌کند.

مدل GPT-5.4 nano در چه سناریوهایی بهترین عملکرد را دارد؟

مدل nano کوچک‌ترین و ارزان‌ترین عضو این خانواده است که منحصراً برای وظایف با حجم بالا و حساس به هزینه طراحی شده است. استفاده از آن برای دسته‌بندی داده‌ها (Classification)، استخراج اطلاعات انبوه و به عنوان زیر-عامل‌های اجرایی (Subagents) در سیستم‌های توزیع‌شده توصیه می‌شود.

قابلیت “تعامل با کامپیوتر” (Computer Use) در این مدل‌ها چگونه عمل می‌کند؟

مدل GPT-5.4 mini به دلیل معماری چندوجهی (Multimodal) خود، قادر است اسکرین‌شات‌های رابط کاربری (UI) را با سرعت بالا تفسیر کرده و وظایف عملیاتی را در محیط سیستم‌عامل انجام دهد. در بنچمارک OSWorld-Verified، این مدل امتیاز ۷۲.۱٪ را کسب کرده که بسیار نزدیک به توانایی مدل پرچم‌دار است.

هزینه استفاده از API این مدل‌ها برای توسعه‌دهندگان چقدر است؟

هزینه ورودی برای مدل mini معادل ۰.۷۵ دلار و برای مدل nano تنها ۰.۲۰ دلار به ازای هر یک میلیون توکن است. این ساختار قیمت‌گذاری به استارتاپ‌ها اجازه می‌دهد تا با صرف یک‌سوم هزینه مدل‌های بزرگ، سیستم‌های ایجنتیکِ پاسخگو و مقیاس‌پذیر بنا کنند.

چگونه می‌توان به قابلیت Thinking در مدل‌های جدید دسترسی داشت؟

در محیط ChatGPT، مدل GPT-5.4 mini برای کاربران طرح‌های Free و Go از طریق منوی قابلیت “تفکر” (Thinking) در دسترس است. برای کاربران حرفه‌ای (Plus و Pro)، این مدل به عنوان یک جایگزین رزرو (Fallback) در زمان‌های اوج مصرف و اتمام سهمیه مدل اصلی عمل می‌کند تا تداوم پاسخگویی حفظ شود.

کدنویسی

بنچمارک / مدلGPT-5.4 (xhigh)GPT-5.4 mini (xhigh)GPT-5.4 nano (xhigh)GPT-5 mini (high)
SWE-bench Pro (Public)57.70%54.40%52.40%45.70%
Terminal-Bench 2.075.10%60.00%46.30%38.20%

فراخوانی ابزار (Tool-calling)

بنچمارک / مدلGPT-5.4 (xhigh)GPT-5.4 mini (xhigh)GPT-5.4 nano (xhigh)GPT-5 mini (high)
MCP Atlas67.20%57.70%56.10%47.60%
Toolathlon54.60%42.90%35.50%26.90%
τ2-bench (telecom)98.90%93.40%92.50%74.10%

هوش و استدلال (Intelligence)

بنچمارک / مدلGPT-5.4 (xhigh)GPT-5.4 mini (xhigh)GPT-5.4 nano (xhigh)GPT-5 mini (high)
GPQA Diamond93.00%88.00%82.80%81.60%
HLE w/ tool52.10%41.50%37.70%31.60%
HLE w/o tools39.80%28.20%24.30%18.30%

عملکرد بینایی و چندرسانه‌ای (MM / Vision / CUA)

بنچمارک / مدلGPT-5.4 (xhigh)GPT-5.4 mini (xhigh)GPT-5.4 nano (xhigh)GPT-5 mini (high)
OSWorld-Verified75.00%72.10%39.00%42.00%
MMMUPro w/ Python81.50%78.00%69.50%74.10%
MMMUPro81.20%76.60%66.10%67.50%
OmniDocBench 1.5 (no tools)0.1090.12630.24190.1791

جدول عملکرد بافتار طولانی (Long context)

بنچمارک / مدلGPT-5.4 (xhigh)GPT-5.4 mini (xhigh)GPT-5.4 nano (xhigh)GPT-5 mini (high)
OpenAI MRCR v2 8-needle 64K-128K86.00%47.70%44.20%35.10%
OpenAI MRCR v2 8-needle 128K-256K79.30%33.60%33.10%19.40%
Graphwalks BFS 0K-128K93.10%76.30%73.40%73.40%
Graphwalks parents 0-128K (accuracy)89.80%71.50%50.80%64.30%

امتیاز دهید!
0 / 0

نوشته های مشابه

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

دکمه بازگشت به بالا