Ai Models: Difference between revisions
(Created page with "== مقایسه مدلهای هوش مصنوعی برای برنامهنویسی == این صفحه مدلهای موجود در انتخابگر مدل '''Freebuff''' (و بهطور کلی مدلهای برتر کدنویسی) را از دیدگاههای مختلف مقایسه میکند: کیفیت کد، قدرت عاملگرا (Agentic)، هزینه، سرعت، پنجره زمینه، اکوسیستم، متنباز بودن و حریم...") |
|
(No difference)
| |
Latest revision as of 04:24, 19 August 2026
مقایسه مدلهای هوش مصنوعی برای برنامهنویسی
این صفحه مدلهای موجود در انتخابگر مدل Freebuff (و بهطور کلی مدلهای برتر کدنویسی) را از دیدگاههای مختلف مقایسه میکند: کیفیت کد، قدرت عاملگرا (Agentic)، هزینه، سرعت، پنجره زمینه، اکوسیستم، متنباز بودن و حریم خصوصی.
توجه: بسیاری از اعداد بنچمارکها توسط خود شرکتها منتشر شدهاند و برخی بنچمارکها (مثل SWE-bench Pro) حاشیههای زیادی دارند. اعداد را «نشانگر جهت» بگیرید، نه حقیقت مطلق.
جدول خلاصه
| مدل | کیفیت کد | قدرت Agentic / ترمینال | هزینه | سرعت | نکته کلیدی |
|---|---|---|---|---|---|
| Claude Fable 5 | ⭐ بهترین (SWE-bench Pro ~80٪) | خیلی خوب | گرانترین ($10/$50) | متوسط | پادشاه کدنویسی سطح مخزن؛ پروژههای چندروزه |
| DeepSeek V4 Pro 08/13 | عالی (~77/100 تست مستقل) | خوب | متوسط–بالا | خوب | هوشمندترین متنباز؛ بین Opus 4.7 و Kimi K2.6 |
| GPT-5.6 Sol | خیلی خوب (Pro 64.6٪) | ⭐ بهترین ترمینال (88.8٪) | گران ($5/$30) | خوب | رکورد Terminal-Bench؛ ولی در SWE-bench Pro از Fable عقبتر |
| Claude Opus 4.8 | عالی (Pro 69.2٪) | خوب (TB 74.6٪) | بالا | متوسط | قابل اعتماد برای کارهای چندمرحلهای طولانی |
| Claude Sonnet 5 | خوب (Pro 63.2٪) | ⭐ بهتر از Opus! (TB 80.4٪) | ارزان ($2/$10) | سریع | بهترین نسبت قیمت/کیفیت در خانواده کلود |
| GLM 5.2 | عالی (Pro 62.1٪) | عالی (TB 81.0٪) | متوسط ($1.40/$4.40) | خوب | متنباز MIT؛ سازگار با Claude Code |
| GPT-5.6 Terra | خوب | عالی (TB 87.4٪) | ارزان ($2/$12) | سریع | همهفنحریف روزمرهٔ Codex |
| MiniMax M3 | خوب (Pro 59.0٪) | متوسط (TB 66.0٪) | بسیار ارزان ($0.30/$1.20) | ⭐ سریعترین (~110 tok/s) | چندوجهی: تصویر/ویدیو/دسکتاپ |
| GPT-5.6 Luna | متوسط (Coding Index 74.6) | خوب (TB 84.7٪) | ⭐ ارزانترین ($0.20/$1.20) | ⭐ خیلی سریع | سقوط فاجعهبار در حافظهٔ طولانی (MRCR 41.3٪) |
| DeepSeek V4 Flash | متوسط (60/100) | متوسط | ⭐ فوقالعاده ارزان (~$0.02/اجرا) | سریع | مناسب اولین پیشنویس + بازبینی انسانی |
| MiMo 2.5 | متوسط–خوب | متوسط | ارزان | ~55 tok/s | متعادل؛ مناسب کار روزمره |
۱. کیفیت کد (SWE-bench Pro)
ترتیب تقریبی: Fable 5 (~80٪) با فاصله جلو است؛ سپس Opus 4.8 (69٪)، GPT-5.6 Sol (64.6٪)، Sonnet 5 (63٪)، GLM 5.2 (62٪)، MiniMax M3 (59٪).
نکته مهم: اپلیکیشنها GPT-5.6 را «بهترین مدل کدنویسی» معرفی میکنند چون در بنچمارکهای عاملگرا جلو است؛ اما در حل مسائل واقعی مخزن (issueهای چندفایلی) خانواده کلود بهویژه Fable 5 قویتر است. هر دو ادعا درستاند — روی تسکهای متفاوت.
۲. قدرت عاملگرا و ترمینال (Terminal-Bench 2.1)
اینجا دنیا برعکس میشود:
- GPT-5.6 Sol: 88.8٪ (رکورد)
- GPT-5.6 Terra: 87.4٪
- GPT-5.6 Luna: 84.7٪
- Claude Fable 5: 86.0٪
- GLM 5.2: 81.0٪
- Claude Sonnet 5: 80.4٪
- Claude Opus 4.8: 74.6٪
- MiniMax M3: 66.0٪
برای «عاملی که خودش دستور در ترمینال اجرا میکند» خانواده GPT-5.6 و سپس Sonnet 5 انتخابهای بهتری هستند — حتی Sonnet 5 ارزانتر از Opus 4.8 در ترمینال بهتر عمل میکند.
۳. هزینه
| دسته | مدلها | توضیح |
|---|---|---|
| Unlimited / رایگان | DeepSeek V4 Flash، MiMo 2.5 | برای حجم کار بالا بدون دغدغه هزینه |
| Premium | DeepSeek V4 Pro، GPT-5.6 Luna، MiniMax M3 | Luna پس از کاهش قیمت ۸۰٪ ($0.20/$1.20) از نظر «کار به ازای هر دلار» رکورد میزند |
| اشتراک خودتان | Claude (Fable/Opus/Sonnet) و Codex (Sol/Terra/Luna) | از سهمیهٔ اشتراک شما مصرف میکنند |
قیمتهای API (به ازای هر میلیون توکن، ورودی/خروجی) پس از کاهشهای ۳۰ ژوئیه:
- GPT-5.6 Sol: $5 / $30
- GPT-5.6 Terra: $2 / $12
- GPT-5.6 Luna: $0.20 / $1.20
- Claude Fable 5: $10 / $50
- Claude Sonnet 5: $2 / $10 (تا ۳۱ اوت؛ سپس $3/$15)
- GLM 5.2: $1.40 / $4.40
- MiniMax M3: $0.30 / $1.20 (پرومو)
۴. سرعت
- ⭐ سریعترین: MiniMax M3 (~110 توکن/ثانیه، تقریباً دو برابر MiMo با ~55 tok/s)
- سریع: GPT-5.6 Luna، DeepSeek V4 Flash، Sonnet 5
- کندتر (مدلهای سنگین): Fable 5، V4 Pro، Sol — برای پاسخ سریع مناسب نیستند
۵. پنجره زمینه (Context)
همهٔ مدلهای جدید حدود ۱ میلیون توکن پنجره دارند، اما کیفیت استفاده فرق میکند. در بنچمارک MRCR (بازیابی از متن طولانی):
- GPT-5.6 Sol: 91.5٪
- GPT-5.6 Terra: 89.6٪
- GPT-5.6 Luna: 41.3٪ ← سقوط شدید
اگر با کدبیس بزرگ کار میکنید، Luna گزینهٔ اشتباهی است؛ Sol/Terra یا Opus 4.8/Fable را انتخاب کنید.
۶. اکوسیستم و ابزار
- GLM 5.2 با API انتروپیک سازگار است — دراپاین مستقیم در Claude Code.
- مدلهای Claude بهصورت بومی در Claude Code و مدلهای GPT-5.6 در Codex یکپارچهاند؛ تلفیق ابزار، مدیریت فایل و اجازهٔ اجرا روانتر کار میکند.
۷. متنباز بودن
- متنباز (MIT): DeepSeek V4 (MIT)، GLM 5.2 (MIT، وزنها منتشرشده)
- وزنهای باز: MiniMax M3، MiMo 2.5
- اختصاصی: Claude و GPT-5.6
مدلهای متنباز را میتوانید خودتان میزبانی کنید، داده بیرون نرود و کاستومسازی کنید.
۸. حریم خصوصی
- مدلهای DeepSeek «ممکن است داده را برای آموزش AI استفاده کنند» (در خود اپ هم نوشته شده).
- Claude و Codex با اشتراک، معمولاً آموزش روی دادههای شما ندارند.
اگر کد محرمانه دارید، این تفاوت مهم است.
۹. قابلیت تصویر (Multimodal)
مدلهای دارای برچسب Images: MiniMax M3، GPT-5.6 Luna و MiMo 2.5 — مفید برای کدنویسی از روی اسکرینشات یا طراحی UI.
توصیه نهایی بر اساس کاربرد
| کاربرد | مدل پیشنهادی |
|---|---|
| پروژه بزرگ / مهاجرت کد / کار چندروزه | Fable 5 (اگر سهمیهٔ اشتراک کلود اجازه دهد) |
| عامل خودمختار در ترمینال (Agentic) | GPT-5.6 Sol؛ برای کار روزمره Terra |
| بهترین تعادل قیمت/کیفیت | Sonnet 5 یا GPT-5.6 Terra یا GLM 5.2 |
| بودجه صفر / حجم بالا | DeepSeek V4 Flash یا MiMo 2.5 (با بازبینی انسانی) |
| کدنویسی + تصویر/اسکرینشات | MiniMax M3 (سریع و ارزان) یا GPT-5.6 Luna |
| کدبیس خیلی بزرگ | از Luna پرهیز کنید؛ Sol/Terra یا Opus 4.8/Fable |
منابع
- OpenAI — معرفی GPT-5.6 (Sol/Terra/Luna) و رهبری در Terminal-Bench 2.1
- Anthropic — معرفی Claude Fable 5، Opus 4.8 و Sonnet 5
- Kilo AI — تست مستقل DeepSeek V4 Pro و Flash در برابر Opus 4.7 و Kimi K2.6
- Artificial Analysis — شاخص Coding Agent و مقایسهٔ MiniMax M3 در برابر MiMo
- CodingFleet — مقایسهٔ GLM-5.2 و MiniMax M3