Ai Models

From wiki karavi
Revision as of 20:19, 16 August 2026 by Karavi (talk | contribs) (Created page with "== مقایسه مدل‌های هوش مصنوعی برای برنامه‌نویسی == این صفحه مدل‌های موجود در انتخابگر مدل '''Freebuff''' (و به‌طور کلی مدل‌های برتر کدنویسی) را از دیدگاه‌های مختلف مقایسه می‌کند: کیفیت کد، قدرت عامل‌گرا (Agentic)، هزینه، سرعت، پنجره زمینه، اکوسیستم، متن‌باز بودن و حریم...")
(diff) ← Older revision | Latest revision (diff) | Newer revision → (diff)
Jump to navigation Jump to search

مقایسه مدل‌های هوش مصنوعی برای برنامه‌نویسی

این صفحه مدل‌های موجود در انتخابگر مدل Freebuff (و به‌طور کلی مدل‌های برتر کدنویسی) را از دیدگاه‌های مختلف مقایسه می‌کند: کیفیت کد، قدرت عامل‌گرا (Agentic)، هزینه، سرعت، پنجره زمینه، اکوسیستم، متن‌باز بودن و حریم خصوصی.

توجه: بسیاری از اعداد بنچمارک‌ها توسط خود شرکت‌ها منتشر شده‌اند و برخی بنچمارک‌ها (مثل SWE-bench Pro) حاشیه‌های زیادی دارند. اعداد را «نشانگر جهت» بگیرید، نه حقیقت مطلق.


جدول خلاصه

مدل کیفیت کد قدرت Agentic / ترمینال هزینه سرعت نکته کلیدی
Claude Fable 5 ⭐ بهترین (SWE-bench Pro ~80٪) خیلی خوب گران‌ترین ($10/$50) متوسط پادشاه کدنویسی سطح مخزن؛ پروژه‌های چندروزه
DeepSeek V4 Pro 08/13 عالی (~77/100 تست مستقل) خوب متوسط–بالا خوب هوشمندترین متن‌باز؛ بین Opus 4.7 و Kimi K2.6
GPT-5.6 Sol خیلی خوب (Pro 64.6٪) ⭐ بهترین ترمینال (88.8٪) گران ($5/$30) خوب رکورد Terminal-Bench؛ ولی در SWE-bench Pro از Fable عقب‌تر
Claude Opus 4.8 عالی (Pro 69.2٪) خوب (TB 74.6٪) بالا متوسط قابل اعتماد برای کارهای چندمرحله‌ای طولانی
Claude Sonnet 5 خوب (Pro 63.2٪) ⭐ بهتر از Opus! (TB 80.4٪) ارزان ($2/$10) سریع بهترین نسبت قیمت/کیفیت در خانواده کلود
GLM 5.2 عالی (Pro 62.1٪) عالی (TB 81.0٪) متوسط ($1.40/$4.40) خوب متن‌باز MIT؛ سازگار با Claude Code
GPT-5.6 Terra خوب عالی (TB 87.4٪) ارزان ($2/$12) سریع همه‌فن‌حریف روزمرهٔ Codex
MiniMax M3 خوب (Pro 59.0٪) متوسط (TB 66.0٪) بسیار ارزان ($0.30/$1.20) ⭐ سریع‌ترین (~110 tok/s) چندوجهی: تصویر/ویدیو/دسکتاپ
GPT-5.6 Luna متوسط (Coding Index 74.6) خوب (TB 84.7٪) ⭐ ارزان‌ترین ($0.20/$1.20) ⭐ خیلی سریع سقوط فاجعه‌بار در حافظهٔ طولانی (MRCR 41.3٪)
DeepSeek V4 Flash متوسط (60/100) متوسط ⭐ فوق‌العاده ارزان (~$0.02/اجرا) سریع مناسب اولین پیش‌نویس + بازبینی انسانی
MiMo 2.5 متوسط–خوب متوسط ارزان ~55 tok/s متعادل؛ مناسب کار روزمره

۱. کیفیت کد (SWE-bench Pro)

ترتیب تقریبی: Fable 5 (~80٪) با فاصله جلو است؛ سپس Opus 4.8 (69٪)، GPT-5.6 Sol (64.6٪)، Sonnet 5 (63٪)، GLM 5.2 (62٪)، MiniMax M3 (59٪).

نکته مهم: اپلیکیشن‌ها GPT-5.6 را «بهترین مدل کدنویسی» معرفی می‌کنند چون در بنچمارک‌های عامل‌گرا جلو است؛ اما در حل مسائل واقعی مخزن (issueهای چندفایلی) خانواده کلود به‌ویژه Fable 5 قوی‌تر است. هر دو ادعا درست‌اند — روی تسک‌های متفاوت.


۲. قدرت عامل‌گرا و ترمینال (Terminal-Bench 2.1)

اینجا دنیا برعکس می‌شود:

  • GPT-5.6 Sol: 88.8٪ (رکورد)
  • GPT-5.6 Terra: 87.4٪
  • GPT-5.6 Luna: 84.7٪
  • Claude Fable 5: 86.0٪
  • GLM 5.2: 81.0٪
  • Claude Sonnet 5: 80.4٪
  • Claude Opus 4.8: 74.6٪
  • MiniMax M3: 66.0٪

برای «عاملی که خودش دستور در ترمینال اجرا می‌کند» خانواده GPT-5.6 و سپس Sonnet 5 انتخاب‌های بهتری هستند — حتی Sonnet 5 ارزان‌تر از Opus 4.8 در ترمینال بهتر عمل می‌کند.


۳. هزینه

دسته مدل‌ها توضیح
Unlimited / رایگان DeepSeek V4 Flash، MiMo 2.5 برای حجم کار بالا بدون دغدغه هزینه
Premium DeepSeek V4 Pro، GPT-5.6 Luna، MiniMax M3 Luna پس از کاهش قیمت ۸۰٪ ($0.20/$1.20) از نظر «کار به ازای هر دلار» رکورد می‌زند
اشتراک خودتان Claude (Fable/Opus/Sonnet) و Codex (Sol/Terra/Luna) از سهمیهٔ اشتراک شما مصرف می‌کنند

قیمت‌های API (به ازای هر میلیون توکن، ورودی/خروجی) پس از کاهش‌های ۳۰ ژوئیه:

  • GPT-5.6 Sol: $5 / $30
  • GPT-5.6 Terra: $2 / $12
  • GPT-5.6 Luna: $0.20 / $1.20
  • Claude Fable 5: $10 / $50
  • Claude Sonnet 5: $2 / $10 (تا ۳۱ اوت؛ سپس $3/$15)
  • GLM 5.2: $1.40 / $4.40
  • MiniMax M3: $0.30 / $1.20 (پرومو)

۴. سرعت

  • ⭐ سریع‌ترین: MiniMax M3 (~110 توکن/ثانیه، تقریباً دو برابر MiMo با ~55 tok/s)
  • سریع: GPT-5.6 Luna، DeepSeek V4 Flash، Sonnet 5
  • کندتر (مدل‌های سنگین): Fable 5، V4 Pro، Sol — برای پاسخ سریع مناسب نیستند

۵. پنجره زمینه (Context)

همهٔ مدل‌های جدید حدود ۱ میلیون توکن پنجره دارند، اما کیفیت استفاده فرق می‌کند. در بنچمارک MRCR (بازیابی از متن طولانی):

  • GPT-5.6 Sol: 91.5٪
  • GPT-5.6 Terra: 89.6٪
  • GPT-5.6 Luna: 41.3٪ ← سقوط شدید

اگر با کدبیس بزرگ کار می‌کنید، Luna گزینهٔ اشتباهی است؛ Sol/Terra یا Opus 4.8/Fable را انتخاب کنید.


۶. اکوسیستم و ابزار

  • GLM 5.2 با API انتروپیک سازگار است — دراپ‌این مستقیم در Claude Code.
  • مدل‌های Claude به‌صورت بومی در Claude Code و مدل‌های GPT-5.6 در Codex یکپارچه‌اند؛ تلفیق ابزار، مدیریت فایل و اجازهٔ اجرا روان‌تر کار می‌کند.

۷. متن‌باز بودن

  • متن‌باز (MIT): DeepSeek V4 (MIT)، GLM 5.2 (MIT، وزن‌ها منتشرشده)
  • وزن‌های باز: MiniMax M3، MiMo 2.5
  • اختصاصی: Claude و GPT-5.6

مدل‌های متن‌باز را می‌توانید خودتان میزبانی کنید، داده بیرون نرود و کاستوم‌سازی کنید.


۸. حریم خصوصی

  • مدل‌های DeepSeek «ممکن است داده را برای آموزش AI استفاده کنند» (در خود اپ هم نوشته شده).
  • Claude و Codex با اشتراک، معمولاً آموزش روی داده‌های شما ندارند.

اگر کد محرمانه دارید، این تفاوت مهم است.


۹. قابلیت تصویر (Multimodal)

مدل‌های دارای برچسب Images: MiniMax M3، GPT-5.6 Luna و MiMo 2.5 — مفید برای کدنویسی از روی اسکرین‌شات یا طراحی UI.


توصیه نهایی بر اساس کاربرد

کاربرد مدل پیشنهادی
پروژه بزرگ / مهاجرت کد / کار چندروزه Fable 5 (اگر سهمیهٔ اشتراک کلود اجازه دهد)
عامل خودمختار در ترمینال (Agentic) GPT-5.6 Sol؛ برای کار روزمره Terra
بهترین تعادل قیمت/کیفیت Sonnet 5 یا GPT-5.6 Terra یا GLM 5.2
بودجه صفر / حجم بالا DeepSeek V4 Flash یا MiMo 2.5 (با بازبینی انسانی)
کدنویسی + تصویر/اسکرین‌شات MiniMax M3 (سریع و ارزان) یا GPT-5.6 Luna
کدبیس خیلی بزرگ از Luna پرهیز کنید؛ Sol/Terra یا Opus 4.8/Fable

منابع

  • OpenAI — معرفی GPT-5.6 (Sol/Terra/Luna) و رهبری در Terminal-Bench 2.1
  • Anthropic — معرفی Claude Fable 5، Opus 4.8 و Sonnet 5
  • Kilo AI — تست مستقل DeepSeek V4 Pro و Flash در برابر Opus 4.7 و Kimi K2.6
  • Artificial Analysis — شاخص Coding Agent و مقایسهٔ MiniMax M3 در برابر MiMo
  • CodingFleet — مقایسهٔ GLM-5.2 و MiniMax M3