Ai Models: Difference between revisions

From wiki karavi
Jump to navigation Jump to search
(Created page with "== مقایسه مدل‌های هوش مصنوعی برای برنامه‌نویسی == این صفحه مدل‌های موجود در انتخابگر مدل '''Freebuff''' (و به‌طور کلی مدل‌های برتر کدنویسی) را از دیدگاه‌های مختلف مقایسه می‌کند: کیفیت کد، قدرت عامل‌گرا (Agentic)، هزینه، سرعت، پنجره زمینه، اکوسیستم، متن‌باز بودن و حریم...")
 
m (Karavi moved page Ai Modes to Ai Models)
 
(No difference)

Latest revision as of 04:24, 19 August 2026

مقایسه مدل‌های هوش مصنوعی برای برنامه‌نویسی

این صفحه مدل‌های موجود در انتخابگر مدل Freebuff (و به‌طور کلی مدل‌های برتر کدنویسی) را از دیدگاه‌های مختلف مقایسه می‌کند: کیفیت کد، قدرت عامل‌گرا (Agentic)، هزینه، سرعت، پنجره زمینه، اکوسیستم، متن‌باز بودن و حریم خصوصی.

توجه: بسیاری از اعداد بنچمارک‌ها توسط خود شرکت‌ها منتشر شده‌اند و برخی بنچمارک‌ها (مثل SWE-bench Pro) حاشیه‌های زیادی دارند. اعداد را «نشانگر جهت» بگیرید، نه حقیقت مطلق.


جدول خلاصه

مدل کیفیت کد قدرت Agentic / ترمینال هزینه سرعت نکته کلیدی
Claude Fable 5 ⭐ بهترین (SWE-bench Pro ~80٪) خیلی خوب گران‌ترین ($10/$50) متوسط پادشاه کدنویسی سطح مخزن؛ پروژه‌های چندروزه
DeepSeek V4 Pro 08/13 عالی (~77/100 تست مستقل) خوب متوسط–بالا خوب هوشمندترین متن‌باز؛ بین Opus 4.7 و Kimi K2.6
GPT-5.6 Sol خیلی خوب (Pro 64.6٪) ⭐ بهترین ترمینال (88.8٪) گران ($5/$30) خوب رکورد Terminal-Bench؛ ولی در SWE-bench Pro از Fable عقب‌تر
Claude Opus 4.8 عالی (Pro 69.2٪) خوب (TB 74.6٪) بالا متوسط قابل اعتماد برای کارهای چندمرحله‌ای طولانی
Claude Sonnet 5 خوب (Pro 63.2٪) ⭐ بهتر از Opus! (TB 80.4٪) ارزان ($2/$10) سریع بهترین نسبت قیمت/کیفیت در خانواده کلود
GLM 5.2 عالی (Pro 62.1٪) عالی (TB 81.0٪) متوسط ($1.40/$4.40) خوب متن‌باز MIT؛ سازگار با Claude Code
GPT-5.6 Terra خوب عالی (TB 87.4٪) ارزان ($2/$12) سریع همه‌فن‌حریف روزمرهٔ Codex
MiniMax M3 خوب (Pro 59.0٪) متوسط (TB 66.0٪) بسیار ارزان ($0.30/$1.20) ⭐ سریع‌ترین (~110 tok/s) چندوجهی: تصویر/ویدیو/دسکتاپ
GPT-5.6 Luna متوسط (Coding Index 74.6) خوب (TB 84.7٪) ⭐ ارزان‌ترین ($0.20/$1.20) ⭐ خیلی سریع سقوط فاجعه‌بار در حافظهٔ طولانی (MRCR 41.3٪)
DeepSeek V4 Flash متوسط (60/100) متوسط ⭐ فوق‌العاده ارزان (~$0.02/اجرا) سریع مناسب اولین پیش‌نویس + بازبینی انسانی
MiMo 2.5 متوسط–خوب متوسط ارزان ~55 tok/s متعادل؛ مناسب کار روزمره

۱. کیفیت کد (SWE-bench Pro)

ترتیب تقریبی: Fable 5 (~80٪) با فاصله جلو است؛ سپس Opus 4.8 (69٪)، GPT-5.6 Sol (64.6٪)، Sonnet 5 (63٪)، GLM 5.2 (62٪)، MiniMax M3 (59٪).

نکته مهم: اپلیکیشن‌ها GPT-5.6 را «بهترین مدل کدنویسی» معرفی می‌کنند چون در بنچمارک‌های عامل‌گرا جلو است؛ اما در حل مسائل واقعی مخزن (issueهای چندفایلی) خانواده کلود به‌ویژه Fable 5 قوی‌تر است. هر دو ادعا درست‌اند — روی تسک‌های متفاوت.


۲. قدرت عامل‌گرا و ترمینال (Terminal-Bench 2.1)

اینجا دنیا برعکس می‌شود:

  • GPT-5.6 Sol: 88.8٪ (رکورد)
  • GPT-5.6 Terra: 87.4٪
  • GPT-5.6 Luna: 84.7٪
  • Claude Fable 5: 86.0٪
  • GLM 5.2: 81.0٪
  • Claude Sonnet 5: 80.4٪
  • Claude Opus 4.8: 74.6٪
  • MiniMax M3: 66.0٪

برای «عاملی که خودش دستور در ترمینال اجرا می‌کند» خانواده GPT-5.6 و سپس Sonnet 5 انتخاب‌های بهتری هستند — حتی Sonnet 5 ارزان‌تر از Opus 4.8 در ترمینال بهتر عمل می‌کند.


۳. هزینه

دسته مدل‌ها توضیح
Unlimited / رایگان DeepSeek V4 Flash، MiMo 2.5 برای حجم کار بالا بدون دغدغه هزینه
Premium DeepSeek V4 Pro، GPT-5.6 Luna، MiniMax M3 Luna پس از کاهش قیمت ۸۰٪ ($0.20/$1.20) از نظر «کار به ازای هر دلار» رکورد می‌زند
اشتراک خودتان Claude (Fable/Opus/Sonnet) و Codex (Sol/Terra/Luna) از سهمیهٔ اشتراک شما مصرف می‌کنند

قیمت‌های API (به ازای هر میلیون توکن، ورودی/خروجی) پس از کاهش‌های ۳۰ ژوئیه:

  • GPT-5.6 Sol: $5 / $30
  • GPT-5.6 Terra: $2 / $12
  • GPT-5.6 Luna: $0.20 / $1.20
  • Claude Fable 5: $10 / $50
  • Claude Sonnet 5: $2 / $10 (تا ۳۱ اوت؛ سپس $3/$15)
  • GLM 5.2: $1.40 / $4.40
  • MiniMax M3: $0.30 / $1.20 (پرومو)

۴. سرعت

  • ⭐ سریع‌ترین: MiniMax M3 (~110 توکن/ثانیه، تقریباً دو برابر MiMo با ~55 tok/s)
  • سریع: GPT-5.6 Luna، DeepSeek V4 Flash، Sonnet 5
  • کندتر (مدل‌های سنگین): Fable 5، V4 Pro، Sol — برای پاسخ سریع مناسب نیستند

۵. پنجره زمینه (Context)

همهٔ مدل‌های جدید حدود ۱ میلیون توکن پنجره دارند، اما کیفیت استفاده فرق می‌کند. در بنچمارک MRCR (بازیابی از متن طولانی):

  • GPT-5.6 Sol: 91.5٪
  • GPT-5.6 Terra: 89.6٪
  • GPT-5.6 Luna: 41.3٪ ← سقوط شدید

اگر با کدبیس بزرگ کار می‌کنید، Luna گزینهٔ اشتباهی است؛ Sol/Terra یا Opus 4.8/Fable را انتخاب کنید.


۶. اکوسیستم و ابزار

  • GLM 5.2 با API انتروپیک سازگار است — دراپ‌این مستقیم در Claude Code.
  • مدل‌های Claude به‌صورت بومی در Claude Code و مدل‌های GPT-5.6 در Codex یکپارچه‌اند؛ تلفیق ابزار، مدیریت فایل و اجازهٔ اجرا روان‌تر کار می‌کند.

۷. متن‌باز بودن

  • متن‌باز (MIT): DeepSeek V4 (MIT)، GLM 5.2 (MIT، وزن‌ها منتشرشده)
  • وزن‌های باز: MiniMax M3، MiMo 2.5
  • اختصاصی: Claude و GPT-5.6

مدل‌های متن‌باز را می‌توانید خودتان میزبانی کنید، داده بیرون نرود و کاستوم‌سازی کنید.


۸. حریم خصوصی

  • مدل‌های DeepSeek «ممکن است داده را برای آموزش AI استفاده کنند» (در خود اپ هم نوشته شده).
  • Claude و Codex با اشتراک، معمولاً آموزش روی داده‌های شما ندارند.

اگر کد محرمانه دارید، این تفاوت مهم است.


۹. قابلیت تصویر (Multimodal)

مدل‌های دارای برچسب Images: MiniMax M3، GPT-5.6 Luna و MiMo 2.5 — مفید برای کدنویسی از روی اسکرین‌شات یا طراحی UI.


توصیه نهایی بر اساس کاربرد

کاربرد مدل پیشنهادی
پروژه بزرگ / مهاجرت کد / کار چندروزه Fable 5 (اگر سهمیهٔ اشتراک کلود اجازه دهد)
عامل خودمختار در ترمینال (Agentic) GPT-5.6 Sol؛ برای کار روزمره Terra
بهترین تعادل قیمت/کیفیت Sonnet 5 یا GPT-5.6 Terra یا GLM 5.2
بودجه صفر / حجم بالا DeepSeek V4 Flash یا MiMo 2.5 (با بازبینی انسانی)
کدنویسی + تصویر/اسکرین‌شات MiniMax M3 (سریع و ارزان) یا GPT-5.6 Luna
کدبیس خیلی بزرگ از Luna پرهیز کنید؛ Sol/Terra یا Opus 4.8/Fable

منابع

  • OpenAI — معرفی GPT-5.6 (Sol/Terra/Luna) و رهبری در Terminal-Bench 2.1
  • Anthropic — معرفی Claude Fable 5، Opus 4.8 و Sonnet 5
  • Kilo AI — تست مستقل DeepSeek V4 Pro و Flash در برابر Opus 4.7 و Kimi K2.6
  • Artificial Analysis — شاخص Coding Agent و مقایسهٔ MiniMax M3 در برابر MiMo
  • CodingFleet — مقایسهٔ GLM-5.2 و MiniMax M3