LLM Agentic Coding Model: Difference between revisions

From wiki karavi
Jump to navigation Jump to search
No edit summary
 
(2 intermediate revisions by the same user not shown)
Line 1: Line 1:
= مقایسه بهترین مدل‌های هوش مصنوعی برای برنامه‌نویسی و Agentic Coding در سال 2026 =
= مقایسه جامع مدل‌های هوش مصنوعی برای برنامه‌نویسی و Agentic Coding در سال 2026 =


هوش مصنوعی در سال 2026 از یک ابزار ساده برای تکمیل کد به یک بخش مهم از فرایند مهندسی نرم‌افزار تبدیل شده است.
مدل‌های هوش مصنوعی در سال 2026 از ابزارهای ساده Code Completion به سیستم‌هایی تبدیل شده‌اند که می‌توانند بخش قابل توجهی از فرایند مهندسی نرم‌افزار را به‌صورت Agentic انجام دهند.


مدل‌های جدید علاوه بر Code Generation می‌توانند Repository را بررسی کنند، چندین فایل را هم‌زمان تغییر دهند، Terminal اجرا کنند، تست بنویسند، خطاها را Debug کنند، از ابزارها استفاده کنند و حتی یک Task نرم‌افزاری را در چندین مرحله به پایان برسانند.
یک Coding Agent مدرن می‌تواند:


به همین دلیل انتخاب مدل مناسب برای برنامه‌نویسی دیگر فقط بر اساس Benchmarkهای تولید کد انجام نمی‌شود.
* Repository را بررسی کند.
* ساختار پروژه را درک کند.
* چندین فایل را ویرایش کند.
* Terminal و Shell اجرا کند.
* Test اجرا کند.
* خطا را پیدا و Debug کند.
* Refactoring انجام دهد.
* از Tool Calling و MCP استفاده کند.
* نتیجه اجرای برنامه را بررسی کند.
* پس از شکست، راه‌حل دیگری را امتحان کند.


در این مقاله مدل‌ها از نظر موارد زیر مقایسه شده‌اند:
بنابراین برای انتخاب مدل مناسب برنامه‌نویسی، صرفاً قدرت تولید Code کافی نیست.
 
در این مقاله مدل‌ها از نظر موارد زیر بررسی می‌شوند:


* Coding
* Coding
* Agentic Coding
* Software Engineering
* Software Engineering
* Debugging
* Debugging
* Refactoring
* Refactoring
* Repository Understanding
* Repository Understanding
* Agentic Coding
* Tool Calling
* Tool Calling
* Context Window
* Long Context
* Multimodal Coding
* سرعت
* سرعت
* هزینه API
* قیمت API
* Price/Performance
* Price/Performance
* Self-hosting
* Self-hosting
* Multimodal Coding


'''آخرین به‌روزرسانی: سپتامبر 2026'''
'''آخرین به‌روزرسانی: 4 سپتامبر 2026'''


----
----


== خلاصه سریع ==
= خلاصه سریع =
 
اگر فقط نتیجه نهایی را می‌خواهید:


{| class="wikitable"
{| class="wikitable"
! کاربرد
! کاربرد
! پیشنهاد
! مدل پیشنهادی
! توضیح
|-
|-
| 🏆 حداکثر قدرت
| 🏆 حداکثر قدرت
| '''GPT-6 Astra / GPT-5.6 Sol'''
| '''GPT-6 Astra'''
| سخت‌ترین مسائل End-to-End
|-
| 🧠 Coding بسیار پیچیده
| '''GPT-5.6 Sol'''
| معماری، Debugging و Software Engineering پیچیده
|-
|-
| 🤖 Coding Agent حرفه‌ای
| 🤖 Coding Agent حرفه‌ای
| '''Claude Sonnet 5'''
| '''Claude Sonnet 5'''
| Agentic Software Engineering و Tool Use
|-
|-
| ⚡ Coding Agent سریع
| ⚡ Coding Agent سریع
| '''Gemini 3.8 Flash / Gemini 3.7 Flash'''
| '''Gemini 3.8 Flash / Gemini 3.7 Flash'''
| سرعت بالا و مناسب Agent
|-
|-
| 💰 Coding Agent بسیار اقتصادی
| 💰 بهترین Price/Performance
| '''GLM 5.3 Flash'''
| '''GLM 5.3 Flash'''
| Coding و Agentic با هزینه بسیار پایین
|-
|-
| 💵 Coding ارزان
| 💵 Coding اقتصادی
| '''DeepSeek V4 Flash 0731'''
| '''DeepSeek V4 Flash 0731'''
| مناسب Agent و پردازش پرتعداد
|-
|-
| ⚖️ تعادل قدرت و قیمت OpenAI
| ⚖️ OpenAI متعادل
| '''GPT-5.6 Terra'''
| '''GPT-5.6 Terra'''
| تعادل قدرت و هزینه
|-
|-
| 🛠️ Coding + Tools
| 🛠️ Coding + Tool Use
| '''Grok 4.6'''
| '''Grok 4.6'''
| Agentic Workflow و Tool Calling
|-
|-
| 🚀 Agentic Software Engineering ارزان
| 🚀 Agentic Software Engineering
| '''Grok Build 0.1'''
| '''Grok Build 0.1'''
| مدل تخصصی Coding Agent
|-
|-
| 📚 Repository بسیار بزرگ
| 📚 Repository بزرگ
| '''GPT-5.6 / Gemini / DeepSeek / Qwen'''
| '''GPT-5.6 / Gemini / DeepSeek / Qwen / GLM'''
|-
| Long Context
| 🖼️ Frontend از روی Screenshot
| '''Gemini 3.8/3.7 Flash'''
|-
|-
| 🔓 Open Weight
| 🖼️ Screenshot → Code
| '''GLM / Mistral / gpt-oss / Qwen'''
| '''Gemini Flash / Claude / GPT-5.6'''
| Multimodal Coding
|-
|-
| 🖥️ Self-hosting
| 🔓 Self-hosting
| '''gpt-oss-120b / GLM / Mistral / Qwen'''
| '''gpt-oss-120b / GLM / Mistral / Qwen'''
| اجرای Local و Private
|}
|}


----
----


== جدول جامع مقایسه مدل‌ها ==
= جدول جامع مقایسه مدل‌ها =
 
جدول زیر مدل‌ها را بر اساس '''تاریخ ارائه از جدیدترین به قدیمی‌ترین''' مرتب می‌کند.


قیمت‌ها به ازای یک میلیون Token هستند.
قیمت‌ها به ازای '''یک میلیون Token''' هستند.


{| class="wikitable sortable"
{| class="wikitable sortable"
! تاریخ ارائه
! مدل
! مدل
! شرکت
! Input
! Input
! Cached
! Cached
Line 90: Line 116:
! کاربرد اصلی
! کاربرد اصلی
|-
|-
| '''GPT-6 Astra''' 🆕
 
| 2026-09-04
| '''GPT-6 Astra'''
| OpenAI
| $10
| $10
| $1
| $1
Line 98: Line 127:
| '''10/10'''
| '''10/10'''
| '''10/10'''
| '''10/10'''
| 6.5/10
| 6.5
| سخت‌ترین مسائل End-to-End و Coding
| سخت‌ترین End-to-End Workloads
|-
|-
| '''GPT-5.6 Sol'''
 
| $4
| 2026-09-02
| $0.40
| '''Gemini 3.8 Flash'''
| $20
| Google DeepMind
| 1.05M
| 128K
| '''10/10'''
| '''10/10'''
| 8/10
| Coding و Software Engineering بسیار پیچیده
|-
| '''Claude Sonnet 5'''
| $2
| متغیر
| $10
| ~1M
| -
| '''9.8/10'''
| '''10/10'''
| '''9.3/10'''
| Coding Agent حرفه‌ای
|-
| '''Gemini 3.8 Flash''' 🆕
| متغیر
| متغیر
| متغیر
| متغیر
Line 129: Line 139:
| Long Context
| Long Context
| -
| -
| '''9.8/10'''
| '''9.8'''
| '''9.8/10'''
| '''9.8'''
| '''9.7/10'''
| '''9.7'''
| نسل جدید Agentic Workflow
| Coding، Agents و Multimodal
|-
|-
| '''Grok 4.6'''
 
| $2
| 2026-08
| $0.50
| '''GLM 5.3 Flash'''
| $6
| Z.ai / Zhipu AI
| 500K
| بسیار ارزان
| بسیار ارزان
| بسیار ارزان
| Long Context
| -
| -
| '''9.6/10'''
| '''9.5'''
| '''9.8/10'''
| '''9.7'''
| '''9.4/10'''
| '''10'''
| Coding + Tools + Agent
| Coding Agent اقتصادی
|-
|-
| 2026-08
| '''Gemini 3.7 Flash'''
| '''Gemini 3.7 Flash'''
| $0.75*
| Google DeepMind
| Introductory
| -
| -
| $3.75*
| Introductory
| ~1M
| ~1M
| -
| -
| '''9.6/10'''
| '''9.6'''
| '''9.7/10'''
| '''9.7'''
| '''9.8/10'''
| '''9.8'''
| Coding Agent سریع
| Coding Agent سریع
|-
|-
| '''GLM 5.3 Flash'''
 
| $0.075*
| 2026-08
| $0.015*
| '''DeepSeek V4 Pro'''
| $0.25*
| DeepSeek
| Long Context
| Tiered
| Tiered
| Tiered
| ~1M
| تا 384K
| '''9.5'''
| '''9.6'''
| '''9.7'''
| Agentic Coding
|-
 
| 2026-08
| '''Grok 4.6'''
| xAI
| $2*
| $0.50*
| $6*
| 500K
| -
| -
| '''9.5/10'''
| '''9.6'''
| '''9.7/10'''
| '''9.8'''
| '''10/10'''
| '''9.4'''
| Coding Agent بسیار اقتصادی
| Coding + Tool Use
|-
|-
| '''GLM-5.2'''
 
| $1.40
| 2026-07-31
| $0.26
| '''DeepSeek V4 Flash 0731'''
| $4.40
| DeepSeek
| $0.22–0.44*
| $0.007–0.014*
| $0.66–1.32*
| ~1M
| ~1M
| -
| تا 384K
| '''9.5/10'''
| '''9.2'''
| '''9.7/10'''
| '''9.4'''
| 9.4/10
| '''10'''
| Long-Horizon Coding
| Coding اقتصادی
|-
 
| 2026-07
| '''GPT-5.6 Sol'''
| OpenAI
| $4
| $0.40
| $20
| 1.05M
| 128K
| '''10'''
| '''10'''
| 8
| Complex Professional Coding
|-
|-
| 2026-07
| '''GPT-5.6 Terra'''
| '''GPT-5.6 Terra'''
| OpenAI
| $2
| $2
| $0.20
| $0.20
Line 184: Line 237:
| 1.05M
| 1.05M
| 128K
| 128K
| '''9.5/10'''
| '''9.5'''
| '''9.5/10'''
| '''9.5'''
| 9.2/10
| '''9.2'''
| تعادل قدرت و هزینه
| تعادل قدرت و قیمت
|-
 
| 2026-07
| '''GPT-5.6 Luna'''
| OpenAI
| $0.20
| $0.02
| $1.20
| 1.05M
| 128K
| 8.2
| 8.6
| '''10'''
| High-volume / Sub-Agent
|-
|-
| '''DeepSeek V4 Pro'''
 
| 2026-06
| '''Claude Sonnet 5'''
| Anthropic
| $2
| متغیر
| متغیر
| متغیر
| $10
| متغیر
| Long Context
| ~1M
| تا 384K
| '''9.5/10'''
| '''9.6/10'''
| '''9.7/10'''
| Agentic Coding
|-
| '''Gemini 3.1 Pro'''
| Tiered
| Tiered
| Tiered
| ~1M
| -
| -
| '''9.5/10'''
| '''9.8'''
| '''9.6/10'''
| '''10'''
| 8.8/10
| '''9.3'''
| Deep Reasoning و Coding
| Professional Coding Agent
|-
|-
| 2026
| '''Claude Opus 4.6'''
| '''Claude Opus 4.6'''
| Anthropic
| Premium
| Premium
| متغیر
| متغیر
Line 217: Line 279:
| Long Context
| Long Context
| -
| -
| '''9.6/10'''
| '''9.6'''
| '''9.7/10'''
| '''9.7'''
| 7.5/10
| 7.5
| مسائل بسیار سخت و Refactoring
| Debugging و Reasoning بسیار پیچیده
|-
|-
| '''Qwen 3.7 Max'''
 
| Region-based
| 2026
| متغیر
| '''GLM-5.2'''
| Region-based
| Z.ai / Zhipu AI
| Provider-based
| Provider-based
| Provider-based
| ~1M
| ~1M
| ~131K
| -
| '''9.4/10'''
| '''9.5'''
| '''9.5/10'''
| '''9.7'''
| 9.3/10
| 9.4
| Long Context Coding
| Long-Horizon Coding
|-
|-
| 2026
| '''Grok Build 0.1'''
| '''Grok Build 0.1'''
| $1
| xAI
| $0.20
| $1*
| $2
| $0.20*
| $2*
| 256K
| 256K
| -
| -
| 9.3/10
| 9.3
| '''9.5/10'''
| '''9.5'''
| '''9.8/10'''
| '''9.8'''
| Agentic Software Engineering
| Agentic Software Engineering
|-
|-
| 2026
| '''Mistral Medium 3.5'''
| '''Mistral Medium 3.5'''
| Mistral AI
| $1.50
| $1.50
| $0.15
| -
| $7.50
| $7.50
| 256K
| 256K
| -
| -
| 9.2/10
| 9.2
| '''9.5/10'''
| '''9.5'''
| 9.1/10
| 9.1
| Coding Agent / Open Weight
| Coding و Agent
|-
| '''DeepSeek V4 Flash 0731'''
| $0.22–0.44
| $0.007–0.014
| $0.66–1.32
| ~1M
| تا 384K
| 9.2/10
| '''9.4/10'''
| '''10/10'''
| Coding بسیار اقتصادی
|-
|-
| 2026
| '''Gemini 3.6 Flash'''
| '''Gemini 3.6 Flash'''
| Google DeepMind
| -
| -
| -
| -
Line 272: Line 335:
| ~1M
| ~1M
| -
| -
| 9.0/10
| 9.0
| 9.1/10
| 9.1
| 8.8/10
| 8.8
| نسل قبل 3.7
| Coding سریع
|-
|-
| '''Solar Pro 4'''
 
| Provider-based
| 2026
| '''Gemini 3.5 Flash'''
| Google DeepMind
| -
| -
| -
| Provider-based
| -
| -
| Long Context
| -
| -
| 8.8/10
| 8.6
| 8.7/10
| 8.7
| 8.8/10
| 8.5
| Coding عمومی
| Coding و Multimodal
|-
 
| 2026
| '''Gemini 3.1 Pro'''
| Google DeepMind
| Tiered
| Tiered
| Tiered
| ~1M
| -
| '''9.5'''
| '''9.6'''
| 8.8
| Deep Reasoning
|-
|-
| 2026
| '''Qwen 3.7 Max'''
| Alibaba Cloud / Qwen
| Region-based
| Region-based
| Region-based
| ~1M
| ~131K
| '''9.4'''
| '''9.5'''
| 9.3
| Long Context
|-
| 2026
| '''Qwen3-Coder Plus'''
| Alibaba Cloud / Qwen
| Tiered
| -
| Tiered
| ~1M
| ~65K
| '''9.2'''
| 8.7
| 9.2
| Coding تخصصی
|-
| 2026
| '''MiMo 2.5'''
| '''MiMo 2.5'''
| Xiaomi / MiMo
| Provider-based
| Provider-based
| -
| -
Line 294: Line 405:
| -
| -
| -
| -
| 8.7/10
| 8.7
| 8.7/10
| 8.7
| 9.2/10
| 9.2
| Coding + Multimodal
| Coding + Multimodal
|-
|-
| '''Gemini 3.5 Flash'''
 
| -
| 2026
| '''Solar Pro 4'''
| Upstage
| Provider-based
| -
| -
| Provider-based
| -
| -
| Long Context
| -
| -
| 8.6/10
| 8.8
| 8.7/10
| 8.7
| 8.5/10
| 8.8
| Coding سریع نسل قبل
| General Coding
|-
|-
| 2025-08-05
| '''gpt-oss-120b'''
| '''gpt-oss-120b'''
| OpenAI
| Self-host
| Self-host
| -
| -
Line 316: Line 433:
| 128K
| 128K
| -
| -
| 8.6/10
| 8.6
| 8.5/10
| 8.5
| '''9.5/10'''
| '''9.5'''
| Local AI / Self-hosting
| Self-hosted Coding
|-
| '''GPT-5.6 Luna'''
| '''$0.20'''
| '''$0.02'''
| '''$1.20'''
| '''1.05M'''
| 128K
| 8.2/10
| 8.6/10
| '''10/10'''
| Sub-Agent و Taskهای پرتعداد
|}
|}


<small>
'''نکته:'''
* قیمت GLM 5.3 Flash در جدول، قیمت Promotional فعلی است و ممکن است تغییر کند.
 
* قیمت Gemini 3.7 Flash نیز قیمت Introductory تا پایان سال 2026 است.
 
* قیمت API برخی مدل‌ها بر اساس Region، Context Length، Provider و Peak/Off-Peak تغییر می‌کند.


* امتیازهای Coding، Agentic و Price/Performance ارزیابی مقایسه‌ای این مقاله هستند و Benchmark رسمی شرکت‌های سازنده محسوب نمی‌شوند.
* امتیازهای Coding، Agentic و Price/Performance ارزیابی تحلیلی این مقاله هستند و Benchmark رسمی شرکت‌های سازنده نیستند.
</small>
* قیمت API ممکن است بر اساس Provider، Region، Context Length، Peak/Off-Peak و Promotional Pricing تغییر کند.
* علامت «-» به معنی نبود اطلاعات قطعی قابل مقایسه در این جدول است.
* برای مدل‌هایی که تاریخ دقیق نسخه مورد استفاده Provider مشخص نیست، سال یا ماه انتشار درج شده است.


----
----


== رتبه‌بندی پیشنهادی برای برنامه‌نویسی ==
= رتبه‌بندی کلی برای برنامه‌نویسی =


{| class="wikitable sortable"
{| class="wikitable sortable"
Line 352: Line 455:
! Coding
! Coding
! Agentic
! Agentic
! ارزش استفاده
! مناسب برای
|-
|-
| 1
| 1
Line 364: Line 467:
| 10
| 10
| 10
| 10
| مسائل بسیار پیچیده
| Software Engineering پیچیده
|-
|-
| 3
| 3
Line 370: Line 473:
| 9.8
| 9.8
| 10
| 10
| Coding Agent حرفه‌ای
| Coding Agent
|-
|-
| 4
| 4
Line 376: Line 479:
| 9.8
| 9.8
| 9.8
| 9.8
| Agent سریع نسل جدید
| Agent سریع
|-
|-
| 5
| 5
Line 382: Line 485:
| 9.6
| 9.6
| 9.8
| 9.8
| Coding + Tool Use
| Coding + Tools
|-
|-
| 6
| 6
Line 388: Line 491:
| 9.6
| 9.6
| 9.7
| 9.7
| سرعت + کیفیت + قیمت
| Coding سریع
|-
|-
| 7
| 7
| '''GLM 5.3 Flash'''
| '''Claude Opus 4.6'''
| 9.5
| 9.6
| 9.7
| 9.7
| بهترین Price/Performance
| مسائل سخت
|-
|-
| 8
| 8
| '''Claude Opus 4.6'''
| '''GLM 5.3 Flash'''
| 9.6
| 9.5
| 9.7
| 9.7
| مسائل پیچیده
| Price/Performance
|-
|-
| 9
| 9
Line 409: Line 512:
|-
|-
| 10
| 10
| '''GPT-5.6 Terra'''
| '''Gemini 3.1 Pro'''
| 9.5
| 9.5
| 9.5
| 9.6
| تعادل قدرت/قیمت
| Deep Reasoning
|-
|-
| 11
| 11
| '''Gemini 3.1 Pro'''
| '''GPT-5.6 Terra'''
| 9.5
| 9.5
| 9.5
| 9.6
| Balanced Coding
| Deep Reasoning
|-
|-
| 12
| 12
Line 430: Line 533:
| 9.3
| 9.3
| 9.5
| 9.5
| Coding Agent ارزان
| Agentic Software Engineering
|-
|-
| 14
| 14
| '''DeepSeek V4 Flash'''
| 9.2
| 9.4
| Low-cost Coding
|-
| 15
| '''Mistral Medium 3.5'''
| '''Mistral Medium 3.5'''
| 9.2
| 9.2
| 9.5
| 9.5
| Open Weight Agent
| Open / Agentic
|-
|-
| 15
| 16
| '''DeepSeek V4 Flash 0731'''
| '''Qwen3-Coder Plus'''
| 9.2
| 9.2
| 9.4
| 8.7
| Coding بسیار اقتصادی
| Coding
|-
| 17
| '''Gemini 3.6 Flash'''
| 9.0
| 9.1
| Fast Coding
|-
| 18
| '''Solar Pro 4'''
| 8.8
| 8.7
| General Coding
|-
| 19
| '''MiMo 2.5'''
| 8.7
| 8.7
| Coding + Image
|-
| 20
| '''gpt-oss-120b'''
| 8.6
| 8.5
| Self-host
|-
| 21
| '''Gemini 3.5 Flash'''
| 8.6
| 8.7
| Fast Coding
|-
| 22
| '''GPT-5.6 Luna'''
| 8.2
| 8.6
| Cheap Sub-Agent
|}
|}


----
----


= بررسی مدل‌ها =
= مقایسه مدل‌های اقتصادی برای Coding =


== GPT-6 Astra ==
این جدول برای زمانی مهم است که Coding Agent تعداد زیادی Token مصرف می‌کند.


GPT-6 Astra نسل جدید مدل Flagship شرکت OpenAI است و برای سخت‌ترین کارهای End-to-End، Reasoning و Coding طراحی شده است.
{| class="wikitable sortable"
 
! مدل
مشخصات:
! Coding
 
! Agentic
<syntaxhighlight lang="text">
! هزینه
Context Window : 1,050,000
! Price/Performance
Max Output    : 128,000
! پیشنهاد
 
|-
Input          : $10 / 1M
| '''GLM 5.3 Flash'''
Cached Input  : $1 / 1M
| 9.5
Output        : $50 / 1M
| 9.7
</syntaxhighlight>
| بسیار پایین
 
| '''10/10'''
قابلیت‌ها:
| 🥇
 
|-
* Function Calling
| '''DeepSeek V4 Flash 0731'''
* Web Search
| 9.2
* File Search
| 9.4
* Computer Use
| بسیار پایین
* Image Input
| '''10/10'''
* Structured Output
| 🥇
* Reasoning
|-
* Coding
| '''GPT-5.6 Luna'''
* Agentic Workflows
| 8.2
 
| 8.6
این مدل بسیار قدرتمند است اما برای Taskهای روزمره از نظر اقتصادی منطقی نیست.
| بسیار پایین
 
| '''10/10'''
'''پیشنهاد:'''
| Sub-Agent
 
|-
برای Escalation و مسئله‌هایی که مدل‌های ارزان‌تر قادر به حل آنها نیستند.
| '''Grok Build 0.1'''
| 9.3
| 9.5
| پایین
| '''9.8/10'''
| Coding Agent
|-
| '''Gemini 3.7 Flash'''
| 9.6
| 9.7
| پایین/متوسط
| '''9.8/10'''
| Agent سریع
|-
| '''GPT-5.6 Terra'''
| 9.5
| 9.5
| متوسط
| 9.2/10
| Coding حرفه‌ای
|-
| '''Claude Sonnet 5'''
| 9.8
| 10
| متوسط
| 9.3/10
| Task سخت
|}


----
----


== GPT-5.6 Sol ==
= مقایسه برای Agentic Coding =


یکی از قدرتمندترین مدل‌های خانواده GPT-5.6 برای Coding و Professional Work است.
Agentic Coding با Code Generation معمولی متفاوت است.


<syntaxhighlight lang="text">
در Agentic Coding مدل باید بتواند:
Context      : 1,050,000
Max Output  : 128,000


Input        : $4
* Task را برنامه‌ریزی کند.
Cached      : $0.40
* Repository را جستجو کند.
Output      : $20
* فایل مناسب را پیدا کند.
</syntaxhighlight>
* Terminal اجرا کند.
* Code را تغییر دهد.
* Test اجرا کند.
* خطا را تحلیل کند.
* مجدداً Code را اصلاح کند.
* Toolهای مختلف را هماهنگ کند.


Reasoning Effort:
{| class="wikitable sortable"
 
! مدل
* none
! Agentic
* low
! Tool Use
* medium
! Repository
* high
! Long-running Task
* xhigh
! پیشنهاد
* max
|-
 
| '''GPT-6 Astra'''
مناسب برای:
| 10
 
| عالی
* معماری نرم‌افزار
| عالی
* Debugging پیچیده
| عالی
* Repository بزرگ
| 🥇
* Refactoring
|-
* Code Review
| '''Claude Sonnet 5'''
* Software Design
| 10
* Agentic Coding
| عالی
* Tool Calling
| عالی
* Computer Use
| عالی
 
| 🥇
'''Coding: 10/10'''
|-
 
| '''GPT-5.6 Sol'''
'''Agentic: 10/10'''
| 10
| عالی
| عالی
| عالی
| 🥇
|-
| '''Gemini 3.8 Flash'''
| 9.8
| عالی
| عالی
| عالی
| ⭐
|-
| '''Grok 4.6'''
| 9.8
| عالی
| عالی
| عالی
| ⭐
|-
| '''GLM 5.3 Flash'''
| 9.7
| عالی
| عالی
| عالی
| ⭐
|-
| '''Gemini 3.7 Flash'''
| 9.7
| عالی
| عالی
| عالی
| ⭐
|-
| '''Claude Opus 4.6'''
| 9.7
| عالی
| عالی
| عالی
| Task بسیار سخت
|-
| '''DeepSeek V4 Pro'''
| 9.6
| عالی
| عالی
| عالی
| ⭐
|-
| '''Grok Build'''
| 9.5
| عالی
| خوب
| عالی
| ⭐
|-
| '''GPT-5.6 Terra'''
| 9.5
| عالی
| عالی
| عالی
| ⭐
|}


----
----


== GPT-5.6 Terra ==
= مقایسه برای Debugging و Refactoring =


اگر از OpenAI API استفاده می‌کنید، Terra یکی از بهترین مدل‌ها برای ایجاد تعادل میان قدرت و هزینه است.
{| class="wikitable sortable"
 
! مدل
<syntaxhighlight lang="text">
! Debugging
Context      : 1,050,000
! Refactoring
Max Output  : 128,000
! Architecture
 
! پیشنهاد
Input        : $2
|-
Cached      : $0.20
| '''GPT-6 Astra'''
Output      : $12
| 10
</syntaxhighlight>
| 10
 
| 10
مناسب برای:
| 🥇
 
|-
* Coding روزمره
| '''GPT-5.6 Sol'''
* Debugging
| 10
* Feature Development
| 10
* Refactoring
| 10
* Code Review
| 🥇
* Repository Analysis
|-
* Tool Calling
| '''Claude Sonnet 5'''
* Coding Agent
| 9.8
 
| 9.8
'''Coding: 9.5/10'''
| 9.7
 
| ⭐
'''Agentic: 9.5/10'''
|-
| '''Claude Opus 4.6'''
| 9.8
| 9.8
| 9.8
| ⭐
|-
| '''Gemini 3.8 Flash'''
| 9.6
| 9.6
| 9.5
| ⭐
|-
| '''Grok 4.6'''
| 9.6
| 9.5
| 9.5
| ⭐
|-
| '''GLM 5.3 Flash'''
| 9.5
| 9.5
| 9.3
| خوب
|-
| '''DeepSeek V4 Pro'''
| 9.5
| 9.5
| 9.4
| خوب
|-
| '''GPT-5.6 Terra'''
| 9.5
| 9.5
| 9.5
| خوب
|}


----
----


== GPT-5.6 Luna ==
= مقایسه برای Repositoryهای بزرگ =


Luna برای Workloadهای ارزان و پرتعداد طراحی شده است.
برای Repository بزرگ، Context Window فقط یکی از معیارها است.


<syntaxhighlight lang="text">
مدل همچنین باید بتواند ارتباط میان فایل‌ها، Dependencyها، Interfaceها و Call Chainها را درک کند.
Context      : 1,050,000
Max Output  : 128,000


Input        : $0.20
{| class="wikitable sortable"
Cached      : $0.02
! مدل
Output      : $1.20
! Context تقریبی
</syntaxhighlight>
! Repository Understanding
 
! پیشنهاد
مناسب برای:
|-
 
| '''GPT-6 Astra'''
* Sub-Agent
| 1.05M
* Documentation
| عالی
* Boilerplate
| 🥇
* Classification
|-
* Code Explanation
| '''GPT-5.6 Sol'''
* تغییرات ساده
| 1.05M
* Unit Test ساده
| عالی
* File Analysis
| 🥇
* Routing
|-
 
| '''GPT-5.6 Terra'''
برای مسائل پیچیده Software Engineering بهتر است Task به Terra یا Sol منتقل شود.
| 1.05M
| عالی
| ⭐
|-
| '''GPT-5.6 Luna'''
| 1.05M
| خوب
| پردازش اولیه
|-
| '''Gemini Flash'''
| ~1M
| عالی
| ⭐
|-
| '''DeepSeek V4'''
| ~1M
| عالی
| ⭐
|-
| '''GLM'''
| Long Context
| عالی
| ⭐
|-
| '''Qwen 3.7 Max'''
| ~1M
| عالی
| ⭐
|-
| '''gpt-oss-120b'''
| 128K
| خوب
| Self-host
|}


----
----


== Claude Sonnet 5 ==
= مقایسه Frontend و Screenshot-to-Code =


Claude Sonnet 5 یکی از مهم‌ترین مدل‌های فعلی برای Agentic Software Engineering است.
برای کارهایی مانند:


Anthropic این مدل را برای انجام Taskهای چندمرحله‌ای، Tool Use، Terminal و Coding طراحی کرده است.
* Screenshot → HTML/CSS
* Screenshot → React
* Screenshot → Angular
* UI → Responsive Design
* تحلیل Layout
* تولید Component
* تشخیص عناصر تصویر
* تبدیل Design به Code


<syntaxhighlight lang="text">
مدل Multimodal مزیت مهمی دارد.
Input  : $2 / 1M
Output : $10 / 1M
</syntaxhighlight>


مناسب برای:
{| class="wikitable sortable"
 
! رتبه
* Claude Code
! مدل
* Repository Analysis
! Frontend
* Refactoring
! Vision
* Debugging
! Agentic
* Terminal
|-
* Tool Use
| 1
* Multi-file Editing
| '''Gemini 3.8 Flash'''
* Long-running Coding Tasks
| 9.8
* Agentic Software Engineering
| عالی
 
| 9.8
'''Coding: 9.8/10'''
|-
 
| 2
'''Agentic: 10/10'''
| '''Gemini 3.7 Flash'''
 
| 9.7
از نظر ترکیب قدرت و قیمت، Sonnet 5 یکی از بهترین انتخاب‌های Coding Agent است.
| عالی
| 9.7
|-
| 3
| '''Claude Sonnet 5'''
| 9.7
| عالی
| 10
|-
| 4
| '''GPT-5.6 Sol'''
| 9.7
| عالی
| 10
|-
| 5
| '''GPT-5.6 Terra'''
| 9.5
| عالی
| 9.5
|-
| 6
| '''MiMo 2.5'''
| 8.8
| خوب
| 8.7
|}


----
----


== Claude Opus 4.6 ==
= مقایسه Backend و Microservice =


Opus برای مسائل بسیار پیچیده مناسب است.
برای:


بهترین کاربرد:
* ASP.NET Core
* C#
* Java
* Spring
* Node.js
* Python
* Go
* REST API
* gRPC
* Microservices
* SQL
* Redis
* RabbitMQ
* Kafka
* Docker
* Kubernetes


* Debugging بسیار پیچیده
{| class="wikitable sortable"
* Architecture Analysis
! رتبه
* Refactoring سنگین
! مدل
* تحلیل Repository
! Backend
* Reasoning طولانی
! Architecture
* Taskهای چندمرحله‌ای
! Debugging
 
! Agentic
در استفاده روزمره معمولاً Sonnet اقتصادی‌تر است.
|-
 
| 1
می‌توان از این معماری استفاده کرد:
| '''GPT-6 Astra'''
 
| 10
<syntaxhighlight lang="text">
| 10
Claude Sonnet
| 10
      │
| 10
      │ Task Failed
|-
      ▼
| 2
Claude Opus
| '''GPT-5.6 Sol'''
</syntaxhighlight>
| 10
| 10
| 10
| 10
|-
| 3
| '''Claude Sonnet 5'''
| 9.8
| 9.7
| 9.8
| 10
|-
| 4
| '''Gemini 3.8 Flash'''
| 9.7
| 9.5
| 9.6
| 9.8
|-
| 5
| '''Grok 4.6'''
| 9.6
| 9.5
| 9.6
| 9.8
|-
| 6
| '''GPT-5.6 Terra'''
| 9.5
| 9.5
| 9.5
| 9.5
|-
| 7
| '''GLM 5.3 Flash'''
| 9.5
| 9.3
| 9.5
| 9.7
|-
| 8
| '''DeepSeek V4 Pro'''
| 9.5
| 9.4
| 9.5
| 9.6
|}


----
----


== Gemini 3.8 Flash ==
= مقایسه مدل‌های Open Weight و Self-hosted =


Gemini 3.8 Flash یکی از جدیدترین مدل‌های Google DeepMind است که در سپتامبر 2026 معرفی شده است.
در سازمان‌هایی که Source Code محرمانه است، Self-hosting می‌تواند اهمیت زیادی داشته باشد.


تمرکز اصلی نسل جدید Flash روی:
{| class="wikitable sortable"
! مدل
! Self-host
! Coding
! Agentic
! کاربرد
|-
| '''gpt-oss-120b'''
| '''بله'''
| 8.6
| 8.5
| Private Coding Agent
|-
| '''GLM Open Models'''
| '''بله'''
| عالی
| عالی
| Coding / Reasoning
|-
| '''Mistral'''
| '''بله'''
| عالی
| عالی
| Enterprise Agent
|-
| '''Qwen'''
| '''بله'''
| عالی
| خوب تا عالی
| Coding / Long Context
|}


* Agentic Workflows
مزایای Self-hosting:
* Coding
* Tool Use
* Multimodal Reasoning
* Software Engineering
* سرعت بالا
 
است.


اگر 3.8 Flash در Provider یا Coding Agent مورد استفاده شما فعال باشد، نسبت به نسل‌های قبلی Flash باید در اولویت آزمایش قرار گیرد.
* حفظ Source Code در شبکه داخلی
* Data Residency
* کنترل کامل Infrastructure
* عدم وابستگی به API خارجی
* امکان استفاده در شبکه بدون اینترنت
* امکان Fine-tuning یا Custom Deployment
* کنترل هزینه در حجم بسیار بالا


----
----


== Gemini 3.7 Flash ==
= مقایسه نسل‌های Gemini Flash =


Gemini 3.7 Flash یکی از مهم‌ترین مدل‌های Coding سال 2026 است.
{| class="wikitable"
 
! مدل
Google آن را به عنوان یک Workhorse Model برای Coding و Agents معرفی کرده است.
! Coding
 
! Agentic
قیمت Introductory:
! وضعیت پیشنهادی
 
|-
<syntaxhighlight lang="text">
| '''Gemini 3.8 Flash'''
Input  : $0.75 / 1M
| '''9.8'''
Output : $3.75 / 1M
| '''9.8'''
</syntaxhighlight>
| 🥇 اولویت اول
 
|-
قیمت اعلام‌شده بعد از پایان دوره Introductory:
| '''Gemini 3.7 Flash'''
 
| '''9.6'''
<syntaxhighlight lang="text">
| '''9.7'''
Input  : $1.50 / 1M
| ⭐ بسیار مناسب
Output : $7.50 / 1M
|-
</syntaxhighlight>
| '''Gemini 3.6 Flash'''
 
| 9.0
این مدل در Coding نسبت به Gemini 3.6 Flash پیشرفت قابل توجهی داشته است.
| 9.1
 
| نسل قبلی
برخی نتایج اعلام‌شده:
|-
 
| '''Gemini 3.5 Flash'''
<syntaxhighlight lang="text">
| 8.6
FrontierCode 1.1
| 8.7
 
| اولویت پایین‌تر
Gemini 3.7 Flash : 43.6%
|}
Gemini 3.6 Flash : 34.4%
 
DeepSWE v1.1
 
Gemini 3.7 Flash : 65.3%
Gemini 3.6 Flash : ~49%
</syntaxhighlight>
 
مناسب برای:
 
* Web Development
* Backend
* Frontend
* Debugging
* Repository Analysis
* Tool Calling
* Agentic Coding
* UI Generation
* Screenshot → Code
* Multimodal Coding
 
'''Coding: 9.6/10'''
 
'''Agentic: 9.7/10'''


----
در صورت دسترسی یکسان:


== Gemini 3.6 Flash ==
<pre>
 
Gemini 3.8 Flash
3.6 Flash همچنان مدل خوبی برای Coding است اما با عرضه 3.7 و سپس 3.8، اولویت آن کاهش یافته است.
      ↓
 
اگر هر دو مدل در Provider موجود باشند:
 
<syntaxhighlight lang="text">
Gemini 3.7 Flash
Gemini 3.7 Flash
       >
       ↓
Gemini 3.6 Flash
Gemini 3.6 Flash
</syntaxhighlight>
      ↓
 
Gemini 3.5 Flash
مگر اینکه محدودیت Quota یا Provider وجود داشته باشد.
</pre>


----
----


== Gemini 3.5 Flash ==
= مقایسه خانواده GPT-5.6 =


این مدل برای:
{| class="wikitable"
 
! ویژگی
* Coding سریع
! GPT-5.6 Sol
* Code Explanation
! GPT-5.6 Terra
* Taskهای ساده
! GPT-5.6 Luna
* Multimodal Tasks
|-
 
| Input / 1M
مناسب است.
| $4
 
| $2
اما در صورت دسترسی به 3.7 یا 3.8 Flash، استفاده از نسل جدیدتر منطقی‌تر است.
| $0.20
 
|-
----
| Cached
 
| $0.40
== Gemini 3.1 Pro ==
| $0.20
| $0.02
|-
| Output / 1M
| $20
| $12
| $1.20
|-
| Context
| 1.05M
| 1.05M
| 1.05M
|-
| Max Output
| 128K
| 128K
| 128K
|-
| Coding
| '''10'''
| '''9.5'''
| 8.2
|-
| Agentic
| '''10'''
| '''9.5'''
| 8.6
|-
| کاربرد
| Hard Tasks
| Daily Professional Coding
| Cheap / High Volume
|}


این مدل بیشتر برای:
بنابراین:


* Deep Reasoning
<pre>
* Complex Coding
مسئله بسیار پیچیده → Sol
* Repository Analysis
* Multimodal Reasoning
* Agentic Workflows


مناسب است.
Coding حرفه‌ای روزمره → Terra


در بسیاری از Taskهای روزمره Coding، Flashهای جدید می‌توانند سریع‌تر و اقتصادی‌تر باشند.
Task ساده و پرتعداد → Luna
</pre>


----
----


== GLM 5.3 Flash ==
= مقایسه Claude برای Coding =


GLM 5.3 Flash یکی از جذاب‌ترین مدل‌های جدید از نظر Price/Performance است.
{| class="wikitable"
! مدل
! Coding
! Agentic
! Debugging
! کاربرد
|-
| '''Claude Sonnet 5'''
| 9.8
| '''10'''
| 9.8
| Coding Agent روزمره
|-
| '''Claude Opus 4.6'''
| 9.6
| 9.7
| '''9.8'''
| Escalation / Hard Reasoning
|}


این مدل دارای معماری Mixture-of-Experts است.
در Coding Agent می‌توان از معماری زیر استفاده کرد:


<syntaxhighlight lang="text">
<pre>
Total Parameters  : ~320B
Claude Sonnet
Active Parameters : ~18B
      │
</syntaxhighlight>
       │ Failed / Very Hard
 
       ▼
تمرکز مدل روی:
Claude Opus
 
</pre>
* Coding
* Agentic Coding
* Tool Use
* Reasoning
* Software Engineering
* Multimodal Tasks
 
است.
 
قیمت Promotional فعلی:
 
<syntaxhighlight lang="text">
Input        : $0.075 / 1M
Cached Input : $0.015 / 1M
Output       : $0.25 / 1M
</syntaxhighlight>
 
قیمت List:
 
<syntaxhighlight lang="text">
Input        : $0.15
Cached       : $0.03
Output      : $0.50
</syntaxhighlight>
 
این قیمت در مقایسه با توانایی Coding مدل بسیار قابل توجه است.
 
'''Coding: 9.5/10'''
 
'''Agentic: 9.7/10'''
 
'''Price/Performance: 10/10'''


----
----


== GLM-5.2 ==
= مقایسه DeepSeek =


GLM-5.2 برای Long-Horizon Taskها طراحی شده است.
{| class="wikitable"
! مدل
! Coding
! Agentic
! هزینه
! کاربرد
|-
| '''DeepSeek V4 Pro'''
| '''9.5'''
| '''9.6'''
| پایین
| Task پیچیده
|-
| '''DeepSeek V4 Flash 0731'''
| 9.2
| 9.4
| '''بسیار پایین'''
| Daily Agent / Sub-Agent
|}


<syntaxhighlight lang="text">
اگر هزینه مهم باشد:
Input        : $1.40
Cached      : $0.26
Output      : $4.40
Context      : ~1M
</syntaxhighlight>


مناسب برای:
'''V4 Flash'''


* Coding Agent
اگر قدرت بیشتر مهم باشد:
* Repository Analysis
* Long-Horizon Coding
* Debugging
* Tool Use


با عرضه GLM 5.3 Flash، برای بسیاری از Taskهای Coding بهتر است ابتدا 5.3 Flash آزمایش شود.
'''V4 Pro'''


----
----


== DeepSeek V4 Pro ==
= مقایسه GLM =


DeepSeek V4 Pro یکی از مدل‌های مهم برای Agentic Coding است.
{| class="wikitable"
 
مناسب برای:
 
* Software Engineering
* Reasoning
* Coding
* Tool Calling
* Repository Analysis
* Agentic Workflow
 
مزیت اصلی DeepSeek معمولاً Price/Performance بسیار مناسب آن است.
 
----
 
== DeepSeek V4 Flash 0731 ==
 
این مدل یکی از گزینه‌های بسیار جذاب برای Coding اقتصادی است.
 
<syntaxhighlight lang="text">
Context Window : ~1,000,000
Max Output    : تا 384K
</syntaxhighlight>
 
قیمت بسته به Peak/Off-Peak تغییر می‌کند.
 
<syntaxhighlight lang="text">
Off-Peak
 
Input        : $0.22
Cached      : $0.007
Output      : $0.66
 
Peak
 
Input        : $0.44
Cached      : $0.014
Output      : $1.32
</syntaxhighlight>
 
قابلیت‌ها:
 
* Thinking
* Non-Thinking
* Tool Calling
* Responses API
* JSON Output
* FIM
* Prefix Completion
* Agentic Coding
 
مناسب برای:
 
* Coding Agent
* Sub-Agent
* Tool Loop
* Repository Analysis
* پردازش انبوه
 
'''Coding: 9.2/10'''
 
'''Agentic: 9.4/10'''
 
'''Price/Performance: 10/10'''
 
----
 
== Grok 4.6 ==
 
Grok 4.6 یک Frontier Model برای Coding، Agentic Tasks و Knowledge Work است.
 
<syntaxhighlight lang="text">
Context : 500,000
 
Input    : $2
Cached  : $0.50
Output  : $6
</syntaxhighlight>
 
قابلیت‌ها:
 
* Function Calling
* Structured Output
* Reasoning
* Tool Calling
* Image Input
 
'''Coding: 9.6/10'''
 
'''Agentic: 9.8/10'''
 
----
 
== Grok Build 0.1 ==
 
این مدل برخلاف Grok عمومی، مشخصاً برای Agentic Software Engineering ساخته شده است.
 
<syntaxhighlight lang="text">
Context : 256K
 
Input    : $1
Cached  : $0.20
Output  : $2
</syntaxhighlight>
 
مناسب برای:
 
* Coding Agent
* Software Engineering
* Tool Calling
* Workflow Automation
* Debugging
* Web Development
 
'''Coding: 9.3/10'''
 
'''Agentic: 9.5/10'''
 
'''Price/Performance: 9.8/10'''
 
----
 
== Mistral Medium 3.5 ==
 
Mistral Medium 3.5 یک مدل Frontier-Class Multimodal است که برای Agentic و Coding Use Case بهینه شده است.
 
<syntaxhighlight lang="text">
Context : 256K
 
Input    : $1.50
Cached  : $0.15
Output  : $7.50
</syntaxhighlight>
 
قابلیت‌ها:
 
* Function Calling
* Structured Output
* Agents
* Conversations
* Document Q&A
* Prefix
* Batch
* Multimodal
 
مزیت مهم:
 
'''Open Weights'''
 
با Modified MIT License.
 
----
 
== Qwen 3.7 Max ==
 
Qwen 3.7 Max برای Long Context و Agentic Taskها گزینه قابل توجهی است.
 
<syntaxhighlight lang="text">
Context    : ~1M
Max Output : ~131K
</syntaxhighlight>
 
مناسب برای:
 
* Large Repository
* Coding
* Agent
* Tool Calling
* Structured Output
* Long Context
 
----
 
== gpt-oss-120b ==
 
این مدل با GPT-5.6 تفاوت اساسی دارد.
 
gpt-oss-120b یک مدل Open Weight است.
 
<syntaxhighlight lang="text">
Parameters      : ~117B
Active Parameters: ~5.1B/token
Context          : 128K
</syntaxhighlight>
 
مزیت اصلی:
 
'''Self-hosting'''
 
مناسب برای:
 
* Local AI
* Private Coding Agent
* Code Generation
* Reasoning
* Tool Use
* سازمان‌هایی که نمی‌خواهند Source Code به API خارجی ارسال شود
 
در قدرت خام Coding، مدل‌های Frontier جدید معمولاً بهتر هستند، اما در Self-hosting، gpt-oss-120b بسیار جذاب است.
 
----
 
== MiMo 2.5 ==
 
MiMo 2.5 مدلی Balanced برای:
 
* Coding
* Reasoning
* Image Understanding
* Multimodal Tasks
* General Agent
 
است.
 
اگر Task شامل Screenshot یا Image باشد، قابلیت Multimodal آن مفید است.
 
اما برای Agentic Software Engineering سنگین، GLM، Gemini، Claude یا DeepSeek معمولاً در اولویت بالاتری قرار می‌گیرند.
 
----
 
== Solar Pro 4 ==
 
Solar Pro 4 یک مدل General Purpose مناسب برای:
 
* Coding
* Reasoning
* Debugging
* Software Tasks
 
است.
 
برای Coding عمومی گزینه خوبی است اما در صورت دسترسی به GLM 5.3 Flash، DeepSeek V4 Flash یا Gemini Flash جدید، ابتدا مدل‌های تخصصی‌تر Coding را آزمایش می‌کنیم.
 
----
 
= مقایسه مدل‌های اقتصادی =
 
یکی از مهم‌ترین رقابت‌های سال 2026 در مدل‌های ارزان Coding است.
 
{| class="wikitable sortable"
! مدل
! مدل
! Input
! Output
! Coding
! Coding
! Agentic
! Agentic
! Price/Performance
! Price/Performance
! پیشنهاد
|-
|-
| '''GLM 5.3 Flash'''
| '''GLM 5.3 Flash'''
| $0.075*
| $0.25*
| 9.5
| 9.5
| 9.7
| 9.7
| '''10'''
| '''10'''
| 🥇
|-
|-
| '''GPT-5.6 Luna'''
| '''GLM-5.2'''
| $0.20
| $1.20
| 8.2
| 8.6
| '''10'''
|-
| '''DeepSeek V4 Flash'''
| $0.22–0.44
| $0.66–1.32
| 9.2
| 9.4
| '''10'''
|-
| '''Grok Build'''
| $1
| $2
| 9.3
| 9.5
| 9.5
| 9.8
|-
| '''Gemini 3.7 Flash'''
| $0.75*
| $3.75*
| 9.6
| 9.7
| 9.7
| 9.8
| 9.4
| Long-Horizon
|}
|}


در حال حاضر GLM 5.3 Flash از نظر قیمت Token بسیار جذاب است.
GLM 5.3 Flash به دلیل ترکیب:


اما قیمت Token تنها معیار نیست.
* سرعت
* Coding
* Agentic capability
* هزینه پایین


مدلی که Task را در یک Iteration حل کند ممکن است در عمل ارزان‌تر از مدلی باشد که پنج بار نیاز به Retry داشته باشد.
یکی از جذاب‌ترین گزینه‌های Coding Agent است.


----
----


= بهترین مدل برای Frontend و Screenshot-to-Code =
= مقایسه مدل‌های مشاهده‌شده در Provider =


برای کارهایی مانند:
در بررسی Provider مورد استفاده، مدل‌های زیر نیز در دسترس بودند:


* Screenshot → HTML/CSS
* DeepSeek V4 Flash 0731
* Screenshot → React
* GLM 5.3 Flash
* UI → Angular
* GPT-5.6 Luna
* طراحی Responsive
* MiMo 2.5
* تحلیل UI
* Solar Pro 4
* تبدیل Design به Code


پیشنهاد:
برای Coding:


{| class="wikitable"
{| class="wikitable"
! رتبه
! رتبه
! مدل
! مدل
! Coding
! Agentic
! پیشنهاد
|-
|-
| 1
| 1
| '''Gemini 3.8 Flash'''
| '''GLM 5.3 Flash'''
| 9.5
| 9.7
| 🥇
|-
|-
| 2
| 2
| '''Gemini 3.7 Flash'''
| '''DeepSeek V4 Flash 0731'''
| 9.2
| 9.4
| 🥈
|-
|-
| 3
| 3
| '''Claude Sonnet 5'''
| '''Solar Pro 4'''
| 8.8
| 8.7
| 🥉
|-
|-
| 4
| 4
| '''GPT-5.6 Sol/Terra'''
| '''MiMo 2.5'''
| 8.7
| 8.7
| Multimodal
|-
|-
| 5
| 5
| '''MiMo 2.5'''
| '''GPT-5.6 Luna'''
| 8.2
| 8.6
| Sub-Agent
|}
|}
مدل‌های Multimodal در این نوع Task مزیت مهمی دارند.


----
----


= بهترین مدل برای Backend =
= مقایسه مدل‌های مشاهده‌شده در Antigravity =
 
برای:


* ASP.NET Core
مدل‌های بررسی‌شده:
* Java
* Go
* Node.js
* Python
* Microservices
* Database
* API
* Docker
* Kubernetes


پیشنهاد:
* Gemini 3.7 Flash
* Gemini 3.6 Flash
* Claude Opus 4.6
* Claude Sonnet 4.6
* Gemini 3.1 Pro
* Gemini 3.5 Flash
* gpt-oss-120b


{| class="wikitable"
{| class="wikitable sortable"
! رتبه
! رتبه
! مدل
! مدل
! Coding
! Agentic
! بهترین کاربرد
|-
|-
| 1
| 1
| '''GPT-5.6 Sol'''
| '''Gemini 3.7 Flash'''
| 9.6
| 9.7
| Coding روزمره سریع
|-
|-
| 2
| 2
| '''Claude Sonnet 5'''
| '''Claude Opus 4.6'''
| 9.6
| 9.7
| مسائل بسیار پیچیده
|-
|-
| 3
| 3
| '''Gemini 3.8/3.7 Flash'''
| '''Claude Sonnet 4.6'''
| 9.5
| 9.6
| Coding Agent
|-
|-
| 4
| 4
| '''Grok 4.6'''
| '''Gemini 3.1 Pro'''
| 9.5
| 9.6
| Deep Reasoning
|-
|-
| 5
| 5
| '''GLM 5.3 Flash'''
| '''Gemini 3.6 Flash'''
| 9.0
| 9.1
| Fast Coding
|-
|-
| 6
| 6
| '''DeepSeek V4 Pro'''
| '''Gemini 3.5 Flash'''
| 8.6
| 8.7
| Taskهای ساده‌تر
|-
|-
| 7
| 7
| '''GPT-5.6 Terra'''
| '''gpt-oss-120b'''
| 8.6
| 8.5
| Self-hosting
|}
|}


----
----


= بهترین مدل برای Repository بزرگ =
= انتخاب مدل بر اساس نوع Task =


در Repositoryهای بزرگ Context Window اهمیت زیادی دارد.
{| class="wikitable sortable"
 
! Task
مدل‌های مناسب:
! انتخاب اول
 
! انتخاب دوم
* GPT-5.6 Sol
! انتخاب اقتصادی
* GPT-5.6 Terra
|-
* GPT-5.6 Luna
| Coding روزمره
* Gemini
| Gemini 3.8/3.7 Flash
* DeepSeek V4
| Claude Sonnet 5
* Qwen 3.7 Max
| GLM 5.3 Flash
* GLM
|-
 
| Bug پیچیده
اما Context بزرگ به تنهایی کافی نیست.
| GPT-5.6 Sol
 
| Claude Sonnet 5
مدل باید بتواند اطلاعات مهم Repository را پیدا کرده و بین فایل‌ها ارتباط برقرار کند.
| DeepSeek V4 Pro
 
|-
----
| Architecture
 
| GPT-6 Astra
= بهترین مدل برای Self-hosting =
| GPT-5.6 Sol
 
| GPT-5.6 Terra
اگر Source Code نباید از سازمان خارج شود:
|-
 
| Refactoring
{| class="wikitable"
| Claude Sonnet 5
! مدل
| GPT-5.6 Sol
! مزیت
| GLM 5.3 Flash
|-
| Repository بزرگ
| GPT-5.6 Sol
| Gemini
| DeepSeek / GLM
|-
| Frontend
| Gemini Flash
| Claude Sonnet
| GLM
|-
|-
| '''gpt-oss-120b'''
| Backend
| Open Weight + Reasoning
| GPT-5.6 Sol
| Claude Sonnet
| GLM / DeepSeek
|-
|-
| '''GLM'''
| Tool-heavy Agent
| Coding + Agentic + Open Models
| Claude Sonnet 5
| Grok 4.6
| Grok Build
|-
|-
| '''Mistral Medium 3.5'''
| Sub-Agent
| Coding + Agent + Modified MIT
| GPT-5.6 Luna
| DeepSeek Flash
| GLM Flash
|-
|-
| '''Qwen'''
| Self-host
| مدل‌های Open متعدد
| gpt-oss-120b
| GLM
| Qwen / Mistral
|}
|}
Self-hosting برای شرکت‌هایی که:
* Source Code محرمانه دارند
* محدودیت اینترنت دارند
* Data Residency مهم است
* هزینه API بالا دارند
می‌تواند مناسب باشد.


----
----
Line 1,262: Line 1,465:
= معماری پیشنهادی Multi-Model Coding Agent =
= معماری پیشنهادی Multi-Model Coding Agent =


استفاده از قوی‌ترین مدل برای تمام Taskها معمولاً اقتصادی نیست.
استفاده از گران‌ترین مدل برای تمام درخواست‌ها از نظر اقتصادی بهینه نیست.


معماری بهتر:
یک Orchestrator می‌تواند ابتدا Task را طبقه‌بندی کند.


<syntaxhighlight lang="text">
<pre>
                         USER
                         USER
                           │
                           │
Line 1,273: Line 1,476:
                           │
                           │
                           ▼
                           ▼
                   Task Classification
                   TASK CLASSIFIER
                          │
          ┌───────────────┼───────────────┐
          │              │              │
          ▼              ▼              ▼
        SIMPLE          MEDIUM          HARD
          │              │              │
          ▼              ▼              ▼
      GPT-5.6 Luna    GLM 5.3 Flash  Claude Sonnet 5
      DeepSeek Flash  Gemini Flash    GPT-5.6 Sol
      GLM Flash      GPT-5.6 Terra  Grok 4.6
          │              │              │
          └───────────────┼───────────────┘
                          │
                          ▼
                      FAILED?
                          │
                        YES
                           │
                           │
          ┌────────────────┼────────────────┐
                          ▼
          │                │                │
                      GPT-6 Astra
          ▼                ▼                ▼
</pre>
        SIMPLE          MEDIUM            HARD
          │                │                │
          ▼                ▼                ▼
GPT-5.6 Luna      GLM 5.3 Flash    Claude Sonnet 5
DeepSeek Flash    GPT-5.6 Terra      Gemini 3.8
GLM Flash          DeepSeek Pro      Grok 4.6
Grok Build        Gemini Flash            │
                                          ▼
                                    VERY COMPLEX
                                          │
                                          ▼
                                    GPT-5.6 Sol
                                          │
                                      Failed?
                                          │
                                          ▼
                                      GPT-6 Astra
</syntaxhighlight>


----
----


= معماری کم‌هزینه پیشنهادی =
= معماری پیشنهادی برای کاهش هزینه =


<syntaxhighlight lang="text">
به جای شروع Task با مدل گران:
 
<pre>
Task
Task
  │
  │
Line 1,307: Line 1,511:
GLM 5.3 Flash
GLM 5.3 Flash
  │
  │
  ├── Success ──> DONE
  ├── Success ───────────────► DONE
  │
  │
  ▼
  ▼
DeepSeek V4 Flash
DeepSeek V4 Flash
  │
  │
  ├── Success ──> DONE
  ├── Success ───────────────► DONE
  │
  │
  ▼
  ▼
Gemini 3.7/3.8 Flash
Gemini Flash
  │
  │
  ├── Success ──> DONE
  ├── Success ───────────────► DONE
  │
  │
  ▼
  ▼
GPT-5.6 Terra
GPT-5.6 Terra
  │
  │
  ├── Success ──> DONE
  ├── Success ───────────────► DONE
  │
  │
  ▼
  ▼
Claude Sonnet 5
Claude Sonnet 5
  │
  │
  ├── Success ──> DONE
  ├── Success ───────────────► DONE
│
▼
GPT-5.6 Sol
│
├── Success ───────────────► DONE
  │
  │
  ▼
  ▼
GPT-5.6 Sol / GPT-6 Astra
GPT-6 Astra
</syntaxhighlight>
</pre>


این معماری می‌تواند هزینه Coding Agent را به میزان قابل توجهی کاهش دهد.
این روش '''Escalation Routing''' نامیده می‌شود.


----
----


= پیشنهاد برای Coding Agent روزمره =
= معماری پیشنهادی Orchestrator + Worker =


اگر مدل‌ها بدون محدودیت یا با Subscription در دسترس باشند:
برای سیستم‌هایی مانند Coding Agent، استفاده از یک مدل به عنوان Orchestrator و مدل‌های ارزان به عنوان Worker می‌تواند مؤثر باشد.


=== انتخاب اول ===
<pre>
                    ORCHESTRATOR
                  Claude / GPT / Gemini
                          │
          ┌───────────────┼───────────────┐
          │              │              │
          ▼              ▼              ▼
      WORKER 1        WORKER 2        WORKER 3
      GLM Flash      DeepSeek Flash    GPT Luna
          │              │              │
          ▼              ▼              ▼
      Coding          Testing        Analysis
          │              │              │
          └───────────────┼───────────────┘
                          │
                          ▼
                    CODE REVIEW
                          │
                          ▼
                    ORCHESTRATOR
</pre>


'''Gemini 3.8 Flash / Gemini 3.7 Flash'''
----


برای اکثر Taskهای روزمره.
= معماری پیشنهادی برای Repository بزرگ =


=== انتخاب دوم ===
<pre>
Repository
    │
    ▼
Repository Scanner
    │
    ├── Architecture Files
    ├── Source Files
    ├── Tests
    ├── Database
    ├── Config
    └── Documentation
            │
            ▼
        Cheap Models
    Luna / GLM / DeepSeek
            │
            ▼
        Summary / Index
            │
            ▼
      Powerful Model
    Claude / GPT / Gemini
            │
            ▼
          Solution
</pre>


'''GLM 5.3 Flash'''
این معماری باعث می‌شود لازم نباشد تمام Source Code در هر Request به مدل گران ارسال شود.


برای Coding سریع و Agentic Workload.
----


=== Task سخت ===
= آیا همیشه قوی‌ترین مدل بهتر است؟ =


'''Claude Sonnet 5'''
خیر.


=== Task بسیار سخت ===
فرض کنید یک Task با مدل ارزان:


'''GPT-5.6 Sol'''
<pre>
1M Input
100K Output
</pre>


=== Escalation نهایی ===
قابل انجام باشد.


'''GPT-6 Astra'''
ارسال همان Task به یک Frontier Model ممکن است چندین برابر هزینه ایجاد کند بدون اینکه نتیجه نهایی تفاوت مهمی داشته باشد.
 
بنابراین باید سه عامل را همزمان بررسی کرد:
 
# کیفیت
# زمان
# هزینه
 
در Coding Agent معیار مهم دیگری نیز وجود دارد:
 
'''تعداد Iteration لازم برای رسیدن به جواب صحیح'''
 
ممکن است مدل A از نظر Token ارزان‌تر باشد اما برای حل Task پنج بار تلاش کند.
 
در حالی که مدل B گران‌تر است اما Task را در اولین تلاش حل می‌کند.
 
بنابراین:
 
<pre>
Real Cost =
Token Cost
+
Retries
+
Tool Calls
+
Execution Time
+
Developer Time
</pre>


----
----


= نتیجه‌گیری =
= استراتژی پیشنهادی استفاده روزمره =


بازار مدل‌های Coding در سال 2026 بسیار رقابتی شده است.
برای Coding روزمره:


دیگر نمی‌توان گفت یک مدل در تمام شرایط بهترین انتخاب است.
'''Gemini Flash / GLM 5.3 Flash'''


اگر '''حداکثر قدرت''' اهمیت داشته باشد:
برای Feature پیچیده:


:🏆 '''GPT-6 Astra / GPT-5.6 Sol'''
'''GPT-5.6 Terra / Claude Sonnet'''


اگر '''Coding Agent حرفه‌ای''' بخواهیم:
برای Bug سخت:


:🤖 '''Claude Sonnet 5'''
'''Claude Sonnet 5 / GPT-5.6 Sol'''


اگر '''Coding Agent سریع''' بخواهیم:
برای Architecture:


:⚡ '''Gemini 3.8 Flash / Gemini 3.7 Flash'''
'''GPT-5.6 Sol / GPT-6 Astra'''


اگر '''Price/Performance''' اولویت اصلی باشد:
برای Taskهای پرتعداد:


:💰 '''GLM 5.3 Flash'''
'''GPT-5.6 Luna / DeepSeek Flash / GLM Flash'''


اگر '''Coding اقتصادی''' بخواهیم:
برای Local:


:💵 '''DeepSeek V4 Flash 0731'''
'''gpt-oss-120b / Qwen / GLM / Mistral'''


اگر '''OpenAI با تعادل قیمت و قدرت''' بخواهیم:
----


:⚖️ '''GPT-5.6 Terra'''
= نتیجه‌گیری نهایی =


اگر '''Coding + Tool Use''' اهمیت داشته باشد:
در سال 2026 یک مدل واحد را نمی‌توان برای تمام سناریوهای برنامه‌نویسی «بهترین» دانست.


:🛠️ '''Grok 4.6'''
'''حداکثر قدرت:'''


اگر '''Coding Agent ارزان''' بخواهیم:
:🏆 GPT-6 Astra


:🚀 '''Grok Build 0.1'''
'''Software Engineering بسیار پیچیده:'''


اگر '''Sub-Agent بسیار ارزان''' بخواهیم:
:🧠 GPT-5.6 Sol


:💵 '''GPT-5.6 Luna'''
'''Coding Agent حرفه‌ای:'''


اگر '''Self-hosting''' بخواهیم:
:🤖 Claude Sonnet 5


:🔓 '''gpt-oss-120b / GLM / Mistral / Qwen'''
'''Coding Agent سریع:'''


در سیستم‌های حرفه‌ای Software Engineering بهترین راهکار معمولاً استفاده از یک مدل واحد نیست.
:⚡ Gemini 3.8 / 3.7 Flash


استفاده از '''Multi-Model Routing''' باعث می‌شود Taskهای ساده توسط مدل‌های ارزان و سریع انجام شوند و تنها مسائل پیچیده به مدل‌های Frontier ارسال شوند.
'''بهترین Price/Performance:'''


این روش می‌تواند هم سرعت Agent را افزایش دهد و هم هزینه API را به میزان قابل توجهی کاهش دهد.
:💰 GLM 5.3 Flash
 
'''Coding اقتصادی:'''
 
:💵 DeepSeek V4 Flash 0731
 
'''تعادل قدرت و هزینه در OpenAI:'''
 
:⚖️ GPT-5.6 Terra
 
'''Tool-heavy Agent:'''
 
:🛠️ Grok 4.6
 
'''Agentic Software Engineering اقتصادی:'''
 
:🚀 Grok Build 0.1
 
'''Sub-Agent و پردازش پرتعداد:'''
 
:💵 GPT-5.6 Luna
 
'''Self-hosting:'''
 
:🔓 gpt-oss-120b / GLM / Qwen / Mistral
 
اما برای سیستم‌های حرفه‌ای، راهکار مناسب‌تر استفاده از '''Multi-Model Architecture''' است.
 
در چنین معماری:
 
<pre>
Cheap Model
    ↓
Medium Model
    ↓
Strong Model
    ↓
Frontier Model
</pre>
 
تنها Taskهایی که مدل قبلی قادر به حل آنها نیست به مدل گران‌تر منتقل می‌شوند.
 
این معماری می‌تواند:
 
* هزینه API را کاهش دهد.
* سرعت Coding Agent را افزایش دهد.
* Parallel Agentها را اقتصادی کند.
* استفاده از Contextهای بسیار بزرگ را مدیریت کند.
* از Frontier Model فقط در جایی که واقعاً لازم است استفاده کند.
 
در نتیجه، برای ساخت Coding Agent حرفه‌ای در سال 2026، '''انتخاب معماری Routing به اندازه انتخاب خود مدل اهمیت دارد.'''


----
----
'''آخرین به‌روزرسانی: 4 سپتامبر 2026'''


[[رده:هوش مصنوعی]]
[[رده:هوش مصنوعی]]
Line 1,430: Line 1,765:
[[رده:Coding Agent]]
[[رده:Coding Agent]]
[[رده:Software Engineering]]
[[رده:Software Engineering]]
[[رده:Artificial Intelligence]]
[[رده:OpenAI]]
[[رده:OpenAI]]
[[رده:Claude]]
[[رده:Claude]]
Line 1,436: Line 1,772:
[[رده:GLM]]
[[رده:GLM]]
[[رده:Grok]]
[[رده:Grok]]
[[رده:Qwen]]
[[رده:Mistral]]

Latest revision as of 15:06, 4 September 2026

مقایسه جامع مدل‌های هوش مصنوعی برای برنامه‌نویسی و Agentic Coding در سال 2026

مدل‌های هوش مصنوعی در سال 2026 از ابزارهای ساده Code Completion به سیستم‌هایی تبدیل شده‌اند که می‌توانند بخش قابل توجهی از فرایند مهندسی نرم‌افزار را به‌صورت Agentic انجام دهند.

یک Coding Agent مدرن می‌تواند:

  • Repository را بررسی کند.
  • ساختار پروژه را درک کند.
  • چندین فایل را ویرایش کند.
  • Terminal و Shell اجرا کند.
  • Test اجرا کند.
  • خطا را پیدا و Debug کند.
  • Refactoring انجام دهد.
  • از Tool Calling و MCP استفاده کند.
  • نتیجه اجرای برنامه را بررسی کند.
  • پس از شکست، راه‌حل دیگری را امتحان کند.

بنابراین برای انتخاب مدل مناسب برنامه‌نویسی، صرفاً قدرت تولید Code کافی نیست.

در این مقاله مدل‌ها از نظر موارد زیر بررسی می‌شوند:

  • Coding
  • Agentic Coding
  • Software Engineering
  • Debugging
  • Refactoring
  • Repository Understanding
  • Tool Calling
  • Long Context
  • Multimodal Coding
  • سرعت
  • قیمت API
  • Price/Performance
  • Self-hosting

آخرین به‌روزرسانی: 4 سپتامبر 2026


خلاصه سریع

کاربرد مدل پیشنهادی توضیح
🏆 حداکثر قدرت GPT-6 Astra سخت‌ترین مسائل End-to-End
🧠 Coding بسیار پیچیده GPT-5.6 Sol معماری، Debugging و Software Engineering پیچیده
🤖 Coding Agent حرفه‌ای Claude Sonnet 5 Agentic Software Engineering و Tool Use
⚡ Coding Agent سریع Gemini 3.8 Flash / Gemini 3.7 Flash سرعت بالا و مناسب Agent
💰 بهترین Price/Performance GLM 5.3 Flash Coding و Agentic با هزینه بسیار پایین
💵 Coding اقتصادی DeepSeek V4 Flash 0731 مناسب Agent و پردازش پرتعداد
⚖️ OpenAI متعادل GPT-5.6 Terra تعادل قدرت و هزینه
🛠️ Coding + Tool Use Grok 4.6 Agentic Workflow و Tool Calling
🚀 Agentic Software Engineering Grok Build 0.1 مدل تخصصی Coding Agent
📚 Repository بزرگ GPT-5.6 / Gemini / DeepSeek / Qwen / GLM Long Context
🖼️ Screenshot → Code Gemini Flash / Claude / GPT-5.6 Multimodal Coding
🔓 Self-hosting gpt-oss-120b / GLM / Mistral / Qwen اجرای Local و Private

جدول جامع مقایسه مدل‌ها

جدول زیر مدل‌ها را بر اساس تاریخ ارائه از جدیدترین به قدیمی‌ترین مرتب می‌کند.

قیمت‌ها به ازای یک میلیون Token هستند.

تاریخ ارائه مدل شرکت Input Cached Output Context Max Output Coding Agentic Price/Performance کاربرد اصلی
2026-09-04 GPT-6 Astra OpenAI $10 $1 $50 1.05M 128K 10/10 10/10 6.5 سخت‌ترین End-to-End Workloads
2026-09-02 Gemini 3.8 Flash Google DeepMind متغیر متغیر متغیر Long Context - 9.8 9.8 9.7 Coding، Agents و Multimodal
2026-08 GLM 5.3 Flash Z.ai / Zhipu AI بسیار ارزان بسیار ارزان بسیار ارزان Long Context - 9.5 9.7 10 Coding Agent اقتصادی
2026-08 Gemini 3.7 Flash Google DeepMind Introductory - Introductory ~1M - 9.6 9.7 9.8 Coding Agent سریع
2026-08 DeepSeek V4 Pro DeepSeek Tiered Tiered Tiered ~1M تا 384K 9.5 9.6 9.7 Agentic Coding
2026-08 Grok 4.6 xAI $2* $0.50* $6* 500K - 9.6 9.8 9.4 Coding + Tool Use
2026-07-31 DeepSeek V4 Flash 0731 DeepSeek $0.22–0.44* $0.007–0.014* $0.66–1.32* ~1M تا 384K 9.2 9.4 10 Coding اقتصادی
2026-07 GPT-5.6 Sol OpenAI $4 $0.40 $20 1.05M 128K 10 10 8 Complex Professional Coding
2026-07 GPT-5.6 Terra OpenAI $2 $0.20 $12 1.05M 128K 9.5 9.5 9.2 تعادل قدرت و قیمت
2026-07 GPT-5.6 Luna OpenAI $0.20 $0.02 $1.20 1.05M 128K 8.2 8.6 10 High-volume / Sub-Agent
2026-06 Claude Sonnet 5 Anthropic $2 متغیر $10 Long Context - 9.8 10 9.3 Professional Coding Agent
2026 Claude Opus 4.6 Anthropic Premium متغیر Premium Long Context - 9.6 9.7 7.5 Debugging و Reasoning بسیار پیچیده
2026 GLM-5.2 Z.ai / Zhipu AI Provider-based Provider-based Provider-based ~1M - 9.5 9.7 9.4 Long-Horizon Coding
2026 Grok Build 0.1 xAI $1* $0.20* $2* 256K - 9.3 9.5 9.8 Agentic Software Engineering
2026 Mistral Medium 3.5 Mistral AI $1.50 - $7.50 256K - 9.2 9.5 9.1 Coding و Agent
2026 Gemini 3.6 Flash Google DeepMind - - - ~1M - 9.0 9.1 8.8 Coding سریع
2026 Gemini 3.5 Flash Google DeepMind - - - Long Context - 8.6 8.7 8.5 Coding و Multimodal
2026 Gemini 3.1 Pro Google DeepMind Tiered Tiered Tiered ~1M - 9.5 9.6 8.8 Deep Reasoning
2026 Qwen 3.7 Max Alibaba Cloud / Qwen Region-based Region-based Region-based ~1M ~131K 9.4 9.5 9.3 Long Context
2026 Qwen3-Coder Plus Alibaba Cloud / Qwen Tiered - Tiered ~1M ~65K 9.2 8.7 9.2 Coding تخصصی
2026 MiMo 2.5 Xiaomi / MiMo Provider-based - Provider-based - - 8.7 8.7 9.2 Coding + Multimodal
2026 Solar Pro 4 Upstage Provider-based - Provider-based - - 8.8 8.7 8.8 General Coding
2025-08-05 gpt-oss-120b OpenAI Self-host - Self-host 128K - 8.6 8.5 9.5 Self-hosted Coding

نکته:

  • امتیازهای Coding، Agentic و Price/Performance ارزیابی تحلیلی این مقاله هستند و Benchmark رسمی شرکت‌های سازنده نیستند.
  • قیمت API ممکن است بر اساس Provider، Region، Context Length، Peak/Off-Peak و Promotional Pricing تغییر کند.
  • علامت «-» به معنی نبود اطلاعات قطعی قابل مقایسه در این جدول است.
  • برای مدل‌هایی که تاریخ دقیق نسخه مورد استفاده Provider مشخص نیست، سال یا ماه انتشار درج شده است.

رتبه‌بندی کلی برای برنامه‌نویسی

رتبه مدل Coding Agentic مناسب برای
1 GPT-6 Astra 10 10 حداکثر قدرت
2 GPT-5.6 Sol 10 10 Software Engineering پیچیده
3 Claude Sonnet 5 9.8 10 Coding Agent
4 Gemini 3.8 Flash 9.8 9.8 Agent سریع
5 Grok 4.6 9.6 9.8 Coding + Tools
6 Gemini 3.7 Flash 9.6 9.7 Coding سریع
7 Claude Opus 4.6 9.6 9.7 مسائل سخت
8 GLM 5.3 Flash 9.5 9.7 Price/Performance
9 DeepSeek V4 Pro 9.5 9.6 Agentic Coding
10 Gemini 3.1 Pro 9.5 9.6 Deep Reasoning
11 GPT-5.6 Terra 9.5 9.5 Balanced Coding
12 Qwen 3.7 Max 9.4 9.5 Long Context
13 Grok Build 0.1 9.3 9.5 Agentic Software Engineering
14 DeepSeek V4 Flash 9.2 9.4 Low-cost Coding
15 Mistral Medium 3.5 9.2 9.5 Open / Agentic
16 Qwen3-Coder Plus 9.2 8.7 Coding
17 Gemini 3.6 Flash 9.0 9.1 Fast Coding
18 Solar Pro 4 8.8 8.7 General Coding
19 MiMo 2.5 8.7 8.7 Coding + Image
20 gpt-oss-120b 8.6 8.5 Self-host
21 Gemini 3.5 Flash 8.6 8.7 Fast Coding
22 GPT-5.6 Luna 8.2 8.6 Cheap Sub-Agent

مقایسه مدل‌های اقتصادی برای Coding

این جدول برای زمانی مهم است که Coding Agent تعداد زیادی Token مصرف می‌کند.

مدل Coding Agentic هزینه Price/Performance پیشنهاد
GLM 5.3 Flash 9.5 9.7 بسیار پایین 10/10 🥇
DeepSeek V4 Flash 0731 9.2 9.4 بسیار پایین 10/10 🥇
GPT-5.6 Luna 8.2 8.6 بسیار پایین 10/10 Sub-Agent
Grok Build 0.1 9.3 9.5 پایین 9.8/10 Coding Agent
Gemini 3.7 Flash 9.6 9.7 پایین/متوسط 9.8/10 Agent سریع
GPT-5.6 Terra 9.5 9.5 متوسط 9.2/10 Coding حرفه‌ای
Claude Sonnet 5 9.8 10 متوسط 9.3/10 Task سخت

مقایسه برای Agentic Coding

Agentic Coding با Code Generation معمولی متفاوت است.

در Agentic Coding مدل باید بتواند:

  • Task را برنامه‌ریزی کند.
  • Repository را جستجو کند.
  • فایل مناسب را پیدا کند.
  • Terminal اجرا کند.
  • Code را تغییر دهد.
  • Test اجرا کند.
  • خطا را تحلیل کند.
  • مجدداً Code را اصلاح کند.
  • Toolهای مختلف را هماهنگ کند.
مدل Agentic Tool Use Repository Long-running Task پیشنهاد
GPT-6 Astra 10 عالی عالی عالی 🥇
Claude Sonnet 5 10 عالی عالی عالی 🥇
GPT-5.6 Sol 10 عالی عالی عالی 🥇
Gemini 3.8 Flash 9.8 عالی عالی عالی ⭐
Grok 4.6 9.8 عالی عالی عالی ⭐
GLM 5.3 Flash 9.7 عالی عالی عالی ⭐
Gemini 3.7 Flash 9.7 عالی عالی عالی ⭐
Claude Opus 4.6 9.7 عالی عالی عالی Task بسیار سخت
DeepSeek V4 Pro 9.6 عالی عالی عالی ⭐
Grok Build 9.5 عالی خوب عالی ⭐
GPT-5.6 Terra 9.5 عالی عالی عالی ⭐

مقایسه برای Debugging و Refactoring

مدل Debugging Refactoring Architecture پیشنهاد
GPT-6 Astra 10 10 10 🥇
GPT-5.6 Sol 10 10 10 🥇
Claude Sonnet 5 9.8 9.8 9.7 ⭐
Claude Opus 4.6 9.8 9.8 9.8 ⭐
Gemini 3.8 Flash 9.6 9.6 9.5 ⭐
Grok 4.6 9.6 9.5 9.5 ⭐
GLM 5.3 Flash 9.5 9.5 9.3 خوب
DeepSeek V4 Pro 9.5 9.5 9.4 خوب
GPT-5.6 Terra 9.5 9.5 9.5 خوب

مقایسه برای Repositoryهای بزرگ

برای Repository بزرگ، Context Window فقط یکی از معیارها است.

مدل همچنین باید بتواند ارتباط میان فایل‌ها، Dependencyها، Interfaceها و Call Chainها را درک کند.

مدل Context تقریبی Repository Understanding پیشنهاد
GPT-6 Astra 1.05M عالی 🥇
GPT-5.6 Sol 1.05M عالی 🥇
GPT-5.6 Terra 1.05M عالی ⭐
GPT-5.6 Luna 1.05M خوب پردازش اولیه
Gemini Flash ~1M عالی ⭐
DeepSeek V4 ~1M عالی ⭐
GLM Long Context عالی ⭐
Qwen 3.7 Max ~1M عالی ⭐
gpt-oss-120b 128K خوب Self-host

مقایسه Frontend و Screenshot-to-Code

برای کارهایی مانند:

  • Screenshot → HTML/CSS
  • Screenshot → React
  • Screenshot → Angular
  • UI → Responsive Design
  • تحلیل Layout
  • تولید Component
  • تشخیص عناصر تصویر
  • تبدیل Design به Code

مدل Multimodal مزیت مهمی دارد.

رتبه مدل Frontend Vision Agentic
1 Gemini 3.8 Flash 9.8 عالی 9.8
2 Gemini 3.7 Flash 9.7 عالی 9.7
3 Claude Sonnet 5 9.7 عالی 10
4 GPT-5.6 Sol 9.7 عالی 10
5 GPT-5.6 Terra 9.5 عالی 9.5
6 MiMo 2.5 8.8 خوب 8.7

مقایسه Backend و Microservice

برای:

  • ASP.NET Core
  • C#
  • Java
  • Spring
  • Node.js
  • Python
  • Go
  • REST API
  • gRPC
  • Microservices
  • SQL
  • Redis
  • RabbitMQ
  • Kafka
  • Docker
  • Kubernetes
رتبه مدل Backend Architecture Debugging Agentic
1 GPT-6 Astra 10 10 10 10
2 GPT-5.6 Sol 10 10 10 10
3 Claude Sonnet 5 9.8 9.7 9.8 10
4 Gemini 3.8 Flash 9.7 9.5 9.6 9.8
5 Grok 4.6 9.6 9.5 9.6 9.8
6 GPT-5.6 Terra 9.5 9.5 9.5 9.5
7 GLM 5.3 Flash 9.5 9.3 9.5 9.7
8 DeepSeek V4 Pro 9.5 9.4 9.5 9.6

مقایسه مدل‌های Open Weight و Self-hosted

در سازمان‌هایی که Source Code محرمانه است، Self-hosting می‌تواند اهمیت زیادی داشته باشد.

مدل Self-host Coding Agentic کاربرد
gpt-oss-120b بله 8.6 8.5 Private Coding Agent
GLM Open Models بله عالی عالی Coding / Reasoning
Mistral بله عالی عالی Enterprise Agent
Qwen بله عالی خوب تا عالی Coding / Long Context

مزایای Self-hosting:

  • حفظ Source Code در شبکه داخلی
  • Data Residency
  • کنترل کامل Infrastructure
  • عدم وابستگی به API خارجی
  • امکان استفاده در شبکه بدون اینترنت
  • امکان Fine-tuning یا Custom Deployment
  • کنترل هزینه در حجم بسیار بالا

مقایسه نسل‌های Gemini Flash

مدل Coding Agentic وضعیت پیشنهادی
Gemini 3.8 Flash 9.8 9.8 🥇 اولویت اول
Gemini 3.7 Flash 9.6 9.7 ⭐ بسیار مناسب
Gemini 3.6 Flash 9.0 9.1 نسل قبلی
Gemini 3.5 Flash 8.6 8.7 اولویت پایین‌تر

در صورت دسترسی یکسان:

Gemini 3.8 Flash
       ↓
Gemini 3.7 Flash
       ↓
Gemini 3.6 Flash
       ↓
Gemini 3.5 Flash

مقایسه خانواده GPT-5.6

ویژگی GPT-5.6 Sol GPT-5.6 Terra GPT-5.6 Luna
Input / 1M $4 $2 $0.20
Cached $0.40 $0.20 $0.02
Output / 1M $20 $12 $1.20
Context 1.05M 1.05M 1.05M
Max Output 128K 128K 128K
Coding 10 9.5 8.2
Agentic 10 9.5 8.6
کاربرد Hard Tasks Daily Professional Coding Cheap / High Volume

بنابراین:

مسئله بسیار پیچیده → Sol

Coding حرفه‌ای روزمره → Terra

Task ساده و پرتعداد → Luna

مقایسه Claude برای Coding

مدل Coding Agentic Debugging کاربرد
Claude Sonnet 5 9.8 10 9.8 Coding Agent روزمره
Claude Opus 4.6 9.6 9.7 9.8 Escalation / Hard Reasoning

در Coding Agent می‌توان از معماری زیر استفاده کرد:

Claude Sonnet
      │
      │ Failed / Very Hard
      ▼
Claude Opus

مقایسه DeepSeek

مدل Coding Agentic هزینه کاربرد
DeepSeek V4 Pro 9.5 9.6 پایین Task پیچیده
DeepSeek V4 Flash 0731 9.2 9.4 بسیار پایین Daily Agent / Sub-Agent

اگر هزینه مهم باشد:

V4 Flash

اگر قدرت بیشتر مهم باشد:

V4 Pro


مقایسه GLM

مدل Coding Agentic Price/Performance پیشنهاد
GLM 5.3 Flash 9.5 9.7 10 🥇
GLM-5.2 9.5 9.7 9.4 Long-Horizon

GLM 5.3 Flash به دلیل ترکیب:

  • سرعت
  • Coding
  • Agentic capability
  • هزینه پایین

یکی از جذاب‌ترین گزینه‌های Coding Agent است.


مقایسه مدل‌های مشاهده‌شده در Provider

در بررسی Provider مورد استفاده، مدل‌های زیر نیز در دسترس بودند:

  • DeepSeek V4 Flash 0731
  • GLM 5.3 Flash
  • GPT-5.6 Luna
  • MiMo 2.5
  • Solar Pro 4

برای Coding:

رتبه مدل Coding Agentic پیشنهاد
1 GLM 5.3 Flash 9.5 9.7 🥇
2 DeepSeek V4 Flash 0731 9.2 9.4 🥈
3 Solar Pro 4 8.8 8.7 🥉
4 MiMo 2.5 8.7 8.7 Multimodal
5 GPT-5.6 Luna 8.2 8.6 Sub-Agent

مقایسه مدل‌های مشاهده‌شده در Antigravity

مدل‌های بررسی‌شده:

  • Gemini 3.7 Flash
  • Gemini 3.6 Flash
  • Claude Opus 4.6
  • Claude Sonnet 4.6
  • Gemini 3.1 Pro
  • Gemini 3.5 Flash
  • gpt-oss-120b
رتبه مدل Coding Agentic بهترین کاربرد
1 Gemini 3.7 Flash 9.6 9.7 Coding روزمره سریع
2 Claude Opus 4.6 9.6 9.7 مسائل بسیار پیچیده
3 Claude Sonnet 4.6 9.5 9.6 Coding Agent
4 Gemini 3.1 Pro 9.5 9.6 Deep Reasoning
5 Gemini 3.6 Flash 9.0 9.1 Fast Coding
6 Gemini 3.5 Flash 8.6 8.7 Taskهای ساده‌تر
7 gpt-oss-120b 8.6 8.5 Self-hosting

انتخاب مدل بر اساس نوع Task

Task انتخاب اول انتخاب دوم انتخاب اقتصادی
Coding روزمره Gemini 3.8/3.7 Flash Claude Sonnet 5 GLM 5.3 Flash
Bug پیچیده GPT-5.6 Sol Claude Sonnet 5 DeepSeek V4 Pro
Architecture GPT-6 Astra GPT-5.6 Sol GPT-5.6 Terra
Refactoring Claude Sonnet 5 GPT-5.6 Sol GLM 5.3 Flash
Repository بزرگ GPT-5.6 Sol Gemini DeepSeek / GLM
Frontend Gemini Flash Claude Sonnet GLM
Backend GPT-5.6 Sol Claude Sonnet GLM / DeepSeek
Tool-heavy Agent Claude Sonnet 5 Grok 4.6 Grok Build
Sub-Agent GPT-5.6 Luna DeepSeek Flash GLM Flash
Self-host gpt-oss-120b GLM Qwen / Mistral

معماری پیشنهادی Multi-Model Coding Agent

استفاده از گران‌ترین مدل برای تمام درخواست‌ها از نظر اقتصادی بهینه نیست.

یک Orchestrator می‌تواند ابتدا Task را طبقه‌بندی کند.

                         USER
                           │
                           ▼
                  CODING ORCHESTRATOR
                           │
                           ▼
                   TASK CLASSIFIER
                           │
           ┌───────────────┼───────────────┐
           │               │               │
           ▼               ▼               ▼
         SIMPLE          MEDIUM           HARD
           │               │               │
           ▼               ▼               ▼
      GPT-5.6 Luna    GLM 5.3 Flash   Claude Sonnet 5
      DeepSeek Flash  Gemini Flash    GPT-5.6 Sol
      GLM Flash       GPT-5.6 Terra   Grok 4.6
           │               │               │
           └───────────────┼───────────────┘
                           │
                           ▼
                       FAILED?
                           │
                         YES
                           │
                           ▼
                      GPT-6 Astra

معماری پیشنهادی برای کاهش هزینه

به جای شروع Task با مدل گران:

Task
 │
 ▼
GLM 5.3 Flash
 │
 ├── Success ───────────────► DONE
 │
 ▼
DeepSeek V4 Flash
 │
 ├── Success ───────────────► DONE
 │
 ▼
Gemini Flash
 │
 ├── Success ───────────────► DONE
 │
 ▼
GPT-5.6 Terra
 │
 ├── Success ───────────────► DONE
 │
 ▼
Claude Sonnet 5
 │
 ├── Success ───────────────► DONE
 │
 ▼
GPT-5.6 Sol
 │
 ├── Success ───────────────► DONE
 │
 ▼
GPT-6 Astra

این روش Escalation Routing نامیده می‌شود.


معماری پیشنهادی Orchestrator + Worker

برای سیستم‌هایی مانند Coding Agent، استفاده از یک مدل به عنوان Orchestrator و مدل‌های ارزان به عنوان Worker می‌تواند مؤثر باشد.

                    ORCHESTRATOR
                   Claude / GPT / Gemini
                          │
          ┌───────────────┼───────────────┐
          │               │               │
          ▼               ▼               ▼
       WORKER 1         WORKER 2        WORKER 3
      GLM Flash      DeepSeek Flash    GPT Luna
          │               │               │
          ▼               ▼               ▼
       Coding           Testing        Analysis
          │               │               │
          └───────────────┼───────────────┘
                          │
                          ▼
                     CODE REVIEW
                          │
                          ▼
                    ORCHESTRATOR

معماری پیشنهادی برای Repository بزرگ

Repository
    │
    ▼
Repository Scanner
    │
    ├── Architecture Files
    ├── Source Files
    ├── Tests
    ├── Database
    ├── Config
    └── Documentation
             │
             ▼
        Cheap Models
     Luna / GLM / DeepSeek
             │
             ▼
        Summary / Index
             │
             ▼
       Powerful Model
    Claude / GPT / Gemini
             │
             ▼
          Solution

این معماری باعث می‌شود لازم نباشد تمام Source Code در هر Request به مدل گران ارسال شود.


آیا همیشه قوی‌ترین مدل بهتر است؟

خیر.

فرض کنید یک Task با مدل ارزان:

1M Input
100K Output

قابل انجام باشد.

ارسال همان Task به یک Frontier Model ممکن است چندین برابر هزینه ایجاد کند بدون اینکه نتیجه نهایی تفاوت مهمی داشته باشد.

بنابراین باید سه عامل را همزمان بررسی کرد:

  1. کیفیت
  2. زمان
  3. هزینه

در Coding Agent معیار مهم دیگری نیز وجود دارد:

تعداد Iteration لازم برای رسیدن به جواب صحیح

ممکن است مدل A از نظر Token ارزان‌تر باشد اما برای حل Task پنج بار تلاش کند.

در حالی که مدل B گران‌تر است اما Task را در اولین تلاش حل می‌کند.

بنابراین:

Real Cost =
Token Cost
+
Retries
+
Tool Calls
+
Execution Time
+
Developer Time

استراتژی پیشنهادی استفاده روزمره

برای Coding روزمره:

Gemini Flash / GLM 5.3 Flash

برای Feature پیچیده:

GPT-5.6 Terra / Claude Sonnet

برای Bug سخت:

Claude Sonnet 5 / GPT-5.6 Sol

برای Architecture:

GPT-5.6 Sol / GPT-6 Astra

برای Taskهای پرتعداد:

GPT-5.6 Luna / DeepSeek Flash / GLM Flash

برای Local:

gpt-oss-120b / Qwen / GLM / Mistral


نتیجه‌گیری نهایی

در سال 2026 یک مدل واحد را نمی‌توان برای تمام سناریوهای برنامه‌نویسی «بهترین» دانست.

حداکثر قدرت:

🏆 GPT-6 Astra

Software Engineering بسیار پیچیده:

🧠 GPT-5.6 Sol

Coding Agent حرفه‌ای:

🤖 Claude Sonnet 5

Coding Agent سریع:

⚡ Gemini 3.8 / 3.7 Flash

بهترین Price/Performance:

💰 GLM 5.3 Flash

Coding اقتصادی:

💵 DeepSeek V4 Flash 0731

تعادل قدرت و هزینه در OpenAI:

⚖️ GPT-5.6 Terra

Tool-heavy Agent:

🛠️ Grok 4.6

Agentic Software Engineering اقتصادی:

🚀 Grok Build 0.1

Sub-Agent و پردازش پرتعداد:

💵 GPT-5.6 Luna

Self-hosting:

🔓 gpt-oss-120b / GLM / Qwen / Mistral

اما برای سیستم‌های حرفه‌ای، راهکار مناسب‌تر استفاده از Multi-Model Architecture است.

در چنین معماری:

Cheap Model
     ↓
Medium Model
     ↓
Strong Model
     ↓
Frontier Model

تنها Taskهایی که مدل قبلی قادر به حل آنها نیست به مدل گران‌تر منتقل می‌شوند.

این معماری می‌تواند:

  • هزینه API را کاهش دهد.
  • سرعت Coding Agent را افزایش دهد.
  • Parallel Agentها را اقتصادی کند.
  • استفاده از Contextهای بسیار بزرگ را مدیریت کند.
  • از Frontier Model فقط در جایی که واقعاً لازم است استفاده کند.

در نتیجه، برای ساخت Coding Agent حرفه‌ای در سال 2026، انتخاب معماری Routing به اندازه انتخاب خود مدل اهمیت دارد.


رده:هوش مصنوعی رده:برنامه‌نویسی رده:مدل‌های زبانی بزرگ رده:LLM رده:Agentic AI رده:Coding Agent رده:Software Engineering رده:Artificial Intelligence رده:OpenAI رده:Claude رده:Gemini رده:DeepSeek رده:GLM رده:Grok رده:Qwen رده:Mistral