LLM Agentic Coding Model: Difference between revisions

From wiki karavi
Jump to navigation Jump to search
No edit summary
No edit summary
Line 1: Line 1:
== جدول جامع مقایسه مدل‌ها ==
= مقایسه جامع مدل‌های هوش مصنوعی برای برنامه‌نویسی و Agentic Coding در سال 2026 =


جدول زیر مدل‌های مهم مناسب برای '''Programming، Software Engineering و Agentic Coding''' را مقایسه می‌کند.
مدل‌های هوش مصنوعی در سال 2026 از ابزارهای ساده Code Completion به سیستم‌هایی تبدیل شده‌اند که می‌توانند بخش قابل توجهی از فرایند مهندسی نرم‌افزار را به‌صورت Agentic انجام دهند.


مدل‌ها بر اساس '''تاریخ عرضه از جدیدترین به قدیمی‌ترین''' مرتب شده‌اند.
یک Coding Agent مدرن می‌تواند:
 
* Repository را بررسی کند.
* ساختار پروژه را درک کند.
* چندین فایل را ویرایش کند.
* Terminal و Shell اجرا کند.
* Test اجرا کند.
* خطا را پیدا و Debug کند.
* Refactoring انجام دهد.
* از Tool Calling و MCP استفاده کند.
* نتیجه اجرای برنامه را بررسی کند.
* پس از شکست، راه‌حل دیگری را امتحان کند.
 
بنابراین برای انتخاب مدل مناسب برنامه‌نویسی، صرفاً قدرت تولید Code کافی نیست.
 
در این مقاله مدل‌ها از نظر موارد زیر بررسی می‌شوند:
 
* Coding
* Agentic Coding
* Software Engineering
* Debugging
* Refactoring
* Repository Understanding
* Tool Calling
* Long Context
* Multimodal Coding
* سرعت
* قیمت API
* Price/Performance
* Self-hosting
 
'''آخرین به‌روزرسانی: 4 سپتامبر 2026'''
 
----
 
= خلاصه سریع =
 
{| class="wikitable"
! کاربرد
! مدل پیشنهادی
! توضیح
|-
| 🏆 حداکثر قدرت
| '''GPT-6 Astra'''
| سخت‌ترین مسائل End-to-End
|-
| 🧠 Coding بسیار پیچیده
| '''GPT-5.6 Sol'''
| معماری، Debugging و Software Engineering پیچیده
|-
| 🤖 Coding Agent حرفه‌ای
| '''Claude Sonnet 5'''
| Agentic Software Engineering و Tool Use
|-
| ⚡ Coding Agent سریع
| '''Gemini 3.8 Flash / Gemini 3.7 Flash'''
| سرعت بالا و مناسب Agent
|-
| 💰 بهترین Price/Performance
| '''GLM 5.3 Flash'''
| Coding و Agentic با هزینه بسیار پایین
|-
| 💵 Coding اقتصادی
| '''DeepSeek V4 Flash 0731'''
| مناسب Agent و پردازش پرتعداد
|-
| ⚖️ OpenAI متعادل
| '''GPT-5.6 Terra'''
| تعادل قدرت و هزینه
|-
| 🛠️ Coding + Tool Use
| '''Grok 4.6'''
| Agentic Workflow و Tool Calling
|-
| 🚀 Agentic Software Engineering
| '''Grok Build 0.1'''
| مدل تخصصی Coding Agent
|-
| 📚 Repository بزرگ
| '''GPT-5.6 / Gemini / DeepSeek / Qwen / GLM'''
| Long Context
|-
| 🖼️ Screenshot → Code
| '''Gemini Flash / Claude / GPT-5.6'''
| Multimodal Coding
|-
| 🔓 Self-hosting
| '''gpt-oss-120b / GLM / Mistral / Qwen'''
| اجرای Local و Private
|}
 
----
 
= جدول جامع مقایسه مدل‌ها =
 
جدول زیر مدل‌ها را بر اساس '''تاریخ ارائه از جدیدترین به قدیمی‌ترین''' مرتب می‌کند.


قیمت‌ها به ازای '''یک میلیون Token''' هستند.
قیمت‌ها به ازای '''یک میلیون Token''' هستند.
Line 12: Line 107:
! شرکت
! شرکت
! Input
! Input
! Cached Input
! Cached
! Output
! Output
! Context
! Context
Line 22: Line 117:
|-
|-


| '''2026-09-04'''
| 2026-09-04
| '''GPT-6 Astra''' 🆕
| '''GPT-6 Astra'''
| '''OpenAI'''
| OpenAI
| $10
| $10
| $1
| $1
Line 32: Line 127:
| '''10/10'''
| '''10/10'''
| '''10/10'''
| '''10/10'''
| 6.5/10
| 6.5
| سخت‌ترین مسائل End-to-End، Coding، Computer Use و Software Engineering
| سخت‌ترین End-to-End Workloads
|-
|-


| '''2026-09-02'''
| 2026-09-02
| '''Gemini 3.8 Flash''' 🆕
| '''Gemini 3.8 Flash'''
| '''Google DeepMind'''
| Google DeepMind
| متغیر
| متغیر
| متغیر
| متغیر
Line 44: Line 139:
| Long Context
| Long Context
| -
| -
| '''9.8/10'''
| '''9.8'''
| '''9.8/10'''
| '''9.8'''
| '''9.7/10'''
| '''9.7'''
| Coding، Agentic Workflows، Tool Use و Multimodal
| Coding، Agents و Multimodal
|-
|-


| '''2026-08-26'''
| 2026-08
| '''GLM 5.3 Flash''' 🔥
| '''GLM 5.3 Flash'''
| '''Z.ai / Zhipu AI'''
| Z.ai / Zhipu AI
| $0.075*
| بسیار ارزان
| $0.015*
| بسیار ارزان
| $0.25*
| بسیار ارزان
| Long Context
| Long Context
| -
| -
| '''9.5/10'''
| '''9.5'''
| '''9.7/10'''
| '''9.7'''
| '''10/10'''
| '''10'''
| Coding Agent سریع و بسیار اقتصادی
| Coding Agent اقتصادی
|-
|-


| '''2026-08-14'''
| 2026-08
| '''Gemini 3.7 Flash'''
| '''Gemini 3.7 Flash'''
| '''Google DeepMind'''
| Google DeepMind
| $0.75*
| Introductory
| -
| -
| $3.75*
| Introductory
| ~1M
| ~1M
| -
| -
| '''9.6/10'''
| '''9.6'''
| '''9.7/10'''
| '''9.7'''
| '''9.8/10'''
| '''9.8'''
| Coding Agent، Web Development و Multimodal Coding
| Coding Agent سریع
|-
|-


| '''2026-08-13'''
| 2026-08
| '''DeepSeek V4 Pro'''
| '''DeepSeek V4 Pro'''
| '''DeepSeek'''
| DeepSeek
| $0.66–$1.32
| Tiered
| $0.022–$0.044
| Tiered
| $1.98–$3.96
| Tiered
| ~1M
| ~1M
| تا 384K
| تا 384K
| '''9.5/10'''
| '''9.5'''
| '''9.6/10'''
| '''9.6'''
| '''9.7/10'''
| '''9.7'''
| Agentic Coding و Software Engineering
| Agentic Coding
|-
|-


| '''2026-08-12'''
| 2026-08
| '''Grok 4.6'''
| '''Grok 4.6'''
| '''xAI'''
| xAI
| $2
| $2*
| $0.50
| $0.50*
| $6
| $6*
| 500K
| 500K
| -
| -
| '''9.6/10'''
| '''9.6'''
| '''9.8/10'''
| '''9.8'''
| '''9.4/10'''
| '''9.4'''
| Long-running Agent، Coding، Reasoning و Tool Use
| Coding + Tool Use
|-
|-


| '''2026-07-31'''
| 2026-07-31
| '''DeepSeek V4 Flash 0731''' 💰
| '''DeepSeek V4 Flash 0731'''
| '''DeepSeek'''
| DeepSeek
| $0.22–$0.44
| $0.22–0.44*
| $0.007–$0.014
| $0.007–0.014*
| $0.66–$1.32
| $0.66–1.32*
| ~1M
| ~1M
| تا 384K
| تا 384K
| 9.2/10
| '''9.2'''
| '''9.4/10'''
| '''9.4'''
| '''10/10'''
| '''10'''
| Coding اقتصادی، Agent و Sub-Agent
| Coding اقتصادی
|-
|-


| '''2026-07-09'''
| 2026-07
| '''GPT-5.6 Sol'''
| '''GPT-5.6 Sol'''
| '''OpenAI'''
| OpenAI
| $4
| $4
| $0.40
| $0.40
Line 128: Line 223:
| 1.05M
| 1.05M
| 128K
| 128K
| '''10/10'''
| '''10'''
| '''10/10'''
| '''10'''
| 8/10
| 8
| Coding و Software Engineering بسیار پیچیده
| Complex Professional Coding
|-
|-


| '''2026-07-09'''
| 2026-07
| '''GPT-5.6 Terra'''
| '''GPT-5.6 Terra'''
| '''OpenAI'''
| OpenAI
| $2
| $2
| $0.20
| $0.20
Line 142: Line 237:
| 1.05M
| 1.05M
| 128K
| 128K
| '''9.5/10'''
| '''9.5'''
| '''9.5/10'''
| '''9.5'''
| '''9.2/10'''
| '''9.2'''
| Coding حرفه‌ای با تعادل قدرت و هزینه
| تعادل قدرت و قیمت
|-
|-


| '''2026-07-09'''
| 2026-07
| '''GPT-5.6 Luna'''
| '''GPT-5.6 Luna'''
| '''OpenAI'''
| OpenAI
| '''$0.20'''
| $0.20
| '''$0.02'''
| $0.02
| '''$1.20'''
| $1.20
| 1.05M
| 1.05M
| 128K
| 128K
| 8.2/10
| 8.2
| 8.6/10
| 8.6
| '''10/10'''
| '''10'''
| Sub-Agent، Coding ارزان و Taskهای پرتعداد
| High-volume / Sub-Agent
|-
|-


| '''2026-06-30'''
| 2026-06
| '''Claude Sonnet 5'''
| '''Claude Sonnet 5'''
| '''Anthropic'''
| Anthropic
| $2
| $2
| $0.20**
| متغیر
| $10
| $10
| ~1M
| Long Context
| -
| '''9.8'''
| '''10'''
| '''9.3'''
| Professional Coding Agent
|-
 
| 2026
| '''Claude Opus 4.6'''
| Anthropic
| Premium
| متغیر
| Premium
| Long Context
| -
| -
| '''9.8/10'''
| '''9.6'''
| '''10/10'''
| '''9.7'''
| '''9.3/10'''
| 7.5
| Coding Agent حرفه‌ای، Terminal، Tool Use و Refactoring
| Debugging و Reasoning بسیار پیچیده
|-
|-


| '''2026-06-13'''
| 2026
| '''GLM-5.2'''
| '''GLM-5.2'''
| '''Z.ai / Zhipu AI'''
| Z.ai / Zhipu AI
| $1.40
| Provider-based
| $0.26
| Provider-based
| $4.40
| Provider-based
| ~1M
| ~1M
| -
| -
| '''9.5/10'''
| '''9.5'''
| '''9.7/10'''
| '''9.7'''
| 9.4/10
| 9.4
| Long-Horizon Coding Agent
| Long-Horizon Coding
|-
|-


| '''2026-05-29'''
| 2026
| '''Grok Build 0.1'''
| '''Grok Build 0.1'''
| '''xAI'''
| xAI
| $1
| $1*
| $0.20
| $0.20*
| $2
| $2*
| 256K
| 256K
| -
| -
| 9.3/10
| 9.3
| '''9.5/10'''
| '''9.5'''
| '''9.8/10'''
| '''9.8'''
| Agentic Software Engineering، Debugging و MCP
| Agentic Software Engineering
|-
|-


| '''2026-05-22'''
| 2026
| '''Mistral Medium 3.5'''
| '''Mistral Medium 3.5'''
| '''Mistral AI'''
| Mistral AI
| $1.50
| $1.50
| -
| -
Line 212: Line 321:
| 256K
| 256K
| -
| -
| 9.2/10
| 9.2
| '''9.5/10'''
| '''9.5'''
| 9.1/10
| 9.1
| Long-Horizon Coding Agent و Open Weight
| Coding و Agent
|-
 
| 2026
| '''Gemini 3.6 Flash'''
| Google DeepMind
| -
| -
| -
| ~1M
| -
| 9.0
| 9.1
| 8.8
| Coding سریع
|-
|-


| '''2026-05-20'''
| 2026
| '''Gemini 3.5 Flash'''
| '''Gemini 3.5 Flash'''
| '''Google DeepMind'''
| Google DeepMind
| -
| -
| -
| -
| Long Context
| -
| -
| 8.6
| 8.7
| 8.5
| Coding و Multimodal
|-
| 2026
| '''Gemini 3.1 Pro'''
| Google DeepMind
| Tiered
| Tiered
| Tiered
| ~1M
| -
| -
| '''9.5'''
| '''9.6'''
| 8.8
| Deep Reasoning
|-
| 2026
| '''Qwen 3.7 Max'''
| Alibaba Cloud / Qwen
| Region-based
| Region-based
| Region-based
| ~1M
| ~131K
| '''9.4'''
| '''9.5'''
| 9.3
| Long Context
| Long Context
|-
| 2026
| '''Qwen3-Coder Plus'''
| Alibaba Cloud / Qwen
| Tiered
| -
| Tiered
| ~1M
| ~65K
| '''9.2'''
| 8.7
| 9.2
| Coding تخصصی
|-
| 2026
| '''MiMo 2.5'''
| Xiaomi / MiMo
| Provider-based
| -
| Provider-based
| -
| -
| 8.7
| 8.7
| 9.2
| Coding + Multimodal
|-
| 2026
| '''Solar Pro 4'''
| Upstage
| Provider-based
| -
| Provider-based
| -
| -
| -
| 8.6/10
| 8.8
| 8.7/10
| 8.7
| 8.5/10
| 8.8
| Coding سریع و Agentic Workflows
| General Coding
|-
|-


| '''2025-08-05'''
| 2025-08-05
| '''gpt-oss-120b'''
| '''gpt-oss-120b'''
| '''OpenAI'''
| OpenAI
| Self-host
| Self-host
| -
| -
Line 240: Line 433:
| 128K
| 128K
| -
| -
| 8.6/10
| 8.6
| 8.5/10
| 8.5
| '''9.5/10'''
| '''9.5'''
| Local AI، Private Coding Agent و Self-hosting
| Self-hosted Coding
|}
|}


<small>
'''نکته:'''
'''توضیحات:'''
 
* امتیازهای Coding، Agentic و Price/Performance ارزیابی تحلیلی این مقاله هستند و Benchmark رسمی شرکت‌های سازنده نیستند.
* قیمت API ممکن است بر اساس Provider، Region، Context Length، Peak/Off-Peak و Promotional Pricing تغییر کند.
* علامت «-» به معنی نبود اطلاعات قطعی قابل مقایسه در این جدول است.
* برای مدل‌هایی که تاریخ دقیق نسخه مورد استفاده Provider مشخص نیست، سال یا ماه انتشار درج شده است.
 
----
 
= رتبه‌بندی کلی برای برنامه‌نویسی =
 
{| class="wikitable sortable"
! رتبه
! مدل
! Coding
! Agentic
! مناسب برای
|-
| 1
| '''GPT-6 Astra'''
| 10
| 10
| حداکثر قدرت
|-
| 2
| '''GPT-5.6 Sol'''
| 10
| 10
| Software Engineering پیچیده
|-
| 3
| '''Claude Sonnet 5'''
| 9.8
| 10
| Coding Agent
|-
| 4
| '''Gemini 3.8 Flash'''
| 9.8
| 9.8
| Agent سریع
|-
| 5
| '''Grok 4.6'''
| 9.6
| 9.8
| Coding + Tools
|-
| 6
| '''Gemini 3.7 Flash'''
| 9.6
| 9.7
| Coding سریع
|-
| 7
| '''Claude Opus 4.6'''
| 9.6
| 9.7
| مسائل سخت
|-
| 8
| '''GLM 5.3 Flash'''
| 9.5
| 9.7
| Price/Performance
|-
| 9
| '''DeepSeek V4 Pro'''
| 9.5
| 9.6
| Agentic Coding
|-
| 10
| '''Gemini 3.1 Pro'''
| 9.5
| 9.6
| Deep Reasoning
|-
| 11
| '''GPT-5.6 Terra'''
| 9.5
| 9.5
| Balanced Coding
|-
| 12
| '''Qwen 3.7 Max'''
| 9.4
| 9.5
| Long Context
|-
| 13
| '''Grok Build 0.1'''
| 9.3
| 9.5
| Agentic Software Engineering
|-
| 14
| '''DeepSeek V4 Flash'''
| 9.2
| 9.4
| Low-cost Coding
|-
| 15
| '''Mistral Medium 3.5'''
| 9.2
| 9.5
| Open / Agentic
|-
| 16
| '''Qwen3-Coder Plus'''
| 9.2
| 8.7
| Coding
|-
| 17
| '''Gemini 3.6 Flash'''
| 9.0
| 9.1
| Fast Coding
|-
| 18
| '''Solar Pro 4'''
| 8.8
| 8.7
| General Coding
|-
| 19
| '''MiMo 2.5'''
| 8.7
| 8.7
| Coding + Image
|-
| 20
| '''gpt-oss-120b'''
| 8.6
| 8.5
| Self-host
|-
| 21
| '''Gemini 3.5 Flash'''
| 8.6
| 8.7
| Fast Coding
|-
| 22
| '''GPT-5.6 Luna'''
| 8.2
| 8.6
| Cheap Sub-Agent
|}
 
----
 
= مقایسه مدل‌های اقتصادی برای Coding =
 
این جدول برای زمانی مهم است که Coding Agent تعداد زیادی Token مصرف می‌کند.
 
{| class="wikitable sortable"
! مدل
! Coding
! Agentic
! هزینه
! Price/Performance
! پیشنهاد
|-
| '''GLM 5.3 Flash'''
| 9.5
| 9.7
| بسیار پایین
| '''10/10'''
| 🥇
|-
| '''DeepSeek V4 Flash 0731'''
| 9.2
| 9.4
| بسیار پایین
| '''10/10'''
| 🥇
|-
| '''GPT-5.6 Luna'''
| 8.2
| 8.6
| بسیار پایین
| '''10/10'''
| Sub-Agent
|-
| '''Grok Build 0.1'''
| 9.3
| 9.5
| پایین
| '''9.8/10'''
| Coding Agent
|-
| '''Gemini 3.7 Flash'''
| 9.6
| 9.7
| پایین/متوسط
| '''9.8/10'''
| Agent سریع
|-
| '''GPT-5.6 Terra'''
| 9.5
| 9.5
| متوسط
| 9.2/10
| Coding حرفه‌ای
|-
| '''Claude Sonnet 5'''
| 9.8
| 10
| متوسط
| 9.3/10
| Task سخت
|}
 
----
 
= مقایسه برای Agentic Coding =
 
Agentic Coding با Code Generation معمولی متفاوت است.
 
در Agentic Coding مدل باید بتواند:
 
* Task را برنامه‌ریزی کند.
* Repository را جستجو کند.
* فایل مناسب را پیدا کند.
* Terminal اجرا کند.
* Code را تغییر دهد.
* Test اجرا کند.
* خطا را تحلیل کند.
* مجدداً Code را اصلاح کند.
* Toolهای مختلف را هماهنگ کند.
 
{| class="wikitable sortable"
! مدل
! Agentic
! Tool Use
! Repository
! Long-running Task
! پیشنهاد
|-
| '''GPT-6 Astra'''
| 10
| عالی
| عالی
| عالی
| 🥇
|-
| '''Claude Sonnet 5'''
| 10
| عالی
| عالی
| عالی
| 🥇
|-
| '''GPT-5.6 Sol'''
| 10
| عالی
| عالی
| عالی
| 🥇
|-
| '''Gemini 3.8 Flash'''
| 9.8
| عالی
| عالی
| عالی
| ⭐
|-
| '''Grok 4.6'''
| 9.8
| عالی
| عالی
| عالی
| ⭐
|-
| '''GLM 5.3 Flash'''
| 9.7
| عالی
| عالی
| عالی
| ⭐
|-
| '''Gemini 3.7 Flash'''
| 9.7
| عالی
| عالی
| عالی
| ⭐
|-
| '''Claude Opus 4.6'''
| 9.7
| عالی
| عالی
| عالی
| Task بسیار سخت
|-
| '''DeepSeek V4 Pro'''
| 9.6
| عالی
| عالی
| عالی
| ⭐
|-
| '''Grok Build'''
| 9.5
| عالی
| خوب
| عالی
| ⭐
|-
| '''GPT-5.6 Terra'''
| 9.5
| عالی
| عالی
| عالی
| ⭐
|}
 
----
 
= مقایسه برای Debugging و Refactoring =
 
{| class="wikitable sortable"
! مدل
! Debugging
! Refactoring
! Architecture
! پیشنهاد
|-
| '''GPT-6 Astra'''
| 10
| 10
| 10
| 🥇
|-
| '''GPT-5.6 Sol'''
| 10
| 10
| 10
| 🥇
|-
| '''Claude Sonnet 5'''
| 9.8
| 9.8
| 9.7
| ⭐
|-
| '''Claude Opus 4.6'''
| 9.8
| 9.8
| 9.8
| ⭐
|-
| '''Gemini 3.8 Flash'''
| 9.6
| 9.6
| 9.5
| ⭐
|-
| '''Grok 4.6'''
| 9.6
| 9.5
| 9.5
| ⭐
|-
| '''GLM 5.3 Flash'''
| 9.5
| 9.5
| 9.3
| خوب
|-
| '''DeepSeek V4 Pro'''
| 9.5
| 9.5
| 9.4
| خوب
|-
| '''GPT-5.6 Terra'''
| 9.5
| 9.5
| 9.5
| خوب
|}
 
----
 
= مقایسه برای Repositoryهای بزرگ =
 
برای Repository بزرگ، Context Window فقط یکی از معیارها است.
 
مدل همچنین باید بتواند ارتباط میان فایل‌ها، Dependencyها، Interfaceها و Call Chainها را درک کند.
 
{| class="wikitable sortable"
! مدل
! Context تقریبی
! Repository Understanding
! پیشنهاد
|-
| '''GPT-6 Astra'''
| 1.05M
| عالی
| 🥇
|-
| '''GPT-5.6 Sol'''
| 1.05M
| عالی
| 🥇
|-
| '''GPT-5.6 Terra'''
| 1.05M
| عالی
| ⭐
|-
| '''GPT-5.6 Luna'''
| 1.05M
| خوب
| پردازش اولیه
|-
| '''Gemini Flash'''
| ~1M
| عالی
| ⭐
|-
| '''DeepSeek V4'''
| ~1M
| عالی
| ⭐
|-
| '''GLM'''
| Long Context
| عالی
| ⭐
|-
| '''Qwen 3.7 Max'''
| ~1M
| عالی
| ⭐
|-
| '''gpt-oss-120b'''
| 128K
| خوب
| Self-host
|}
 
----
 
= مقایسه Frontend و Screenshot-to-Code =
 
برای کارهایی مانند:
 
* Screenshot → HTML/CSS
* Screenshot → React
* Screenshot → Angular
* UI → Responsive Design
* تحلیل Layout
* تولید Component
* تشخیص عناصر تصویر
* تبدیل Design به Code
 
مدل Multimodal مزیت مهمی دارد.
 
{| class="wikitable sortable"
! رتبه
! مدل
! Frontend
! Vision
! Agentic
|-
| 1
| '''Gemini 3.8 Flash'''
| 9.8
| عالی
| 9.8
|-
| 2
| '''Gemini 3.7 Flash'''
| 9.7
| عالی
| 9.7
|-
| 3
| '''Claude Sonnet 5'''
| 9.7
| عالی
| 10
|-
| 4
| '''GPT-5.6 Sol'''
| 9.7
| عالی
| 10
|-
| 5
| '''GPT-5.6 Terra'''
| 9.5
| عالی
| 9.5
|-
| 6
| '''MiMo 2.5'''
| 8.8
| خوب
| 8.7
|}
 
----
 
= مقایسه Backend و Microservice =
 
برای:
 
* ASP.NET Core
* C#
* Java
* Spring
* Node.js
* Python
* Go
* REST API
* gRPC
* Microservices
* SQL
* Redis
* RabbitMQ
* Kafka
* Docker
* Kubernetes
 
{| class="wikitable sortable"
! رتبه
! مدل
! Backend
! Architecture
! Debugging
! Agentic
|-
| 1
| '''GPT-6 Astra'''
| 10
| 10
| 10
| 10
|-
| 2
| '''GPT-5.6 Sol'''
| 10
| 10
| 10
| 10
|-
| 3
| '''Claude Sonnet 5'''
| 9.8
| 9.7
| 9.8
| 10
|-
| 4
| '''Gemini 3.8 Flash'''
| 9.7
| 9.5
| 9.6
| 9.8
|-
| 5
| '''Grok 4.6'''
| 9.6
| 9.5
| 9.6
| 9.8
|-
| 6
| '''GPT-5.6 Terra'''
| 9.5
| 9.5
| 9.5
| 9.5
|-
| 7
| '''GLM 5.3 Flash'''
| 9.5
| 9.3
| 9.5
| 9.7
|-
| 8
| '''DeepSeek V4 Pro'''
| 9.5
| 9.4
| 9.5
| 9.6
|}
 
----
 
= مقایسه مدل‌های Open Weight و Self-hosted =
 
در سازمان‌هایی که Source Code محرمانه است، Self-hosting می‌تواند اهمیت زیادی داشته باشد.
 
{| class="wikitable sortable"
! مدل
! Self-host
! Coding
! Agentic
! کاربرد
|-
| '''gpt-oss-120b'''
| '''بله'''
| 8.6
| 8.5
| Private Coding Agent
|-
| '''GLM Open Models'''
| '''بله'''
| عالی
| عالی
| Coding / Reasoning
|-
| '''Mistral'''
| '''بله'''
| عالی
| عالی
| Enterprise Agent
|-
| '''Qwen'''
| '''بله'''
| عالی
| خوب تا عالی
| Coding / Long Context
|}
 
مزایای Self-hosting:
 
* حفظ Source Code در شبکه داخلی
* Data Residency
* کنترل کامل Infrastructure
* عدم وابستگی به API خارجی
* امکان استفاده در شبکه بدون اینترنت
* امکان Fine-tuning یا Custom Deployment
* کنترل هزینه در حجم بسیار بالا
 
----
 
= مقایسه نسل‌های Gemini Flash =
 
{| class="wikitable"
! مدل
! Coding
! Agentic
! وضعیت پیشنهادی
|-
| '''Gemini 3.8 Flash'''
| '''9.8'''
| '''9.8'''
| 🥇 اولویت اول
|-
| '''Gemini 3.7 Flash'''
| '''9.6'''
| '''9.7'''
| ⭐ بسیار مناسب
|-
| '''Gemini 3.6 Flash'''
| 9.0
| 9.1
| نسل قبلی
|-
| '''Gemini 3.5 Flash'''
| 8.6
| 8.7
| اولویت پایین‌تر
|}
 
در صورت دسترسی یکسان:
 
<pre>
Gemini 3.8 Flash
      ↓
Gemini 3.7 Flash
      ↓
Gemini 3.6 Flash
      ↓
Gemini 3.5 Flash
</pre>
 
----
 
= مقایسه خانواده GPT-5.6 =
 
{| class="wikitable"
! ویژگی
! GPT-5.6 Sol
! GPT-5.6 Terra
! GPT-5.6 Luna
|-
| Input / 1M
| $4
| $2
| $0.20
|-
| Cached
| $0.40
| $0.20
| $0.02
|-
| Output / 1M
| $20
| $12
| $1.20
|-
| Context
| 1.05M
| 1.05M
| 1.05M
|-
| Max Output
| 128K
| 128K
| 128K
|-
| Coding
| '''10'''
| '''9.5'''
| 8.2
|-
| Agentic
| '''10'''
| '''9.5'''
| 8.6
|-
| کاربرد
| Hard Tasks
| Daily Professional Coding
| Cheap / High Volume
|}
 
بنابراین:
 
<pre>
مسئله بسیار پیچیده → Sol
 
Coding حرفه‌ای روزمره → Terra
 
Task ساده و پرتعداد → Luna
</pre>
 
----
 
= مقایسه Claude برای Coding =
 
{| class="wikitable"
! مدل
! Coding
! Agentic
! Debugging
! کاربرد
|-
| '''Claude Sonnet 5'''
| 9.8
| '''10'''
| 9.8
| Coding Agent روزمره
|-
| '''Claude Opus 4.6'''
| 9.6
| 9.7
| '''9.8'''
| Escalation / Hard Reasoning
|}
 
در Coding Agent می‌توان از معماری زیر استفاده کرد:
 
<pre>
Claude Sonnet
      │
      │ Failed / Very Hard
      ▼
Claude Opus
</pre>
 
----
 
= مقایسه DeepSeek =
 
{| class="wikitable"
! مدل
! Coding
! Agentic
! هزینه
! کاربرد
|-
| '''DeepSeek V4 Pro'''
| '''9.5'''
| '''9.6'''
| پایین
| Task پیچیده
|-
| '''DeepSeek V4 Flash 0731'''
| 9.2
| 9.4
| '''بسیار پایین'''
| Daily Agent / Sub-Agent
|}
 
اگر هزینه مهم باشد:
 
'''V4 Flash'''
 
اگر قدرت بیشتر مهم باشد:
 
'''V4 Pro'''
 
----
 
= مقایسه GLM =
 
{| class="wikitable"
! مدل
! Coding
! Agentic
! Price/Performance
! پیشنهاد
|-
| '''GLM 5.3 Flash'''
| 9.5
| 9.7
| '''10'''
| 🥇
|-
| '''GLM-5.2'''
| 9.5
| 9.7
| 9.4
| Long-Horizon
|}
 
GLM 5.3 Flash به دلیل ترکیب:
 
* سرعت
* Coding
* Agentic capability
* هزینه پایین
 
یکی از جذاب‌ترین گزینه‌های Coding Agent است.
 
----
 
= مقایسه مدل‌های مشاهده‌شده در Provider =
 
در بررسی Provider مورد استفاده، مدل‌های زیر نیز در دسترس بودند:
 
* DeepSeek V4 Flash 0731
* GLM 5.3 Flash
* GPT-5.6 Luna
* MiMo 2.5
* Solar Pro 4
 
برای Coding:
 
{| class="wikitable"
! رتبه
! مدل
! Coding
! Agentic
! پیشنهاد
|-
| 1
| '''GLM 5.3 Flash'''
| 9.5
| 9.7
| 🥇
|-
| 2
| '''DeepSeek V4 Flash 0731'''
| 9.2
| 9.4
| 🥈
|-
| 3
| '''Solar Pro 4'''
| 8.8
| 8.7
| 🥉
|-
| 4
| '''MiMo 2.5'''
| 8.7
| 8.7
| Multimodal
|-
| 5
| '''GPT-5.6 Luna'''
| 8.2
| 8.6
| Sub-Agent
|}
 
----
 
= مقایسه مدل‌های مشاهده‌شده در Antigravity =
 
مدل‌های بررسی‌شده:
 
* Gemini 3.7 Flash
* Gemini 3.6 Flash
* Claude Opus 4.6
* Claude Sonnet 4.6
* Gemini 3.1 Pro
* Gemini 3.5 Flash
* gpt-oss-120b
 
{| class="wikitable sortable"
! رتبه
! مدل
! Coding
! Agentic
! بهترین کاربرد
|-
| 1
| '''Gemini 3.7 Flash'''
| 9.6
| 9.7
| Coding روزمره سریع
|-
| 2
| '''Claude Opus 4.6'''
| 9.6
| 9.7
| مسائل بسیار پیچیده
|-
| 3
| '''Claude Sonnet 4.6'''
| 9.5
| 9.6
| Coding Agent
|-
| 4
| '''Gemini 3.1 Pro'''
| 9.5
| 9.6
| Deep Reasoning
|-
| 5
| '''Gemini 3.6 Flash'''
| 9.0
| 9.1
| Fast Coding
|-
| 6
| '''Gemini 3.5 Flash'''
| 8.6
| 8.7
| Taskهای ساده‌تر
|-
| 7
| '''gpt-oss-120b'''
| 8.6
| 8.5
| Self-hosting
|}
 
----
 
= انتخاب مدل بر اساس نوع Task =
 
{| class="wikitable sortable"
! Task
! انتخاب اول
! انتخاب دوم
! انتخاب اقتصادی
|-
| Coding روزمره
| Gemini 3.8/3.7 Flash
| Claude Sonnet 5
| GLM 5.3 Flash
|-
| Bug پیچیده
| GPT-5.6 Sol
| Claude Sonnet 5
| DeepSeek V4 Pro
|-
| Architecture
| GPT-6 Astra
| GPT-5.6 Sol
| GPT-5.6 Terra
|-
| Refactoring
| Claude Sonnet 5
| GPT-5.6 Sol
| GLM 5.3 Flash
|-
| Repository بزرگ
| GPT-5.6 Sol
| Gemini
| DeepSeek / GLM
|-
| Frontend
| Gemini Flash
| Claude Sonnet
| GLM
|-
| Backend
| GPT-5.6 Sol
| Claude Sonnet
| GLM / DeepSeek
|-
| Tool-heavy Agent
| Claude Sonnet 5
| Grok 4.6
| Grok Build
|-
| Sub-Agent
| GPT-5.6 Luna
| DeepSeek Flash
| GLM Flash
|-
| Self-host
| gpt-oss-120b
| GLM
| Qwen / Mistral
|}
 
----
 
= معماری پیشنهادی Multi-Model Coding Agent =
 
استفاده از گران‌ترین مدل برای تمام درخواست‌ها از نظر اقتصادی بهینه نیست.
 
یک Orchestrator می‌تواند ابتدا Task را طبقه‌بندی کند.
 
<pre>
                        USER
                          │
                          ▼
                  CODING ORCHESTRATOR
                          │
                          ▼
                  TASK CLASSIFIER
                          │
          ┌───────────────┼───────────────┐
          │              │              │
          ▼              ▼              ▼
        SIMPLE          MEDIUM          HARD
          │              │              │
          ▼              ▼              ▼
      GPT-5.6 Luna    GLM 5.3 Flash  Claude Sonnet 5
      DeepSeek Flash  Gemini Flash    GPT-5.6 Sol
      GLM Flash      GPT-5.6 Terra  Grok 4.6
          │              │              │
          └───────────────┼───────────────┘
                          │
                          ▼
                      FAILED?
                          │
                        YES
                          │
                          ▼
                      GPT-6 Astra
</pre>
 
----
 
= معماری پیشنهادی برای کاهش هزینه =
 
به جای شروع Task با مدل گران:
 
<pre>
Task
│
▼
GLM 5.3 Flash
│
├── Success ───────────────► DONE
│
▼
DeepSeek V4 Flash
│
├── Success ───────────────► DONE
│
▼
Gemini Flash
│
├── Success ───────────────► DONE
│
▼
GPT-5.6 Terra
│
├── Success ───────────────► DONE
│
▼
Claude Sonnet 5
│
├── Success ───────────────► DONE
│
▼
GPT-5.6 Sol
│
├── Success ───────────────► DONE
│
▼
GPT-6 Astra
</pre>
 
این روش '''Escalation Routing''' نامیده می‌شود.
 
----
 
= معماری پیشنهادی Orchestrator + Worker =
 
برای سیستم‌هایی مانند Coding Agent، استفاده از یک مدل به عنوان Orchestrator و مدل‌های ارزان به عنوان Worker می‌تواند مؤثر باشد.
 
<pre>
                    ORCHESTRATOR
                  Claude / GPT / Gemini
                          │
          ┌───────────────┼───────────────┐
          │              │              │
          ▼              ▼              ▼
      WORKER 1        WORKER 2        WORKER 3
      GLM Flash      DeepSeek Flash    GPT Luna
          │              │              │
          ▼              ▼              ▼
      Coding          Testing        Analysis
          │              │              │
          └───────────────┼───────────────┘
                          │
                          ▼
                    CODE REVIEW
                          │
                          ▼
                    ORCHESTRATOR
</pre>
 
----
 
= معماری پیشنهادی برای Repository بزرگ =
 
<pre>
Repository
    │
    ▼
Repository Scanner
    │
    ├── Architecture Files
    ├── Source Files
    ├── Tests
    ├── Database
    ├── Config
    └── Documentation
            │
            ▼
        Cheap Models
    Luna / GLM / DeepSeek
            │
            ▼
        Summary / Index
            │
            ▼
      Powerful Model
    Claude / GPT / Gemini
            │
            ▼
          Solution
</pre>
 
این معماری باعث می‌شود لازم نباشد تمام Source Code در هر Request به مدل گران ارسال شود.
 
----
 
= آیا همیشه قوی‌ترین مدل بهتر است؟ =
 
خیر.
 
فرض کنید یک Task با مدل ارزان:
 
<pre>
1M Input
100K Output
</pre>
 
قابل انجام باشد.
 
ارسال همان Task به یک Frontier Model ممکن است چندین برابر هزینه ایجاد کند بدون اینکه نتیجه نهایی تفاوت مهمی داشته باشد.
 
بنابراین باید سه عامل را همزمان بررسی کرد:
 
# کیفیت
# زمان
# هزینه
 
در Coding Agent معیار مهم دیگری نیز وجود دارد:
 
'''تعداد Iteration لازم برای رسیدن به جواب صحیح'''
 
ممکن است مدل A از نظر Token ارزان‌تر باشد اما برای حل Task پنج بار تلاش کند.
 
در حالی که مدل B گران‌تر است اما Task را در اولین تلاش حل می‌کند.
 
بنابراین:
 
<pre>
Real Cost =
Token Cost
+
Retries
+
Tool Calls
+
Execution Time
+
Developer Time
</pre>
 
----
 
= استراتژی پیشنهادی استفاده روزمره =
 
برای Coding روزمره:
 
'''Gemini Flash / GLM 5.3 Flash'''
 
برای Feature پیچیده:
 
'''GPT-5.6 Terra / Claude Sonnet'''
 
برای Bug سخت:
 
'''Claude Sonnet 5 / GPT-5.6 Sol'''
 
برای Architecture:
 
'''GPT-5.6 Sol / GPT-6 Astra'''
 
برای Taskهای پرتعداد:
 
'''GPT-5.6 Luna / DeepSeek Flash / GLM Flash'''
 
برای Local:
 
'''gpt-oss-120b / Qwen / GLM / Mistral'''
 
----
 
= نتیجه‌گیری نهایی =
 
در سال 2026 یک مدل واحد را نمی‌توان برای تمام سناریوهای برنامه‌نویسی «بهترین» دانست.
 
'''حداکثر قدرت:'''
 
:🏆 GPT-6 Astra
 
'''Software Engineering بسیار پیچیده:'''
 
:🧠 GPT-5.6 Sol
 
'''Coding Agent حرفه‌ای:'''
 
:🤖 Claude Sonnet 5
 
'''Coding Agent سریع:'''
 
:⚡ Gemini 3.8 / 3.7 Flash
 
'''بهترین Price/Performance:'''
 
:💰 GLM 5.3 Flash
 
'''Coding اقتصادی:'''
 
:💵 DeepSeek V4 Flash 0731
 
'''تعادل قدرت و هزینه در OpenAI:'''
 
:⚖️ GPT-5.6 Terra
 
'''Tool-heavy Agent:'''
 
:🛠️ Grok 4.6
 
'''Agentic Software Engineering اقتصادی:'''
 
:🚀 Grok Build 0.1
 
'''Sub-Agent و پردازش پرتعداد:'''
 
:💵 GPT-5.6 Luna
 
'''Self-hosting:'''
 
:🔓 gpt-oss-120b / GLM / Qwen / Mistral
 
اما برای سیستم‌های حرفه‌ای، راهکار مناسب‌تر استفاده از '''Multi-Model Architecture''' است.


* جدول بر اساس '''تاریخ عرضه از جدیدترین به قدیمی‌ترین''' مرتب شده است.
در چنین معماری:


* قیمت‌ها به دلار و به ازای '''یک میلیون Token''' هستند.
<pre>
Cheap Model
    ↓
Medium Model
    ↓
Strong Model
    ↓
Frontier Model
</pre>


* قیمت برخی مدل‌ها بر اساس Region، Context Length، Provider، Peak/Off-Peak یا نوع API تغییر می‌کند.
تنها Taskهایی که مدل قبلی قادر به حل آنها نیست به مدل گران‌تر منتقل می‌شوند.


* قیمت GLM 5.3 Flash در جدول، قیمت Promotional فعلی است و ممکن است تغییر کند.
این معماری می‌تواند:


* قیمت Gemini 3.7 Flash قیمت Introductory است.
* هزینه API را کاهش دهد.
* سرعت Coding Agent را افزایش دهد.
* Parallel Agentها را اقتصادی کند.
* استفاده از Contextهای بسیار بزرگ را مدیریت کند.
* از Frontier Model فقط در جایی که واقعاً لازم است استفاده کند.


* قیمت DeepSeek V4 بسته به Peak و Off-Peak تغییر می‌کند.
در نتیجه، برای ساخت Coding Agent حرفه‌ای در سال 2026، '''انتخاب معماری Routing به اندازه انتخاب خود مدل اهمیت دارد.'''


* امتیازهای '''Coding، Agentic و Price/Performance''' ارزیابی مقایسه‌ای این مقاله هستند و امتیاز رسمی شرکت‌های سازنده محسوب نمی‌شوند.
----


* علامت «-» به معنی نبود اطلاعات قطعی یا قابل مقایسه در این جدول است و الزاماً به معنی پشتیبانی‌نکردن مدل از آن قابلیت نیست.
[[رده:هوش مصنوعی]]
</small>
[[رده:برنامه‌نویسی]]
[[رده:مدل‌های زبانی بزرگ]]
[[رده:LLM]]
[[رده:Agentic AI]]
[[رده:Coding Agent]]
[[رده:Software Engineering]]
[[رده:Artificial Intelligence]]
[[رده:OpenAI]]
[[رده:Claude]]
[[رده:Gemini]]
[[رده:DeepSeek]]
[[رده:GLM]]
[[رده:Grok]]
[[رده:Qwen]]
[[رده:Mistral]]

Revision as of 15:05, 4 September 2026

مقایسه جامع مدل‌های هوش مصنوعی برای برنامه‌نویسی و Agentic Coding در سال 2026

مدل‌های هوش مصنوعی در سال 2026 از ابزارهای ساده Code Completion به سیستم‌هایی تبدیل شده‌اند که می‌توانند بخش قابل توجهی از فرایند مهندسی نرم‌افزار را به‌صورت Agentic انجام دهند.

یک Coding Agent مدرن می‌تواند:

  • Repository را بررسی کند.
  • ساختار پروژه را درک کند.
  • چندین فایل را ویرایش کند.
  • Terminal و Shell اجرا کند.
  • Test اجرا کند.
  • خطا را پیدا و Debug کند.
  • Refactoring انجام دهد.
  • از Tool Calling و MCP استفاده کند.
  • نتیجه اجرای برنامه را بررسی کند.
  • پس از شکست، راه‌حل دیگری را امتحان کند.

بنابراین برای انتخاب مدل مناسب برنامه‌نویسی، صرفاً قدرت تولید Code کافی نیست.

در این مقاله مدل‌ها از نظر موارد زیر بررسی می‌شوند:

  • Coding
  • Agentic Coding
  • Software Engineering
  • Debugging
  • Refactoring
  • Repository Understanding
  • Tool Calling
  • Long Context
  • Multimodal Coding
  • سرعت
  • قیمت API
  • Price/Performance
  • Self-hosting

آخرین به‌روزرسانی: 4 سپتامبر 2026


خلاصه سریع

کاربرد مدل پیشنهادی توضیح
🏆 حداکثر قدرت GPT-6 Astra سخت‌ترین مسائل End-to-End
🧠 Coding بسیار پیچیده GPT-5.6 Sol معماری، Debugging و Software Engineering پیچیده
🤖 Coding Agent حرفه‌ای Claude Sonnet 5 Agentic Software Engineering و Tool Use
⚡ Coding Agent سریع Gemini 3.8 Flash / Gemini 3.7 Flash سرعت بالا و مناسب Agent
💰 بهترین Price/Performance GLM 5.3 Flash Coding و Agentic با هزینه بسیار پایین
💵 Coding اقتصادی DeepSeek V4 Flash 0731 مناسب Agent و پردازش پرتعداد
⚖️ OpenAI متعادل GPT-5.6 Terra تعادل قدرت و هزینه
🛠️ Coding + Tool Use Grok 4.6 Agentic Workflow و Tool Calling
🚀 Agentic Software Engineering Grok Build 0.1 مدل تخصصی Coding Agent
📚 Repository بزرگ GPT-5.6 / Gemini / DeepSeek / Qwen / GLM Long Context
🖼️ Screenshot → Code Gemini Flash / Claude / GPT-5.6 Multimodal Coding
🔓 Self-hosting gpt-oss-120b / GLM / Mistral / Qwen اجرای Local و Private

جدول جامع مقایسه مدل‌ها

جدول زیر مدل‌ها را بر اساس تاریخ ارائه از جدیدترین به قدیمی‌ترین مرتب می‌کند.

قیمت‌ها به ازای یک میلیون Token هستند.

تاریخ ارائه مدل شرکت Input Cached Output Context Max Output Coding Agentic Price/Performance کاربرد اصلی
2026-09-04 GPT-6 Astra OpenAI $10 $1 $50 1.05M 128K 10/10 10/10 6.5 سخت‌ترین End-to-End Workloads
2026-09-02 Gemini 3.8 Flash Google DeepMind متغیر متغیر متغیر Long Context - 9.8 9.8 9.7 Coding، Agents و Multimodal
2026-08 GLM 5.3 Flash Z.ai / Zhipu AI بسیار ارزان بسیار ارزان بسیار ارزان Long Context - 9.5 9.7 10 Coding Agent اقتصادی
2026-08 Gemini 3.7 Flash Google DeepMind Introductory - Introductory ~1M - 9.6 9.7 9.8 Coding Agent سریع
2026-08 DeepSeek V4 Pro DeepSeek Tiered Tiered Tiered ~1M تا 384K 9.5 9.6 9.7 Agentic Coding
2026-08 Grok 4.6 xAI $2* $0.50* $6* 500K - 9.6 9.8 9.4 Coding + Tool Use
2026-07-31 DeepSeek V4 Flash 0731 DeepSeek $0.22–0.44* $0.007–0.014* $0.66–1.32* ~1M تا 384K 9.2 9.4 10 Coding اقتصادی
2026-07 GPT-5.6 Sol OpenAI $4 $0.40 $20 1.05M 128K 10 10 8 Complex Professional Coding
2026-07 GPT-5.6 Terra OpenAI $2 $0.20 $12 1.05M 128K 9.5 9.5 9.2 تعادل قدرت و قیمت
2026-07 GPT-5.6 Luna OpenAI $0.20 $0.02 $1.20 1.05M 128K 8.2 8.6 10 High-volume / Sub-Agent
2026-06 Claude Sonnet 5 Anthropic $2 متغیر $10 Long Context - 9.8 10 9.3 Professional Coding Agent
2026 Claude Opus 4.6 Anthropic Premium متغیر Premium Long Context - 9.6 9.7 7.5 Debugging و Reasoning بسیار پیچیده
2026 GLM-5.2 Z.ai / Zhipu AI Provider-based Provider-based Provider-based ~1M - 9.5 9.7 9.4 Long-Horizon Coding
2026 Grok Build 0.1 xAI $1* $0.20* $2* 256K - 9.3 9.5 9.8 Agentic Software Engineering
2026 Mistral Medium 3.5 Mistral AI $1.50 - $7.50 256K - 9.2 9.5 9.1 Coding و Agent
2026 Gemini 3.6 Flash Google DeepMind - - - ~1M - 9.0 9.1 8.8 Coding سریع
2026 Gemini 3.5 Flash Google DeepMind - - - Long Context - 8.6 8.7 8.5 Coding و Multimodal
2026 Gemini 3.1 Pro Google DeepMind Tiered Tiered Tiered ~1M - 9.5 9.6 8.8 Deep Reasoning
2026 Qwen 3.7 Max Alibaba Cloud / Qwen Region-based Region-based Region-based ~1M ~131K 9.4 9.5 9.3 Long Context
2026 Qwen3-Coder Plus Alibaba Cloud / Qwen Tiered - Tiered ~1M ~65K 9.2 8.7 9.2 Coding تخصصی
2026 MiMo 2.5 Xiaomi / MiMo Provider-based - Provider-based - - 8.7 8.7 9.2 Coding + Multimodal
2026 Solar Pro 4 Upstage Provider-based - Provider-based - - 8.8 8.7 8.8 General Coding
2025-08-05 gpt-oss-120b OpenAI Self-host - Self-host 128K - 8.6 8.5 9.5 Self-hosted Coding

نکته:

  • امتیازهای Coding، Agentic و Price/Performance ارزیابی تحلیلی این مقاله هستند و Benchmark رسمی شرکت‌های سازنده نیستند.
  • قیمت API ممکن است بر اساس Provider، Region، Context Length، Peak/Off-Peak و Promotional Pricing تغییر کند.
  • علامت «-» به معنی نبود اطلاعات قطعی قابل مقایسه در این جدول است.
  • برای مدل‌هایی که تاریخ دقیق نسخه مورد استفاده Provider مشخص نیست، سال یا ماه انتشار درج شده است.

رتبه‌بندی کلی برای برنامه‌نویسی

رتبه مدل Coding Agentic مناسب برای
1 GPT-6 Astra 10 10 حداکثر قدرت
2 GPT-5.6 Sol 10 10 Software Engineering پیچیده
3 Claude Sonnet 5 9.8 10 Coding Agent
4 Gemini 3.8 Flash 9.8 9.8 Agent سریع
5 Grok 4.6 9.6 9.8 Coding + Tools
6 Gemini 3.7 Flash 9.6 9.7 Coding سریع
7 Claude Opus 4.6 9.6 9.7 مسائل سخت
8 GLM 5.3 Flash 9.5 9.7 Price/Performance
9 DeepSeek V4 Pro 9.5 9.6 Agentic Coding
10 Gemini 3.1 Pro 9.5 9.6 Deep Reasoning
11 GPT-5.6 Terra 9.5 9.5 Balanced Coding
12 Qwen 3.7 Max 9.4 9.5 Long Context
13 Grok Build 0.1 9.3 9.5 Agentic Software Engineering
14 DeepSeek V4 Flash 9.2 9.4 Low-cost Coding
15 Mistral Medium 3.5 9.2 9.5 Open / Agentic
16 Qwen3-Coder Plus 9.2 8.7 Coding
17 Gemini 3.6 Flash 9.0 9.1 Fast Coding
18 Solar Pro 4 8.8 8.7 General Coding
19 MiMo 2.5 8.7 8.7 Coding + Image
20 gpt-oss-120b 8.6 8.5 Self-host
21 Gemini 3.5 Flash 8.6 8.7 Fast Coding
22 GPT-5.6 Luna 8.2 8.6 Cheap Sub-Agent

مقایسه مدل‌های اقتصادی برای Coding

این جدول برای زمانی مهم است که Coding Agent تعداد زیادی Token مصرف می‌کند.

مدل Coding Agentic هزینه Price/Performance پیشنهاد
GLM 5.3 Flash 9.5 9.7 بسیار پایین 10/10 🥇
DeepSeek V4 Flash 0731 9.2 9.4 بسیار پایین 10/10 🥇
GPT-5.6 Luna 8.2 8.6 بسیار پایین 10/10 Sub-Agent
Grok Build 0.1 9.3 9.5 پایین 9.8/10 Coding Agent
Gemini 3.7 Flash 9.6 9.7 پایین/متوسط 9.8/10 Agent سریع
GPT-5.6 Terra 9.5 9.5 متوسط 9.2/10 Coding حرفه‌ای
Claude Sonnet 5 9.8 10 متوسط 9.3/10 Task سخت

مقایسه برای Agentic Coding

Agentic Coding با Code Generation معمولی متفاوت است.

در Agentic Coding مدل باید بتواند:

  • Task را برنامه‌ریزی کند.
  • Repository را جستجو کند.
  • فایل مناسب را پیدا کند.
  • Terminal اجرا کند.
  • Code را تغییر دهد.
  • Test اجرا کند.
  • خطا را تحلیل کند.
  • مجدداً Code را اصلاح کند.
  • Toolهای مختلف را هماهنگ کند.
مدل Agentic Tool Use Repository Long-running Task پیشنهاد
GPT-6 Astra 10 عالی عالی عالی 🥇
Claude Sonnet 5 10 عالی عالی عالی 🥇
GPT-5.6 Sol 10 عالی عالی عالی 🥇
Gemini 3.8 Flash 9.8 عالی عالی عالی ⭐
Grok 4.6 9.8 عالی عالی عالی ⭐
GLM 5.3 Flash 9.7 عالی عالی عالی ⭐
Gemini 3.7 Flash 9.7 عالی عالی عالی ⭐
Claude Opus 4.6 9.7 عالی عالی عالی Task بسیار سخت
DeepSeek V4 Pro 9.6 عالی عالی عالی ⭐
Grok Build 9.5 عالی خوب عالی ⭐
GPT-5.6 Terra 9.5 عالی عالی عالی ⭐

مقایسه برای Debugging و Refactoring

مدل Debugging Refactoring Architecture پیشنهاد
GPT-6 Astra 10 10 10 🥇
GPT-5.6 Sol 10 10 10 🥇
Claude Sonnet 5 9.8 9.8 9.7 ⭐
Claude Opus 4.6 9.8 9.8 9.8 ⭐
Gemini 3.8 Flash 9.6 9.6 9.5 ⭐
Grok 4.6 9.6 9.5 9.5 ⭐
GLM 5.3 Flash 9.5 9.5 9.3 خوب
DeepSeek V4 Pro 9.5 9.5 9.4 خوب
GPT-5.6 Terra 9.5 9.5 9.5 خوب

مقایسه برای Repositoryهای بزرگ

برای Repository بزرگ، Context Window فقط یکی از معیارها است.

مدل همچنین باید بتواند ارتباط میان فایل‌ها، Dependencyها، Interfaceها و Call Chainها را درک کند.

مدل Context تقریبی Repository Understanding پیشنهاد
GPT-6 Astra 1.05M عالی 🥇
GPT-5.6 Sol 1.05M عالی 🥇
GPT-5.6 Terra 1.05M عالی ⭐
GPT-5.6 Luna 1.05M خوب پردازش اولیه
Gemini Flash ~1M عالی ⭐
DeepSeek V4 ~1M عالی ⭐
GLM Long Context عالی ⭐
Qwen 3.7 Max ~1M عالی ⭐
gpt-oss-120b 128K خوب Self-host

مقایسه Frontend و Screenshot-to-Code

برای کارهایی مانند:

  • Screenshot → HTML/CSS
  • Screenshot → React
  • Screenshot → Angular
  • UI → Responsive Design
  • تحلیل Layout
  • تولید Component
  • تشخیص عناصر تصویر
  • تبدیل Design به Code

مدل Multimodal مزیت مهمی دارد.

رتبه مدل Frontend Vision Agentic
1 Gemini 3.8 Flash 9.8 عالی 9.8
2 Gemini 3.7 Flash 9.7 عالی 9.7
3 Claude Sonnet 5 9.7 عالی 10
4 GPT-5.6 Sol 9.7 عالی 10
5 GPT-5.6 Terra 9.5 عالی 9.5
6 MiMo 2.5 8.8 خوب 8.7

مقایسه Backend و Microservice

برای:

  • ASP.NET Core
  • C#
  • Java
  • Spring
  • Node.js
  • Python
  • Go
  • REST API
  • gRPC
  • Microservices
  • SQL
  • Redis
  • RabbitMQ
  • Kafka
  • Docker
  • Kubernetes
رتبه مدل Backend Architecture Debugging Agentic
1 GPT-6 Astra 10 10 10 10
2 GPT-5.6 Sol 10 10 10 10
3 Claude Sonnet 5 9.8 9.7 9.8 10
4 Gemini 3.8 Flash 9.7 9.5 9.6 9.8
5 Grok 4.6 9.6 9.5 9.6 9.8
6 GPT-5.6 Terra 9.5 9.5 9.5 9.5
7 GLM 5.3 Flash 9.5 9.3 9.5 9.7
8 DeepSeek V4 Pro 9.5 9.4 9.5 9.6

مقایسه مدل‌های Open Weight و Self-hosted

در سازمان‌هایی که Source Code محرمانه است، Self-hosting می‌تواند اهمیت زیادی داشته باشد.

مدل Self-host Coding Agentic کاربرد
gpt-oss-120b بله 8.6 8.5 Private Coding Agent
GLM Open Models بله عالی عالی Coding / Reasoning
Mistral بله عالی عالی Enterprise Agent
Qwen بله عالی خوب تا عالی Coding / Long Context

مزایای Self-hosting:

  • حفظ Source Code در شبکه داخلی
  • Data Residency
  • کنترل کامل Infrastructure
  • عدم وابستگی به API خارجی
  • امکان استفاده در شبکه بدون اینترنت
  • امکان Fine-tuning یا Custom Deployment
  • کنترل هزینه در حجم بسیار بالا

مقایسه نسل‌های Gemini Flash

مدل Coding Agentic وضعیت پیشنهادی
Gemini 3.8 Flash 9.8 9.8 🥇 اولویت اول
Gemini 3.7 Flash 9.6 9.7 ⭐ بسیار مناسب
Gemini 3.6 Flash 9.0 9.1 نسل قبلی
Gemini 3.5 Flash 8.6 8.7 اولویت پایین‌تر

در صورت دسترسی یکسان:

Gemini 3.8 Flash
       ↓
Gemini 3.7 Flash
       ↓
Gemini 3.6 Flash
       ↓
Gemini 3.5 Flash

مقایسه خانواده GPT-5.6

ویژگی GPT-5.6 Sol GPT-5.6 Terra GPT-5.6 Luna
Input / 1M $4 $2 $0.20
Cached $0.40 $0.20 $0.02
Output / 1M $20 $12 $1.20
Context 1.05M 1.05M 1.05M
Max Output 128K 128K 128K
Coding 10 9.5 8.2
Agentic 10 9.5 8.6
کاربرد Hard Tasks Daily Professional Coding Cheap / High Volume

بنابراین:

مسئله بسیار پیچیده → Sol

Coding حرفه‌ای روزمره → Terra

Task ساده و پرتعداد → Luna

مقایسه Claude برای Coding

مدل Coding Agentic Debugging کاربرد
Claude Sonnet 5 9.8 10 9.8 Coding Agent روزمره
Claude Opus 4.6 9.6 9.7 9.8 Escalation / Hard Reasoning

در Coding Agent می‌توان از معماری زیر استفاده کرد:

Claude Sonnet
      │
      │ Failed / Very Hard
      ▼
Claude Opus

مقایسه DeepSeek

مدل Coding Agentic هزینه کاربرد
DeepSeek V4 Pro 9.5 9.6 پایین Task پیچیده
DeepSeek V4 Flash 0731 9.2 9.4 بسیار پایین Daily Agent / Sub-Agent

اگر هزینه مهم باشد:

V4 Flash

اگر قدرت بیشتر مهم باشد:

V4 Pro


مقایسه GLM

مدل Coding Agentic Price/Performance پیشنهاد
GLM 5.3 Flash 9.5 9.7 10 🥇
GLM-5.2 9.5 9.7 9.4 Long-Horizon

GLM 5.3 Flash به دلیل ترکیب:

  • سرعت
  • Coding
  • Agentic capability
  • هزینه پایین

یکی از جذاب‌ترین گزینه‌های Coding Agent است.


مقایسه مدل‌های مشاهده‌شده در Provider

در بررسی Provider مورد استفاده، مدل‌های زیر نیز در دسترس بودند:

  • DeepSeek V4 Flash 0731
  • GLM 5.3 Flash
  • GPT-5.6 Luna
  • MiMo 2.5
  • Solar Pro 4

برای Coding:

رتبه مدل Coding Agentic پیشنهاد
1 GLM 5.3 Flash 9.5 9.7 🥇
2 DeepSeek V4 Flash 0731 9.2 9.4 🥈
3 Solar Pro 4 8.8 8.7 🥉
4 MiMo 2.5 8.7 8.7 Multimodal
5 GPT-5.6 Luna 8.2 8.6 Sub-Agent

مقایسه مدل‌های مشاهده‌شده در Antigravity

مدل‌های بررسی‌شده:

  • Gemini 3.7 Flash
  • Gemini 3.6 Flash
  • Claude Opus 4.6
  • Claude Sonnet 4.6
  • Gemini 3.1 Pro
  • Gemini 3.5 Flash
  • gpt-oss-120b
رتبه مدل Coding Agentic بهترین کاربرد
1 Gemini 3.7 Flash 9.6 9.7 Coding روزمره سریع
2 Claude Opus 4.6 9.6 9.7 مسائل بسیار پیچیده
3 Claude Sonnet 4.6 9.5 9.6 Coding Agent
4 Gemini 3.1 Pro 9.5 9.6 Deep Reasoning
5 Gemini 3.6 Flash 9.0 9.1 Fast Coding
6 Gemini 3.5 Flash 8.6 8.7 Taskهای ساده‌تر
7 gpt-oss-120b 8.6 8.5 Self-hosting

انتخاب مدل بر اساس نوع Task

Task انتخاب اول انتخاب دوم انتخاب اقتصادی
Coding روزمره Gemini 3.8/3.7 Flash Claude Sonnet 5 GLM 5.3 Flash
Bug پیچیده GPT-5.6 Sol Claude Sonnet 5 DeepSeek V4 Pro
Architecture GPT-6 Astra GPT-5.6 Sol GPT-5.6 Terra
Refactoring Claude Sonnet 5 GPT-5.6 Sol GLM 5.3 Flash
Repository بزرگ GPT-5.6 Sol Gemini DeepSeek / GLM
Frontend Gemini Flash Claude Sonnet GLM
Backend GPT-5.6 Sol Claude Sonnet GLM / DeepSeek
Tool-heavy Agent Claude Sonnet 5 Grok 4.6 Grok Build
Sub-Agent GPT-5.6 Luna DeepSeek Flash GLM Flash
Self-host gpt-oss-120b GLM Qwen / Mistral

معماری پیشنهادی Multi-Model Coding Agent

استفاده از گران‌ترین مدل برای تمام درخواست‌ها از نظر اقتصادی بهینه نیست.

یک Orchestrator می‌تواند ابتدا Task را طبقه‌بندی کند.

                         USER
                           │
                           ▼
                  CODING ORCHESTRATOR
                           │
                           ▼
                   TASK CLASSIFIER
                           │
           ┌───────────────┼───────────────┐
           │               │               │
           ▼               ▼               ▼
         SIMPLE          MEDIUM           HARD
           │               │               │
           ▼               ▼               ▼
      GPT-5.6 Luna    GLM 5.3 Flash   Claude Sonnet 5
      DeepSeek Flash  Gemini Flash    GPT-5.6 Sol
      GLM Flash       GPT-5.6 Terra   Grok 4.6
           │               │               │
           └───────────────┼───────────────┘
                           │
                           ▼
                       FAILED?
                           │
                         YES
                           │
                           ▼
                      GPT-6 Astra

معماری پیشنهادی برای کاهش هزینه

به جای شروع Task با مدل گران:

Task
 │
 ▼
GLM 5.3 Flash
 │
 ├── Success ───────────────► DONE
 │
 ▼
DeepSeek V4 Flash
 │
 ├── Success ───────────────► DONE
 │
 ▼
Gemini Flash
 │
 ├── Success ───────────────► DONE
 │
 ▼
GPT-5.6 Terra
 │
 ├── Success ───────────────► DONE
 │
 ▼
Claude Sonnet 5
 │
 ├── Success ───────────────► DONE
 │
 ▼
GPT-5.6 Sol
 │
 ├── Success ───────────────► DONE
 │
 ▼
GPT-6 Astra

این روش Escalation Routing نامیده می‌شود.


معماری پیشنهادی Orchestrator + Worker

برای سیستم‌هایی مانند Coding Agent، استفاده از یک مدل به عنوان Orchestrator و مدل‌های ارزان به عنوان Worker می‌تواند مؤثر باشد.

                    ORCHESTRATOR
                   Claude / GPT / Gemini
                          │
          ┌───────────────┼───────────────┐
          │               │               │
          ▼               ▼               ▼
       WORKER 1         WORKER 2        WORKER 3
      GLM Flash      DeepSeek Flash    GPT Luna
          │               │               │
          ▼               ▼               ▼
       Coding           Testing        Analysis
          │               │               │
          └───────────────┼───────────────┘
                          │
                          ▼
                     CODE REVIEW
                          │
                          ▼
                    ORCHESTRATOR

معماری پیشنهادی برای Repository بزرگ

Repository
    │
    ▼
Repository Scanner
    │
    ├── Architecture Files
    ├── Source Files
    ├── Tests
    ├── Database
    ├── Config
    └── Documentation
             │
             ▼
        Cheap Models
     Luna / GLM / DeepSeek
             │
             ▼
        Summary / Index
             │
             ▼
       Powerful Model
    Claude / GPT / Gemini
             │
             ▼
          Solution

این معماری باعث می‌شود لازم نباشد تمام Source Code در هر Request به مدل گران ارسال شود.


آیا همیشه قوی‌ترین مدل بهتر است؟

خیر.

فرض کنید یک Task با مدل ارزان:

1M Input
100K Output

قابل انجام باشد.

ارسال همان Task به یک Frontier Model ممکن است چندین برابر هزینه ایجاد کند بدون اینکه نتیجه نهایی تفاوت مهمی داشته باشد.

بنابراین باید سه عامل را همزمان بررسی کرد:

  1. کیفیت
  2. زمان
  3. هزینه

در Coding Agent معیار مهم دیگری نیز وجود دارد:

تعداد Iteration لازم برای رسیدن به جواب صحیح

ممکن است مدل A از نظر Token ارزان‌تر باشد اما برای حل Task پنج بار تلاش کند.

در حالی که مدل B گران‌تر است اما Task را در اولین تلاش حل می‌کند.

بنابراین:

Real Cost =
Token Cost
+
Retries
+
Tool Calls
+
Execution Time
+
Developer Time

استراتژی پیشنهادی استفاده روزمره

برای Coding روزمره:

Gemini Flash / GLM 5.3 Flash

برای Feature پیچیده:

GPT-5.6 Terra / Claude Sonnet

برای Bug سخت:

Claude Sonnet 5 / GPT-5.6 Sol

برای Architecture:

GPT-5.6 Sol / GPT-6 Astra

برای Taskهای پرتعداد:

GPT-5.6 Luna / DeepSeek Flash / GLM Flash

برای Local:

gpt-oss-120b / Qwen / GLM / Mistral


نتیجه‌گیری نهایی

در سال 2026 یک مدل واحد را نمی‌توان برای تمام سناریوهای برنامه‌نویسی «بهترین» دانست.

حداکثر قدرت:

🏆 GPT-6 Astra

Software Engineering بسیار پیچیده:

🧠 GPT-5.6 Sol

Coding Agent حرفه‌ای:

🤖 Claude Sonnet 5

Coding Agent سریع:

⚡ Gemini 3.8 / 3.7 Flash

بهترین Price/Performance:

💰 GLM 5.3 Flash

Coding اقتصادی:

💵 DeepSeek V4 Flash 0731

تعادل قدرت و هزینه در OpenAI:

⚖️ GPT-5.6 Terra

Tool-heavy Agent:

🛠️ Grok 4.6

Agentic Software Engineering اقتصادی:

🚀 Grok Build 0.1

Sub-Agent و پردازش پرتعداد:

💵 GPT-5.6 Luna

Self-hosting:

🔓 gpt-oss-120b / GLM / Qwen / Mistral

اما برای سیستم‌های حرفه‌ای، راهکار مناسب‌تر استفاده از Multi-Model Architecture است.

در چنین معماری:

Cheap Model
     ↓
Medium Model
     ↓
Strong Model
     ↓
Frontier Model

تنها Taskهایی که مدل قبلی قادر به حل آنها نیست به مدل گران‌تر منتقل می‌شوند.

این معماری می‌تواند:

  • هزینه API را کاهش دهد.
  • سرعت Coding Agent را افزایش دهد.
  • Parallel Agentها را اقتصادی کند.
  • استفاده از Contextهای بسیار بزرگ را مدیریت کند.
  • از Frontier Model فقط در جایی که واقعاً لازم است استفاده کند.

در نتیجه، برای ساخت Coding Agent حرفه‌ای در سال 2026، انتخاب معماری Routing به اندازه انتخاب خود مدل اهمیت دارد.


رده:هوش مصنوعی رده:برنامه‌نویسی رده:مدل‌های زبانی بزرگ رده:LLM رده:Agentic AI رده:Coding Agent رده:Software Engineering رده:Artificial Intelligence رده:OpenAI رده:Claude رده:Gemini رده:DeepSeek رده:GLM رده:Grok رده:Qwen رده:Mistral