LLM Agentic Coding Model: Difference between revisions

From wiki karavi
Jump to navigation Jump to search
No edit summary
No edit summary
Line 1: Line 1:
= مقایسه بهترین مدل‌های هوش مصنوعی برای برنامه‌نویسی و Agentic Coding در سال 2026 =
== جدول جامع مقایسه مدل‌ها ==
 
هوش مصنوعی در سال 2026 از یک ابزار ساده برای تکمیل کد به یک بخش مهم از فرایند مهندسی نرم‌افزار تبدیل شده است.
 
مدل‌های جدید علاوه بر Code Generation می‌توانند Repository را بررسی کنند، چندین فایل را هم‌زمان تغییر دهند، Terminal اجرا کنند، تست بنویسند، خطاها را Debug کنند، از ابزارها استفاده کنند و حتی یک Task نرم‌افزاری را در چندین مرحله به پایان برسانند.
 
به همین دلیل انتخاب مدل مناسب برای برنامه‌نویسی دیگر فقط بر اساس Benchmarkهای تولید کد انجام نمی‌شود.
 
در این مقاله مدل‌ها از نظر موارد زیر مقایسه شده‌اند:
 
* Coding
* Software Engineering
* Debugging
* Refactoring
* Repository Understanding
* Agentic Coding
* Tool Calling
* Context Window
* سرعت
* هزینه API
* Price/Performance
* Self-hosting
* Multimodal Coding


'''آخرین به‌روزرسانی: سپتامبر 2026'''
جدول زیر مدل‌های مهم مناسب برای '''Programming، Software Engineering و Agentic Coding''' را مقایسه می‌کند.


----
مدل‌ها بر اساس '''تاریخ عرضه از جدیدترین به قدیمی‌ترین''' مرتب شده‌اند.


== خلاصه سریع ==
قیمت‌ها به ازای '''یک میلیون Token''' هستند.
 
اگر فقط نتیجه نهایی را می‌خواهید:
 
{| class="wikitable"
! کاربرد
! پیشنهاد
|-
| 🏆 حداکثر قدرت
| '''GPT-6 Astra / GPT-5.6 Sol'''
|-
| 🤖 Coding Agent حرفه‌ای
| '''Claude Sonnet 5'''
|-
| ⚡ Coding Agent سریع
| '''Gemini 3.8 Flash / Gemini 3.7 Flash'''
|-
| 💰 Coding Agent بسیار اقتصادی
| '''GLM 5.3 Flash'''
|-
| 💵 Coding ارزان
| '''DeepSeek V4 Flash 0731'''
|-
| ⚖️ تعادل قدرت و قیمت OpenAI
| '''GPT-5.6 Terra'''
|-
| 🛠️ Coding + Tools
| '''Grok 4.6'''
|-
| 🚀 Agentic Software Engineering ارزان
| '''Grok Build 0.1'''
|-
| 📚 Repository بسیار بزرگ
| '''GPT-5.6 / Gemini / DeepSeek / Qwen'''
|-
| 🖼️ Frontend از روی Screenshot
| '''Gemini 3.8/3.7 Flash'''
|-
| 🔓 Open Weight
| '''GLM / Mistral / gpt-oss / Qwen'''
|-
| 🖥️ Self-hosting
| '''gpt-oss-120b / GLM / Mistral / Qwen'''
|}
 
----
 
== جدول جامع مقایسه مدل‌ها ==
 
قیمت‌ها به ازای یک میلیون Token هستند.


{| class="wikitable sortable"
{| class="wikitable sortable"
! تاریخ ارائه
! مدل
! مدل
! شرکت
! Input
! Input
! Cached
! Cached Input
! Output
! Output
! Context
! Context
Line 90: Line 21:
! کاربرد اصلی
! کاربرد اصلی
|-
|-
| '''2026-09-04'''
| '''GPT-6 Astra''' 🆕
| '''GPT-6 Astra''' 🆕
| '''OpenAI'''
| $10
| $10
| $1
| $1
Line 99: Line 33:
| '''10/10'''
| '''10/10'''
| 6.5/10
| 6.5/10
| سخت‌ترین مسائل End-to-End و Coding
| سخت‌ترین مسائل End-to-End، Coding، Computer Use و Software Engineering
|-
| '''GPT-5.6 Sol'''
| $4
| $0.40
| $20
| 1.05M
| 128K
| '''10/10'''
| '''10/10'''
| 8/10
| Coding و Software Engineering بسیار پیچیده
|-
| '''Claude Sonnet 5'''
| $2
| متغیر
| $10
| ~1M
| -
| '''9.8/10'''
| '''10/10'''
| '''9.3/10'''
| Coding Agent حرفه‌ای
|-
|-
| '''2026-09-02'''
| '''Gemini 3.8 Flash''' 🆕
| '''Gemini 3.8 Flash''' 🆕
| '''Google DeepMind'''
| متغیر
| متغیر
| متغیر
| متغیر
Line 132: Line 47:
| '''9.8/10'''
| '''9.8/10'''
| '''9.7/10'''
| '''9.7/10'''
| نسل جدید Agentic Workflow
| Coding، Agentic Workflows، Tool Use و Multimodal
|-
|-
| '''Grok 4.6'''
 
| $2
| '''2026-08-26'''
| $0.50
| '''GLM 5.3 Flash''' 🔥
| $6
| '''Z.ai / Zhipu AI'''
| 500K
| $0.075*
| $0.015*
| $0.25*
| Long Context
| -
| -
| '''9.6/10'''
| '''9.5/10'''
| '''9.8/10'''
| '''9.7/10'''
| '''9.4/10'''
| '''10/10'''
| Coding + Tools + Agent
| Coding Agent سریع و بسیار اقتصادی
|-
|-
| '''2026-08-14'''
| '''Gemini 3.7 Flash'''
| '''Gemini 3.7 Flash'''
| '''Google DeepMind'''
| $0.75*
| $0.75*
| -
| -
Line 154: Line 75:
| '''9.7/10'''
| '''9.7/10'''
| '''9.8/10'''
| '''9.8/10'''
| Coding Agent سریع
| Coding Agent، Web Development و Multimodal Coding
|-
|-
| '''GLM 5.3 Flash'''
 
| $0.075*
| '''2026-08-13'''
| $0.015*
| '''DeepSeek V4 Pro'''
| $0.25*
| '''DeepSeek'''
| Long Context
| $0.66–$1.32
| -
| $0.022–$0.044
| $1.98–$3.96
| ~1M
| تا 384K
| '''9.5/10'''
| '''9.5/10'''
| '''9.6/10'''
| '''9.7/10'''
| '''9.7/10'''
| Agentic Coding و Software Engineering
|-
| '''2026-08-12'''
| '''Grok 4.6'''
| '''xAI'''
| $2
| $0.50
| $6
| 500K
| -
| '''9.6/10'''
| '''9.8/10'''
| '''9.4/10'''
| Long-running Agent، Coding، Reasoning و Tool Use
|-
| '''2026-07-31'''
| '''DeepSeek V4 Flash 0731''' 💰
| '''DeepSeek'''
| $0.22–$0.44
| $0.007–$0.014
| $0.66–$1.32
| ~1M
| تا 384K
| 9.2/10
| '''9.4/10'''
| '''10/10'''
| '''10/10'''
| Coding Agent بسیار اقتصادی
| Coding اقتصادی، Agent و Sub-Agent
|-
|-
| '''GLM-5.2'''
 
| $1.40
| '''2026-07-09'''
| $0.26
| '''GPT-5.6 Sol'''
| $4.40
| '''OpenAI'''
| ~1M
| $4
| -
| $0.40
| '''9.5/10'''
| $20
| '''9.7/10'''
| 1.05M
| 9.4/10
| 128K
| Long-Horizon Coding
| '''10/10'''
| '''10/10'''
| 8/10
| Coding و Software Engineering بسیار پیچیده
|-
|-
| '''2026-07-09'''
| '''GPT-5.6 Terra'''
| '''GPT-5.6 Terra'''
| '''OpenAI'''
| $2
| $2
| $0.20
| $0.20
Line 186: Line 144:
| '''9.5/10'''
| '''9.5/10'''
| '''9.5/10'''
| '''9.5/10'''
| 9.2/10
| '''9.2/10'''
| تعادل قدرت و هزینه
| Coding حرفه‌ای با تعادل قدرت و هزینه
|-
 
| '''2026-07-09'''
| '''GPT-5.6 Luna'''
| '''OpenAI'''
| '''$0.20'''
| '''$0.02'''
| '''$1.20'''
| 1.05M
| 128K
| 8.2/10
| 8.6/10
| '''10/10'''
| Sub-Agent، Coding ارزان و Taskهای پرتعداد
|-
|-
| '''DeepSeek V4 Pro'''
 
| متغیر
| '''2026-06-30'''
| متغیر
| '''Claude Sonnet 5'''
| متغیر
| '''Anthropic'''
| $2
| $0.20**
| $10
| ~1M
| ~1M
| تا 384K
| -
| '''9.5/10'''
| '''9.8/10'''
| '''9.6/10'''
| '''10/10'''
| '''9.7/10'''
| '''9.3/10'''
| Agentic Coding
| Coding Agent حرفه‌ای، Terminal، Tool Use و Refactoring
|-
|-
| '''Gemini 3.1 Pro'''
 
| Tiered
| '''2026-06-13'''
| Tiered
| '''GLM-5.2'''
| Tiered
| '''Z.ai / Zhipu AI'''
| $1.40
| $0.26
| $4.40
| ~1M
| ~1M
| -
| -
| '''9.5/10'''
| '''9.5/10'''
| '''9.6/10'''
| 8.8/10
| Deep Reasoning و Coding
|-
| '''Claude Opus 4.6'''
| Premium
| متغیر
| Premium
| Long Context
| -
| '''9.6/10'''
| '''9.7/10'''
| '''9.7/10'''
| 7.5/10
| 9.4/10
| مسائل بسیار سخت و Refactoring
| Long-Horizon Coding Agent
|-
| '''Qwen 3.7 Max'''
| Region-based
| متغیر
| Region-based
| ~1M
| ~131K
| '''9.4/10'''
| '''9.5/10'''
| 9.3/10
| Long Context Coding
|-
|-
| '''2026-05-29'''
| '''Grok Build 0.1'''
| '''Grok Build 0.1'''
| '''xAI'''
| $1
| $1
| $0.20
| $0.20
Line 242: Line 201:
| '''9.5/10'''
| '''9.5/10'''
| '''9.8/10'''
| '''9.8/10'''
| Agentic Software Engineering
| Agentic Software Engineering، Debugging و MCP
|-
|-
| '''2026-05-22'''
| '''Mistral Medium 3.5'''
| '''Mistral Medium 3.5'''
| '''Mistral AI'''
| $1.50
| $1.50
| $0.15
| -
| $7.50
| $7.50
| 256K
| 256K
Line 253: Line 215:
| '''9.5/10'''
| '''9.5/10'''
| 9.1/10
| 9.1/10
| Coding Agent / Open Weight
| Long-Horizon Coding Agent و Open Weight
|-
| '''DeepSeek V4 Flash 0731'''
| $0.22–0.44
| $0.007–0.014
| $0.66–1.32
| ~1M
| تا 384K
| 9.2/10
| '''9.4/10'''
| '''10/10'''
| Coding بسیار اقتصادی
|-
| '''Gemini 3.6 Flash'''
| -
| -
| -
| ~1M
| -
| 9.0/10
| 9.1/10
| 8.8/10
| نسل قبل 3.7
|-
| '''Solar Pro 4'''
| Provider-based
| -
| Provider-based
| -
| -
| 8.8/10
| 8.7/10
| 8.8/10
| Coding عمومی
|-
| '''MiMo 2.5'''
| Provider-based
| -
| Provider-based
| -
| -
| 8.7/10
| 8.7/10
| 9.2/10
| Coding + Multimodal
|-
|-
| '''2026-05-20'''
| '''Gemini 3.5 Flash'''
| '''Gemini 3.5 Flash'''
| '''Google DeepMind'''
| -
| -
| -
| -
Line 308: Line 229:
| 8.7/10
| 8.7/10
| 8.5/10
| 8.5/10
| Coding سریع نسل قبل
| Coding سریع و Agentic Workflows
|-
|-
| '''2025-08-05'''
| '''gpt-oss-120b'''
| '''gpt-oss-120b'''
| '''OpenAI'''
| Self-host
| Self-host
| -
| -
Line 319: Line 243:
| 8.5/10
| 8.5/10
| '''9.5/10'''
| '''9.5/10'''
| Local AI / Self-hosting
| Local AI، Private Coding Agent و Self-hosting
|-
| '''GPT-5.6 Luna'''
| '''$0.20'''
| '''$0.02'''
| '''$1.20'''
| '''1.05M'''
| 128K
| 8.2/10
| 8.6/10
| '''10/10'''
| Sub-Agent و Taskهای پرتعداد
|}
|}


<small>
<small>
* قیمت GLM 5.3 Flash در جدول، قیمت Promotional فعلی است و ممکن است تغییر کند.
'''توضیحات:'''


* قیمت Gemini 3.7 Flash نیز قیمت Introductory تا پایان سال 2026 است.
* جدول بر اساس '''تاریخ عرضه از جدیدترین به قدیمی‌ترین''' مرتب شده است.


* قیمت API برخی مدل‌ها بر اساس Region، Context Length، Provider و Peak/Off-Peak تغییر می‌کند.
* قیمت‌ها به دلار و به ازای '''یک میلیون Token''' هستند.


* امتیازهای Coding، Agentic و Price/Performance ارزیابی مقایسه‌ای این مقاله هستند و Benchmark رسمی شرکت‌های سازنده محسوب نمی‌شوند.
* قیمت برخی مدل‌ها بر اساس Region، Context Length، Provider، Peak/Off-Peak یا نوع API تغییر می‌کند.
</small>


----
* قیمت GLM 5.3 Flash در جدول، قیمت Promotional فعلی است و ممکن است تغییر کند.
 
== رتبه‌بندی پیشنهادی برای برنامه‌نویسی ==
 
{| class="wikitable sortable"
! رتبه
! مدل
! Coding
! Agentic
! ارزش استفاده
|-
| 1
| '''GPT-6 Astra'''
| 10
| 10
| حداکثر قدرت
|-
| 2
| '''GPT-5.6 Sol'''
| 10
| 10
| مسائل بسیار پیچیده
|-
| 3
| '''Claude Sonnet 5'''
| 9.8
| 10
| Coding Agent حرفه‌ای
|-
| 4
| '''Gemini 3.8 Flash'''
| 9.8
| 9.8
| Agent سریع نسل جدید
|-
| 5
| '''Grok 4.6'''
| 9.6
| 9.8
| Coding + Tool Use
|-
| 6
| '''Gemini 3.7 Flash'''
| 9.6
| 9.7
| سرعت + کیفیت + قیمت
|-
| 7
| '''GLM 5.3 Flash'''
| 9.5
| 9.7
| بهترین Price/Performance
|-
| 8
| '''Claude Opus 4.6'''
| 9.6
| 9.7
| مسائل پیچیده
|-
| 9
| '''DeepSeek V4 Pro'''
| 9.5
| 9.6
| Agentic Coding
|-
| 10
| '''GPT-5.6 Terra'''
| 9.5
| 9.5
| تعادل قدرت/قیمت
|-
| 11
| '''Gemini 3.1 Pro'''
| 9.5
| 9.6
| Deep Reasoning
|-
| 12
| '''Qwen 3.7 Max'''
| 9.4
| 9.5
| Long Context
|-
| 13
| '''Grok Build 0.1'''
| 9.3
| 9.5
| Coding Agent ارزان
|-
| 14
| '''Mistral Medium 3.5'''
| 9.2
| 9.5
| Open Weight Agent
|-
| 15
| '''DeepSeek V4 Flash 0731'''
| 9.2
| 9.4
| Coding بسیار اقتصادی
|}


----
* قیمت Gemini 3.7 Flash قیمت Introductory است.


= بررسی مدل‌ها =
* قیمت DeepSeek V4 بسته به Peak و Off-Peak تغییر می‌کند.


== GPT-6 Astra ==
* امتیازهای '''Coding، Agentic و Price/Performance''' ارزیابی مقایسه‌ای این مقاله هستند و امتیاز رسمی شرکت‌های سازنده محسوب نمی‌شوند.


GPT-6 Astra نسل جدید مدل Flagship شرکت OpenAI است و برای سخت‌ترین کارهای End-to-End، Reasoning و Coding طراحی شده است.
* علامت «-» به معنی نبود اطلاعات قطعی یا قابل مقایسه در این جدول است و الزاماً به معنی پشتیبانی‌نکردن مدل از آن قابلیت نیست.
 
</small>
مشخصات:
 
<syntaxhighlight lang="text">
Context Window : 1,050,000
Max Output    : 128,000
 
Input          : $10 / 1M
Cached Input  : $1 / 1M
Output        : $50 / 1M
</syntaxhighlight>
 
قابلیت‌ها:
 
* Function Calling
* Web Search
* File Search
* Computer Use
* Image Input
* Structured Output
* Reasoning
* Coding
* Agentic Workflows
 
این مدل بسیار قدرتمند است اما برای Taskهای روزمره از نظر اقتصادی منطقی نیست.
 
'''پیشنهاد:'''
 
برای Escalation و مسئله‌هایی که مدل‌های ارزان‌تر قادر به حل آنها نیستند.
 
----
 
== GPT-5.6 Sol ==
 
یکی از قدرتمندترین مدل‌های خانواده GPT-5.6 برای Coding و Professional Work است.
 
<syntaxhighlight lang="text">
Context      : 1,050,000
Max Output  : 128,000
 
Input        : $4
Cached      : $0.40
Output      : $20
</syntaxhighlight>
 
Reasoning Effort:
 
* none
* low
* medium
* high
* xhigh
* max
 
مناسب برای:
 
* معماری نرم‌افزار
* Debugging پیچیده
* Repository بزرگ
* Refactoring
* Code Review
* Software Design
* Agentic Coding
* Tool Calling
* Computer Use
 
'''Coding: 10/10'''
 
'''Agentic: 10/10'''
 
----
 
== GPT-5.6 Terra ==
 
اگر از OpenAI API استفاده می‌کنید، Terra یکی از بهترین مدل‌ها برای ایجاد تعادل میان قدرت و هزینه است.
 
<syntaxhighlight lang="text">
Context      : 1,050,000
Max Output  : 128,000
 
Input        : $2
Cached      : $0.20
Output      : $12
</syntaxhighlight>
 
مناسب برای:
 
* Coding روزمره
* Debugging
* Feature Development
* Refactoring
* Code Review
* Repository Analysis
* Tool Calling
* Coding Agent
 
'''Coding: 9.5/10'''
 
'''Agentic: 9.5/10'''
 
----
 
== GPT-5.6 Luna ==
 
Luna برای Workloadهای ارزان و پرتعداد طراحی شده است.
 
<syntaxhighlight lang="text">
Context      : 1,050,000
Max Output  : 128,000
 
Input        : $0.20
Cached      : $0.02
Output      : $1.20
</syntaxhighlight>
 
مناسب برای:
 
* Sub-Agent
* Documentation
* Boilerplate
* Classification
* Code Explanation
* تغییرات ساده
* Unit Test ساده
* File Analysis
* Routing
 
برای مسائل پیچیده Software Engineering بهتر است Task به Terra یا Sol منتقل شود.
 
----
 
== Claude Sonnet 5 ==
 
Claude Sonnet 5 یکی از مهم‌ترین مدل‌های فعلی برای Agentic Software Engineering است.
 
Anthropic این مدل را برای انجام Taskهای چندمرحله‌ای، Tool Use، Terminal و Coding طراحی کرده است.
 
<syntaxhighlight lang="text">
Input  : $2 / 1M
Output : $10 / 1M
</syntaxhighlight>
 
مناسب برای:
 
* Claude Code
* Repository Analysis
* Refactoring
* Debugging
* Terminal
* Tool Use
* Multi-file Editing
* Long-running Coding Tasks
* Agentic Software Engineering
 
'''Coding: 9.8/10'''
 
'''Agentic: 10/10'''
 
از نظر ترکیب قدرت و قیمت، Sonnet 5 یکی از بهترین انتخاب‌های Coding Agent است.
 
----
 
== Claude Opus 4.6 ==
 
Opus برای مسائل بسیار پیچیده مناسب است.
 
بهترین کاربرد:
 
* Debugging بسیار پیچیده
* Architecture Analysis
* Refactoring سنگین
* تحلیل Repository
* Reasoning طولانی
* Taskهای چندمرحله‌ای
 
در استفاده روزمره معمولاً Sonnet اقتصادی‌تر است.
 
می‌توان از این معماری استفاده کرد:
 
<syntaxhighlight lang="text">
Claude Sonnet
      │
      │ Task Failed
      ▼
Claude Opus
</syntaxhighlight>
 
----
 
== Gemini 3.8 Flash ==
 
Gemini 3.8 Flash یکی از جدیدترین مدل‌های Google DeepMind است که در سپتامبر 2026 معرفی شده است.
 
تمرکز اصلی نسل جدید Flash روی:
 
* Agentic Workflows
* Coding
* Tool Use
* Multimodal Reasoning
* Software Engineering
* سرعت بالا
 
است.
 
اگر 3.8 Flash در Provider یا Coding Agent مورد استفاده شما فعال باشد، نسبت به نسل‌های قبلی Flash باید در اولویت آزمایش قرار گیرد.
 
----
 
== Gemini 3.7 Flash ==
 
Gemini 3.7 Flash یکی از مهم‌ترین مدل‌های Coding سال 2026 است.
 
Google آن را به عنوان یک Workhorse Model برای Coding و Agents معرفی کرده است.
 
قیمت Introductory:
 
<syntaxhighlight lang="text">
Input  : $0.75 / 1M
Output : $3.75 / 1M
</syntaxhighlight>
 
قیمت اعلام‌شده بعد از پایان دوره Introductory:
 
<syntaxhighlight lang="text">
Input  : $1.50 / 1M
Output : $7.50 / 1M
</syntaxhighlight>
 
این مدل در Coding نسبت به Gemini 3.6 Flash پیشرفت قابل توجهی داشته است.
 
برخی نتایج اعلام‌شده:
 
<syntaxhighlight lang="text">
FrontierCode 1.1
 
Gemini 3.7 Flash : 43.6%
Gemini 3.6 Flash : 34.4%
 
DeepSWE v1.1
 
Gemini 3.7 Flash : 65.3%
Gemini 3.6 Flash : ~49%
</syntaxhighlight>
 
مناسب برای:
 
* Web Development
* Backend
* Frontend
* Debugging
* Repository Analysis
* Tool Calling
* Agentic Coding
* UI Generation
* Screenshot → Code
* Multimodal Coding
 
'''Coding: 9.6/10'''
 
'''Agentic: 9.7/10'''
 
----
 
== Gemini 3.6 Flash ==
 
3.6 Flash همچنان مدل خوبی برای Coding است اما با عرضه 3.7 و سپس 3.8، اولویت آن کاهش یافته است.
 
اگر هر دو مدل در Provider موجود باشند:
 
<syntaxhighlight lang="text">
Gemini 3.7 Flash
      >
Gemini 3.6 Flash
</syntaxhighlight>
 
مگر اینکه محدودیت Quota یا Provider وجود داشته باشد.
 
----
 
== Gemini 3.5 Flash ==
 
این مدل برای:
 
* Coding سریع
* Code Explanation
* Taskهای ساده
* Multimodal Tasks
 
مناسب است.
 
اما در صورت دسترسی به 3.7 یا 3.8 Flash، استفاده از نسل جدیدتر منطقی‌تر است.
 
----
 
== Gemini 3.1 Pro ==
 
این مدل بیشتر برای:
 
* Deep Reasoning
* Complex Coding
* Repository Analysis
* Multimodal Reasoning
* Agentic Workflows
 
مناسب است.
 
در بسیاری از Taskهای روزمره Coding، Flashهای جدید می‌توانند سریع‌تر و اقتصادی‌تر باشند.
 
----
 
== GLM 5.3 Flash ==
 
GLM 5.3 Flash یکی از جذاب‌ترین مدل‌های جدید از نظر Price/Performance است.
 
این مدل دارای معماری Mixture-of-Experts است.
 
<syntaxhighlight lang="text">
Total Parameters  : ~320B
Active Parameters : ~18B
</syntaxhighlight>
 
تمرکز مدل روی:
 
* Coding
* Agentic Coding
* Tool Use
* Reasoning
* Software Engineering
* Multimodal Tasks
 
است.
 
قیمت Promotional فعلی:
 
<syntaxhighlight lang="text">
Input        : $0.075 / 1M
Cached Input : $0.015 / 1M
Output      : $0.25 / 1M
</syntaxhighlight>
 
قیمت List:
 
<syntaxhighlight lang="text">
Input        : $0.15
Cached      : $0.03
Output      : $0.50
</syntaxhighlight>
 
این قیمت در مقایسه با توانایی Coding مدل بسیار قابل توجه است.
 
'''Coding: 9.5/10'''
 
'''Agentic: 9.7/10'''
 
'''Price/Performance: 10/10'''
 
----
 
== GLM-5.2 ==
 
GLM-5.2 برای Long-Horizon Taskها طراحی شده است.
 
<syntaxhighlight lang="text">
Input        : $1.40
Cached      : $0.26
Output      : $4.40
Context      : ~1M
</syntaxhighlight>
 
مناسب برای:
 
* Coding Agent
* Repository Analysis
* Long-Horizon Coding
* Debugging
* Tool Use
 
با عرضه GLM 5.3 Flash، برای بسیاری از Taskهای Coding بهتر است ابتدا 5.3 Flash آزمایش شود.
 
----
 
== DeepSeek V4 Pro ==
 
DeepSeek V4 Pro یکی از مدل‌های مهم برای Agentic Coding است.
 
مناسب برای:
 
* Software Engineering
* Reasoning
* Coding
* Tool Calling
* Repository Analysis
* Agentic Workflow
 
مزیت اصلی DeepSeek معمولاً Price/Performance بسیار مناسب آن است.
 
----
 
== DeepSeek V4 Flash 0731 ==
 
این مدل یکی از گزینه‌های بسیار جذاب برای Coding اقتصادی است.
 
<syntaxhighlight lang="text">
Context Window : ~1,000,000
Max Output    : تا 384K
</syntaxhighlight>
 
قیمت بسته به Peak/Off-Peak تغییر می‌کند.
 
<syntaxhighlight lang="text">
Off-Peak
 
Input        : $0.22
Cached      : $0.007
Output      : $0.66
 
Peak
 
Input        : $0.44
Cached      : $0.014
Output      : $1.32
</syntaxhighlight>
 
قابلیت‌ها:
 
* Thinking
* Non-Thinking
* Tool Calling
* Responses API
* JSON Output
* FIM
* Prefix Completion
* Agentic Coding
 
مناسب برای:
 
* Coding Agent
* Sub-Agent
* Tool Loop
* Repository Analysis
* پردازش انبوه
 
'''Coding: 9.2/10'''
 
'''Agentic: 9.4/10'''
 
'''Price/Performance: 10/10'''
 
----
 
== Grok 4.6 ==
 
Grok 4.6 یک Frontier Model برای Coding، Agentic Tasks و Knowledge Work است.
 
<syntaxhighlight lang="text">
Context : 500,000
 
Input    : $2
Cached  : $0.50
Output  : $6
</syntaxhighlight>
 
قابلیت‌ها:
 
* Function Calling
* Structured Output
* Reasoning
* Tool Calling
* Image Input
 
'''Coding: 9.6/10'''
 
'''Agentic: 9.8/10'''
 
----
 
== Grok Build 0.1 ==
 
این مدل برخلاف Grok عمومی، مشخصاً برای Agentic Software Engineering ساخته شده است.
 
<syntaxhighlight lang="text">
Context : 256K
 
Input    : $1
Cached  : $0.20
Output  : $2
</syntaxhighlight>
 
مناسب برای:
 
* Coding Agent
* Software Engineering
* Tool Calling
* Workflow Automation
* Debugging
* Web Development
 
'''Coding: 9.3/10'''
 
'''Agentic: 9.5/10'''
 
'''Price/Performance: 9.8/10'''
 
----
 
== Mistral Medium 3.5 ==
 
Mistral Medium 3.5 یک مدل Frontier-Class Multimodal است که برای Agentic و Coding Use Case بهینه شده است.
 
<syntaxhighlight lang="text">
Context : 256K
 
Input    : $1.50
Cached  : $0.15
Output  : $7.50
</syntaxhighlight>
 
قابلیت‌ها:
 
* Function Calling
* Structured Output
* Agents
* Conversations
* Document Q&A
* Prefix
* Batch
* Multimodal
 
مزیت مهم:
 
'''Open Weights'''
 
با Modified MIT License.
 
----
 
== Qwen 3.7 Max ==
 
Qwen 3.7 Max برای Long Context و Agentic Taskها گزینه قابل توجهی است.
 
<syntaxhighlight lang="text">
Context    : ~1M
Max Output : ~131K
</syntaxhighlight>
 
مناسب برای:
 
* Large Repository
* Coding
* Agent
* Tool Calling
* Structured Output
* Long Context
 
----
 
== gpt-oss-120b ==
 
این مدل با GPT-5.6 تفاوت اساسی دارد.
 
gpt-oss-120b یک مدل Open Weight است.
 
<syntaxhighlight lang="text">
Parameters      : ~117B
Active Parameters: ~5.1B/token
Context          : 128K
</syntaxhighlight>
 
مزیت اصلی:
 
'''Self-hosting'''
 
مناسب برای:
 
* Local AI
* Private Coding Agent
* Code Generation
* Reasoning
* Tool Use
* سازمان‌هایی که نمی‌خواهند Source Code به API خارجی ارسال شود
 
در قدرت خام Coding، مدل‌های Frontier جدید معمولاً بهتر هستند، اما در Self-hosting، gpt-oss-120b بسیار جذاب است.
 
----
 
== MiMo 2.5 ==
 
MiMo 2.5 مدلی Balanced برای:
 
* Coding
* Reasoning
* Image Understanding
* Multimodal Tasks
* General Agent
 
است.
 
اگر Task شامل Screenshot یا Image باشد، قابلیت Multimodal آن مفید است.
 
اما برای Agentic Software Engineering سنگین، GLM، Gemini، Claude یا DeepSeek معمولاً در اولویت بالاتری قرار می‌گیرند.
 
----
 
== Solar Pro 4 ==
 
Solar Pro 4 یک مدل General Purpose مناسب برای:
 
* Coding
* Reasoning
* Debugging
* Software Tasks
 
است.
 
برای Coding عمومی گزینه خوبی است اما در صورت دسترسی به GLM 5.3 Flash، DeepSeek V4 Flash یا Gemini Flash جدید، ابتدا مدل‌های تخصصی‌تر Coding را آزمایش می‌کنیم.
 
----
 
= مقایسه مدل‌های اقتصادی =
 
یکی از مهم‌ترین رقابت‌های سال 2026 در مدل‌های ارزان Coding است.
 
{| class="wikitable sortable"
! مدل
! Input
! Output
! Coding
! Agentic
! Price/Performance
|-
| '''GLM 5.3 Flash'''
| $0.075*
| $0.25*
| 9.5
| 9.7
| '''10'''
|-
| '''GPT-5.6 Luna'''
| $0.20
| $1.20
| 8.2
| 8.6
| '''10'''
|-
| '''DeepSeek V4 Flash'''
| $0.22–0.44
| $0.66–1.32
| 9.2
| 9.4
| '''10'''
|-
| '''Grok Build'''
| $1
| $2
| 9.3
| 9.5
| 9.8
|-
| '''Gemini 3.7 Flash'''
| $0.75*
| $3.75*
| 9.6
| 9.7
| 9.8
|}
 
در حال حاضر GLM 5.3 Flash از نظر قیمت Token بسیار جذاب است.
 
اما قیمت Token تنها معیار نیست.
 
مدلی که Task را در یک Iteration حل کند ممکن است در عمل ارزان‌تر از مدلی باشد که پنج بار نیاز به Retry داشته باشد.
 
----
 
= بهترین مدل برای Frontend و Screenshot-to-Code =
 
برای کارهایی مانند:
 
* Screenshot → HTML/CSS
* Screenshot → React
* UI → Angular
* طراحی Responsive
* تحلیل UI
* تبدیل Design به Code
 
پیشنهاد:
 
{| class="wikitable"
! رتبه
! مدل
|-
| 1
| '''Gemini 3.8 Flash'''
|-
| 2
| '''Gemini 3.7 Flash'''
|-
| 3
| '''Claude Sonnet 5'''
|-
| 4
| '''GPT-5.6 Sol/Terra'''
|-
| 5
| '''MiMo 2.5'''
|}
 
مدل‌های Multimodal در این نوع Task مزیت مهمی دارند.
 
----
 
= بهترین مدل برای Backend =
 
برای:
 
* ASP.NET Core
* Java
* Go
* Node.js
* Python
* Microservices
* Database
* API
* Docker
* Kubernetes
 
پیشنهاد:
 
{| class="wikitable"
! رتبه
! مدل
|-
| 1
| '''GPT-5.6 Sol'''
|-
| 2
| '''Claude Sonnet 5'''
|-
| 3
| '''Gemini 3.8/3.7 Flash'''
|-
| 4
| '''Grok 4.6'''
|-
| 5
| '''GLM 5.3 Flash'''
|-
| 6
| '''DeepSeek V4 Pro'''
|-
| 7
| '''GPT-5.6 Terra'''
|}
 
----
 
= بهترین مدل برای Repository بزرگ =
 
در Repositoryهای بزرگ Context Window اهمیت زیادی دارد.
 
مدل‌های مناسب:
 
* GPT-5.6 Sol
* GPT-5.6 Terra
* GPT-5.6 Luna
* Gemini
* DeepSeek V4
* Qwen 3.7 Max
* GLM
 
اما Context بزرگ به تنهایی کافی نیست.
 
مدل باید بتواند اطلاعات مهم Repository را پیدا کرده و بین فایل‌ها ارتباط برقرار کند.
 
----
 
= بهترین مدل برای Self-hosting =
 
اگر Source Code نباید از سازمان خارج شود:
 
{| class="wikitable"
! مدل
! مزیت
|-
| '''gpt-oss-120b'''
| Open Weight + Reasoning
|-
| '''GLM'''
| Coding + Agentic + Open Models
|-
| '''Mistral Medium 3.5'''
| Coding + Agent + Modified MIT
|-
| '''Qwen'''
| مدل‌های Open متعدد
|}
 
Self-hosting برای شرکت‌هایی که:
 
* Source Code محرمانه دارند
* محدودیت اینترنت دارند
* Data Residency مهم است
* هزینه API بالا دارند
 
می‌تواند مناسب باشد.
 
----
 
= معماری پیشنهادی Multi-Model Coding Agent =
 
استفاده از قوی‌ترین مدل برای تمام Taskها معمولاً اقتصادی نیست.
 
معماری بهتر:
 
<syntaxhighlight lang="text">
                        USER
                          │
                          ▼
                  CODING ORCHESTRATOR
                          │
                          ▼
                  Task Classification
                          │
          ┌────────────────┼────────────────┐
          │                │                │
          ▼                ▼                ▼
        SIMPLE          MEDIUM            HARD
          │                │                │
          ▼                ▼                ▼
GPT-5.6 Luna      GLM 5.3 Flash    Claude Sonnet 5
DeepSeek Flash    GPT-5.6 Terra      Gemini 3.8
GLM Flash          DeepSeek Pro      Grok 4.6
Grok Build        Gemini Flash            │
                                          ▼
                                    VERY COMPLEX
                                          │
                                          ▼
                                    GPT-5.6 Sol
                                          │
                                      Failed?
                                          │
                                          ▼
                                      GPT-6 Astra
</syntaxhighlight>
 
----
 
= معماری کم‌هزینه پیشنهادی =
 
<syntaxhighlight lang="text">
Task
│
▼
GLM 5.3 Flash
│
├── Success ──> DONE
│
▼
DeepSeek V4 Flash
│
├── Success ──> DONE
│
▼
Gemini 3.7/3.8 Flash
│
├── Success ──> DONE
│
▼
GPT-5.6 Terra
│
├── Success ──> DONE
│
▼
Claude Sonnet 5
│
├── Success ──> DONE
│
▼
GPT-5.6 Sol / GPT-6 Astra
</syntaxhighlight>
 
این معماری می‌تواند هزینه Coding Agent را به میزان قابل توجهی کاهش دهد.
 
----
 
= پیشنهاد برای Coding Agent روزمره =
 
اگر مدل‌ها بدون محدودیت یا با Subscription در دسترس باشند:
 
=== انتخاب اول ===
 
'''Gemini 3.8 Flash / Gemini 3.7 Flash'''
 
برای اکثر Taskهای روزمره.
 
=== انتخاب دوم ===
 
'''GLM 5.3 Flash'''
 
برای Coding سریع و Agentic Workload.
 
=== Task سخت ===
 
'''Claude Sonnet 5'''
 
=== Task بسیار سخت ===
 
'''GPT-5.6 Sol'''
 
=== Escalation نهایی ===
 
'''GPT-6 Astra'''
 
----
 
= نتیجه‌گیری =
 
بازار مدل‌های Coding در سال 2026 بسیار رقابتی شده است.
 
دیگر نمی‌توان گفت یک مدل در تمام شرایط بهترین انتخاب است.
 
اگر '''حداکثر قدرت''' اهمیت داشته باشد:
 
:🏆 '''GPT-6 Astra / GPT-5.6 Sol'''
 
اگر '''Coding Agent حرفه‌ای''' بخواهیم:
 
:🤖 '''Claude Sonnet 5'''
 
اگر '''Coding Agent سریع''' بخواهیم:
 
:⚡ '''Gemini 3.8 Flash / Gemini 3.7 Flash'''
 
اگر '''Price/Performance''' اولویت اصلی باشد:
 
:💰 '''GLM 5.3 Flash'''
 
اگر '''Coding اقتصادی''' بخواهیم:
 
:💵 '''DeepSeek V4 Flash 0731'''
 
اگر '''OpenAI با تعادل قیمت و قدرت''' بخواهیم:
 
:⚖️ '''GPT-5.6 Terra'''
 
اگر '''Coding + Tool Use''' اهمیت داشته باشد:
 
:🛠️ '''Grok 4.6'''
 
اگر '''Coding Agent ارزان''' بخواهیم:
 
:🚀 '''Grok Build 0.1'''
 
اگر '''Sub-Agent بسیار ارزان''' بخواهیم:
 
:💵 '''GPT-5.6 Luna'''
 
اگر '''Self-hosting''' بخواهیم:
 
:🔓 '''gpt-oss-120b / GLM / Mistral / Qwen'''
 
در سیستم‌های حرفه‌ای Software Engineering بهترین راهکار معمولاً استفاده از یک مدل واحد نیست.
 
استفاده از '''Multi-Model Routing''' باعث می‌شود Taskهای ساده توسط مدل‌های ارزان و سریع انجام شوند و تنها مسائل پیچیده به مدل‌های Frontier ارسال شوند.
 
این روش می‌تواند هم سرعت Agent را افزایش دهد و هم هزینه API را به میزان قابل توجهی کاهش دهد.
 
----
 
'''آخرین به‌روزرسانی: 4 سپتامبر 2026'''
 
[[رده:هوش مصنوعی]]
[[رده:برنامه‌نویسی]]
[[رده:مدل‌های زبانی بزرگ]]
[[رده:LLM]]
[[رده:Agentic AI]]
[[رده:Coding Agent]]
[[رده:Software Engineering]]
[[رده:OpenAI]]
[[رده:Claude]]
[[رده:Gemini]]
[[رده:DeepSeek]]
[[رده:GLM]]
[[رده:Grok]]

Revision as of 15:02, 4 September 2026

جدول جامع مقایسه مدل‌ها

جدول زیر مدل‌های مهم مناسب برای Programming، Software Engineering و Agentic Coding را مقایسه می‌کند.

مدل‌ها بر اساس تاریخ عرضه از جدیدترین به قدیمی‌ترین مرتب شده‌اند.

قیمت‌ها به ازای یک میلیون Token هستند.

تاریخ ارائه مدل شرکت Input Cached Input Output Context Max Output Coding Agentic Price/Performance کاربرد اصلی
2026-09-04 GPT-6 Astra 🆕 OpenAI $10 $1 $50 1.05M 128K 10/10 10/10 6.5/10 سخت‌ترین مسائل End-to-End، Coding، Computer Use و Software Engineering
2026-09-02 Gemini 3.8 Flash 🆕 Google DeepMind متغیر متغیر متغیر Long Context - 9.8/10 9.8/10 9.7/10 Coding، Agentic Workflows، Tool Use و Multimodal
2026-08-26 GLM 5.3 Flash 🔥 Z.ai / Zhipu AI $0.075* $0.015* $0.25* Long Context - 9.5/10 9.7/10 10/10 Coding Agent سریع و بسیار اقتصادی
2026-08-14 Gemini 3.7 Flash Google DeepMind $0.75* - $3.75* ~1M - 9.6/10 9.7/10 9.8/10 Coding Agent، Web Development و Multimodal Coding
2026-08-13 DeepSeek V4 Pro DeepSeek $0.66–$1.32 $0.022–$0.044 $1.98–$3.96 ~1M تا 384K 9.5/10 9.6/10 9.7/10 Agentic Coding و Software Engineering
2026-08-12 Grok 4.6 xAI $2 $0.50 $6 500K - 9.6/10 9.8/10 9.4/10 Long-running Agent، Coding، Reasoning و Tool Use
2026-07-31 DeepSeek V4 Flash 0731 💰 DeepSeek $0.22–$0.44 $0.007–$0.014 $0.66–$1.32 ~1M تا 384K 9.2/10 9.4/10 10/10 Coding اقتصادی، Agent و Sub-Agent
2026-07-09 GPT-5.6 Sol OpenAI $4 $0.40 $20 1.05M 128K 10/10 10/10 8/10 Coding و Software Engineering بسیار پیچیده
2026-07-09 GPT-5.6 Terra OpenAI $2 $0.20 $12 1.05M 128K 9.5/10 9.5/10 9.2/10 Coding حرفه‌ای با تعادل قدرت و هزینه
2026-07-09 GPT-5.6 Luna OpenAI $0.20 $0.02 $1.20 1.05M 128K 8.2/10 8.6/10 10/10 Sub-Agent، Coding ارزان و Taskهای پرتعداد
2026-06-30 Claude Sonnet 5 Anthropic $2 $0.20** $10 ~1M - 9.8/10 10/10 9.3/10 Coding Agent حرفه‌ای، Terminal، Tool Use و Refactoring
2026-06-13 GLM-5.2 Z.ai / Zhipu AI $1.40 $0.26 $4.40 ~1M - 9.5/10 9.7/10 9.4/10 Long-Horizon Coding Agent
2026-05-29 Grok Build 0.1 xAI $1 $0.20 $2 256K - 9.3/10 9.5/10 9.8/10 Agentic Software Engineering، Debugging و MCP
2026-05-22 Mistral Medium 3.5 Mistral AI $1.50 - $7.50 256K - 9.2/10 9.5/10 9.1/10 Long-Horizon Coding Agent و Open Weight
2026-05-20 Gemini 3.5 Flash Google DeepMind - - - Long Context - 8.6/10 8.7/10 8.5/10 Coding سریع و Agentic Workflows
2025-08-05 gpt-oss-120b OpenAI Self-host - Self-host 128K - 8.6/10 8.5/10 9.5/10 Local AI، Private Coding Agent و Self-hosting

توضیحات:

  • جدول بر اساس تاریخ عرضه از جدیدترین به قدیمی‌ترین مرتب شده است.
  • قیمت‌ها به دلار و به ازای یک میلیون Token هستند.
  • قیمت برخی مدل‌ها بر اساس Region، Context Length، Provider، Peak/Off-Peak یا نوع API تغییر می‌کند.
  • قیمت GLM 5.3 Flash در جدول، قیمت Promotional فعلی است و ممکن است تغییر کند.
  • قیمت Gemini 3.7 Flash قیمت Introductory است.
  • قیمت DeepSeek V4 بسته به Peak و Off-Peak تغییر می‌کند.
  • امتیازهای Coding، Agentic و Price/Performance ارزیابی مقایسه‌ای این مقاله هستند و امتیاز رسمی شرکت‌های سازنده محسوب نمی‌شوند.
  • علامت «-» به معنی نبود اطلاعات قطعی یا قابل مقایسه در این جدول است و الزاماً به معنی پشتیبانی‌نکردن مدل از آن قابلیت نیست.