LLM Agentic Coding Model: Difference between revisions
No edit summary |
m (Karavi moved page LLM Agentic Coding to LLM Agentic Coding Model) |
||
| (One intermediate revision by the same user not shown) | |||
| Line 1: | Line 1: | ||
= | = مقایسه جامع مدلهای هوش مصنوعی برای برنامهنویسی و Agentic Coding در سال 2026 = | ||
مدلهای هوش مصنوعی در سال 2026 از ابزارهای ساده Code Completion به سیستمهایی تبدیل شدهاند که میتوانند بخش قابل توجهی از فرایند مهندسی نرمافزار را بهصورت Agentic انجام دهند. | |||
مدلها بر اساس '''تاریخ | یک Coding Agent مدرن میتواند: | ||
* Repository را بررسی کند. | |||
* ساختار پروژه را درک کند. | |||
* چندین فایل را ویرایش کند. | |||
* Terminal و Shell اجرا کند. | |||
* Test اجرا کند. | |||
* خطا را پیدا و Debug کند. | |||
* Refactoring انجام دهد. | |||
* از Tool Calling و MCP استفاده کند. | |||
* نتیجه اجرای برنامه را بررسی کند. | |||
* پس از شکست، راهحل دیگری را امتحان کند. | |||
بنابراین برای انتخاب مدل مناسب برنامهنویسی، صرفاً قدرت تولید Code کافی نیست. | |||
در این مقاله مدلها از نظر موارد زیر بررسی میشوند: | |||
* Coding | |||
* Agentic Coding | |||
* Software Engineering | |||
* Debugging | |||
* Refactoring | |||
* Repository Understanding | |||
* Tool Calling | |||
* Long Context | |||
* Multimodal Coding | |||
* سرعت | |||
* قیمت API | |||
* Price/Performance | |||
* Self-hosting | |||
'''آخرین بهروزرسانی: 4 سپتامبر 2026''' | |||
---- | |||
= خلاصه سریع = | |||
{| class="wikitable" | |||
! کاربرد | |||
! مدل پیشنهادی | |||
! توضیح | |||
|- | |||
| 🏆 حداکثر قدرت | |||
| '''GPT-6 Astra''' | |||
| سختترین مسائل End-to-End | |||
|- | |||
| 🧠 Coding بسیار پیچیده | |||
| '''GPT-5.6 Sol''' | |||
| معماری، Debugging و Software Engineering پیچیده | |||
|- | |||
| 🤖 Coding Agent حرفهای | |||
| '''Claude Sonnet 5''' | |||
| Agentic Software Engineering و Tool Use | |||
|- | |||
| ⚡ Coding Agent سریع | |||
| '''Gemini 3.8 Flash / Gemini 3.7 Flash''' | |||
| سرعت بالا و مناسب Agent | |||
|- | |||
| 💰 بهترین Price/Performance | |||
| '''GLM 5.3 Flash''' | |||
| Coding و Agentic با هزینه بسیار پایین | |||
|- | |||
| 💵 Coding اقتصادی | |||
| '''DeepSeek V4 Flash 0731''' | |||
| مناسب Agent و پردازش پرتعداد | |||
|- | |||
| ⚖️ OpenAI متعادل | |||
| '''GPT-5.6 Terra''' | |||
| تعادل قدرت و هزینه | |||
|- | |||
| 🛠️ Coding + Tool Use | |||
| '''Grok 4.6''' | |||
| Agentic Workflow و Tool Calling | |||
|- | |||
| 🚀 Agentic Software Engineering | |||
| '''Grok Build 0.1''' | |||
| مدل تخصصی Coding Agent | |||
|- | |||
| 📚 Repository بزرگ | |||
| '''GPT-5.6 / Gemini / DeepSeek / Qwen / GLM''' | |||
| Long Context | |||
|- | |||
| 🖼️ Screenshot → Code | |||
| '''Gemini Flash / Claude / GPT-5.6''' | |||
| Multimodal Coding | |||
|- | |||
| 🔓 Self-hosting | |||
| '''gpt-oss-120b / GLM / Mistral / Qwen''' | |||
| اجرای Local و Private | |||
|} | |||
---- | |||
= جدول جامع مقایسه مدلها = | |||
جدول زیر مدلها را بر اساس '''تاریخ ارائه از جدیدترین به قدیمیترین''' مرتب میکند. | |||
قیمتها به ازای '''یک میلیون Token''' هستند. | قیمتها به ازای '''یک میلیون Token''' هستند. | ||
| Line 12: | Line 107: | ||
! شرکت | ! شرکت | ||
! Input | ! Input | ||
! Cached | ! Cached | ||
! Output | ! Output | ||
! Context | ! Context | ||
| Line 22: | Line 117: | ||
|- | |- | ||
| | | 2026-09-04 | ||
| '''GPT-6 Astra''' | | '''GPT-6 Astra''' | ||
| | | OpenAI | ||
| $10 | | $10 | ||
| $1 | | $1 | ||
| Line 32: | Line 127: | ||
| '''10/10''' | | '''10/10''' | ||
| '''10/10''' | | '''10/10''' | ||
| 6.5 | | 6.5 | ||
| سختترین | | سختترین End-to-End Workloads | ||
|- | |- | ||
| | | 2026-09-02 | ||
| '''Gemini 3.8 Flash''' | | '''Gemini 3.8 Flash''' | ||
| | | Google DeepMind | ||
| متغیر | | متغیر | ||
| متغیر | | متغیر | ||
| Line 44: | Line 139: | ||
| Long Context | | Long Context | ||
| - | | - | ||
| '''9.8 | | '''9.8''' | ||
| '''9.8 | | '''9.8''' | ||
| '''9.7 | | '''9.7''' | ||
| Coding، | | Coding، Agents و Multimodal | ||
|- | |- | ||
| | | 2026-08 | ||
| '''GLM 5.3 Flash''' | | '''GLM 5.3 Flash''' | ||
| | | Z.ai / Zhipu AI | ||
| | | بسیار ارزان | ||
| | | بسیار ارزان | ||
| | | بسیار ارزان | ||
| Long Context | | Long Context | ||
| - | | - | ||
| '''9.5 | | '''9.5''' | ||
| '''9.7 | | '''9.7''' | ||
| ''' | | '''10''' | ||
| Coding Agent | | Coding Agent اقتصادی | ||
|- | |- | ||
| | | 2026-08 | ||
| '''Gemini 3.7 Flash''' | | '''Gemini 3.7 Flash''' | ||
| | | Google DeepMind | ||
| | | Introductory | ||
| - | | - | ||
| | | Introductory | ||
| ~1M | | ~1M | ||
| - | | - | ||
| '''9.6 | | '''9.6''' | ||
| '''9.7 | | '''9.7''' | ||
| '''9.8 | | '''9.8''' | ||
| Coding | | Coding Agent سریع | ||
|- | |- | ||
| | | 2026-08 | ||
| '''DeepSeek V4 Pro''' | | '''DeepSeek V4 Pro''' | ||
| | | DeepSeek | ||
| | | Tiered | ||
| | | Tiered | ||
| | | Tiered | ||
| ~1M | | ~1M | ||
| تا 384K | | تا 384K | ||
| '''9.5 | | '''9.5''' | ||
| '''9.6 | | '''9.6''' | ||
| '''9.7 | | '''9.7''' | ||
| Agentic Coding | | Agentic Coding | ||
|- | |- | ||
| | | 2026-08 | ||
| '''Grok 4.6''' | | '''Grok 4.6''' | ||
| | | xAI | ||
| $2 | | $2* | ||
| $0.50 | | $0.50* | ||
| $6 | | $6* | ||
| 500K | | 500K | ||
| - | | - | ||
| '''9.6 | | '''9.6''' | ||
| '''9.8 | | '''9.8''' | ||
| '''9.4 | | '''9.4''' | ||
| | | Coding + Tool Use | ||
|- | |- | ||
| | | 2026-07-31 | ||
| '''DeepSeek V4 Flash 0731''' | | '''DeepSeek V4 Flash 0731''' | ||
| | | DeepSeek | ||
| $0. | | $0.22–0.44* | ||
| $0. | | $0.007–0.014* | ||
| $0. | | $0.66–1.32* | ||
| ~1M | | ~1M | ||
| تا 384K | | تا 384K | ||
| 9.2 | | '''9.2''' | ||
| '''9.4 | | '''9.4''' | ||
| ''' | | '''10''' | ||
| Coding | | Coding اقتصادی | ||
|- | |- | ||
| | | 2026-07 | ||
| '''GPT-5.6 Sol''' | | '''GPT-5.6 Sol''' | ||
| | | OpenAI | ||
| $4 | | $4 | ||
| $0.40 | | $0.40 | ||
| Line 128: | Line 223: | ||
| 1.05M | | 1.05M | ||
| 128K | | 128K | ||
| ''' | | '''10''' | ||
| ''' | | '''10''' | ||
| 8 | | 8 | ||
| Coding | | Complex Professional Coding | ||
|- | |- | ||
| | | 2026-07 | ||
| '''GPT-5.6 Terra''' | | '''GPT-5.6 Terra''' | ||
| | | OpenAI | ||
| $2 | | $2 | ||
| $0.20 | | $0.20 | ||
| Line 142: | Line 237: | ||
| 1.05M | | 1.05M | ||
| 128K | | 128K | ||
| '''9.5 | | '''9.5''' | ||
| '''9.5 | | '''9.5''' | ||
| '''9.2 | | '''9.2''' | ||
| | | تعادل قدرت و قیمت | ||
|- | |- | ||
| | | 2026-07 | ||
| '''GPT-5.6 Luna''' | | '''GPT-5.6 Luna''' | ||
| | | OpenAI | ||
| | | $0.20 | ||
| | | $0.02 | ||
| | | $1.20 | ||
| 1.05M | | 1.05M | ||
| 128K | | 128K | ||
| 8.2 | | 8.2 | ||
| 8.6 | | 8.6 | ||
| ''' | | '''10''' | ||
| Sub- | | High-volume / Sub-Agent | ||
|- | |- | ||
| | | 2026-06 | ||
| '''Claude Sonnet 5''' | | '''Claude Sonnet 5''' | ||
| | | Anthropic | ||
| $2 | | $2 | ||
| | | متغیر | ||
| $10 | | $10 | ||
| | | Long Context | ||
| - | |||
| '''9.8''' | |||
| '''10''' | |||
| '''9.3''' | |||
| Professional Coding Agent | |||
|- | |||
| 2026 | |||
| '''Claude Opus 4.6''' | |||
| Anthropic | |||
| Premium | |||
| متغیر | |||
| Premium | |||
| Long Context | |||
| - | | - | ||
| '''9. | | '''9.6''' | ||
| ''' | | '''9.7''' | ||
| | | 7.5 | ||
| | | Debugging و Reasoning بسیار پیچیده | ||
|- | |- | ||
| | | 2026 | ||
| '''GLM-5.2''' | | '''GLM-5.2''' | ||
| | | Z.ai / Zhipu AI | ||
| | | Provider-based | ||
| | | Provider-based | ||
| | | Provider-based | ||
| ~1M | | ~1M | ||
| - | | - | ||
| '''9.5 | | '''9.5''' | ||
| '''9.7 | | '''9.7''' | ||
| 9.4 | | 9.4 | ||
| Long-Horizon Coding | | Long-Horizon Coding | ||
|- | |- | ||
| | | 2026 | ||
| '''Grok Build 0.1''' | | '''Grok Build 0.1''' | ||
| | | xAI | ||
| $1 | | $1* | ||
| $0.20 | | $0.20* | ||
| $2 | | $2* | ||
| 256K | | 256K | ||
| - | | - | ||
| 9.3 | | 9.3 | ||
| '''9.5 | | '''9.5''' | ||
| '''9.8 | | '''9.8''' | ||
| Agentic Software | | Agentic Software Engineering | ||
|- | |- | ||
| | | 2026 | ||
| '''Mistral Medium 3.5''' | | '''Mistral Medium 3.5''' | ||
| | | Mistral AI | ||
| $1.50 | | $1.50 | ||
| - | | - | ||
| Line 212: | Line 321: | ||
| 256K | | 256K | ||
| - | | - | ||
| 9.2 | | 9.2 | ||
| '''9.5 | | '''9.5''' | ||
| 9.1 | | 9.1 | ||
| | | Coding و Agent | ||
|- | |||
| 2026 | |||
| '''Gemini 3.6 Flash''' | |||
| Google DeepMind | |||
| - | |||
| - | |||
| - | |||
| ~1M | |||
| - | |||
| 9.0 | |||
| 9.1 | |||
| 8.8 | |||
| Coding سریع | |||
|- | |- | ||
| | | 2026 | ||
| '''Gemini 3.5 Flash''' | | '''Gemini 3.5 Flash''' | ||
| | | Google DeepMind | ||
| - | |||
| - | |||
| - | | - | ||
| Long Context | |||
| - | | - | ||
| 8.6 | |||
| 8.7 | |||
| 8.5 | |||
| Coding و Multimodal | |||
|- | |||
| 2026 | |||
| '''Gemini 3.1 Pro''' | |||
| Google DeepMind | |||
| Tiered | |||
| Tiered | |||
| Tiered | |||
| ~1M | |||
| - | | - | ||
| '''9.5''' | |||
| '''9.6''' | |||
| 8.8 | |||
| Deep Reasoning | |||
|- | |||
| 2026 | |||
| '''Qwen 3.7 Max''' | |||
| Alibaba Cloud / Qwen | |||
| Region-based | |||
| Region-based | |||
| Region-based | |||
| ~1M | |||
| ~131K | |||
| '''9.4''' | |||
| '''9.5''' | |||
| 9.3 | |||
| Long Context | | Long Context | ||
|- | |||
| 2026 | |||
| '''Qwen3-Coder Plus''' | |||
| Alibaba Cloud / Qwen | |||
| Tiered | |||
| - | |||
| Tiered | |||
| ~1M | |||
| ~65K | |||
| '''9.2''' | |||
| 8.7 | |||
| 9.2 | |||
| Coding تخصصی | |||
|- | |||
| 2026 | |||
| '''MiMo 2.5''' | |||
| Xiaomi / MiMo | |||
| Provider-based | |||
| - | |||
| Provider-based | |||
| - | |||
| - | |||
| 8.7 | |||
| 8.7 | |||
| 9.2 | |||
| Coding + Multimodal | |||
|- | |||
| 2026 | |||
| '''Solar Pro 4''' | |||
| Upstage | |||
| Provider-based | |||
| - | |||
| Provider-based | |||
| - | |||
| - | | - | ||
| 8. | | 8.8 | ||
| 8.7 | | 8.7 | ||
| 8. | | 8.8 | ||
| Coding | | General Coding | ||
|- | |- | ||
| | | 2025-08-05 | ||
| '''gpt-oss-120b''' | | '''gpt-oss-120b''' | ||
| | | OpenAI | ||
| Self-host | | Self-host | ||
| - | | - | ||
| Line 240: | Line 433: | ||
| 128K | | 128K | ||
| - | | - | ||
| 8.6 | | 8.6 | ||
| 8.5 | | 8.5 | ||
| '''9.5 | | '''9.5''' | ||
| | | Self-hosted Coding | ||
|} | |} | ||
< | '''نکته:''' | ||
''' | |||
* امتیازهای Coding، Agentic و Price/Performance ارزیابی تحلیلی این مقاله هستند و Benchmark رسمی شرکتهای سازنده نیستند. | |||
* قیمت API ممکن است بر اساس Provider، Region، Context Length، Peak/Off-Peak و Promotional Pricing تغییر کند. | |||
* علامت «-» به معنی نبود اطلاعات قطعی قابل مقایسه در این جدول است. | |||
* برای مدلهایی که تاریخ دقیق نسخه مورد استفاده Provider مشخص نیست، سال یا ماه انتشار درج شده است. | |||
---- | |||
= رتبهبندی کلی برای برنامهنویسی = | |||
{| class="wikitable sortable" | |||
! رتبه | |||
! مدل | |||
! Coding | |||
! Agentic | |||
! مناسب برای | |||
|- | |||
| 1 | |||
| '''GPT-6 Astra''' | |||
| 10 | |||
| 10 | |||
| حداکثر قدرت | |||
|- | |||
| 2 | |||
| '''GPT-5.6 Sol''' | |||
| 10 | |||
| 10 | |||
| Software Engineering پیچیده | |||
|- | |||
| 3 | |||
| '''Claude Sonnet 5''' | |||
| 9.8 | |||
| 10 | |||
| Coding Agent | |||
|- | |||
| 4 | |||
| '''Gemini 3.8 Flash''' | |||
| 9.8 | |||
| 9.8 | |||
| Agent سریع | |||
|- | |||
| 5 | |||
| '''Grok 4.6''' | |||
| 9.6 | |||
| 9.8 | |||
| Coding + Tools | |||
|- | |||
| 6 | |||
| '''Gemini 3.7 Flash''' | |||
| 9.6 | |||
| 9.7 | |||
| Coding سریع | |||
|- | |||
| 7 | |||
| '''Claude Opus 4.6''' | |||
| 9.6 | |||
| 9.7 | |||
| مسائل سخت | |||
|- | |||
| 8 | |||
| '''GLM 5.3 Flash''' | |||
| 9.5 | |||
| 9.7 | |||
| Price/Performance | |||
|- | |||
| 9 | |||
| '''DeepSeek V4 Pro''' | |||
| 9.5 | |||
| 9.6 | |||
| Agentic Coding | |||
|- | |||
| 10 | |||
| '''Gemini 3.1 Pro''' | |||
| 9.5 | |||
| 9.6 | |||
| Deep Reasoning | |||
|- | |||
| 11 | |||
| '''GPT-5.6 Terra''' | |||
| 9.5 | |||
| 9.5 | |||
| Balanced Coding | |||
|- | |||
| 12 | |||
| '''Qwen 3.7 Max''' | |||
| 9.4 | |||
| 9.5 | |||
| Long Context | |||
|- | |||
| 13 | |||
| '''Grok Build 0.1''' | |||
| 9.3 | |||
| 9.5 | |||
| Agentic Software Engineering | |||
|- | |||
| 14 | |||
| '''DeepSeek V4 Flash''' | |||
| 9.2 | |||
| 9.4 | |||
| Low-cost Coding | |||
|- | |||
| 15 | |||
| '''Mistral Medium 3.5''' | |||
| 9.2 | |||
| 9.5 | |||
| Open / Agentic | |||
|- | |||
| 16 | |||
| '''Qwen3-Coder Plus''' | |||
| 9.2 | |||
| 8.7 | |||
| Coding | |||
|- | |||
| 17 | |||
| '''Gemini 3.6 Flash''' | |||
| 9.0 | |||
| 9.1 | |||
| Fast Coding | |||
|- | |||
| 18 | |||
| '''Solar Pro 4''' | |||
| 8.8 | |||
| 8.7 | |||
| General Coding | |||
|- | |||
| 19 | |||
| '''MiMo 2.5''' | |||
| 8.7 | |||
| 8.7 | |||
| Coding + Image | |||
|- | |||
| 20 | |||
| '''gpt-oss-120b''' | |||
| 8.6 | |||
| 8.5 | |||
| Self-host | |||
|- | |||
| 21 | |||
| '''Gemini 3.5 Flash''' | |||
| 8.6 | |||
| 8.7 | |||
| Fast Coding | |||
|- | |||
| 22 | |||
| '''GPT-5.6 Luna''' | |||
| 8.2 | |||
| 8.6 | |||
| Cheap Sub-Agent | |||
|} | |||
---- | |||
= مقایسه مدلهای اقتصادی برای Coding = | |||
این جدول برای زمانی مهم است که Coding Agent تعداد زیادی Token مصرف میکند. | |||
{| class="wikitable sortable" | |||
! مدل | |||
! Coding | |||
! Agentic | |||
! هزینه | |||
! Price/Performance | |||
! پیشنهاد | |||
|- | |||
| '''GLM 5.3 Flash''' | |||
| 9.5 | |||
| 9.7 | |||
| بسیار پایین | |||
| '''10/10''' | |||
| 🥇 | |||
|- | |||
| '''DeepSeek V4 Flash 0731''' | |||
| 9.2 | |||
| 9.4 | |||
| بسیار پایین | |||
| '''10/10''' | |||
| 🥇 | |||
|- | |||
| '''GPT-5.6 Luna''' | |||
| 8.2 | |||
| 8.6 | |||
| بسیار پایین | |||
| '''10/10''' | |||
| Sub-Agent | |||
|- | |||
| '''Grok Build 0.1''' | |||
| 9.3 | |||
| 9.5 | |||
| پایین | |||
| '''9.8/10''' | |||
| Coding Agent | |||
|- | |||
| '''Gemini 3.7 Flash''' | |||
| 9.6 | |||
| 9.7 | |||
| پایین/متوسط | |||
| '''9.8/10''' | |||
| Agent سریع | |||
|- | |||
| '''GPT-5.6 Terra''' | |||
| 9.5 | |||
| 9.5 | |||
| متوسط | |||
| 9.2/10 | |||
| Coding حرفهای | |||
|- | |||
| '''Claude Sonnet 5''' | |||
| 9.8 | |||
| 10 | |||
| متوسط | |||
| 9.3/10 | |||
| Task سخت | |||
|} | |||
---- | |||
= مقایسه برای Agentic Coding = | |||
Agentic Coding با Code Generation معمولی متفاوت است. | |||
در Agentic Coding مدل باید بتواند: | |||
* Task را برنامهریزی کند. | |||
* Repository را جستجو کند. | |||
* فایل مناسب را پیدا کند. | |||
* Terminal اجرا کند. | |||
* Code را تغییر دهد. | |||
* Test اجرا کند. | |||
* خطا را تحلیل کند. | |||
* مجدداً Code را اصلاح کند. | |||
* Toolهای مختلف را هماهنگ کند. | |||
{| class="wikitable sortable" | |||
! مدل | |||
! Agentic | |||
! Tool Use | |||
! Repository | |||
! Long-running Task | |||
! پیشنهاد | |||
|- | |||
| '''GPT-6 Astra''' | |||
| 10 | |||
| عالی | |||
| عالی | |||
| عالی | |||
| 🥇 | |||
|- | |||
| '''Claude Sonnet 5''' | |||
| 10 | |||
| عالی | |||
| عالی | |||
| عالی | |||
| 🥇 | |||
|- | |||
| '''GPT-5.6 Sol''' | |||
| 10 | |||
| عالی | |||
| عالی | |||
| عالی | |||
| 🥇 | |||
|- | |||
| '''Gemini 3.8 Flash''' | |||
| 9.8 | |||
| عالی | |||
| عالی | |||
| عالی | |||
| ⭐ | |||
|- | |||
| '''Grok 4.6''' | |||
| 9.8 | |||
| عالی | |||
| عالی | |||
| عالی | |||
| ⭐ | |||
|- | |||
| '''GLM 5.3 Flash''' | |||
| 9.7 | |||
| عالی | |||
| عالی | |||
| عالی | |||
| ⭐ | |||
|- | |||
| '''Gemini 3.7 Flash''' | |||
| 9.7 | |||
| عالی | |||
| عالی | |||
| عالی | |||
| ⭐ | |||
|- | |||
| '''Claude Opus 4.6''' | |||
| 9.7 | |||
| عالی | |||
| عالی | |||
| عالی | |||
| Task بسیار سخت | |||
|- | |||
| '''DeepSeek V4 Pro''' | |||
| 9.6 | |||
| عالی | |||
| عالی | |||
| عالی | |||
| ⭐ | |||
|- | |||
| '''Grok Build''' | |||
| 9.5 | |||
| عالی | |||
| خوب | |||
| عالی | |||
| ⭐ | |||
|- | |||
| '''GPT-5.6 Terra''' | |||
| 9.5 | |||
| عالی | |||
| عالی | |||
| عالی | |||
| ⭐ | |||
|} | |||
---- | |||
= مقایسه برای Debugging و Refactoring = | |||
{| class="wikitable sortable" | |||
! مدل | |||
! Debugging | |||
! Refactoring | |||
! Architecture | |||
! پیشنهاد | |||
|- | |||
| '''GPT-6 Astra''' | |||
| 10 | |||
| 10 | |||
| 10 | |||
| 🥇 | |||
|- | |||
| '''GPT-5.6 Sol''' | |||
| 10 | |||
| 10 | |||
| 10 | |||
| 🥇 | |||
|- | |||
| '''Claude Sonnet 5''' | |||
| 9.8 | |||
| 9.8 | |||
| 9.7 | |||
| ⭐ | |||
|- | |||
| '''Claude Opus 4.6''' | |||
| 9.8 | |||
| 9.8 | |||
| 9.8 | |||
| ⭐ | |||
|- | |||
| '''Gemini 3.8 Flash''' | |||
| 9.6 | |||
| 9.6 | |||
| 9.5 | |||
| ⭐ | |||
|- | |||
| '''Grok 4.6''' | |||
| 9.6 | |||
| 9.5 | |||
| 9.5 | |||
| ⭐ | |||
|- | |||
| '''GLM 5.3 Flash''' | |||
| 9.5 | |||
| 9.5 | |||
| 9.3 | |||
| خوب | |||
|- | |||
| '''DeepSeek V4 Pro''' | |||
| 9.5 | |||
| 9.5 | |||
| 9.4 | |||
| خوب | |||
|- | |||
| '''GPT-5.6 Terra''' | |||
| 9.5 | |||
| 9.5 | |||
| 9.5 | |||
| خوب | |||
|} | |||
---- | |||
= مقایسه برای Repositoryهای بزرگ = | |||
برای Repository بزرگ، Context Window فقط یکی از معیارها است. | |||
مدل همچنین باید بتواند ارتباط میان فایلها، Dependencyها، Interfaceها و Call Chainها را درک کند. | |||
{| class="wikitable sortable" | |||
! مدل | |||
! Context تقریبی | |||
! Repository Understanding | |||
! پیشنهاد | |||
|- | |||
| '''GPT-6 Astra''' | |||
| 1.05M | |||
| عالی | |||
| 🥇 | |||
|- | |||
| '''GPT-5.6 Sol''' | |||
| 1.05M | |||
| عالی | |||
| 🥇 | |||
|- | |||
| '''GPT-5.6 Terra''' | |||
| 1.05M | |||
| عالی | |||
| ⭐ | |||
|- | |||
| '''GPT-5.6 Luna''' | |||
| 1.05M | |||
| خوب | |||
| پردازش اولیه | |||
|- | |||
| '''Gemini Flash''' | |||
| ~1M | |||
| عالی | |||
| ⭐ | |||
|- | |||
| '''DeepSeek V4''' | |||
| ~1M | |||
| عالی | |||
| ⭐ | |||
|- | |||
| '''GLM''' | |||
| Long Context | |||
| عالی | |||
| ⭐ | |||
|- | |||
| '''Qwen 3.7 Max''' | |||
| ~1M | |||
| عالی | |||
| ⭐ | |||
|- | |||
| '''gpt-oss-120b''' | |||
| 128K | |||
| خوب | |||
| Self-host | |||
|} | |||
---- | |||
= مقایسه Frontend و Screenshot-to-Code = | |||
برای کارهایی مانند: | |||
* Screenshot → HTML/CSS | |||
* Screenshot → React | |||
* Screenshot → Angular | |||
* UI → Responsive Design | |||
* تحلیل Layout | |||
* تولید Component | |||
* تشخیص عناصر تصویر | |||
* تبدیل Design به Code | |||
مدل Multimodal مزیت مهمی دارد. | |||
{| class="wikitable sortable" | |||
! رتبه | |||
! مدل | |||
! Frontend | |||
! Vision | |||
! Agentic | |||
|- | |||
| 1 | |||
| '''Gemini 3.8 Flash''' | |||
| 9.8 | |||
| عالی | |||
| 9.8 | |||
|- | |||
| 2 | |||
| '''Gemini 3.7 Flash''' | |||
| 9.7 | |||
| عالی | |||
| 9.7 | |||
|- | |||
| 3 | |||
| '''Claude Sonnet 5''' | |||
| 9.7 | |||
| عالی | |||
| 10 | |||
|- | |||
| 4 | |||
| '''GPT-5.6 Sol''' | |||
| 9.7 | |||
| عالی | |||
| 10 | |||
|- | |||
| 5 | |||
| '''GPT-5.6 Terra''' | |||
| 9.5 | |||
| عالی | |||
| 9.5 | |||
|- | |||
| 6 | |||
| '''MiMo 2.5''' | |||
| 8.8 | |||
| خوب | |||
| 8.7 | |||
|} | |||
---- | |||
= مقایسه Backend و Microservice = | |||
برای: | |||
* ASP.NET Core | |||
* C# | |||
* Java | |||
* Spring | |||
* Node.js | |||
* Python | |||
* Go | |||
* REST API | |||
* gRPC | |||
* Microservices | |||
* SQL | |||
* Redis | |||
* RabbitMQ | |||
* Kafka | |||
* Docker | |||
* Kubernetes | |||
{| class="wikitable sortable" | |||
! رتبه | |||
! مدل | |||
! Backend | |||
! Architecture | |||
! Debugging | |||
! Agentic | |||
|- | |||
| 1 | |||
| '''GPT-6 Astra''' | |||
| 10 | |||
| 10 | |||
| 10 | |||
| 10 | |||
|- | |||
| 2 | |||
| '''GPT-5.6 Sol''' | |||
| 10 | |||
| 10 | |||
| 10 | |||
| 10 | |||
|- | |||
| 3 | |||
| '''Claude Sonnet 5''' | |||
| 9.8 | |||
| 9.7 | |||
| 9.8 | |||
| 10 | |||
|- | |||
| 4 | |||
| '''Gemini 3.8 Flash''' | |||
| 9.7 | |||
| 9.5 | |||
| 9.6 | |||
| 9.8 | |||
|- | |||
| 5 | |||
| '''Grok 4.6''' | |||
| 9.6 | |||
| 9.5 | |||
| 9.6 | |||
| 9.8 | |||
|- | |||
| 6 | |||
| '''GPT-5.6 Terra''' | |||
| 9.5 | |||
| 9.5 | |||
| 9.5 | |||
| 9.5 | |||
|- | |||
| 7 | |||
| '''GLM 5.3 Flash''' | |||
| 9.5 | |||
| 9.3 | |||
| 9.5 | |||
| 9.7 | |||
|- | |||
| 8 | |||
| '''DeepSeek V4 Pro''' | |||
| 9.5 | |||
| 9.4 | |||
| 9.5 | |||
| 9.6 | |||
|} | |||
---- | |||
= مقایسه مدلهای Open Weight و Self-hosted = | |||
در سازمانهایی که Source Code محرمانه است، Self-hosting میتواند اهمیت زیادی داشته باشد. | |||
{| class="wikitable sortable" | |||
! مدل | |||
! Self-host | |||
! Coding | |||
! Agentic | |||
! کاربرد | |||
|- | |||
| '''gpt-oss-120b''' | |||
| '''بله''' | |||
| 8.6 | |||
| 8.5 | |||
| Private Coding Agent | |||
|- | |||
| '''GLM Open Models''' | |||
| '''بله''' | |||
| عالی | |||
| عالی | |||
| Coding / Reasoning | |||
|- | |||
| '''Mistral''' | |||
| '''بله''' | |||
| عالی | |||
| عالی | |||
| Enterprise Agent | |||
|- | |||
| '''Qwen''' | |||
| '''بله''' | |||
| عالی | |||
| خوب تا عالی | |||
| Coding / Long Context | |||
|} | |||
مزایای Self-hosting: | |||
* حفظ Source Code در شبکه داخلی | |||
* Data Residency | |||
* کنترل کامل Infrastructure | |||
* عدم وابستگی به API خارجی | |||
* امکان استفاده در شبکه بدون اینترنت | |||
* امکان Fine-tuning یا Custom Deployment | |||
* کنترل هزینه در حجم بسیار بالا | |||
---- | |||
= مقایسه نسلهای Gemini Flash = | |||
{| class="wikitable" | |||
! مدل | |||
! Coding | |||
! Agentic | |||
! وضعیت پیشنهادی | |||
|- | |||
| '''Gemini 3.8 Flash''' | |||
| '''9.8''' | |||
| '''9.8''' | |||
| 🥇 اولویت اول | |||
|- | |||
| '''Gemini 3.7 Flash''' | |||
| '''9.6''' | |||
| '''9.7''' | |||
| ⭐ بسیار مناسب | |||
|- | |||
| '''Gemini 3.6 Flash''' | |||
| 9.0 | |||
| 9.1 | |||
| نسل قبلی | |||
|- | |||
| '''Gemini 3.5 Flash''' | |||
| 8.6 | |||
| 8.7 | |||
| اولویت پایینتر | |||
|} | |||
در صورت دسترسی یکسان: | |||
<pre> | |||
Gemini 3.8 Flash | |||
↓ | |||
Gemini 3.7 Flash | |||
↓ | |||
Gemini 3.6 Flash | |||
↓ | |||
Gemini 3.5 Flash | |||
</pre> | |||
---- | |||
= مقایسه خانواده GPT-5.6 = | |||
{| class="wikitable" | |||
! ویژگی | |||
! GPT-5.6 Sol | |||
! GPT-5.6 Terra | |||
! GPT-5.6 Luna | |||
|- | |||
| Input / 1M | |||
| $4 | |||
| $2 | |||
| $0.20 | |||
|- | |||
| Cached | |||
| $0.40 | |||
| $0.20 | |||
| $0.02 | |||
|- | |||
| Output / 1M | |||
| $20 | |||
| $12 | |||
| $1.20 | |||
|- | |||
| Context | |||
| 1.05M | |||
| 1.05M | |||
| 1.05M | |||
|- | |||
| Max Output | |||
| 128K | |||
| 128K | |||
| 128K | |||
|- | |||
| Coding | |||
| '''10''' | |||
| '''9.5''' | |||
| 8.2 | |||
|- | |||
| Agentic | |||
| '''10''' | |||
| '''9.5''' | |||
| 8.6 | |||
|- | |||
| کاربرد | |||
| Hard Tasks | |||
| Daily Professional Coding | |||
| Cheap / High Volume | |||
|} | |||
بنابراین: | |||
<pre> | |||
مسئله بسیار پیچیده → Sol | |||
Coding حرفهای روزمره → Terra | |||
Task ساده و پرتعداد → Luna | |||
</pre> | |||
---- | |||
= مقایسه Claude برای Coding = | |||
{| class="wikitable" | |||
! مدل | |||
! Coding | |||
! Agentic | |||
! Debugging | |||
! کاربرد | |||
|- | |||
| '''Claude Sonnet 5''' | |||
| 9.8 | |||
| '''10''' | |||
| 9.8 | |||
| Coding Agent روزمره | |||
|- | |||
| '''Claude Opus 4.6''' | |||
| 9.6 | |||
| 9.7 | |||
| '''9.8''' | |||
| Escalation / Hard Reasoning | |||
|} | |||
در Coding Agent میتوان از معماری زیر استفاده کرد: | |||
<pre> | |||
Claude Sonnet | |||
│ | |||
│ Failed / Very Hard | |||
▼ | |||
Claude Opus | |||
</pre> | |||
---- | |||
= مقایسه DeepSeek = | |||
{| class="wikitable" | |||
! مدل | |||
! Coding | |||
! Agentic | |||
! هزینه | |||
! کاربرد | |||
|- | |||
| '''DeepSeek V4 Pro''' | |||
| '''9.5''' | |||
| '''9.6''' | |||
| پایین | |||
| Task پیچیده | |||
|- | |||
| '''DeepSeek V4 Flash 0731''' | |||
| 9.2 | |||
| 9.4 | |||
| '''بسیار پایین''' | |||
| Daily Agent / Sub-Agent | |||
|} | |||
اگر هزینه مهم باشد: | |||
'''V4 Flash''' | |||
اگر قدرت بیشتر مهم باشد: | |||
'''V4 Pro''' | |||
---- | |||
= مقایسه GLM = | |||
{| class="wikitable" | |||
! مدل | |||
! Coding | |||
! Agentic | |||
! Price/Performance | |||
! پیشنهاد | |||
|- | |||
| '''GLM 5.3 Flash''' | |||
| 9.5 | |||
| 9.7 | |||
| '''10''' | |||
| 🥇 | |||
|- | |||
| '''GLM-5.2''' | |||
| 9.5 | |||
| 9.7 | |||
| 9.4 | |||
| Long-Horizon | |||
|} | |||
GLM 5.3 Flash به دلیل ترکیب: | |||
* سرعت | |||
* Coding | |||
* Agentic capability | |||
* هزینه پایین | |||
یکی از جذابترین گزینههای Coding Agent است. | |||
---- | |||
= مقایسه مدلهای مشاهدهشده در Provider = | |||
در بررسی Provider مورد استفاده، مدلهای زیر نیز در دسترس بودند: | |||
* DeepSeek V4 Flash 0731 | |||
* GLM 5.3 Flash | |||
* GPT-5.6 Luna | |||
* MiMo 2.5 | |||
* Solar Pro 4 | |||
برای Coding: | |||
{| class="wikitable" | |||
! رتبه | |||
! مدل | |||
! Coding | |||
! Agentic | |||
! پیشنهاد | |||
|- | |||
| 1 | |||
| '''GLM 5.3 Flash''' | |||
| 9.5 | |||
| 9.7 | |||
| 🥇 | |||
|- | |||
| 2 | |||
| '''DeepSeek V4 Flash 0731''' | |||
| 9.2 | |||
| 9.4 | |||
| 🥈 | |||
|- | |||
| 3 | |||
| '''Solar Pro 4''' | |||
| 8.8 | |||
| 8.7 | |||
| 🥉 | |||
|- | |||
| 4 | |||
| '''MiMo 2.5''' | |||
| 8.7 | |||
| 8.7 | |||
| Multimodal | |||
|- | |||
| 5 | |||
| '''GPT-5.6 Luna''' | |||
| 8.2 | |||
| 8.6 | |||
| Sub-Agent | |||
|} | |||
---- | |||
= مقایسه مدلهای مشاهدهشده در Antigravity = | |||
مدلهای بررسیشده: | |||
* Gemini 3.7 Flash | |||
* Gemini 3.6 Flash | |||
* Claude Opus 4.6 | |||
* Claude Sonnet 4.6 | |||
* Gemini 3.1 Pro | |||
* Gemini 3.5 Flash | |||
* gpt-oss-120b | |||
{| class="wikitable sortable" | |||
! رتبه | |||
! مدل | |||
! Coding | |||
! Agentic | |||
! بهترین کاربرد | |||
|- | |||
| 1 | |||
| '''Gemini 3.7 Flash''' | |||
| 9.6 | |||
| 9.7 | |||
| Coding روزمره سریع | |||
|- | |||
| 2 | |||
| '''Claude Opus 4.6''' | |||
| 9.6 | |||
| 9.7 | |||
| مسائل بسیار پیچیده | |||
|- | |||
| 3 | |||
| '''Claude Sonnet 4.6''' | |||
| 9.5 | |||
| 9.6 | |||
| Coding Agent | |||
|- | |||
| 4 | |||
| '''Gemini 3.1 Pro''' | |||
| 9.5 | |||
| 9.6 | |||
| Deep Reasoning | |||
|- | |||
| 5 | |||
| '''Gemini 3.6 Flash''' | |||
| 9.0 | |||
| 9.1 | |||
| Fast Coding | |||
|- | |||
| 6 | |||
| '''Gemini 3.5 Flash''' | |||
| 8.6 | |||
| 8.7 | |||
| Taskهای سادهتر | |||
|- | |||
| 7 | |||
| '''gpt-oss-120b''' | |||
| 8.6 | |||
| 8.5 | |||
| Self-hosting | |||
|} | |||
---- | |||
= انتخاب مدل بر اساس نوع Task = | |||
{| class="wikitable sortable" | |||
! Task | |||
! انتخاب اول | |||
! انتخاب دوم | |||
! انتخاب اقتصادی | |||
|- | |||
| Coding روزمره | |||
| Gemini 3.8/3.7 Flash | |||
| Claude Sonnet 5 | |||
| GLM 5.3 Flash | |||
|- | |||
| Bug پیچیده | |||
| GPT-5.6 Sol | |||
| Claude Sonnet 5 | |||
| DeepSeek V4 Pro | |||
|- | |||
| Architecture | |||
| GPT-6 Astra | |||
| GPT-5.6 Sol | |||
| GPT-5.6 Terra | |||
|- | |||
| Refactoring | |||
| Claude Sonnet 5 | |||
| GPT-5.6 Sol | |||
| GLM 5.3 Flash | |||
|- | |||
| Repository بزرگ | |||
| GPT-5.6 Sol | |||
| Gemini | |||
| DeepSeek / GLM | |||
|- | |||
| Frontend | |||
| Gemini Flash | |||
| Claude Sonnet | |||
| GLM | |||
|- | |||
| Backend | |||
| GPT-5.6 Sol | |||
| Claude Sonnet | |||
| GLM / DeepSeek | |||
|- | |||
| Tool-heavy Agent | |||
| Claude Sonnet 5 | |||
| Grok 4.6 | |||
| Grok Build | |||
|- | |||
| Sub-Agent | |||
| GPT-5.6 Luna | |||
| DeepSeek Flash | |||
| GLM Flash | |||
|- | |||
| Self-host | |||
| gpt-oss-120b | |||
| GLM | |||
| Qwen / Mistral | |||
|} | |||
---- | |||
= معماری پیشنهادی Multi-Model Coding Agent = | |||
استفاده از گرانترین مدل برای تمام درخواستها از نظر اقتصادی بهینه نیست. | |||
یک Orchestrator میتواند ابتدا Task را طبقهبندی کند. | |||
<pre> | |||
USER | |||
│ | |||
▼ | |||
CODING ORCHESTRATOR | |||
│ | |||
▼ | |||
TASK CLASSIFIER | |||
│ | |||
┌───────────────┼───────────────┐ | |||
│ │ │ | |||
▼ ▼ ▼ | |||
SIMPLE MEDIUM HARD | |||
│ │ │ | |||
▼ ▼ ▼ | |||
GPT-5.6 Luna GLM 5.3 Flash Claude Sonnet 5 | |||
DeepSeek Flash Gemini Flash GPT-5.6 Sol | |||
GLM Flash GPT-5.6 Terra Grok 4.6 | |||
│ │ │ | |||
└───────────────┼───────────────┘ | |||
│ | |||
▼ | |||
FAILED? | |||
│ | |||
YES | |||
│ | |||
▼ | |||
GPT-6 Astra | |||
</pre> | |||
---- | |||
= معماری پیشنهادی برای کاهش هزینه = | |||
به جای شروع Task با مدل گران: | |||
<pre> | |||
Task | |||
│ | |||
▼ | |||
GLM 5.3 Flash | |||
│ | |||
├── Success ───────────────► DONE | |||
│ | |||
▼ | |||
DeepSeek V4 Flash | |||
│ | |||
├── Success ───────────────► DONE | |||
│ | |||
▼ | |||
Gemini Flash | |||
│ | |||
├── Success ───────────────► DONE | |||
│ | |||
▼ | |||
GPT-5.6 Terra | |||
│ | |||
├── Success ───────────────► DONE | |||
│ | |||
▼ | |||
Claude Sonnet 5 | |||
│ | |||
├── Success ───────────────► DONE | |||
│ | |||
▼ | |||
GPT-5.6 Sol | |||
│ | |||
├── Success ───────────────► DONE | |||
│ | |||
▼ | |||
GPT-6 Astra | |||
</pre> | |||
این روش '''Escalation Routing''' نامیده میشود. | |||
---- | |||
= معماری پیشنهادی Orchestrator + Worker = | |||
برای سیستمهایی مانند Coding Agent، استفاده از یک مدل به عنوان Orchestrator و مدلهای ارزان به عنوان Worker میتواند مؤثر باشد. | |||
<pre> | |||
ORCHESTRATOR | |||
Claude / GPT / Gemini | |||
│ | |||
┌───────────────┼───────────────┐ | |||
│ │ │ | |||
▼ ▼ ▼ | |||
WORKER 1 WORKER 2 WORKER 3 | |||
GLM Flash DeepSeek Flash GPT Luna | |||
│ │ │ | |||
▼ ▼ ▼ | |||
Coding Testing Analysis | |||
│ │ │ | |||
└───────────────┼───────────────┘ | |||
│ | |||
▼ | |||
CODE REVIEW | |||
│ | |||
▼ | |||
ORCHESTRATOR | |||
</pre> | |||
---- | |||
= معماری پیشنهادی برای Repository بزرگ = | |||
<pre> | |||
Repository | |||
│ | |||
▼ | |||
Repository Scanner | |||
│ | |||
├── Architecture Files | |||
├── Source Files | |||
├── Tests | |||
├── Database | |||
├── Config | |||
└── Documentation | |||
│ | |||
▼ | |||
Cheap Models | |||
Luna / GLM / DeepSeek | |||
│ | |||
▼ | |||
Summary / Index | |||
│ | |||
▼ | |||
Powerful Model | |||
Claude / GPT / Gemini | |||
│ | |||
▼ | |||
Solution | |||
</pre> | |||
این معماری باعث میشود لازم نباشد تمام Source Code در هر Request به مدل گران ارسال شود. | |||
---- | |||
= آیا همیشه قویترین مدل بهتر است؟ = | |||
خیر. | |||
فرض کنید یک Task با مدل ارزان: | |||
<pre> | |||
1M Input | |||
100K Output | |||
</pre> | |||
قابل انجام باشد. | |||
ارسال همان Task به یک Frontier Model ممکن است چندین برابر هزینه ایجاد کند بدون اینکه نتیجه نهایی تفاوت مهمی داشته باشد. | |||
بنابراین باید سه عامل را همزمان بررسی کرد: | |||
# کیفیت | |||
# زمان | |||
# هزینه | |||
در Coding Agent معیار مهم دیگری نیز وجود دارد: | |||
'''تعداد Iteration لازم برای رسیدن به جواب صحیح''' | |||
ممکن است مدل A از نظر Token ارزانتر باشد اما برای حل Task پنج بار تلاش کند. | |||
در حالی که مدل B گرانتر است اما Task را در اولین تلاش حل میکند. | |||
بنابراین: | |||
<pre> | |||
Real Cost = | |||
Token Cost | |||
+ | |||
Retries | |||
+ | |||
Tool Calls | |||
+ | |||
Execution Time | |||
+ | |||
Developer Time | |||
</pre> | |||
---- | |||
= استراتژی پیشنهادی استفاده روزمره = | |||
برای Coding روزمره: | |||
'''Gemini Flash / GLM 5.3 Flash''' | |||
برای Feature پیچیده: | |||
'''GPT-5.6 Terra / Claude Sonnet''' | |||
برای Bug سخت: | |||
'''Claude Sonnet 5 / GPT-5.6 Sol''' | |||
برای Architecture: | |||
'''GPT-5.6 Sol / GPT-6 Astra''' | |||
برای Taskهای پرتعداد: | |||
'''GPT-5.6 Luna / DeepSeek Flash / GLM Flash''' | |||
برای Local: | |||
'''gpt-oss-120b / Qwen / GLM / Mistral''' | |||
---- | |||
= نتیجهگیری نهایی = | |||
در سال 2026 یک مدل واحد را نمیتوان برای تمام سناریوهای برنامهنویسی «بهترین» دانست. | |||
'''حداکثر قدرت:''' | |||
:🏆 GPT-6 Astra | |||
'''Software Engineering بسیار پیچیده:''' | |||
:🧠 GPT-5.6 Sol | |||
'''Coding Agent حرفهای:''' | |||
:🤖 Claude Sonnet 5 | |||
'''Coding Agent سریع:''' | |||
:⚡ Gemini 3.8 / 3.7 Flash | |||
'''بهترین Price/Performance:''' | |||
:💰 GLM 5.3 Flash | |||
'''Coding اقتصادی:''' | |||
:💵 DeepSeek V4 Flash 0731 | |||
'''تعادل قدرت و هزینه در OpenAI:''' | |||
:⚖️ GPT-5.6 Terra | |||
'''Tool-heavy Agent:''' | |||
:🛠️ Grok 4.6 | |||
'''Agentic Software Engineering اقتصادی:''' | |||
:🚀 Grok Build 0.1 | |||
'''Sub-Agent و پردازش پرتعداد:''' | |||
:💵 GPT-5.6 Luna | |||
'''Self-hosting:''' | |||
:🔓 gpt-oss-120b / GLM / Qwen / Mistral | |||
اما برای سیستمهای حرفهای، راهکار مناسبتر استفاده از '''Multi-Model Architecture''' است. | |||
در چنین معماری: | |||
<pre> | |||
Cheap Model | |||
↓ | |||
Medium Model | |||
↓ | |||
Strong Model | |||
↓ | |||
Frontier Model | |||
</pre> | |||
تنها Taskهایی که مدل قبلی قادر به حل آنها نیست به مدل گرانتر منتقل میشوند. | |||
این معماری میتواند: | |||
* | * هزینه API را کاهش دهد. | ||
* سرعت Coding Agent را افزایش دهد. | |||
* Parallel Agentها را اقتصادی کند. | |||
* استفاده از Contextهای بسیار بزرگ را مدیریت کند. | |||
* از Frontier Model فقط در جایی که واقعاً لازم است استفاده کند. | |||
در نتیجه، برای ساخت Coding Agent حرفهای در سال 2026، '''انتخاب معماری Routing به اندازه انتخاب خود مدل اهمیت دارد.''' | |||
---- | |||
[[رده:هوش مصنوعی]] | |||
[[رده:برنامهنویسی]] | |||
[[رده:مدلهای زبانی بزرگ]] | |||
[[رده:LLM]] | |||
[[رده:Agentic AI]] | |||
[[رده:Coding Agent]] | |||
[[رده:Software Engineering]] | |||
[[رده:Artificial Intelligence]] | |||
[[رده:OpenAI]] | |||
[[رده:Claude]] | |||
[[رده:Gemini]] | |||
[[رده:DeepSeek]] | |||
[[رده:GLM]] | |||
[[رده:Grok]] | |||
[[رده:Qwen]] | |||
[[رده:Mistral]] | |||
Latest revision as of 15:06, 4 September 2026
مقایسه جامع مدلهای هوش مصنوعی برای برنامهنویسی و Agentic Coding در سال 2026
مدلهای هوش مصنوعی در سال 2026 از ابزارهای ساده Code Completion به سیستمهایی تبدیل شدهاند که میتوانند بخش قابل توجهی از فرایند مهندسی نرمافزار را بهصورت Agentic انجام دهند.
یک Coding Agent مدرن میتواند:
- Repository را بررسی کند.
- ساختار پروژه را درک کند.
- چندین فایل را ویرایش کند.
- Terminal و Shell اجرا کند.
- Test اجرا کند.
- خطا را پیدا و Debug کند.
- Refactoring انجام دهد.
- از Tool Calling و MCP استفاده کند.
- نتیجه اجرای برنامه را بررسی کند.
- پس از شکست، راهحل دیگری را امتحان کند.
بنابراین برای انتخاب مدل مناسب برنامهنویسی، صرفاً قدرت تولید Code کافی نیست.
در این مقاله مدلها از نظر موارد زیر بررسی میشوند:
- Coding
- Agentic Coding
- Software Engineering
- Debugging
- Refactoring
- Repository Understanding
- Tool Calling
- Long Context
- Multimodal Coding
- سرعت
- قیمت API
- Price/Performance
- Self-hosting
آخرین بهروزرسانی: 4 سپتامبر 2026
خلاصه سریع
| کاربرد | مدل پیشنهادی | توضیح |
|---|---|---|
| 🏆 حداکثر قدرت | GPT-6 Astra | سختترین مسائل End-to-End |
| 🧠 Coding بسیار پیچیده | GPT-5.6 Sol | معماری، Debugging و Software Engineering پیچیده |
| 🤖 Coding Agent حرفهای | Claude Sonnet 5 | Agentic Software Engineering و Tool Use |
| ⚡ Coding Agent سریع | Gemini 3.8 Flash / Gemini 3.7 Flash | سرعت بالا و مناسب Agent |
| 💰 بهترین Price/Performance | GLM 5.3 Flash | Coding و Agentic با هزینه بسیار پایین |
| 💵 Coding اقتصادی | DeepSeek V4 Flash 0731 | مناسب Agent و پردازش پرتعداد |
| ⚖️ OpenAI متعادل | GPT-5.6 Terra | تعادل قدرت و هزینه |
| 🛠️ Coding + Tool Use | Grok 4.6 | Agentic Workflow و Tool Calling |
| 🚀 Agentic Software Engineering | Grok Build 0.1 | مدل تخصصی Coding Agent |
| 📚 Repository بزرگ | GPT-5.6 / Gemini / DeepSeek / Qwen / GLM | Long Context |
| 🖼️ Screenshot → Code | Gemini Flash / Claude / GPT-5.6 | Multimodal Coding |
| 🔓 Self-hosting | gpt-oss-120b / GLM / Mistral / Qwen | اجرای Local و Private |
جدول جامع مقایسه مدلها
جدول زیر مدلها را بر اساس تاریخ ارائه از جدیدترین به قدیمیترین مرتب میکند.
قیمتها به ازای یک میلیون Token هستند.
| تاریخ ارائه | مدل | شرکت | Input | Cached | Output | Context | Max Output | Coding | Agentic | Price/Performance | کاربرد اصلی |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 2026-09-04 | GPT-6 Astra | OpenAI | $10 | $1 | $50 | 1.05M | 128K | 10/10 | 10/10 | 6.5 | سختترین End-to-End Workloads |
| 2026-09-02 | Gemini 3.8 Flash | Google DeepMind | متغیر | متغیر | متغیر | Long Context | - | 9.8 | 9.8 | 9.7 | Coding، Agents و Multimodal |
| 2026-08 | GLM 5.3 Flash | Z.ai / Zhipu AI | بسیار ارزان | بسیار ارزان | بسیار ارزان | Long Context | - | 9.5 | 9.7 | 10 | Coding Agent اقتصادی |
| 2026-08 | Gemini 3.7 Flash | Google DeepMind | Introductory | - | Introductory | ~1M | - | 9.6 | 9.7 | 9.8 | Coding Agent سریع |
| 2026-08 | DeepSeek V4 Pro | DeepSeek | Tiered | Tiered | Tiered | ~1M | تا 384K | 9.5 | 9.6 | 9.7 | Agentic Coding |
| 2026-08 | Grok 4.6 | xAI | $2* | $0.50* | $6* | 500K | - | 9.6 | 9.8 | 9.4 | Coding + Tool Use |
| 2026-07-31 | DeepSeek V4 Flash 0731 | DeepSeek | $0.22–0.44* | $0.007–0.014* | $0.66–1.32* | ~1M | تا 384K | 9.2 | 9.4 | 10 | Coding اقتصادی |
| 2026-07 | GPT-5.6 Sol | OpenAI | $4 | $0.40 | $20 | 1.05M | 128K | 10 | 10 | 8 | Complex Professional Coding |
| 2026-07 | GPT-5.6 Terra | OpenAI | $2 | $0.20 | $12 | 1.05M | 128K | 9.5 | 9.5 | 9.2 | تعادل قدرت و قیمت |
| 2026-07 | GPT-5.6 Luna | OpenAI | $0.20 | $0.02 | $1.20 | 1.05M | 128K | 8.2 | 8.6 | 10 | High-volume / Sub-Agent |
| 2026-06 | Claude Sonnet 5 | Anthropic | $2 | متغیر | $10 | Long Context | - | 9.8 | 10 | 9.3 | Professional Coding Agent |
| 2026 | Claude Opus 4.6 | Anthropic | Premium | متغیر | Premium | Long Context | - | 9.6 | 9.7 | 7.5 | Debugging و Reasoning بسیار پیچیده |
| 2026 | GLM-5.2 | Z.ai / Zhipu AI | Provider-based | Provider-based | Provider-based | ~1M | - | 9.5 | 9.7 | 9.4 | Long-Horizon Coding |
| 2026 | Grok Build 0.1 | xAI | $1* | $0.20* | $2* | 256K | - | 9.3 | 9.5 | 9.8 | Agentic Software Engineering |
| 2026 | Mistral Medium 3.5 | Mistral AI | $1.50 | - | $7.50 | 256K | - | 9.2 | 9.5 | 9.1 | Coding و Agent |
| 2026 | Gemini 3.6 Flash | Google DeepMind | - | - | - | ~1M | - | 9.0 | 9.1 | 8.8 | Coding سریع |
| 2026 | Gemini 3.5 Flash | Google DeepMind | - | - | - | Long Context | - | 8.6 | 8.7 | 8.5 | Coding و Multimodal |
| 2026 | Gemini 3.1 Pro | Google DeepMind | Tiered | Tiered | Tiered | ~1M | - | 9.5 | 9.6 | 8.8 | Deep Reasoning |
| 2026 | Qwen 3.7 Max | Alibaba Cloud / Qwen | Region-based | Region-based | Region-based | ~1M | ~131K | 9.4 | 9.5 | 9.3 | Long Context |
| 2026 | Qwen3-Coder Plus | Alibaba Cloud / Qwen | Tiered | - | Tiered | ~1M | ~65K | 9.2 | 8.7 | 9.2 | Coding تخصصی |
| 2026 | MiMo 2.5 | Xiaomi / MiMo | Provider-based | - | Provider-based | - | - | 8.7 | 8.7 | 9.2 | Coding + Multimodal |
| 2026 | Solar Pro 4 | Upstage | Provider-based | - | Provider-based | - | - | 8.8 | 8.7 | 8.8 | General Coding |
| 2025-08-05 | gpt-oss-120b | OpenAI | Self-host | - | Self-host | 128K | - | 8.6 | 8.5 | 9.5 | Self-hosted Coding |
نکته:
- امتیازهای Coding، Agentic و Price/Performance ارزیابی تحلیلی این مقاله هستند و Benchmark رسمی شرکتهای سازنده نیستند.
- قیمت API ممکن است بر اساس Provider، Region، Context Length، Peak/Off-Peak و Promotional Pricing تغییر کند.
- علامت «-» به معنی نبود اطلاعات قطعی قابل مقایسه در این جدول است.
- برای مدلهایی که تاریخ دقیق نسخه مورد استفاده Provider مشخص نیست، سال یا ماه انتشار درج شده است.
رتبهبندی کلی برای برنامهنویسی
| رتبه | مدل | Coding | Agentic | مناسب برای |
|---|---|---|---|---|
| 1 | GPT-6 Astra | 10 | 10 | حداکثر قدرت |
| 2 | GPT-5.6 Sol | 10 | 10 | Software Engineering پیچیده |
| 3 | Claude Sonnet 5 | 9.8 | 10 | Coding Agent |
| 4 | Gemini 3.8 Flash | 9.8 | 9.8 | Agent سریع |
| 5 | Grok 4.6 | 9.6 | 9.8 | Coding + Tools |
| 6 | Gemini 3.7 Flash | 9.6 | 9.7 | Coding سریع |
| 7 | Claude Opus 4.6 | 9.6 | 9.7 | مسائل سخت |
| 8 | GLM 5.3 Flash | 9.5 | 9.7 | Price/Performance |
| 9 | DeepSeek V4 Pro | 9.5 | 9.6 | Agentic Coding |
| 10 | Gemini 3.1 Pro | 9.5 | 9.6 | Deep Reasoning |
| 11 | GPT-5.6 Terra | 9.5 | 9.5 | Balanced Coding |
| 12 | Qwen 3.7 Max | 9.4 | 9.5 | Long Context |
| 13 | Grok Build 0.1 | 9.3 | 9.5 | Agentic Software Engineering |
| 14 | DeepSeek V4 Flash | 9.2 | 9.4 | Low-cost Coding |
| 15 | Mistral Medium 3.5 | 9.2 | 9.5 | Open / Agentic |
| 16 | Qwen3-Coder Plus | 9.2 | 8.7 | Coding |
| 17 | Gemini 3.6 Flash | 9.0 | 9.1 | Fast Coding |
| 18 | Solar Pro 4 | 8.8 | 8.7 | General Coding |
| 19 | MiMo 2.5 | 8.7 | 8.7 | Coding + Image |
| 20 | gpt-oss-120b | 8.6 | 8.5 | Self-host |
| 21 | Gemini 3.5 Flash | 8.6 | 8.7 | Fast Coding |
| 22 | GPT-5.6 Luna | 8.2 | 8.6 | Cheap Sub-Agent |
مقایسه مدلهای اقتصادی برای Coding
این جدول برای زمانی مهم است که Coding Agent تعداد زیادی Token مصرف میکند.
| مدل | Coding | Agentic | هزینه | Price/Performance | پیشنهاد |
|---|---|---|---|---|---|
| GLM 5.3 Flash | 9.5 | 9.7 | بسیار پایین | 10/10 | 🥇 |
| DeepSeek V4 Flash 0731 | 9.2 | 9.4 | بسیار پایین | 10/10 | 🥇 |
| GPT-5.6 Luna | 8.2 | 8.6 | بسیار پایین | 10/10 | Sub-Agent |
| Grok Build 0.1 | 9.3 | 9.5 | پایین | 9.8/10 | Coding Agent |
| Gemini 3.7 Flash | 9.6 | 9.7 | پایین/متوسط | 9.8/10 | Agent سریع |
| GPT-5.6 Terra | 9.5 | 9.5 | متوسط | 9.2/10 | Coding حرفهای |
| Claude Sonnet 5 | 9.8 | 10 | متوسط | 9.3/10 | Task سخت |
مقایسه برای Agentic Coding
Agentic Coding با Code Generation معمولی متفاوت است.
در Agentic Coding مدل باید بتواند:
- Task را برنامهریزی کند.
- Repository را جستجو کند.
- فایل مناسب را پیدا کند.
- Terminal اجرا کند.
- Code را تغییر دهد.
- Test اجرا کند.
- خطا را تحلیل کند.
- مجدداً Code را اصلاح کند.
- Toolهای مختلف را هماهنگ کند.
| مدل | Agentic | Tool Use | Repository | Long-running Task | پیشنهاد |
|---|---|---|---|---|---|
| GPT-6 Astra | 10 | عالی | عالی | عالی | 🥇 |
| Claude Sonnet 5 | 10 | عالی | عالی | عالی | 🥇 |
| GPT-5.6 Sol | 10 | عالی | عالی | عالی | 🥇 |
| Gemini 3.8 Flash | 9.8 | عالی | عالی | عالی | ⭐ |
| Grok 4.6 | 9.8 | عالی | عالی | عالی | ⭐ |
| GLM 5.3 Flash | 9.7 | عالی | عالی | عالی | ⭐ |
| Gemini 3.7 Flash | 9.7 | عالی | عالی | عالی | ⭐ |
| Claude Opus 4.6 | 9.7 | عالی | عالی | عالی | Task بسیار سخت |
| DeepSeek V4 Pro | 9.6 | عالی | عالی | عالی | ⭐ |
| Grok Build | 9.5 | عالی | خوب | عالی | ⭐ |
| GPT-5.6 Terra | 9.5 | عالی | عالی | عالی | ⭐ |
مقایسه برای Debugging و Refactoring
| مدل | Debugging | Refactoring | Architecture | پیشنهاد |
|---|---|---|---|---|
| GPT-6 Astra | 10 | 10 | 10 | 🥇 |
| GPT-5.6 Sol | 10 | 10 | 10 | 🥇 |
| Claude Sonnet 5 | 9.8 | 9.8 | 9.7 | ⭐ |
| Claude Opus 4.6 | 9.8 | 9.8 | 9.8 | ⭐ |
| Gemini 3.8 Flash | 9.6 | 9.6 | 9.5 | ⭐ |
| Grok 4.6 | 9.6 | 9.5 | 9.5 | ⭐ |
| GLM 5.3 Flash | 9.5 | 9.5 | 9.3 | خوب |
| DeepSeek V4 Pro | 9.5 | 9.5 | 9.4 | خوب |
| GPT-5.6 Terra | 9.5 | 9.5 | 9.5 | خوب |
مقایسه برای Repositoryهای بزرگ
برای Repository بزرگ، Context Window فقط یکی از معیارها است.
مدل همچنین باید بتواند ارتباط میان فایلها، Dependencyها، Interfaceها و Call Chainها را درک کند.
| مدل | Context تقریبی | Repository Understanding | پیشنهاد |
|---|---|---|---|
| GPT-6 Astra | 1.05M | عالی | 🥇 |
| GPT-5.6 Sol | 1.05M | عالی | 🥇 |
| GPT-5.6 Terra | 1.05M | عالی | ⭐ |
| GPT-5.6 Luna | 1.05M | خوب | پردازش اولیه |
| Gemini Flash | ~1M | عالی | ⭐ |
| DeepSeek V4 | ~1M | عالی | ⭐ |
| GLM | Long Context | عالی | ⭐ |
| Qwen 3.7 Max | ~1M | عالی | ⭐ |
| gpt-oss-120b | 128K | خوب | Self-host |
مقایسه Frontend و Screenshot-to-Code
برای کارهایی مانند:
- Screenshot → HTML/CSS
- Screenshot → React
- Screenshot → Angular
- UI → Responsive Design
- تحلیل Layout
- تولید Component
- تشخیص عناصر تصویر
- تبدیل Design به Code
مدل Multimodal مزیت مهمی دارد.
| رتبه | مدل | Frontend | Vision | Agentic |
|---|---|---|---|---|
| 1 | Gemini 3.8 Flash | 9.8 | عالی | 9.8 |
| 2 | Gemini 3.7 Flash | 9.7 | عالی | 9.7 |
| 3 | Claude Sonnet 5 | 9.7 | عالی | 10 |
| 4 | GPT-5.6 Sol | 9.7 | عالی | 10 |
| 5 | GPT-5.6 Terra | 9.5 | عالی | 9.5 |
| 6 | MiMo 2.5 | 8.8 | خوب | 8.7 |
مقایسه Backend و Microservice
برای:
- ASP.NET Core
- C#
- Java
- Spring
- Node.js
- Python
- Go
- REST API
- gRPC
- Microservices
- SQL
- Redis
- RabbitMQ
- Kafka
- Docker
- Kubernetes
| رتبه | مدل | Backend | Architecture | Debugging | Agentic |
|---|---|---|---|---|---|
| 1 | GPT-6 Astra | 10 | 10 | 10 | 10 |
| 2 | GPT-5.6 Sol | 10 | 10 | 10 | 10 |
| 3 | Claude Sonnet 5 | 9.8 | 9.7 | 9.8 | 10 |
| 4 | Gemini 3.8 Flash | 9.7 | 9.5 | 9.6 | 9.8 |
| 5 | Grok 4.6 | 9.6 | 9.5 | 9.6 | 9.8 |
| 6 | GPT-5.6 Terra | 9.5 | 9.5 | 9.5 | 9.5 |
| 7 | GLM 5.3 Flash | 9.5 | 9.3 | 9.5 | 9.7 |
| 8 | DeepSeek V4 Pro | 9.5 | 9.4 | 9.5 | 9.6 |
مقایسه مدلهای Open Weight و Self-hosted
در سازمانهایی که Source Code محرمانه است، Self-hosting میتواند اهمیت زیادی داشته باشد.
| مدل | Self-host | Coding | Agentic | کاربرد |
|---|---|---|---|---|
| gpt-oss-120b | بله | 8.6 | 8.5 | Private Coding Agent |
| GLM Open Models | بله | عالی | عالی | Coding / Reasoning |
| Mistral | بله | عالی | عالی | Enterprise Agent |
| Qwen | بله | عالی | خوب تا عالی | Coding / Long Context |
مزایای Self-hosting:
- حفظ Source Code در شبکه داخلی
- Data Residency
- کنترل کامل Infrastructure
- عدم وابستگی به API خارجی
- امکان استفاده در شبکه بدون اینترنت
- امکان Fine-tuning یا Custom Deployment
- کنترل هزینه در حجم بسیار بالا
مقایسه نسلهای Gemini Flash
| مدل | Coding | Agentic | وضعیت پیشنهادی |
|---|---|---|---|
| Gemini 3.8 Flash | 9.8 | 9.8 | 🥇 اولویت اول |
| Gemini 3.7 Flash | 9.6 | 9.7 | ⭐ بسیار مناسب |
| Gemini 3.6 Flash | 9.0 | 9.1 | نسل قبلی |
| Gemini 3.5 Flash | 8.6 | 8.7 | اولویت پایینتر |
در صورت دسترسی یکسان:
Gemini 3.8 Flash
↓
Gemini 3.7 Flash
↓
Gemini 3.6 Flash
↓
Gemini 3.5 Flash
مقایسه خانواده GPT-5.6
| ویژگی | GPT-5.6 Sol | GPT-5.6 Terra | GPT-5.6 Luna |
|---|---|---|---|
| Input / 1M | $4 | $2 | $0.20 |
| Cached | $0.40 | $0.20 | $0.02 |
| Output / 1M | $20 | $12 | $1.20 |
| Context | 1.05M | 1.05M | 1.05M |
| Max Output | 128K | 128K | 128K |
| Coding | 10 | 9.5 | 8.2 |
| Agentic | 10 | 9.5 | 8.6 |
| کاربرد | Hard Tasks | Daily Professional Coding | Cheap / High Volume |
بنابراین:
مسئله بسیار پیچیده → Sol Coding حرفهای روزمره → Terra Task ساده و پرتعداد → Luna
مقایسه Claude برای Coding
| مدل | Coding | Agentic | Debugging | کاربرد |
|---|---|---|---|---|
| Claude Sonnet 5 | 9.8 | 10 | 9.8 | Coding Agent روزمره |
| Claude Opus 4.6 | 9.6 | 9.7 | 9.8 | Escalation / Hard Reasoning |
در Coding Agent میتوان از معماری زیر استفاده کرد:
Claude Sonnet
│
│ Failed / Very Hard
▼
Claude Opus
مقایسه DeepSeek
| مدل | Coding | Agentic | هزینه | کاربرد |
|---|---|---|---|---|
| DeepSeek V4 Pro | 9.5 | 9.6 | پایین | Task پیچیده |
| DeepSeek V4 Flash 0731 | 9.2 | 9.4 | بسیار پایین | Daily Agent / Sub-Agent |
اگر هزینه مهم باشد:
V4 Flash
اگر قدرت بیشتر مهم باشد:
V4 Pro
مقایسه GLM
| مدل | Coding | Agentic | Price/Performance | پیشنهاد |
|---|---|---|---|---|
| GLM 5.3 Flash | 9.5 | 9.7 | 10 | 🥇 |
| GLM-5.2 | 9.5 | 9.7 | 9.4 | Long-Horizon |
GLM 5.3 Flash به دلیل ترکیب:
- سرعت
- Coding
- Agentic capability
- هزینه پایین
یکی از جذابترین گزینههای Coding Agent است.
مقایسه مدلهای مشاهدهشده در Provider
در بررسی Provider مورد استفاده، مدلهای زیر نیز در دسترس بودند:
- DeepSeek V4 Flash 0731
- GLM 5.3 Flash
- GPT-5.6 Luna
- MiMo 2.5
- Solar Pro 4
برای Coding:
| رتبه | مدل | Coding | Agentic | پیشنهاد |
|---|---|---|---|---|
| 1 | GLM 5.3 Flash | 9.5 | 9.7 | 🥇 |
| 2 | DeepSeek V4 Flash 0731 | 9.2 | 9.4 | 🥈 |
| 3 | Solar Pro 4 | 8.8 | 8.7 | 🥉 |
| 4 | MiMo 2.5 | 8.7 | 8.7 | Multimodal |
| 5 | GPT-5.6 Luna | 8.2 | 8.6 | Sub-Agent |
مقایسه مدلهای مشاهدهشده در Antigravity
مدلهای بررسیشده:
- Gemini 3.7 Flash
- Gemini 3.6 Flash
- Claude Opus 4.6
- Claude Sonnet 4.6
- Gemini 3.1 Pro
- Gemini 3.5 Flash
- gpt-oss-120b
| رتبه | مدل | Coding | Agentic | بهترین کاربرد |
|---|---|---|---|---|
| 1 | Gemini 3.7 Flash | 9.6 | 9.7 | Coding روزمره سریع |
| 2 | Claude Opus 4.6 | 9.6 | 9.7 | مسائل بسیار پیچیده |
| 3 | Claude Sonnet 4.6 | 9.5 | 9.6 | Coding Agent |
| 4 | Gemini 3.1 Pro | 9.5 | 9.6 | Deep Reasoning |
| 5 | Gemini 3.6 Flash | 9.0 | 9.1 | Fast Coding |
| 6 | Gemini 3.5 Flash | 8.6 | 8.7 | Taskهای سادهتر |
| 7 | gpt-oss-120b | 8.6 | 8.5 | Self-hosting |
انتخاب مدل بر اساس نوع Task
| Task | انتخاب اول | انتخاب دوم | انتخاب اقتصادی |
|---|---|---|---|
| Coding روزمره | Gemini 3.8/3.7 Flash | Claude Sonnet 5 | GLM 5.3 Flash |
| Bug پیچیده | GPT-5.6 Sol | Claude Sonnet 5 | DeepSeek V4 Pro |
| Architecture | GPT-6 Astra | GPT-5.6 Sol | GPT-5.6 Terra |
| Refactoring | Claude Sonnet 5 | GPT-5.6 Sol | GLM 5.3 Flash |
| Repository بزرگ | GPT-5.6 Sol | Gemini | DeepSeek / GLM |
| Frontend | Gemini Flash | Claude Sonnet | GLM |
| Backend | GPT-5.6 Sol | Claude Sonnet | GLM / DeepSeek |
| Tool-heavy Agent | Claude Sonnet 5 | Grok 4.6 | Grok Build |
| Sub-Agent | GPT-5.6 Luna | DeepSeek Flash | GLM Flash |
| Self-host | gpt-oss-120b | GLM | Qwen / Mistral |
معماری پیشنهادی Multi-Model Coding Agent
استفاده از گرانترین مدل برای تمام درخواستها از نظر اقتصادی بهینه نیست.
یک Orchestrator میتواند ابتدا Task را طبقهبندی کند.
USER
│
▼
CODING ORCHESTRATOR
│
▼
TASK CLASSIFIER
│
┌───────────────┼───────────────┐
│ │ │
▼ ▼ ▼
SIMPLE MEDIUM HARD
│ │ │
▼ ▼ ▼
GPT-5.6 Luna GLM 5.3 Flash Claude Sonnet 5
DeepSeek Flash Gemini Flash GPT-5.6 Sol
GLM Flash GPT-5.6 Terra Grok 4.6
│ │ │
└───────────────┼───────────────┘
│
▼
FAILED?
│
YES
│
▼
GPT-6 Astra
معماری پیشنهادی برای کاهش هزینه
به جای شروع Task با مدل گران:
Task │ ▼ GLM 5.3 Flash │ ├── Success ───────────────► DONE │ ▼ DeepSeek V4 Flash │ ├── Success ───────────────► DONE │ ▼ Gemini Flash │ ├── Success ───────────────► DONE │ ▼ GPT-5.6 Terra │ ├── Success ───────────────► DONE │ ▼ Claude Sonnet 5 │ ├── Success ───────────────► DONE │ ▼ GPT-5.6 Sol │ ├── Success ───────────────► DONE │ ▼ GPT-6 Astra
این روش Escalation Routing نامیده میشود.
معماری پیشنهادی Orchestrator + Worker
برای سیستمهایی مانند Coding Agent، استفاده از یک مدل به عنوان Orchestrator و مدلهای ارزان به عنوان Worker میتواند مؤثر باشد.
ORCHESTRATOR
Claude / GPT / Gemini
│
┌───────────────┼───────────────┐
│ │ │
▼ ▼ ▼
WORKER 1 WORKER 2 WORKER 3
GLM Flash DeepSeek Flash GPT Luna
│ │ │
▼ ▼ ▼
Coding Testing Analysis
│ │ │
└───────────────┼───────────────┘
│
▼
CODE REVIEW
│
▼
ORCHESTRATOR
معماری پیشنهادی برای Repository بزرگ
Repository
│
▼
Repository Scanner
│
├── Architecture Files
├── Source Files
├── Tests
├── Database
├── Config
└── Documentation
│
▼
Cheap Models
Luna / GLM / DeepSeek
│
▼
Summary / Index
│
▼
Powerful Model
Claude / GPT / Gemini
│
▼
Solution
این معماری باعث میشود لازم نباشد تمام Source Code در هر Request به مدل گران ارسال شود.
آیا همیشه قویترین مدل بهتر است؟
خیر.
فرض کنید یک Task با مدل ارزان:
1M Input 100K Output
قابل انجام باشد.
ارسال همان Task به یک Frontier Model ممکن است چندین برابر هزینه ایجاد کند بدون اینکه نتیجه نهایی تفاوت مهمی داشته باشد.
بنابراین باید سه عامل را همزمان بررسی کرد:
- کیفیت
- زمان
- هزینه
در Coding Agent معیار مهم دیگری نیز وجود دارد:
تعداد Iteration لازم برای رسیدن به جواب صحیح
ممکن است مدل A از نظر Token ارزانتر باشد اما برای حل Task پنج بار تلاش کند.
در حالی که مدل B گرانتر است اما Task را در اولین تلاش حل میکند.
بنابراین:
Real Cost = Token Cost + Retries + Tool Calls + Execution Time + Developer Time
استراتژی پیشنهادی استفاده روزمره
برای Coding روزمره:
Gemini Flash / GLM 5.3 Flash
برای Feature پیچیده:
GPT-5.6 Terra / Claude Sonnet
برای Bug سخت:
Claude Sonnet 5 / GPT-5.6 Sol
برای Architecture:
GPT-5.6 Sol / GPT-6 Astra
برای Taskهای پرتعداد:
GPT-5.6 Luna / DeepSeek Flash / GLM Flash
برای Local:
gpt-oss-120b / Qwen / GLM / Mistral
نتیجهگیری نهایی
در سال 2026 یک مدل واحد را نمیتوان برای تمام سناریوهای برنامهنویسی «بهترین» دانست.
حداکثر قدرت:
- 🏆 GPT-6 Astra
Software Engineering بسیار پیچیده:
- 🧠 GPT-5.6 Sol
Coding Agent حرفهای:
- 🤖 Claude Sonnet 5
Coding Agent سریع:
- ⚡ Gemini 3.8 / 3.7 Flash
بهترین Price/Performance:
- 💰 GLM 5.3 Flash
Coding اقتصادی:
- 💵 DeepSeek V4 Flash 0731
تعادل قدرت و هزینه در OpenAI:
- ⚖️ GPT-5.6 Terra
Tool-heavy Agent:
- 🛠️ Grok 4.6
Agentic Software Engineering اقتصادی:
- 🚀 Grok Build 0.1
Sub-Agent و پردازش پرتعداد:
- 💵 GPT-5.6 Luna
Self-hosting:
- 🔓 gpt-oss-120b / GLM / Qwen / Mistral
اما برای سیستمهای حرفهای، راهکار مناسبتر استفاده از Multi-Model Architecture است.
در چنین معماری:
Cheap Model
↓
Medium Model
↓
Strong Model
↓
Frontier Model
تنها Taskهایی که مدل قبلی قادر به حل آنها نیست به مدل گرانتر منتقل میشوند.
این معماری میتواند:
- هزینه API را کاهش دهد.
- سرعت Coding Agent را افزایش دهد.
- Parallel Agentها را اقتصادی کند.
- استفاده از Contextهای بسیار بزرگ را مدیریت کند.
- از Frontier Model فقط در جایی که واقعاً لازم است استفاده کند.
در نتیجه، برای ساخت Coding Agent حرفهای در سال 2026، انتخاب معماری Routing به اندازه انتخاب خود مدل اهمیت دارد.
رده:هوش مصنوعی رده:برنامهنویسی رده:مدلهای زبانی بزرگ رده:LLM رده:Agentic AI رده:Coding Agent رده:Software Engineering رده:Artificial Intelligence رده:OpenAI رده:Claude رده:Gemini رده:DeepSeek رده:GLM رده:Grok رده:Qwen رده:Mistral