AI Coding.Info
RepositoriesREPORTS
ABOUT

آیا می توان از LLM محلی برای کدنویسی AI استفاده کرد؟ ~خلاصه روندهای کدگذاری هوش مصنوعی در جولای 2026 همانطور که از طریق داده ها مشاهده می شود~

نویسنده: @kotauchisunsun

تاریخ انتشار: 2026/08/12

روندهای عامل کدنویسی هوش مصنوعی در آگوست 2026

ما از جولای 2025 سایتی به نام AI Coding.Info را راه اندازی کرده ایم.

https://ai-coding.info/

https://x.com/AICodingInfo

این سایتی است که روند استفاده مربوط به عوامل کدنویسی هوش مصنوعی مانند Claude Code، Codex CLI، Github Copilot و Gemini را از یک نقطه ثابت از اطلاعات موجود در مخازن Github مشاهده می کند. برای تعیین استفاده از عامل کدنویسی هوش مصنوعی، نظرسنجی‌های روزانه را تحت شرایط زیر انجام می‌دهیم.

روندهای ماه گذشته

https://ai-coding.info/reports/articles/20260703

نرخ استفاده از عامل کدنویسی AI 13.0٪ است

نرخ استفاده از مخزن عامل کدگذاری AI 13.0% بود که نسبت به دفعه قبل 12.1% 0.9% افزایش داشت.

image.png

image.png

نرخ استفاده از عامل کدگذاری هوش مصنوعی در 1/8/2026

https://ai-coding.info/?date=2026-08-01#adoption-rate

نرخ استفاده از عامل کدگذاری هوش مصنوعی در 1 ژوئیه 2026

https://ai-coding.info/?date=2026-07-01#adoption-rate

روند نرخ استفاده از عامل کدنویسی هوش مصنوعی از 2026/7/1 تا 2026/8/1

https://ai-coding.info/?date=2026-04-01&since=2026-07-01&until=2026-08-01#share-trend

سهم عامل کدنویسی هوش مصنوعی بر اساس محصول

سهم محصول به شرح زیر است.

رتبه بندینام محصولنرخ سهم
مقام اولکدکس CLI40.8 درصد
مقام دومکد کلود32.0٪
مقام سومعامل کمک خلبان15.1%
مقام چهارمجمینی CLI(ضد گرانش)5.3 درصد
مقام پنجممکان نما4.4 درصد

در حالی که سهم Codex CLI در حال افزایش است، Claude Code ثابت می ماند. Copilot Agent و Gemini CLI (Antigravity) نیز کاهش جزئی را نشان می دهند. مکان نما چیزی است که من کمی به آن توجه کرده ام. مکان نما توسط SpaceX خریداری شده است. خبری بود.

https://www.nikkei.com/article/DGXZQOGN16BC70W6A610C2000000/

بنابراین آیا تغییری در نرخ سهم این مکان نما رخ خواهد داد؟ من اینطور فکر می کردم، اما ماه گذشته 4.7٪ و این ماه 4.4٪ بود، بنابراین تغییر چندانی وجود ندارد. با نگاهی به تعداد مخازن ذکر شده در زیر، در تاریخ 1 ژوئیه، 85 مخزن وجود داشت که از مکان نما استفاده کردند و تا 1 آگوست، تعداد مخازن بدون تغییر در 85 باقی مانده است. بنابراین، با توجه به این پدیده، جمعیت مخازن با استفاده از AI Coding Agent به طور کلی افزایش یافته است، اما تعداد استفاده از مکان نما افزایش نیافته است. در نتیجه، سهم کلی بازار در حال کاهش است. این به یک پدیده تبدیل شده است. با این حال، به دلیل ویژگی‌های تحقیقات AI Coding.Info، تعداد مخازن با فایل‌های پیکربندی خاص مکان‌نما (. مکان‌نما) تغییر نخواهد کرد. همانطور که گفته شد، مکان نما خود از AGENTS.md پشتیبانی می کند. AI Coding.Info بیان می کند که تعداد مخازن با AGENTS.md = تعداد پذیرش کدکس CLI است، بنابراین اگرچه از مکان نما استفاده می شود، اما ممکن است به عنوان Codex CLI در نظر گرفته شود و این احتمال وجود دارد که تعداد استفاده ها در یک قسمت نامرئی افزایش یابد.

image.png

نرخ سهم عامل کدگذاری هوش مصنوعی در تاریخ 1/8/2026

https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#agent-share

نرخ سهم عامل کدگذاری هوش مصنوعی در 1/7/2026

https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#agent-share

وضعیت استفاده از عامل کدنویسی هوش مصنوعی بر اساس زبان برنامه نویسی

زبان برنامه نویسی که AI Coding Agent در آن بیشتر استفاده می شود «TypeScript»، دومی «Python»، سومی «Rust»، چهارمی «Go» و پنجمی «C#» است. نرخ پذیرش کدنویسی هوش مصنوعی برای TypeScript همچنان بالا است، در حالی که ترکیب «Python»، «Rust» و «Go» به عنوان گروه دوم، و «C#» به عنوان گروه سوم یک روند ثابت در سال‌های اخیر بوده است.

image.png

رتبه بندی عامل کدنویسی هوش مصنوعی بر اساس زبان برنامه نویسی در 1/8/2026

https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#language-agent-rank

رتبه بندی عامل کدنویسی هوش مصنوعی بر اساس زبان برنامه نویسی در 1 جولای 2026

https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#language-agent-rank

روند ماهانه در تعداد مخازن مورد استفاده توسط AI Coding Agent

تعداد مخازن تا تاریخ 2026/07/01 1,794 بود، اما از 2026/08/01 به 1940 افزایش یافته است و تعداد مخازن با استفاده از AI Coding Agent 146 افزایش یافته است.

image.png

تغییرات در تعداد مخازن با استفاده از AI Coding Agent از 2026/7/1 تا 2026/8/1

https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#time-based-bar-chart

آیا می توان از LLM محلی برای کدنویسی AI استفاده کرد؟

در ماه ژوئن، نسل بعدی LLM ها، Mythos و Fable 5 توسط Claude منتشر شدند و صنعت را با عملکرد خود شوکه کردند. البته پس از آن شرکت کیمی چین یک مدل وزن باز به نام Kimi-K3 عرضه کرد که تقریباً کلاس Fable است. که تبدیل به یک موضوع داغ شد. حتی با نگاهی به معیارهای واقعی، اعداد نزدیک به هم هستند.

image.png

https://artificialanalysis.ai/#intelligence-category-tabs

وقتی فکر کردم که

**آیا LLM محلی نیز گزینه ای برای کدنویسی AI نیست؟ **

من فکر می کنم شما ممکن است فکر کنید. من آن منطقه را بررسی کردم. جدول زیر مدل‌های اصلی LLM با وزن باز را از نمودار بالا فهرست می‌کند.

نام مدلنام شرکتتاریخ اعلامتعداد پارامترهاتعداد پارامترهای فعالطول متنشاخص هوش
Kimi K3(max)Kimi(چین)2026/072800B104B1M60
GLM-5.2(حداکثر)Z AI(چین)2026/06756B40B1M53
DeepSeek V4 Flash 0731DeepSeek(چین)2026/07284B13B1M52
MiMo-V2.5-ProXiaomi(چین)2026/041023B42B1M43
Muse Glimmer (بالا)متا (ایالات متحده آمریکا)2026/0830B256 هزار35
Gemma 4 31B (Reasoning)گوگل (ایالات متحده آمریکا)2026/0430.7B256 هزار30

با این حال، آیا اینها واقعاً روی رایانه شخصی شما کار می کنند؟ من واقعا این را درک نمی کنم. بنابراین روش تعیینی که در نظر گرفتیم این بود

حافظه VRAM مورد نیاز است

2[GB] در هر پارامتر 1[B]

است. شما می توانید تقریباً بر اساس ظرفیت حافظه VRAM رایانه شخصی خود و تعداد پارامترهای مدلی که می خواهید اجرا کنید تخمین بزنید که آیا کار می کند یا خیر. بنابراین،

**از نظر ریاضی، 5.6 ترابایت (5600 گیگابایت) حافظه برای اجرای Kimi-K3 مورد نیاز است. **

دلیل این امر را توضیح خواهم داد. در مدل استاندارد توزیع شده LLM، وزن ها با استفاده از اعداد اعشاری با دقت bf16 یا fp16 بیان می شوند. اینها به 2 بایت برای هر پارامتر نیاز دارند. نمادی که اغلب می بینید، مانند 30[B]، تعداد پارامترها است و B مخفف میلیارد و نشان دهنده 10^9 است. بنابراین مشاهده می شود که مدلی مانند 30[B] دارای داده های وزنی 30×10^9 است. و 1[GB]=1*10^9[Byte]. با فکر کردن به این موضوع، قبلاً اشاره کردیم که وزن‌های استاندارد در 2 بایت ذخیره می‌شوند، بنابراین برای هر وزن 2 بایت طول می‌کشد، که به معنای ذخیره 1 [B] پارامتر در حافظه 2 [GB] است. این محاسبه است. این معنای «2[GB] در هر پارامتر 1[B]» است که قبلاً ذکر شد. با این حال، این فقط یک تقریب است. این حداقل نیاز برای بارگذاری وزن‌ها در VRAM است، و از آنجایی که ممکن است علاوه بر آن از حافظه نیز استفاده شود، توصیه می‌شود از آن تجاوز نکنید. این ظرفیت VRAM است.

اینجاست که مفهوم کوانتیزاسیون مطرح می شود. ممکن است Q4_0 یا Q4_K_M را دیده باشید. این تکنیکی است که وزن را به تعداد بیت های آن فشرده می کند. بنابراین، در مورد Q4_0، به طور کلی، ظرفیت وزن 4 بیت است (4 قسمت Q4_0). بنابراین، در این مورد، ظرفیت 0.5 [GB] در هر 1 [B] است. یک جدول مرجع سریع از این موارد به شکل زیر است:

روش کوانتیزاسیونمقدار حافظه مورد نیاز در هر 1 [B] [GB]
bf16,fp16(استاندارد)2.0
Q8_01.0
Q4_00.5

ممکن است نمادی مانند Q4_K_M را مشاهده کنید، اما به طور کلی، این مدلی است که دقت را در مقایسه با Q4_0 افزایش می دهد، اما از ظرفیت حافظه کمی بیشتر استفاده می کند. خوب است که از این موضوع آگاه باشید. راه دیگری برای تشخیص وجود دارد، به سادگی به اندازه فایل فایل وزن (safetensor یا gguf) نگاه کنید. اگر این مقدار از ظرفیت حافظه VRAM بیشتر شود، معمولاً کار نخواهد کرد. من فکر می کنم شما می توانید اینطور فکر کنید.

از اینجا، ما یک جدول مرجع سریع از مقدار حافظه VRAM، روش کوانتیزاسیون و تعداد پارامترها ایجاد کرده ایم.

|ظرفیت حافظه VRAM [GB]| تعداد پارامترها (bf16,fp16)[B] | تعداد پارامترها (Q8_0)[B] | تعداد پارامترها (Q4_0)[B]| |-----------------:|------------------------:|---------------------------------------------------:| | 8 | 4 | 8 | 16 | | 16 | 8 | 16 | 32 | | 24 | 12 | 24 | 48 | | 32 | 16 | 32 | 64 | | 64 | 32 | 64 | 128 | | 128 | 64 | 128 | 256 | | 256 | 128 | 256 | 512 | | 512 | 256 | 512 | 1024 | |1024| 512 | 1024 | 2048 | |2048| 1024 | 2048 | 4096 |

تقریبا تا کی میشه انجام داد؟ با توجه به اینکه اگر مدلی با 8 گیگابایت VRAM باشد، RTX 5050 خواهد بود و قیمت آمازون 55000 ین است. این ممکن است اگر مدل حدود 8 [B] با Q8_0 کوانتیزه شود، کار می کند. این سطح است.

https://link.amazon/B0brulI9R

هنگامی که VRAM به 16 گیگابایت افزایش می یابد، به مدلی در اطراف RTX 5060 Ti تبدیل می شود که قیمت آن حدود 108000 ین است. در این مرحله، با کوانتیزاسیون Q4_0، یک کلاس LLM 30[B] کار خواهد کرد یا خیر. این سطح است.

https://link.amazon/B0ghUQISo

هنگامی که VRAM به 32 گیگابایت افزایش می یابد، به مدل پرچمدار RTX 5090 تبدیل می شود و قیمت آن 795000 ین است. وقتی نوبت به این می‌رسد، حدس می‌زنم در سطحی است که نمی‌توانید آن را انجام دهید، مگر اینکه اراده زیادی داشته باشید. من اینطور فکر می کنم. این کوانتیزاسیون Q8_0 است و اینکه آیا مدل کلاس 30[B] کار می‌کند یا خیر. تقریباً در همان سطح خواهد بود.

https://link.amazon/B03EseQp5

این منطقه بالاترین سطح محصول مصرفی است. اکنون وقتی صحبت از سطح حرفه ای به میان می آید، RTX PRO 6000 Blackwell به 96 گیگابایت حافظه مجهز شده است. **قیمت 2.35 میلیون ین. ** در اینجا، حتی در سطح کوانتیزاسیون Q4_0، فقط مدل 192[B] کار می کند، بنابراین مدل پرچمدار کار نمی کند.

https://link.amazon/B0g76ngZz

و از آنجایی که داده هایی برای کلاستر GPU وجود داشت که روی سرور نصب می شد، من آن را فقط برای مرجع ارسال می کنم. **در مورد NVIDIA B300 حافظه 288 گیگابایت و قیمت 8.63 میلیون ین **. اگر یکی باشد، DeepSeek V4 Flash 0731 با کوانتیزه Q8_0 ممکن است کار کند. Q4_0 کار خواهد کرد. اگر دو (معادل 17 میلیون ین) دارید، MiMo-V2.5-Pro ​​با کوانتیزاسیون Q4_0 ممکن است کار کند.

image.png

https://www.nttpc.co.jp/cgi-bin/gpu/simulation/custom/index.cgi

بنابراین، اگر مقدار حافظه و تعداد پارامترها را با هم مقایسه کنید، این در مورد آن است. البته جای بحث بیشتر از این است و اینکه آیا این در حافظه گنجانده می شود یا خیر. بنابراین، آیا TOK/s کافی برای استفاده عادی تولید می کند؟ موضوع دیگری وجود دارد. این مقاله در مورد اصول اولیه صحبت می کند. LLM دارای معماری هایی به نام های Dense و MoE است و در MoE فقط پارامترهای فعال در واقع محاسبه می شوند و بسته به روش اجرا، راهی وجود دارد که به جای ذخیره دائمی تمام Expert ها در حافظه، با خواندن Expert های لازم از حافظه و غیره، مقدار حافظه فیزیکی را کاهش دهید. با این حال، جنبه های خاصی در نحوه اجرای مدل وجود دارد و بارگیری از حافظه به حافظه می تواند به یک گلوگاه تبدیل شود. داستان هایی از این دست وجود دارد، اما در اینجا ما چنین جزئیاتی را نادیده می گیریم و به سادگی ظرفیت را در نظر می گیریم که تمام وزن های مدل در حافظه ذخیره می شود.

بنابراین، اگر می‌خواهید مدل پرچمدار کوانتیزه شده Q4_0 یا Q8_0 فعلی را اجرا کنید، به ماشینی نیاز دارید که حداقل 10 میلیون ین قیمت دارد. این احساس از آن است. از سوی دیگر، اگر از سخت افزار خاصی برای دستیابی به کوانتیزاسیون بیشتر استفاده کنید، ممکن است کارساز باشد. برای مثال، افرادی هستند که در M4 Mac با حافظه 128 گیگابایتی (فروخته شده) و DGX Spark (حافظه 128 گیگابایتی) کوانتیزاسیون 2 بیتی و کوانتیزه سازی 3 بیتی را اجرا می کنند.

https://zenn.dev/tkhr_sait/articles/20260508_try-local-deepseek-v4

https://dev.classmethod.jp/articles/dgx-spark-deepseek-v4-flash-0731-llama-cpp/

از سوی دیگر، این احتمالاً حد یک فرد است. این یک احساس پوستی است. من شخصاً به کوانتیزاسیون 1 بیتی توجه دارم. مدل‌های معروف شامل Bonsai و فناوری‌هایی مانند BitNet هستند، اما دانش مربوط به کوانتیزه‌سازی 1 بیتی عمومی نشده است، بنابراین من آن را امتحان نکرده‌ام (احتمالاً زمان زیادی می‌برد و دقت استنتاج را کاهش می‌دهد).

بنابراین، شخصاً، اگر یک نسخه کوانتیزه‌شده 1 بیتی DeepSeek (تقریباً 35.5 گیگابایت) منتشر می‌شد، می‌توانستم دنیایی را ببینم که در آن می‌توانم به صورت محلی بر روی یک GPU درجه مصرف‌کننده، بسته به ذکاوت، اجرا شود، اما از آنجایی که ما در حال حاضر آن را نداریم، بسیار دشوار است. این حقیقت صادقانه است.

بنابراین،

** اجرای مدل پرچمدار با LLM محلی واقع بینانه نیست. **

این برداشت کلی من است. اگر واقعاً می‌خواهید کار کند، فکر می‌کنم باید مقداری آزمایش انجام دهید.

#فکر

این بار، من صحبتم را روی LLM محلی متمرکز کردم. وقتی Kimi-K3 بیرون آمد، من کاملا شوکه شدم و کلاس Fable در LLM محلی نقل مکان کرد! بسیار چشمگیر بود، اما من حتی نمی توانم آن را با تجهیزاتی که دارم حرکت دهم. این برداشت صادقانه من بود. من مقاله ای در مورد LLM محلی در گذشته ارسال کردم، اما در آن زمان خیلی خوب کار نمی کرد، بنابراین می خواهم خودم کمی عمیق تر در آن تحقیق کنم. من اینطور فکر کردم.