AI Coding.Info
RepositoriesREPORTS
ABOUT

Poate fi folosit LLM local pentru codarea AI? ~Rezumat al tendințelor de codificare AI în iulie 2026, văzute prin date~

autor: @kotauchisunsun

Data de lansare: 2026/08/12

Tendințele agentului de codare AI în august 2026

Operăm un site numit AI Coding.Info din iulie 2025.

https://ai-coding.info/

https://x.com/AICodingInfo

Acesta este un site care observă tendințele de utilizare legate de agenții de codare AI, cum ar fi Claude Code, Codex CLI, Github Copilot și Gemini dintr-un punct fix din informațiile din depozitele Github. Pentru a determina utilizarea Agentului de codare AI, efectuăm sondaje zilnice în următoarele condiții.

Tendințele lunii trecute

https://ai-coding.info/reports/articles/20260703

Rata de utilizare a agentului de codare AI este de 13,0%

Rata de utilizare a depozitului Agentului de codare AI a fost de 13,0%, o creștere de 0,9% față de 12,1% data trecută.

image.png

image.png

Rata de utilizare a agentului de codare AI pe 1/8/2026

https://ai-coding.info/?date=2026-08-01#adoption-rate

Rata de utilizare a agentului de codare AI la 1 iulie 2026

https://ai-coding.info/?date=2026-07-01#adoption-rate

Tendințe în rata de utilizare a agentului de codare AI din 2026/7/1 până 2026/8/1

https://ai-coding.info/?date=2026-04-01&since=2026-07-01&until=2026-08-01#share-trend

Cota agentului de codare AI în funcție de produs

Ponderea pe produs este următoarea.

ClasamentNume produsRata acțiunii
locul ICodex CLI40,8%
locul 2Claude Cod32,0%
locul 3Agent copilot15,1%
locul 4Gemeni CLI(Antigravity)5,3%
locul 5Cursor4,4%

În timp ce ponderea Codex CLI este în creștere, Claude Code rămâne aceeași. Copilot Agent și Gemini CLI (Antigravity) prezintă, de asemenea, o ușoară scădere. Cursorul este ceva la care am fost puțin atentă. Cursorul este achiziționat de SpaceX. Au fost vești.

https://www.nikkei.com/article/DGXZQOGN16BC70W6A610C2000000/

Prin urmare, va exista o modificare a ratei acțiunii acestui Cursor? Am crezut că da, dar luna trecută a fost de 4,7% și luna aceasta a fost de 4,4%, așa că nu există o schimbare atât de mare. Privind numărul de depozite menționat mai jos, la 1 iulie, erau 85 de depozite care au adoptat Cursor, iar de la 1 august, numărul rămâne neschimbat la 85. Prin urmare, în ceea ce privește acest fenomen, populația de depozite care utilizează AI Coding Agent a crescut în general, dar numărul de utilizare a Cursorului nu a crescut. Ca urmare, cota de piață globală este în scădere. Acesta a devenit un fenomen. Cu toate acestea, datorită caracteristicilor cercetării AI Coding.Info, numărul de depozite cu fișiere de configurare specifice Cursorului (.cursor) nu se va modifica. Acestea fiind spuse, Cursor însuși acceptă AGENTS.md. AI Coding.Info precizează că numărul de depozite cu AGENTS.md = numărul de adoptări Codex CLI, așa că, deși se folosește Cursor, este posibil ca acesta să fie socotit ca Codex CLI și există posibilitatea ca numărul de utilizări să crească într-o parte invizibilă.

image.png

Rata acțiunilor AI Coding Agent la 01.08.2026

https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#agent-share

Rata acțiunilor AI Coding Agent pe 2026/7/1

https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#agent-share

Starea de utilizare a agentului de codare AI în funcție de limbajul de programare

Limbajul de programare în care AI Coding Agent este folosit cel mai mult este „TypeScript”, al doilea este „Python”, al treilea este „Rugină”, al patrulea este „Go”, iar al cincilea este „C#”. Rata de adoptare a codării AI pentru TypeScript rămâne ridicată, în timp ce compoziția lui „Python”, „Rugină” și „Go” ca al doilea grup și „C#” ca al treilea grup a fost o tendință constantă în ultimii ani.

image.png

Clasamentul AI Coding Agent în funcție de limbajul de programare pe 2026/8/1

https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#language-agent-rank

Clasamentul AI Coding Agent în funcție de limbajul de programare la 1 iulie 2026

https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#language-agent-rank

Tendințele lunare ale numărului de depozite utilizate de AI Coding Agent

Numărul de depozite a fost de 1.794 din 2026/07/01, dar a crescut la 1.940 din 2026/08/01, iar numărul de depozite care utilizează AI Coding Agent a crescut cu 146.

image.png

Modificări ale numărului de depozite care utilizează AI Coding Agent din 2026/7/1 până în 2026/8/1

https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#time-based-bar-chart

LLM local poate fi folosit pentru codarea AI?

În iunie, următoarea generație de LLM, Mythos și Fable 5, au fost lansate de Claude și au șocat industria cu performanța lor. Cu toate acestea, după aceea, compania chineză Kimi a lansat un model deschis numit Kimi-K3, care este aproape de clasă Fable. A devenit un subiect fierbinte. Chiar și privind valorile de referință reale, cifrele sunt apropiate.

image.png

https://artificialanalysis.ai/#intelligence-category-tabs

Când am crezut că,

**LLM local nu este și o opțiune pentru codarea AI? **

Cred că s-ar putea să crezi. Am investigat zona aia. Tabelul de mai jos prezintă principalele modele LLM cu greutate deschisă din graficul de mai sus.

Numele modeluluiNumele companieiData anunțuluiNumărul parametrilorNumărul parametrilor activiLungimea contextuluiIndicele de inteligență
Kimi K3(max)Kimi(China)2026/072.800B104B1M60
GLM-5.2(max)Z AI(China)2026/06756B40B1M53
DeepSeek V4 Flash 0731DeepSeek(China)2026/07284B13B1M52
MiMo-V2.5-ProXiaomi(China)2026/041.023B42B1M43
Muse Glimmer (înalt)Meta(SUA)2026/0830B256K35
Gemma 4 31B (Raționament)Google (SUA)2026/0430,7B256K30

Cu toate acestea, funcționează acestea cu adevărat pe computerul tău? Nu prea înțeleg asta. Prin urmare, metoda de determinare pe care am considerat-o a fost

Memoria VRAM necesară este

2[GB] per parametru 1[B]

este. Puteți estima aproximativ dacă va funcționa pe baza capacității de memorie VRAM a computerului dvs. și a numărului de parametri ai modelului pe care doriți să-l rulați. prin urmare,

**Din punct de vedere matematic, este necesar 5,6 TB (5.600 GB) de memorie pentru a rula Kimi-K3. **

Voi explica motivul pentru asta. În modelul LLM distribuit standard, ponderile sunt exprimate folosind numere zecimale cu o precizie de bf16 sau fp16. Acestea necesită 2 octeți pentru fiecare parametru. Notația pe care o vedeți adesea, cum ar fi 30[B], este numărul de parametri, iar B reprezintă un miliard și reprezintă 10^9. Prin urmare, se poate observa că un model precum 30[B] are date de greutate 30×10^9. Și 1[GB]=1*10^9[Byte]. Gândindu-ne așa, am menționat mai devreme că greutățile standard sunt stocate în 2 octeți, deci este nevoie de 2 octeți pe greutate, ceea ce înseamnă 2 [GB] pentru a stoca 1 [B] parametri în memorie. Acesta este calculul. Acesta este sensul „2[GB] per parametru 1[B]” menționat mai devreme. Totuși, aceasta este doar o aproximare; aceasta este cerința minimă pentru a încărca greutățile în VRAM și, deoarece memoria poate fi folosită în plus, este strict recomandabil să nu o depășiți. Aceasta este capacitatea VRAM.

Aici intervine conceptul de cuantizare. Este posibil să fi văzut Q4_0 sau Q4_K_M. Aceasta este o tehnică care comprimă greutatea la numărul său de biți. Prin urmare, în cazul lui Q4_0, aproximativ vorbind, capacitatea de greutate este de 4 biți (partea a 4-a a Q4_0). Prin urmare, în acest caz, capacitatea este de 0,5 [GB] pe 1 [B]. Un tabel de referință rapidă cu acestea arată astfel:

Metoda de cuantizareCantitatea de memorie necesară per 1[B] [GB]
bf16,fp16(standard)2.0
Q8_01,0
Q4_00,5

S-ar putea să vedeți o notație precum Q4_K_M, dar aproximativ vorbind, este un model care crește precizia în comparație cu Q4_0, dar folosește puțin mai multă capacitate de memorie. Este bine să fii conștient de acest lucru. Există un alt mod de a spune, pur și simplu uitați-vă la dimensiunea fișierului de greutate (safetensor sau gguf). Dacă aceasta depășește capacitatea de memorie VRAM, în general nu va funcționa. Cred că poți să crezi așa.

De aici, am creat un tabel de referință rapid cu cantitatea de memorie VRAM, metoda de cuantizare și numărul de parametri.

Capacitate memorie VRAM [GB]Numărul de parametri (bf16,fp16)[B]Număr de parametri (Q8_0)[B]Numărul de parametri (Q4_0)[B]
84816
1681632
24122448
32163264
643264128
12864128256
256128256512
5122565121024
102451210242048
2048102420484096

Aproximativ cât timp se poate face? Avand in vedere ca, daca este un model cu 8GB de VRAM, va fi un RTX 5050, iar pretul Amazon este de 55.000 de yeni. Acest lucru poate funcționa dacă modelul este aproximativ 8[B] cuantizat cu Q8_0. Acesta este nivelul.

https://link.amazon/B0brulI9R

Când VRAM-ul crește la 16 GB, devine un model în jurul lui RTX 5060 Ti, care costă aproximativ 108.000 de yeni. În acest moment, cu cuantizarea Q4_0, un LLM de clasă 30[B] va funcționa sau nu. Acesta este nivelul.

https://link.amazon/B0ghUQISo

Când VRAM-ul crește la 32 GB, devine modelul emblematic RTX 5090 și costă 795.000 de yeni. Când vine vorba de asta, cred că este la un nivel în care nu poți face asta decât dacă ai multă hotărâre. Așa cred. Aceasta este cuantizarea lui Q8_0 și dacă modelul clasei 30[B] funcționează sau nu. Va fi cam la același nivel.

https://link.amazon/B03EseQp5

Această zonă este linia superioară a nivelului de produse de consum. Acum, când vine vorba de nivel profesional, RTX PRO 6000 Blackwell este echipat cu 96 GB de memorie. **Prețul este de 2,35 milioane de yeni. ** Aici, chiar și la nivelul de cuantizare Q4_0, funcționează doar modelul 192[B], deci modelul emblematic nu funcționează.

https://link.amazon/B0g76ngZz

Și din moment ce au existat date pentru clusterul GPU care urmează să fie instalat pe server, le voi posta doar pentru referință. În cazul lui NVIDIA B300, memoria este de 288 GB și prețul este de 8,63 milioane de yeni. Dacă este unul, DeepSeek V4 Flash 0731 cu cuantizare Q8_0 poate funcționa. Q4_0 va funcționa. Dacă aveți două (echivalentul a 17 milioane de yeni), poate funcționa MiMo-V2.5-Pro ​​​​cu cuantificare Q4_0.

image.png

https://www.nttpc.co.jp/cgi-bin/gpu/simulation/custom/index.cgi

Prin urmare, dacă comparați cantitatea de memorie și numărul de parametri, despre asta este vorba. Desigur, există mai multe de dezbătut decât asta și dacă acest lucru va fi sau nu inclus în memorie. Deci, generează suficiente TOK/s pentru a fi utilizate în mod normal? Există o altă problemă. Acest articol vorbește despre elementele de bază. LLM are arhitecturi numite Dense și MoE, iar în MoE, doar parametrii activi sunt calculați efectiv și, în funcție de metoda de execuție, există o modalitate de a reduce cantitatea de memorie fizică citind experții necesari din stocare etc., în loc să stocheze toți experții în memorie tot timpul. Cu toate acestea, există câteva aspecte speciale ale modului în care este executat modelul, iar încărcarea din stocare în memorie poate deveni un blocaj. Există câteva povești de genul acesta, dar aici ignorăm astfel de detalii și pur și simplu luăm în considerare capacitatea atunci când toate greutățile modelului sunt stocate în memorie.

Deci, dacă doriți să rulați modelul emblematic cuantificat Q4_0 sau Q8_0 actual, veți avea nevoie de o mașină care costă cel puțin 10 milioane de yeni. Asta e senzația. Pe de altă parte, poate funcționa dacă utilizați hardware special pentru a obține o cuantizare și mai mare. De exemplu, există persoane care rulează cuantizare pe 2 biți și cuantizare pe 3 biți pe Mac M4 cu memorie de 128 GB (epuizată) și DGX Spark (memorie de 128 GB).

https://zenn.dev/tkhr_sait/articles/20260508_try-local-deepseek-v4

https://dev.classmethod.jp/articles/dgx-spark-deepseek-v4-flash-0731-llama-cpp/

Pe de altă parte, aceasta este probabil limita pentru un individ. Este o senzație de piele. Personal, sunt atent la cuantizarea pe 1 bit. Modelele celebre includ Bonsai și tehnologie precum BitNet, dar know-how-ul pentru cuantizarea pe 1 bit nu a fost făcut public, așa că nu l-am încercat (probabil ar dura mult timp și ar reduce acuratețea inferenței).

Așadar, personal, dacă ar fi lansată o versiune cuantificată de 1 bit a DeepSeek (aproximativ 35,5 GB), aș putea vedea o lume în care ar putea fi rulat local pe un GPU de calitate consumer, în funcție de o oarecare ingeniozitate, dar pentru că în prezent nu avem asta, este destul de dificil. Acesta este adevărul sincer.

Prin urmare,

**Nu este realist să rulezi modelul emblematic cu LLM local. **

Aceasta este impresia mea generală. Dacă chiar vrei să funcționeze, cred că trebuie să faci niște teste.

gânduri

De data aceasta, mi-am concentrat discursul pe LLM local. Când a apărut Kimi-K3, am fost destul de șocat, iar clasa Fable s-a mutat în LLM local! A fost destul de impresionant, dar nici nu-l pot muta cu echipamentul pe care îl am. Asta a fost impresia mea sinceră. Am postat în trecut un articol despre LLM local, dar nu funcționa prea bine la acel moment, așa că aș dori să aprofundez puțin în el. M-am gândit eu.