autor: @kotauchisunsun
Data de lansare: 2026/08/12
Operăm un site numit AI Coding.Info din iulie 2025.
Acesta este un site care observă tendințele de utilizare legate de agenții de codare AI, cum ar fi Claude Code, Codex CLI, Github Copilot și Gemini dintr-un punct fix din informațiile din depozitele Github. Pentru a determina utilizarea Agentului de codare AI, efectuăm sondaje zilnice în următoarele condiții.
https://ai-coding.info/reports/articles/20260703
Rata de utilizare a depozitului Agentului de codare AI a fost de 13,0%, o creștere de 0,9% față de 12,1% data trecută.


Rata de utilizare a agentului de codare AI pe 1/8/2026
https://ai-coding.info/?date=2026-08-01#adoption-rate
Rata de utilizare a agentului de codare AI la 1 iulie 2026
https://ai-coding.info/?date=2026-07-01#adoption-rate
Tendințe în rata de utilizare a agentului de codare AI din 2026/7/1 până 2026/8/1
https://ai-coding.info/?date=2026-04-01&since=2026-07-01&until=2026-08-01#share-trend
Ponderea pe produs este următoarea.
| Clasament | Nume produs | Rata acțiunii |
|---|---|---|
| locul I | Codex CLI | 40,8% |
| locul 2 | Claude Cod | 32,0% |
| locul 3 | Agent copilot | 15,1% |
| locul 4 | Gemeni CLI(Antigravity) | 5,3% |
| locul 5 | Cursor | 4,4% |
În timp ce ponderea Codex CLI este în creștere, Claude Code rămâne aceeași. Copilot Agent și Gemini CLI (Antigravity) prezintă, de asemenea, o ușoară scădere. Cursorul este ceva la care am fost puțin atentă. Cursorul este achiziționat de SpaceX. Au fost vești.
https://www.nikkei.com/article/DGXZQOGN16BC70W6A610C2000000/
Prin urmare, va exista o modificare a ratei acțiunii acestui Cursor? Am crezut că da, dar luna trecută a fost de 4,7% și luna aceasta a fost de 4,4%, așa că nu există o schimbare atât de mare. Privind numărul de depozite menționat mai jos, la 1 iulie, erau 85 de depozite care au adoptat Cursor, iar de la 1 august, numărul rămâne neschimbat la 85. Prin urmare, în ceea ce privește acest fenomen, populația de depozite care utilizează AI Coding Agent a crescut în general, dar numărul de utilizare a Cursorului nu a crescut. Ca urmare, cota de piață globală este în scădere. Acesta a devenit un fenomen. Cu toate acestea, datorită caracteristicilor cercetării AI Coding.Info, numărul de depozite cu fișiere de configurare specifice Cursorului (.cursor) nu se va modifica. Acestea fiind spuse, Cursor însuși acceptă AGENTS.md. AI Coding.Info precizează că numărul de depozite cu AGENTS.md = numărul de adoptări Codex CLI, așa că, deși se folosește Cursor, este posibil ca acesta să fie socotit ca Codex CLI și există posibilitatea ca numărul de utilizări să crească într-o parte invizibilă.

Rata acțiunilor AI Coding Agent la 01.08.2026
https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#agent-share
Rata acțiunilor AI Coding Agent pe 2026/7/1
https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#agent-share
Limbajul de programare în care AI Coding Agent este folosit cel mai mult este „TypeScript”, al doilea este „Python”, al treilea este „Rugină”, al patrulea este „Go”, iar al cincilea este „C#”. Rata de adoptare a codării AI pentru TypeScript rămâne ridicată, în timp ce compoziția lui „Python”, „Rugină” și „Go” ca al doilea grup și „C#” ca al treilea grup a fost o tendință constantă în ultimii ani.

Clasamentul AI Coding Agent în funcție de limbajul de programare pe 2026/8/1
https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#language-agent-rank
Clasamentul AI Coding Agent în funcție de limbajul de programare la 1 iulie 2026
https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#language-agent-rank
Numărul de depozite a fost de 1.794 din 2026/07/01, dar a crescut la 1.940 din 2026/08/01, iar numărul de depozite care utilizează AI Coding Agent a crescut cu 146.

Modificări ale numărului de depozite care utilizează AI Coding Agent din 2026/7/1 până în 2026/8/1
https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#time-based-bar-chart
În iunie, următoarea generație de LLM, Mythos și Fable 5, au fost lansate de Claude și au șocat industria cu performanța lor. Cu toate acestea, după aceea, compania chineză Kimi a lansat un model deschis numit Kimi-K3, care este aproape de clasă Fable. A devenit un subiect fierbinte. Chiar și privind valorile de referință reale, cifrele sunt apropiate.

https://artificialanalysis.ai/#intelligence-category-tabs
Când am crezut că,
**LLM local nu este și o opțiune pentru codarea AI? **
Cred că s-ar putea să crezi. Am investigat zona aia. Tabelul de mai jos prezintă principalele modele LLM cu greutate deschisă din graficul de mai sus.
| Numele modelului | Numele companiei | Data anunțului | Numărul parametrilor | Numărul parametrilor activi | Lungimea contextului | Indicele de inteligență |
|---|---|---|---|---|---|---|
| Kimi K3(max) | Kimi(China) | 2026/07 | 2.800B | 104B | 1M | 60 |
| GLM-5.2(max) | Z AI(China) | 2026/06 | 756B | 40B | 1M | 53 |
| DeepSeek V4 Flash 0731 | DeepSeek(China) | 2026/07 | 284B | 13B | 1M | 52 |
| MiMo-V2.5-Pro | Xiaomi(China) | 2026/04 | 1.023B | 42B | 1M | 43 |
| Muse Glimmer (înalt) | Meta(SUA) | 2026/08 | 30B | 256K | 35 | |
| Gemma 4 31B (Raționament) | Google (SUA) | 2026/04 | 30,7B | 256K | 30 |
Cu toate acestea, funcționează acestea cu adevărat pe computerul tău? Nu prea înțeleg asta. Prin urmare, metoda de determinare pe care am considerat-o a fost
Memoria VRAM necesară este
2[GB] per parametru 1[B]
este. Puteți estima aproximativ dacă va funcționa pe baza capacității de memorie VRAM a computerului dvs. și a numărului de parametri ai modelului pe care doriți să-l rulați. prin urmare,
**Din punct de vedere matematic, este necesar 5,6 TB (5.600 GB) de memorie pentru a rula Kimi-K3. **
Voi explica motivul pentru asta. În modelul LLM distribuit standard, ponderile sunt exprimate folosind numere zecimale cu o precizie de bf16 sau fp16. Acestea necesită 2 octeți pentru fiecare parametru. Notația pe care o vedeți adesea, cum ar fi 30[B], este numărul de parametri, iar B reprezintă un miliard și reprezintă 10^9. Prin urmare, se poate observa că un model precum 30[B] are date de greutate 30×10^9. Și 1[GB]=1*10^9[Byte]. Gândindu-ne așa, am menționat mai devreme că greutățile standard sunt stocate în 2 octeți, deci este nevoie de 2 octeți pe greutate, ceea ce înseamnă 2 [GB] pentru a stoca 1 [B] parametri în memorie. Acesta este calculul. Acesta este sensul „2[GB] per parametru 1[B]” menționat mai devreme. Totuși, aceasta este doar o aproximare; aceasta este cerința minimă pentru a încărca greutățile în VRAM și, deoarece memoria poate fi folosită în plus, este strict recomandabil să nu o depășiți. Aceasta este capacitatea VRAM.
Aici intervine conceptul de cuantizare. Este posibil să fi văzut Q4_0 sau Q4_K_M. Aceasta este o tehnică care comprimă greutatea la numărul său de biți. Prin urmare, în cazul lui Q4_0, aproximativ vorbind, capacitatea de greutate este de 4 biți (partea a 4-a a Q4_0). Prin urmare, în acest caz, capacitatea este de 0,5 [GB] pe 1 [B]. Un tabel de referință rapidă cu acestea arată astfel:
| Metoda de cuantizare | Cantitatea de memorie necesară per 1[B] [GB] |
|---|---|
| bf16,fp16(standard) | 2.0 |
| Q8_0 | 1,0 |
| Q4_0 | 0,5 |
S-ar putea să vedeți o notație precum Q4_K_M, dar aproximativ vorbind, este un model care crește precizia în comparație cu Q4_0, dar folosește puțin mai multă capacitate de memorie. Este bine să fii conștient de acest lucru. Există un alt mod de a spune, pur și simplu uitați-vă la dimensiunea fișierului de greutate (safetensor sau gguf). Dacă aceasta depășește capacitatea de memorie VRAM, în general nu va funcționa. Cred că poți să crezi așa.
De aici, am creat un tabel de referință rapid cu cantitatea de memorie VRAM, metoda de cuantizare și numărul de parametri.
| Capacitate memorie VRAM [GB] | Numărul de parametri (bf16,fp16)[B] | Număr de parametri (Q8_0)[B] | Numărul de parametri (Q4_0)[B] |
|---|---|---|---|
| 8 | 4 | 8 | 16 |
| 16 | 8 | 16 | 32 |
| 24 | 12 | 24 | 48 |
| 32 | 16 | 32 | 64 |
| 64 | 32 | 64 | 128 |
| 128 | 64 | 128 | 256 |
| 256 | 128 | 256 | 512 |
| 512 | 256 | 512 | 1024 |
| 1024 | 512 | 1024 | 2048 |
| 2048 | 1024 | 2048 | 4096 |
Aproximativ cât timp se poate face? Avand in vedere ca, daca este un model cu 8GB de VRAM, va fi un RTX 5050, iar pretul Amazon este de 55.000 de yeni. Acest lucru poate funcționa dacă modelul este aproximativ 8[B] cuantizat cu Q8_0. Acesta este nivelul.
Când VRAM-ul crește la 16 GB, devine un model în jurul lui RTX 5060 Ti, care costă aproximativ 108.000 de yeni. În acest moment, cu cuantizarea Q4_0, un LLM de clasă 30[B] va funcționa sau nu. Acesta este nivelul.
Când VRAM-ul crește la 32 GB, devine modelul emblematic RTX 5090 și costă 795.000 de yeni. Când vine vorba de asta, cred că este la un nivel în care nu poți face asta decât dacă ai multă hotărâre. Așa cred. Aceasta este cuantizarea lui Q8_0 și dacă modelul clasei 30[B] funcționează sau nu. Va fi cam la același nivel.
Această zonă este linia superioară a nivelului de produse de consum. Acum, când vine vorba de nivel profesional, RTX PRO 6000 Blackwell este echipat cu 96 GB de memorie. **Prețul este de 2,35 milioane de yeni. ** Aici, chiar și la nivelul de cuantizare Q4_0, funcționează doar modelul 192[B], deci modelul emblematic nu funcționează.
Și din moment ce au existat date pentru clusterul GPU care urmează să fie instalat pe server, le voi posta doar pentru referință. În cazul lui NVIDIA B300, memoria este de 288 GB și prețul este de 8,63 milioane de yeni. Dacă este unul, DeepSeek V4 Flash 0731 cu cuantizare Q8_0 poate funcționa. Q4_0 va funcționa. Dacă aveți două (echivalentul a 17 milioane de yeni), poate funcționa MiMo-V2.5-Pro cu cuantificare Q4_0.

https://www.nttpc.co.jp/cgi-bin/gpu/simulation/custom/index.cgi
Prin urmare, dacă comparați cantitatea de memorie și numărul de parametri, despre asta este vorba. Desigur, există mai multe de dezbătut decât asta și dacă acest lucru va fi sau nu inclus în memorie. Deci, generează suficiente TOK/s pentru a fi utilizate în mod normal? Există o altă problemă. Acest articol vorbește despre elementele de bază. LLM are arhitecturi numite Dense și MoE, iar în MoE, doar parametrii activi sunt calculați efectiv și, în funcție de metoda de execuție, există o modalitate de a reduce cantitatea de memorie fizică citind experții necesari din stocare etc., în loc să stocheze toți experții în memorie tot timpul. Cu toate acestea, există câteva aspecte speciale ale modului în care este executat modelul, iar încărcarea din stocare în memorie poate deveni un blocaj. Există câteva povești de genul acesta, dar aici ignorăm astfel de detalii și pur și simplu luăm în considerare capacitatea atunci când toate greutățile modelului sunt stocate în memorie.
Deci, dacă doriți să rulați modelul emblematic cuantificat Q4_0 sau Q8_0 actual, veți avea nevoie de o mașină care costă cel puțin 10 milioane de yeni. Asta e senzația. Pe de altă parte, poate funcționa dacă utilizați hardware special pentru a obține o cuantizare și mai mare. De exemplu, există persoane care rulează cuantizare pe 2 biți și cuantizare pe 3 biți pe Mac M4 cu memorie de 128 GB (epuizată) și DGX Spark (memorie de 128 GB).
https://zenn.dev/tkhr_sait/articles/20260508_try-local-deepseek-v4
https://dev.classmethod.jp/articles/dgx-spark-deepseek-v4-flash-0731-llama-cpp/
Pe de altă parte, aceasta este probabil limita pentru un individ. Este o senzație de piele. Personal, sunt atent la cuantizarea pe 1 bit. Modelele celebre includ Bonsai și tehnologie precum BitNet, dar know-how-ul pentru cuantizarea pe 1 bit nu a fost făcut public, așa că nu l-am încercat (probabil ar dura mult timp și ar reduce acuratețea inferenței).
Așadar, personal, dacă ar fi lansată o versiune cuantificată de 1 bit a DeepSeek (aproximativ 35,5 GB), aș putea vedea o lume în care ar putea fi rulat local pe un GPU de calitate consumer, în funcție de o oarecare ingeniozitate, dar pentru că în prezent nu avem asta, este destul de dificil. Acesta este adevărul sincer.
Prin urmare,
**Nu este realist să rulezi modelul emblematic cu LLM local. **
Aceasta este impresia mea generală. Dacă chiar vrei să funcționeze, cred că trebuie să faci niște teste.
De data aceasta, mi-am concentrat discursul pe LLM local. Când a apărut Kimi-K3, am fost destul de șocat, iar clasa Fable s-a mutat în LLM local! A fost destul de impresionant, dar nici nu-l pot muta cu echipamentul pe care îl am. Asta a fost impresia mea sinceră. Am postat în trecut un articol despre LLM local, dar nu funcționa prea bine la acel moment, așa că aș dori să aprofundez puțin în el. M-am gândit eu.