AI Coding.Info
RepositoriesREPORTS
ABOUT

Je možné na kódovanie AI použiť lokálny LLM? ~Súhrn trendov kódovania AI v júli 2026, ako je vidieť z údajov~

autora: @kotauchisunsun

Dátum vydania: 2026/08/12

Trendy AI Coding Agent v auguste 2026

Od júla 2025 prevádzkujeme stránku s názvom AI Coding.Info.

https://ai-coding.info/

https://x.com/AICodingInfo

Toto je stránka, ktorá sleduje trendy používania súvisiace s kódovacími agentmi AI, ako sú Claude Code, Codex CLI, Github Copilot a Gemini, z pevného bodu z informácií v úložiskách Github. Na určenie použitia AI Coding Agent vykonávame denné prieskumy za nasledujúcich podmienok.

Trendy minulého mesiaca

https://ai-coding.info/reports/articles/20260703

Miera využitia AI Coding Agent je 13,0 %

Miera využitia úložiska AI Coding Agent bola 13,0 %, čo je nárast o 0,9 % z 12,1 % naposledy.

image.png

image.png

Miera používania AI Coding Agent dňa 2026/8/1

https://ai-coding.info/?date=2026-08-01#adoption-rate

Miera používania AI Coding Agent 1. júla 2026

https://ai-coding.info/?date=2026-07-01#adoption-rate

Trendy v miere používania AI Coding Agent od 2026/7/1 do 2026/8/1

https://ai-coding.info/?date=2026-04-01&since=2026-07-01&until=2026-08-01#share-trend

Podiel AI Coding Agent podľa produktu

Podiel podľa produktov je nasledovný.

PoradieNázov produktuPodiel
1.miestoCodex CLI40,8 %
2.miestoClaude Code32,0 %
3.miestoAgent druhého pilota15,1 %
4.miestoGemini CLI(antigravitácia)5,3 %
5.miestoKurzor4,4 %

Zatiaľ čo podiel Codex CLI sa zvyšuje, Claude Code zostáva rovnaký. Mierny pokles vykazuje aj Copilot Agent a Gemini CLI (Antigravitácia). Kurzor je niečo, čomu som venoval trochu pozornosti. Cursor získava SpaceX. Boli novinky.

https://www.nikkei.com/article/DGXZQOGN16BC70W6A610C2000000/

Dôjde teda k zmene podielu tohto kurzora? Myslel som si to, ale minulý mesiac to bolo 4,7% a tento mesiac 4,4%, takže až taká zmena nie je. Keď sa pozrieme na počet repozitárov spomenutých nižšie, k 1. júlu bolo 85 úložísk, ktoré prijali Cursor, a k 1. augustu ich počet zostáva nezmenený na 85. Preto, pokiaľ ide o tento fenomén, populácia repozitárov používajúcich AI Coding Agent celkovo vzrástla, ale počet používania Cursor sa nezvýšil. V dôsledku toho celkový podiel na trhu klesá. Toto sa stalo fenoménom. Vzhľadom na charakteristiky výskumu AI Coding.Info sa však počet úložísk s konfiguračnými súbormi špecifickými pre Cursor (.cursor) nezmení. Ako už bolo povedané, samotný Cursor podporuje AGENTS.md. AI Coding.Info uvádza, že počet repozitárov s AGENTS.md = počet adopcií Codex CLI, takže aj keď sa používa Cursor, je možné, že sa počíta ako Codex CLI, a existuje možnosť, že počet použití sa zvyšuje v neviditeľnej časti.

image.png

Kurz zdieľania AI Coding Agent dňa 1. 8. 2026

https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#agent-share

Podiel AI Coding Agent dňa 1. 7. 2026

https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#agent-share

Stav používania AI Coding Agent podľa programovacieho jazyka

Programovací jazyk, v ktorom sa AI Coding Agent najčastejšie používa, je „TypeScript“, druhý je „Python“, tretí je „Rust“, štvrtý je „Go“ a piaty je „C#“. Miera prijatia kódovania AI pre TypeScript zostáva vysoká, zatiaľ čo zloženie Python'', Rust'' a ,,Go'' ako druhej skupiny a ,,C#'' ako tretej skupiny je v posledných rokoch konzistentným trendom.

image.png

Hodnotenie AI Coding Agent podľa programovacieho jazyka k 1.8.2026

https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#language-agent-rank

Hodnotenie AI Coding Agent podľa programovacieho jazyka k 1. júlu 2026

https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#language-agent-rank

Mesačné trendy v počte úložísk, ktoré používa AI Coding Agent

Počet úložísk bol 1 794 k 2026/07/01, ale zvýšil sa na 1 940 k 2026/08/01 a počet úložísk používajúcich AI Coding Agent sa zvýšil o 146.

image.png

Zmeny v počte úložísk používajúcich AI Coding Agent od 2026/7/1 do 2026/8/1

https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#time-based-bar-chart

Je možné na kódovanie AI použiť lokálny LLM?

V júni spoločnosť Claude uviedla na trh ďalšiu generáciu LLM, Mythos a Fable 5, ktorá šokovala priemysel svojím výkonom. Potom však čínska spoločnosť Kimi vydala model s otvorenou hmotnosťou s názvom Kimi-K3, čo je takmer trieda Fable. To sa stalo horúcou témou. Aj pri pohľade na skutočné referenčné hodnoty sú čísla blízko.

image.png

https://artificialanalysis.ai/#intelligence-category-tabs

Keď som si to myslel,

**Nie je lokálna LLM tiež možnosťou pre kódovanie AI? **

Myslím, že si to môžete myslieť. Skúmal som túto oblasť. V tabuľke nižšie sú uvedené hlavné modely LLM s otvorenou hmotnosťou z vyššie uvedeného grafu.

Názov modeluNázov spoločnostiDátum oznámeniaPočet parametrovPočet aktívnych parametrovDĺžka kontextuIndex inteligencie
Kimi K3(max)Kimi(Čína)2026/072 800 B104B1 mil.60
GLM-5.2(max)Z AI(Čína)2026/06756B40B1 mil.53
DeepSeek V4 Flash 0731DeepSeek(Čína)2026/07284B13B1 mil.52
MiMo-V2.5-ProXiaomi (Čína)2026/041 023 B42B1 mil.43
Muse Glimmer (vysoko)Meta(USA)2026/0830B256 tis.35
Gemma 4 31B (Uvažovanie)Google (USA)2026/0430,7 B256 tis.30

Fungujú však skutočne na vašom počítači? fakt tomu nerozumiem. Metóda stanovenia, ktorú sme uvažovali, bola preto

Požadovaná pamäť VRAM je

2[GB] na parameter 1[B]

je. Či to bude fungovať, môžete zhruba odhadnúť na základe kapacity pamäte VRAM vášho PC a počtu parametrov modelu, ktorý chcete spustiť. preto

**Matematicky je na spustenie Kimi-K3 potrebných 5,6 TB (5 600 GB) pamäte. **

Vysvetlím dôvod. V štandardnom distribuovanom modeli LLM sú váhy vyjadrené pomocou desatinných čísel s presnosťou bf16 alebo fp16. Tieto vyžadujú 2 bajty pre každý parameter. Zápis, ktorý často vidíte, ako napríklad 30[B], je počet parametrov a B znamená miliardu a predstavuje 10^9. Preto je možné vidieť, že model ako 30[B] má údaje o hmotnosti 30×10^9. A 1[GB]=1*10^9[Byte]. Keď o tom premýšľame týmto spôsobom, už sme spomenuli, že štandardné váhy sú uložené v 2 bajtoch, takže na jednu váhu sú potrebné 2 bajty, čo znamená 2 [GB] na uloženie 1 [B] parametrov do pamäte. Toto je výpočet. Toto je význam „2[GB] na parameter 1[B]“ spomenutý vyššie. Toto je však len približné priblíženie; toto je minimálna požiadavka na načítanie závaží do VRAM, a keďže k tomu možno použiť aj pamäť, dôrazne sa odporúča neprekračovať ju. Toto je kapacita VRAM.

Tu vstupuje do hry koncept kvantovania. Možno ste videli Q4_0 alebo Q4_K_M. Ide o techniku, ktorá komprimuje váhu na jej počet bitov. Preto v prípade Q4_0, zhruba povedané, je hmotnostná kapacita 4 bity (4 časti Q4_0). Preto je v tomto prípade kapacita 0,5[GB] na 1[B]. Rýchla referenčná tabuľka z nich vyzerá takto:

Metóda kvantovaniaPožadované množstvo pamäte na 1[B] [GB]
bf16,fp16(štandard)2,0
Q8_01,0
Q4_00,5

Môžete vidieť zápis ako Q4_K_M, ale zhruba povedané, ide o model, ktorý v porovnaní s Q4_0 zvyšuje presnosť, no využíva o niečo väčšiu kapacitu pamäte. Je dobré si to uvedomiť. Existuje aj iný spôsob, ako to zistiť, jednoducho sa pozrieť na veľkosť súboru s hmotnosťou (safetensor alebo gguf). Ak to prekročí kapacitu pamäte VRAM, vo všeobecnosti to nebude fungovať. Myslím, že si to môžeš myslieť.

Odtiaľto sme vytvorili rýchlu referenčnú tabuľku množstva pamäte VRAM, metódy kvantovania a počtu parametrov.

Kapacita pamäte VRAM [GB]Počet parametrov (bf16,fp16)[B]Počet parametrov (Q8_0)[B]Počet parametrov (Q4_0)[B]
84816
1681632
24122448
32163264
643264128
12864128256
256128256512
5122565121024
102451210242048
2048102420484096

Ako dlho sa to dá približne urobiť? Vzhľadom na to, že ak ide o model s 8 GB VRAM, bude to RTX 5050 a cena Amazonu je 55 000 jenov. Toto môže fungovať, ak je model približne 8[B] kvantovaný pomocou Q8_0. To je úroveň.

https://link.amazon/B0brulI9R

Keď sa VRAM zvýši na 16 GB, stane sa modelom okolo RTX 5060 Ti, ktorý stojí asi 108 000 jenov. V tomto bode s kvantizáciou Q4_0 bude LLM triedy 30[B] fungovať alebo nie. To je úroveň.

https://link.amazon/B0ghUQISo

Keď sa VRAM zvýši na 32 GB, stane sa vlajkovým modelom RTX 5090 a stojí 795 000 jenov. Pokiaľ ide o toto, predpokladám, že je to na úrovni, kedy sa to nedá, pokiaľ nemáte veľké odhodlanie. Myslím, že áno. Toto je kvantizácia Q8_0 a to, či model triedy 30[B] funguje alebo nie. Bude to približne na rovnakej úrovni.

https://link.amazon/B03EseQp5

Táto oblasť je vrcholom úrovne spotrebiteľských produktov. Teraz, keď príde na profesionálnu úroveň, RTX PRO 6000 Blackwell je vybavený 96 GB pamäte. **Cena je 2,35 milióna jenov. ** Tu aj na kvantizačnej úrovni Q4_0 funguje iba model 192[B], takže vlajkový model nefunguje.

https://link.amazon/B0g76ngZz

A keďže existovali údaje pre klaster GPU, ktorý sa má nainštalovať na server, zverejním ich len pre informáciu. V prípade NVIDIA B300 je pamäť 288 GB a cena je 8,63 milióna jenov. Ak je to jedna, DeepSeek V4 Flash 0731 s kvantizáciou Q8_0 môže fungovať. Q4_0 bude fungovať. Ak máte dva (ekvivalent 17 miliónov jenov), MiMo-V2.5-Pro ​​​​s kvantizáciou Q4_0 môže fungovať.

image.png

https://www.nttpc.co.jp/cgi-bin/gpu/simulation/custom/index.cgi

Ak teda porovnáte množstvo pamäte a počet parametrov, je to asi všetko. Samozrejme, je tu o čom polemizovať a či to bude alebo nebude zahrnuté v pamäti. Takže generuje dostatok TOK/s na normálne použitie? Je tu ďalší problém. Tento článok hovorí o úplných základoch. LLM má architektúry nazývané Dense a MoE a v MoE sa v skutočnosti počítajú iba aktívne parametre a v závislosti od spôsobu vykonávania existuje spôsob, ako znížiť množstvo fyzickej pamäte načítaním potrebných Expertov z úložiska atď., namiesto neustáleho ukladania všetkých Expertov do pamäte. Existuje však niekoľko špeciálnych aspektov spôsobu vykonávania modelu a načítanie z úložiska do pamäte sa môže stať prekážkou. Existuje niekoľko takýchto príbehov, ale tu takéto detaily ignorujeme a jednoducho zvážime kapacitu, keď sú všetky hmotnosti modelu uložené v pamäti.

Ak teda chcete spustiť súčasný kvantovaný vlajkový model Q4_0 alebo Q8_0, budete potrebovať stroj, ktorý stojí najmenej 10 miliónov jenov. To je ten pocit. Na druhej strane to môže fungovať, ak použijete špeciálny hardvér na dosiahnutie ešte väčšej kvantizácie. Napríklad existujú ľudia, ktorí používajú 2-bitové kvantovanie a 3-bitové kvantovanie na M4 Mac so 128 GB pamäte (vypredané) a DGX Spark (128 GB pamäte).

https://zenn.dev/tkhr_sait/articles/20260508_try-local-deepseek-v4

https://dev.classmethod.jp/articles/dgx-spark-deepseek-v4-flash-0731-llama-cpp/

Na druhej strane je to asi hranica pre jednotlivca. Je to pocit na koži. Osobne si dávam pozor na 1-bitové kvantovanie. Medzi známe modely patria Bonsai a technológie ako BitNet, ale know-how pre 1-bitovú kvantizáciu nebolo zverejnené, takže som to neskúšal (asi by to zabralo obrovské množstvo času a znížilo by to presnosť odvodenia).

Osobne, ak by teda vyšla 1-bitová kvantovaná verzia DeepSeek (približne 35,5 GB), mohol by som vidieť svet, v ktorom by sa dal spustiť lokálne na GPU spotrebiteľskej triedy, v závislosti od určitej vynaliezavosti, ale keďže to momentálne nemáme, je to dosť ťažké. To je úprimná pravda.

preto

** Nie je reálne prevádzkovať vlajkový model s lokálnym LLM. **

To je môj všeobecný dojem. Ak naozaj chcete, aby to fungovalo, myslím, že musíte urobiť nejaké testy.

myšlienky

Tentokrát som svoju prednášku zameral na miestnu LLM. Keď vyšiel Kimi-K3, bol som dosť šokovaný a trieda Fable sa presťahovala do miestnej LLM! Bolo to celkom pôsobivé, ale s výbavou, ktorú mám, nemôžem ani pohnúť. To bol môj úprimný dojem. V minulosti som uverejnil článok o lokálnom LLM, no ten vtedy veľmi nefungoval, tak by som sa v ňom rád pohrabal trochu hlbšie. Myslel som si to.