AI Coding.Info
RepositoriesREPORTS
ABOUT

Lze pro kódování AI použít místní LLM? ~Shrnutí trendů kódování AI v červenci 2026, jak je vidět z dat~

autor: @kotauchisunsun

Datum vydání: 2026/08/12

Trendy AI Coding Agent v srpnu 2026

Od července 2025 provozujeme web s názvem AI Coding.Info.

https://ai-coding.info/

https://x.com/AICodingInfo

Toto je stránka, která sleduje trendy používání související s AI Coding Agents, jako je Claude Code, Codex CLI, Github Copilot a Gemini, z pevného bodu z informací v úložištích Github. Abychom určili použití AI Coding Agent, provádíme denní průzkumy za následujících podmínek.

Trendy minulého měsíce

https://ai-coding.info/reports/articles/20260703

Míra využití AI Coding Agent je 13,0 %

Míra využití úložiště AI Coding Agent byla 13,0 %, což je nárůst o 0,9 % z 12,1 % naposledy.

image.png

image.png

Míra využití AI Coding Agent dne 2026/8/1

https://ai-coding.info/?date=2026-08-01#adoption-rate

Míra využití AI Coding Agent k 1. červenci 2026

https://ai-coding.info/?date=2026-07-01#adoption-rate

Trendy v míře používání AI Coding Agent od 2026/7/1 do 2026/8/1

https://ai-coding.info/?date=2026-04-01&since=2026-07-01&until=2026-08-01#share-trend

Podíl AI Coding Agent podle produktu

Podíl podle produktu je následující.

PořadíNázev produktuKurz akcií
1.místoCodex CLI40,8 %
2.místoClaude Code32,0 %
3.místoAgent druhého pilota15,1 %
4.místoGemini CLI(antigravitace)5,3 %
5.místoKurzor4,4 %

Zatímco podíl Codex CLI roste, Claude Code zůstává stejný. Copilot Agent a Gemini CLI (Antigravity) také vykazují mírný pokles. Kurzor je něco, čemu jsem věnoval trochu pozornosti. Cursor získává SpaceX. Byly tam novinky.

https://www.nikkei.com/article/DGXZQOGN16BC70W6A610C2000000/

Dojde tedy ke změně podílu tohoto kurzoru? Myslel jsem si to, ale minulý měsíc to bylo 4,7 % a tento měsíc 4,4 %, takže zas tak velká změna to není. Když se podíváme na níže uvedený počet úložišť, k 1. červenci bylo 85 úložišť, která přijala Cursor, a k 1. srpnu zůstává počet nezměněn na 85. Pokud jde o tento jev, populace úložišť používajících AI Coding Agent se celkově zvýšila, ale počet použití Cursoru se nezvýšil. V důsledku toho se celkový podíl na trhu snižuje. To se stalo fenoménem. Vzhledem k charakteristikám výzkumu AI Coding.Info se však počet úložišť s konfiguračními soubory specifickými pro Cursor (.cursor) nezmění. Jak již bylo řečeno, Cursor samotný podporuje AGENTS.md. AI Coding.Info uvádí, že počet úložišť s AGENTS.md = počet přijetí Codex CLI, takže ačkoli se používá Cursor, je možné, že se počítá jako Codex CLI, a existuje možnost, že se počet použití zvyšuje v neviditelné části.

image.png

Kurz sdílení AI Coding Agent dne 1. 8. 2026

https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#agent-share

Kurz sdílení AI Coding Agent dne 2026/7/1

https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#agent-share

Stav použití AI Coding Agent podle programovacího jazyka

Programovací jazyk, ve kterém se AI Coding Agent nejvíce používá, je „TypeScript“, druhý je „Python“, třetí je „Rust“, čtvrtý je „Go“ a pátý je „C#“. Míra přijetí kódování AI pro TypeScript zůstává vysoká, zatímco složení ,,Python'', ,,Rust'' a ,,Go'' jako druhé skupiny a ,,C#'' jako třetí skupiny, je v posledních letech konzistentním trendem.

image.png

Hodnocení AI Coding Agent podle programovacího jazyka dne 2026/8/1

https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#language-agent-rank

Hodnocení AI Coding Agent podle programovacího jazyka k 1. červenci 2026

https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#language-agent-rank

Měsíční trendy v počtu úložišť používaných AI Coding Agent

Počet úložišť byl 1 794 od 2026/07/01, ale zvýšil se na 1,940 od ​​2026/08/01 a počet úložišť využívajících AI Coding Agent se zvýšil o 146.

image.png

Změny v počtu úložišť používajících AI Coding Agent od 2026/7/1 do 2026/8/1

https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#time-based-bar-chart

Lze pro kódování AI použít místní LLM?

V červnu Claude vydala další generaci LLM, Mythos a Fable 5 a šokovala průmysl svým výkonem. Poté však čínská společnost Kimi vydala model s otevřenou váhou nazvaný Kimi-K3, což je téměř třída Fable. To se stalo horkým tématem. I při pohledu na skutečné benchmarky jsou čísla blízko.

image.png

https://artificialanalysis.ai/#intelligence-category-tabs

Když jsem si to myslel,

**Není místní LLM také možností pro kódování AI? **

Myslím, že si to můžete myslet. Zkoumal jsem tu oblast. Níže uvedená tabulka uvádí hlavní modely LLM s otevřenou hmotností z výše uvedeného grafu.

Název modeluNázev společnostiDatum oznámeníPočet parametrůPočet aktivních parametrůDélka kontextuIndex inteligence
Kimi K3(max)Kimi(Čína)2026/072 800 B104B1M60
GLM-5.2(max)Z AI(Čína)2026/06756B40B1M53
DeepSeek V4 Flash 0731DeepSeek(Čína)2026/07284B13B1M52
MiMo-V2.5-ProXiaomi (Čína)2026/041 023 B42B1M43
Muse Glimmer (vysoká)Meta(USA)2026/0830B256 tis.35
Gemma 4 31B (Úvaha)Google (USA)2026/0430,7B256 tis.30

Fungují však skutečně na vašem PC? Tomu fakt nerozumím. Metoda stanovení, kterou jsme zvažovali, tedy byla

Požadovaná paměť VRAM je

2[GB] na parametr 1[B]

je. Zda to bude fungovat, můžete zhruba odhadnout podle kapacity paměti VRAM vašeho PC a počtu parametrů modelu, který chcete provozovat. proto,

**Matematicky je ke spuštění Kimi-K3 zapotřebí 5,6 TB (5 600 GB) paměti. **

Vysvětlím důvod. Ve standardním distribuovaném modelu LLM jsou váhy vyjádřeny pomocí desetinných čísel s přesností bf16 nebo fp16. Ty vyžadují 2 bajty pro každý parametr. Zápis, který často vidíte, například 30[B], je počet parametrů a B znamená miliardu a představuje 10^9. Je tedy vidět, že model jako 30[B] má hmotnostní údaje 30×10^9. A 1[GB]=1*10^9[Byte]. Když o tom přemýšlíme tímto způsobem, zmínili jsme se dříve, že standardní váhy jsou uloženy ve 2 bytech, takže na váhu jsou potřeba 2 bajty, což znamená 2 [GB] na uložení 1 [B] parametrů do paměti. Toto je výpočet. Toto je význam „2[GB] na parametr 1[B]“ zmíněný dříve. Jde však pouze o přiblížení; toto je minimální požadavek pro načtení závaží do VRAM, a protože k tomu lze použít paměť, je přísně doporučeno jej nepřekračovat. Toto je kapacita VRAM.

Zde vstupuje do hry koncept kvantizace. Možná jste viděli Q4_0 nebo Q4_K_M. Jedná se o techniku, která komprimuje váhu na její počet bitů. Proto v případě Q4_0, zhruba řečeno, je hmotnostní kapacita 4 bity (4 části Q4_0). Proto je v tomto případě kapacita 0,5[GB] na 1[B]. Rychlá referenční tabulka těchto položek vypadá takto:

Metoda kvantifikacePožadované množství paměti na 1[B] [GB]
bf16,fp16(standardní)2,0
Q8_01,0
Q4_00,5

Můžete vidět zápis jako Q4_K_M, ale zhruba řečeno jde o model, který ve srovnání s Q4_0 zvyšuje přesnost, ale využívá o něco větší kapacitu paměti. Je dobré si to uvědomit. Existuje další způsob, jak to zjistit, jednoduše se podívat na velikost souboru váhového souboru (safetensor nebo gguf). Pokud to překročí kapacitu paměti VRAM, obecně to nebude fungovat. Myslím, že si to můžete myslet.

Odtud jsme vytvořili rychlou referenční tabulku množství paměti VRAM, kvantizační metody a počtu parametrů.

Kapacita paměti VRAM [GB]Počet parametrů (bf16,fp16)[B]Počet parametrů (Q8_0)[B]Počet parametrů (Q4_0)[B]
84816
1681632
24122448
32163264
643264128
12864128256
256128256512
5122565121024
102451210242048
2048102420484096

Za jak dlouho to lze přibližně udělat? Vzhledem k tomu, že pokud se jedná o model s 8GB VRAM, bude to RTX 5050 a cena Amazonu je 55 000 jenů. To může fungovat, pokud je model přibližně 8[B] kvantizován pomocí Q8_0. To je úroveň.

https://link.amazon/B0brulI9R

Když se VRAM zvýší na 16 GB, stane se modelem kolem RTX 5060 Ti, který stojí asi 108 000 jenů. V tomto okamžiku s kvantizací Q4_0 bude LLM třídy 30[B] fungovat nebo ne. To je úroveň.

https://link.amazon/B0ghUQISo

Když se VRAM zvýší na 32 GB, stane se vlajkovým modelem RTX 5090 a stojí 795 000 jenů. Pokud jde o tohle, předpokládám, že je to na úrovni, kdy to nezvládnete, pokud nemáte hodně odhodlání. Myslím, že ano. Toto je kvantování Q8_0 a zda model třídy 30[B] funguje nebo ne. Bude to zhruba na stejné úrovni.

https://link.amazon/B03EseQp5

Tato oblast je vrcholem úrovně spotřebitelských produktů. Nyní, pokud jde o profesionální úroveň, je RTX PRO 6000 Blackwell vybaven 96 GB paměti. **Cena je 2,35 milionu jenů. ** Zde i na úrovni kvantizace Q4_0 funguje pouze model 192[B], takže model vlajkové lodi nefunguje.

https://link.amazon/B0g76ngZz

A protože existovala data pro cluster GPU k instalaci na server, zveřejním je pouze pro informaci. V případě NVIDIA B300 je paměť 288 GB a cena je 8,63 milionů jenů. Pokud je jedna, DeepSeek V4 Flash 0731 s kvantizací Q8_0 může fungovat. Q4_0 bude fungovat. Pokud máte dva (ekvivalent 17 milionů jenů), MiMo-V2.5-Pro ​​​​s kvantizací Q4_0 může fungovat.

image.png

https://www.nttpc.co.jp/cgi-bin/gpu/simulation/custom/index.cgi

Pokud tedy porovnáte množství paměti a počet parametrů, je to asi vše. Samozřejmě je toho k debatě mnohem víc a zda to bude či nebude zahrnuto do paměti. Takže generuje dostatek TOK/s k běžnému použití? Je tu další problém. Tento článek hovoří o úplných základech. LLM má architektury zvané Dense a MoE a v MoE se ve skutečnosti počítají pouze aktivní parametry a v závislosti na způsobu provádění existuje způsob, jak snížit množství fyzické paměti načítáním potřebných Expertů z úložiště atd., namísto neustálého ukládání všech Expertů do paměti. Způsob provádění modelu má však některé zvláštní aspekty a načítání z úložiště do paměti se může stát úzkým hrdlem. Existuje několik takových příběhů, ale zde tyto detaily ignorujeme a jednoduše vezmeme v úvahu kapacitu, když jsou všechny hmotnosti modelu uloženy v paměti.

Pokud tedy chcete provozovat aktuální kvantovaný vlajkový model Q4_0 nebo Q8_0, budete potřebovat stroj, který stojí alespoň 10 milionů jenů. To je ten pocit. Na druhou stranu to může fungovat, pokud k dosažení ještě větší kvantizace použijete speciální hardware. Například existují lidé, kteří používají 2bitovou kvantizaci a 3bitovou kvantizaci na M4 Mac se 128GB pamětí (vyprodáno) a DGX Spark (128GB paměti).

https://zenn.dev/tkhr_sait/articles/20260508_try-local-deepseek-v4

https://dev.classmethod.jp/articles/dgx-spark-deepseek-v4-flash-0731-llama-cpp/

Na druhou stranu je to asi limit pro jednotlivce. Je to pocit na kůži. Osobně si dávám pozor na 1bitovou kvantizaci. Mezi známé modely patří Bonsai a technologie jako BitNet, ale know-how pro 1bitovou kvantizaci nebylo zveřejněno, takže jsem to nezkoušel (asi by to zabralo obrovské množství času a snížilo by to přesnost odvození).

Takže osobně, pokud by byla vydána 1bitová kvantovaná verze DeepSeek (přibližně 35,5 GB), mohl bych vidět svět, ve kterém by to šlo provozovat lokálně na GPU pro spotřebitele, v závislosti na určité vynalézavosti, ale protože to v současné době nemáme, je to docela obtížné. To je upřímná pravda.

Proto,

**Není reálné provozovat vlajkový model s místním LLM. **

To je můj obecný dojem. Pokud opravdu chcete, aby to fungovalo, myslím, že musíte udělat nějaké testy.

myšlenky

Tentokrát jsem svou přednášku zaměřil na místní LLM. Když vyšel Kimi-K3, byl jsem docela v šoku a třída Fable se přesunula do místního LLM! Bylo to docela působivé, ale s vybavením, které mám, s tím nemůžu ani pohnout. To byl můj upřímný dojem. V minulosti jsem vložil článek o místním LLM, ale tenkrát to moc nefungovalo, takže bych se v tom chtěl sám ponořit trochu hlouběji. Myslel jsem si to.