forfatter: @kotauchisunsun
Udgivelsesdato: 2026/08/12
Vi har drevet et websted kaldet AI Coding.Info siden juli 2025.
Dette er et websted, der observerer brugstendenser relateret til AI Coding Agents såsom Claude Code, Codex CLI, Github Copilot og Gemini fra et fast punkt fra information i Github-lagre. For at bestemme brugen af AI Coding Agent udfører vi daglige undersøgelser under følgende forhold.
https://ai-coding.info/reports/articles/20260703
** AI Coding Agent repository udnyttelsesgrad var 13,0 %**, en stigning på 0,9 % fra 12,1 % sidste gang.


AI Coding Agent-brugshastighed den 2026/8/1
https://ai-coding.info/?date=2026-08-01#adoption-rate
AI Coding Agent-brugshastighed den 1. juli 2026
https://ai-coding.info/?date=2026-07-01#adoption-rate
Tendenser i brugsraten for AI Coding Agent fra 2026/7/1 til 2026/8/1
https://ai-coding.info/?date=2026-04-01&since=2026-07-01&until=2026-08-01#share-trend
Andelen pr. produkt er som følger.
| Rangering | Produktnavn | Aktiekurs |
|---|---|---|
| 1. plads | Codex CLI | 40,8 % |
| 2. plads | Claude kode | 32,0 % |
| 3. plads | Copilot Agent | 15,1 % |
| 4. plads | Gemini CLI(Antigravity) | 5,3 % |
| 5. plads | Markør | 4,4 % |
Mens andelen af Codex CLI er stigende, forbliver Claude Code den samme. Copilot Agent og Gemini CLI (Antigravity) viser også et lille fald. Cursor er noget, jeg har været lidt opmærksom på. Cursor er erhvervet af SpaceX. Der var nyheder.
https://www.nikkei.com/article/DGXZQOGN16BC70W6A610C2000000/
Vil der derfor være en ændring i aktiekursen for denne markør? Det troede jeg, men i sidste måned var det 4,7 % og i denne måned var det 4,4 %, så der er ikke den store ændring. Ser man på antallet af repositories, der er nævnt nedenfor, var der den 1. juli 85 repositories, der adopterede Cursor, og pr. 1. august forbliver antallet uændret på 85. Derfor, hvad angår dette fænomen, er populationen af repositories, der bruger AI Coding Agent, steget generelt, men antallet af Cursor-brug er ikke steget. Som følge heraf er den samlede markedsandel faldende. Dette er blevet et fænomen. Men på grund af egenskaberne ved AI Coding.Info-forskning vil antallet af repositories med markørspecifikke konfigurationsfiler (.cursor) ikke ændre sig. Når det er sagt, så understøtter Cursor selv AGENTS.md. AI Coding.Info angiver, at antallet af repositories med AGENTS.md = antallet af Codex CLI adoptioner, så selvom Cursor bruges, er det muligt, at det tælles som Codex CLI, og der er mulighed for, at antallet af anvendelser er stigende i en usynlig del.

AI Coding Agent aktiekurs den 1/8/2026
https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#agent-share
AI Coding Agent aktiekurs 2026/7/1
https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#agent-share
Det programmeringssprog, hvori AI Coding Agent bruges mest, er "TypeScript", det andet er "Python", det tredje er "Rust", det fjerde er "Go", og det femte er "C#." Vedtagelseshastigheden af AI Coding for TypeScript forbliver høj, mens sammensætningen af Python'', Rust'' og Go'' som den anden gruppe og C#'' som den tredje gruppe har været en konsekvent tendens i de seneste år.

AI Coding Agent rangering efter programmeringssprog den 2026/8/1
https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#language-agent-rank
AI Coding Agent rangering efter programmeringssprog den 1. juli 2026
https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#language-agent-rank
Antallet af repositories var 1.794 pr. 2026/07/01, men er steget til 1.940 pr. 2026/08/01, og antallet af repositories, der bruger AI Coding Agent, er steget med 146.

Ændringer i antallet af repositories ved hjælp af AI Coding Agent fra 2026/7/1 til 2026/8/1
https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#time-based-bar-chart
I juni blev den næste generation af LLM'er, Mythos og Fable 5, udgivet af Claude og chokerede branchen med deres præstationer. Men efter det udgav Kinas Kimi-firma en åbenvægtsmodel kaldet Kimi-K3, som næsten er Fable-klasse. Det blev et varmt emne. Selv ser man på de faktiske benchmarks, er tallene tæt på.

https://artificialanalysis.ai/#intelligence-category-tabs
Da jeg tænkte,
**Er lokal LLM ikke også en mulighed for AI-kodning? **
Det tror jeg måske, du tror. Jeg undersøgte det område. Tabellen nedenfor viser de vigtigste LLM-modeller med åben vægt fra grafen ovenfor.
| Modelnavn | Virksomhedsnavn | Meddelelsesdato | Antal parametre | Antal aktive parametre | Kontekstlængde | Efterretningsindeks |
|---|---|---|---|---|---|---|
| Kimi K3(max) | Kimi(Kina) | 2026/07 | 2.800B | 104B | 1M | 60 |
| GLM-5.2(max) | Z AI(Kina) | 2026/06 | 756B | 40B | 1M | 53 |
| DeepSeek V4 Flash 0731 | DeepSeek(Kina) | 2026/07 | 284B | 13B | 1M | 52 |
| MiMo-V2.5-Pro | Xiaomi(Kina) | 2026/04 | 1.023B | 42B | 1M | 43 |
| Muse Glimmer (høj) | Meta(USA) | 2026/08 | 30B | 256K | 35 | |
| Gemma 4 31B (Begrundelse) | Google (USA) | 2026/04 | 30.7B | 256K | 30 |
Men virker disse faktisk på din pc? Det forstår jeg ikke rigtigt. Derfor var den bestemmelsesmetode, vi overvejede
Den nødvendige VRAM-hukommelse er
2[GB] pr. parameter 1[B]
er. Du kan groft estimere, om det vil fungere, baseret på VRAM-hukommelseskapaciteten på din pc og antallet af parametre for den model, du ønsker at køre. derfor,
**Matematisk kræves der 5,6 TB (5.600 GB) hukommelse for at køre Kimi-K3. **
Jeg vil forklare årsagen til dette. I den standarddistribuerede LLM-model er vægte udtrykt ved hjælp af decimaltal med en præcision på bf16 eller fp16. Disse kræver 2 bytes for hver parameter. Den notation, du ofte ser, såsom 30[B], er antallet af parametre, og B står for milliard og repræsenterer 10^9. Derfor kan det ses, at en model som 30[B] har 30×10^9 vægtdata. Og 1[GB]=1*10^9[Byte]. Når vi tænker over det på den måde, nævnte vi tidligere, at standardvægte er gemt i 2 bytes, så det tager 2 bytes pr. vægt, hvilket betyder 2 [GB] at gemme 1 [B] parametre i hukommelsen. Dette er beregningen. Dette er betydningen af "2[GB] pr. parameter 1[B]" nævnt tidligere. Dette er dog kun en tilnærmelse; dette er minimumskravet for at indlæse vægtene i VRAM, og da hukommelse kan bruges udover det, er det strengt tilrådeligt ikke at overskride det. Dette er VRAM-kapaciteten.
Det er her begrebet kvantisering kommer i spil. Du har måske set Q4_0 eller Q4_K_M. Dette er en teknik, der komprimerer vægten til dets antal bit. Derfor er vægtkapaciteten i tilfældet med Q4_0 groft sagt 4 bit (den 4 del af Q4_0). Derfor er kapaciteten i dette tilfælde 0,5[GB] pr. 1[B]. En hurtig referencetabel over disse ser sådan ud:
| Kvantiseringsmetode | Påkrævet hukommelsesmængde pr. 1[B] [GB] |
|---|---|
| bf16,fp16(standard) | 2.0 |
| Q8_0 | 1.0 |
| Q4_0 | 0,5 |
Du kan muligvis se en notation som Q4_K_M, men groft sagt er det en model, der øger nøjagtigheden i forhold til Q4_0, men bruger lidt mere hukommelseskapacitet. Det er godt at være opmærksom på dette. Der er en anden måde at fortælle det på, bare se på filstørrelsen på vægtfilen (safetensor eller gguf). Hvis dette overskrider VRAM-hukommelseskapaciteten, vil det generelt ikke fungere. Det tror jeg, du kan mene.
Herfra har vi lavet en hurtig referencetabel over mængden af VRAM-hukommelse, kvantiseringsmetode og antallet af parametre.
| VRAM-hukommelseskapacitet [GB] | Antal parametre (bf16,fp16)[B] | Antal parametre (Q8_0)[B] | Antal parametre (Q4_0)[B] |
|---|---|---|---|
| 8 | 4 | 8 | 16 |
| 16 | 8 | 16 | 32 |
| 24 | 12 | 24 | 48 |
| 32 | 16 | 32 | 64 |
| 64 | 32 | 64 | 128 |
| 128 | 64 | 128 | 256 |
| 256 | 128 | 256 | 512 |
| 512 | 256 | 512 | 1024 |
| 1024 | 512 | 1024 | 2048 |
| 2048 | 1024 | 2048 | 4096 |
Hvor længe kan det gøres cirka? I betragtning af, at hvis det er en model med 8 GB VRAM, vil det være en RTX 5050, og Amazon-prisen er 55.000 yen. Dette kan fungere, hvis modellen er omkring 8[B] kvantiseret med Q8_0. Det er niveauet.
Når VRAM stiger til 16GB, bliver det en model omkring RTX 5060 Ti, som koster omkring 108.000 yen. På dette tidspunkt, med Q4_0 kvantisering, vil en 30[B] klasse LLM fungere eller ej. Det er niveauet.
Når VRAM stiger til 32GB, bliver det RTX 5090 flagskibsmodellen og koster 795.000 yen. Når det kommer til dette, så er det vel på et niveau, hvor du ikke kan gøre det, medmindre du har en masse beslutsomhed. Det tror jeg. Dette er kvantiseringen af Q8_0, og om 30[B] klassemodellen virker eller ej. Det bliver cirka samme niveau.
Dette område er den øverste linje af forbrugerproduktniveau. Nu, når det kommer til det professionelle niveau, er RTX PRO 6000 Blackwell udstyret med 96 GB hukommelse. **Prisen er 2,35 millioner yen. ** Her, selv på Q4_0-kvantiseringsniveauet, er det kun 192[B]-modellen, der virker, så flagskibsmodellen virker ikke.
Og da der var data til GPU-klyngen, der skulle installeres på serveren, vil jeg kun poste det til reference. I tilfældet med NVIDIA B300 er hukommelsen 288GB og prisen er 8,63 millioner yen. Hvis det er en, kan DeepSeek V4 Flash 0731 med Q8_0 kvantisering fungere. Q4_0 vil virke. Hvis du har to (svarende til 17 millioner yen), fungerer MiMo-V2.5-Pro med Q4_0 kvantisering muligvis.

https://www.nttpc.co.jp/cgi-bin/gpu/simulation/custom/index.cgi
Derfor, hvis du sammenligner mængden af hukommelse og antallet af parametre, handler det her om det. Selvfølgelig er der mere at diskutere end dette, og hvorvidt dette vil blive inkluderet i hukommelsen. Så genererer det nok TOK/s til at blive brugt normalt? Der er et andet problem. Denne artikel taler om det helt grundlæggende. LLM har arkitekturer kaldet Dense og MoE, og i MoE er det kun de aktive parametre, der rent faktisk beregnes, og afhængigt af udførelsesmetoden er der en måde at reducere mængden af fysisk hukommelse ved at udlæse de nødvendige Experts fra lager osv., i stedet for at gemme alle Experts i hukommelsen hele tiden. Der er dog nogle særlige aspekter ved den måde, modellen udføres på, og indlæsning fra lager til hukommelse kan blive en flaskehals. Der er nogle historier som denne, men her ignorerer vi sådanne detaljer og overvejer blot kapaciteten, når alle modellens vægte er gemt i hukommelsen.
Så hvis du vil køre den nuværende Q4_0 eller Q8_0 kvantiserede flagskibsmodel, skal du bruge en maskine, der koster mindst 10 millioner yen. Det er følelsen af det. På den anden side kan det virke, hvis du bruger speciel hardware til at opnå endnu større kvantisering. For eksempel er der folk, der kører 2-bit kvantisering og 3-bit kvantisering på M4 Mac med 128 GB hukommelse (udsolgt) og DGX Spark (128 GB hukommelse).
https://zenn.dev/tkhr_sait/articles/20260508_try-local-deepseek-v4
https://dev.classmethod.jp/articles/dgx-spark-deepseek-v4-flash-0731-llama-cpp/
På den anden side er det nok grænsen for et individ. Det er en hudfornemmelse. Personligt er jeg opmærksom på 1-bit kvantisering. Berømte modeller inkluderer Bonsai og teknologi som BitNet, men knowhow til 1-bit kvantisering er ikke blevet offentliggjort, så jeg har ikke prøvet det (det ville sandsynligvis tage enormt lang tid og reducere slutningsnøjagtigheden).
Så personligt, hvis en 1-bit kvantiseret version af DeepSeek (ca. 35,5 GB) blev frigivet, kunne jeg se en verden, hvor den kunne køres lokalt på en forbruger-grade GPU, afhængig af en vis opfindsomhed, men da vi i øjeblikket ikke har det, er det ret svært. Det er den ærlige sandhed.
Derfor,
**Det er ikke realistisk at køre flagskibsmodellen med lokal LLM. **
Det er mit generelle indtryk. Hvis du virkelig vil have det til at virke, tror jeg, du skal lave nogle test.
#tanker
Denne gang fokuserede jeg min tale på lokal LLM. Da Kimi-K3 kom ud, var jeg ret chokeret, og Fable-klassen flyttede i den lokale LLM! Det var ret imponerende, men jeg kan ikke engang flytte det med det udstyr, jeg har. Det var mit ærlige indtryk. Jeg postede tidligere en artikel om lokal LLM, men den fungerede ikke særlig godt på det tidspunkt, så jeg vil gerne selv grave lidt dybere i det. Det troede jeg.