författare: @kotauchisunsun
Releasedatum: 2026/08/12
Vi har drivit en sida som heter AI Coding.Info sedan juli 2025.
Det här är en webbplats som observerar användningstrender relaterade till AI-kodningsagenter som Claude Code, Codex CLI, Github Copilot och Gemini från en fast punkt från information i Github-förråd. För att fastställa användningen av AI Coding Agent genomför vi dagliga undersökningar under följande förhållanden.
https://ai-coding.info/reports/articles/20260703
Användningsgraden för AI Coding Agent-förvaret var 13,0 %, en ökning med 0,9 % från 12,1 % förra gången.


Användningshastighet för AI Coding Agent den 2026/8/1
https://ai-coding.info/?date=2026-08-01#adoption-rate
Användningshastighet för AI Coding Agent den 1 juli 2026
https://ai-coding.info/?date=2026-07-01#adoption-rate
Trender i AI Coding Agent-användningshastighet från 2026/7/1 till 2026/8/1
https://ai-coding.info/?date=2026-04-01&since=2026-07-01&until=2026-08-01#share-trend
Andelen per produkt är som följer.
| Ranking | Produktnamn | Aktiekurs |
|---|---|---|
| 1:a plats | Codex CLI | 40,8 % |
| 2:a plats | Claude Code | 32,0 % |
| 3:e plats | Copilot Agent | 15,1 % |
| 4:e plats | Gemini CLI(Antigravity) | 5,3 % |
| 5:e plats | Markör | 4,4 % |
Medan andelen Codex CLI ökar, förblir Claude Code densamma. Copilot Agent och Gemini CLI (Antigravity) visar också en liten nedgång. Markören är något jag har ägnat lite uppmärksamhet åt. Cursor köps av SpaceX. Det var nyheter.
https://www.nikkei.com/article/DGXZQOGN16BC70W6A610C2000000/
Kommer det därför att ske en förändring i andelskursen för denna markör? Jag trodde det, men förra månaden var det 4,7 % och denna månad var det 4,4 %, så det är inte så stor förändring. Om man tittar på antalet förvar som nämns nedan, den 1 juli, fanns det 85 förråd som antog Cursor, och från och med den 1 augusti förblir antalet oförändrat på 85. Därför, angående detta fenomen, har populationen av förvar som använder AI Coding Agent ökat totalt sett, men antalet marköranvändning har inte ökat. Som ett resultat av detta minskar den totala marknadsandelen. Detta har blivit ett fenomen. Men på grund av egenskaperna hos AI Coding.Info-forskning kommer antalet arkiv med markörspecifika konfigurationsfiler (.cursor) inte att ändras. Med det sagt så stöder Cursor själv AGENTS.md. AI Coding.Info anger att antalet repositories med AGENTS.md = antalet Codex CLI adoptioner, så även om Cursor används är det möjligt att det räknas som Codex CLI, och det finns en möjlighet att antalet användningar ökar i en osynlig del.

AI Coding Agent aktiekurs den 1/8/2026
https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#agent-share
AI Coding Agent aktiekurs 2026/7/1
https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#agent-share
Det programmeringsspråk där AI Coding Agent används mest är "TypeScript", det andra är "Python", det tredje är "Rust", det fjärde är "Go" och det femte är "C#." Användningshastigheten för AI-kodning för TypeScript är fortfarande hög, medan sammansättningen av Python'', Rust'' och Go'' som den andra gruppen, och C#'' som den tredje gruppen har varit en konsekvent trend de senaste åren.

AI Coding Agent rangordning efter programmeringsspråk den 2026/8/1
https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#language-agent-rank
AI Coding Agent rangordning efter programmeringsspråk den 1 juli 2026
https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#language-agent-rank
Antalet förråd var 1 794 per 2026/07/01, men har ökat till 1 940 från och med 2026/08/01, och antalet förråd som använder AI Coding Agent har ökat med 146.

Ändringar i antalet arkiv med AI Coding Agent från 2026/7/1 till 2026/8/1
https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#time-based-bar-chart
I juni släpptes nästa generations LLM, Mythos och Fable 5, av Claude och chockade branschen med sin prestation. Men efter det släppte Kinas Kimi-företag en öppen viktmodell som heter Kimi-K3, som nästan är Fable-klass. Det blev ett hett ämne. Även om man tittar på de faktiska riktmärkena är siffrorna nära.

https://artificialanalysis.ai/#intelligence-category-tabs
När jag tänkte att
**Är inte lokal LLM också ett alternativ för AI-kodning? **
Jag tror att du kanske tycker det. Jag undersökte det området. Tabellen nedan listar de stora LLM-modellerna med öppen vikt från grafen ovan.
| Modellnamn | Företagets namn | Meddelandedatum | Antal parametrar | Antal aktiva parametrar | Kontextlängd | Intelligence Index |
|---|---|---|---|---|---|---|
| Kimi K3(max) | Kimi(Kina) | 2026/07 | 2 800B | 104B | 1M | 60 |
| GLM-5.2(max) | Z AI(Kina) | 2026/06 | 756B | 40B | 1M | 53 |
| DeepSeek V4 Flash 0731 | DeepSeek(Kina) | 2026/07 | 284B | 13B | 1M | 52 |
| MiMo-V2.5-Pro | Xiaomi(Kina) | 2026/04 | 1 023B | 42B | 1M | 43 |
| Muse Glimmer (hög) | Meta(USA) | 2026/08 | 30B | 256K | 35 | |
| Gemma 4 31B (Resonemang) | Google (USA) | 2026/04 | 30.7B | 256K | 30 |
Men fungerar dessa verkligen på din PC? Det förstår jag inte riktigt. Därför var den bestämningsmetod vi övervägde
Det nödvändiga VRAM-minnet är
2[GB] per parameter 1[B]
är. Du kan grovt uppskatta om det kommer att fungera baserat på VRAM-minneskapaciteten på din PC och antalet parametrar för modellen du vill köra. därför,
**Matematiskt krävs 5,6 TB (5 600 GB) minne för att köra Kimi-K3. **
Jag ska förklara orsaken till detta. I den standarddistribuerade LLM-modellen uttrycks vikter med decimaltal med en precision av bf16 eller fp16. Dessa kräver 2 byte för varje parameter. Den notation du ofta ser, till exempel 30[B], är antalet parametrar, och B står för miljard och representerar 10^9. Därför kan det ses att en modell som 30[B] har 30×10^9 viktdata. Och 1[GB]=1*10^9[Byte]. När vi tänker på det så nämnde vi tidigare att standardvikter lagras i 2 byte, så det tar 2 byte per vikt, vilket betyder 2 [GB] för att lagra 1 [B] parametrar i minnet. Detta är beräkningen. Detta är innebörden av "2[GB] per parameter 1[B]" som nämnts tidigare. Detta är dock bara en uppskattning; detta är minimikravet för att ladda vikterna i VRAM, och eftersom minne kan användas utöver det är det absolut tillrådligt att inte överskrida det. Detta är VRAM-kapaciteten.
Det är här begreppet kvantisering kommer in i bilden. Du kanske har sett Q4_0 eller Q4_K_M. Detta är en teknik som komprimerar vikten till dess antal bitar. Därför, i fallet med Q4_0, grovt sett, är viktkapaciteten 4 bitar (4-delen av Q4_0). Därför är kapaciteten i det här fallet 0,5[GB] per 1[B]. En snabbreferenstabell över dessa ser ut så här:
| Kvantiseringsmetod | Erforderlig minnesmängd per 1[B] [GB] |
|---|---|
| bf16,fp16(standard) | 2.0 |
| F8_0 | 1.0 |
| F4_0 | 0,5 |
Du kanske ser en notation som Q4_K_M, men grovt sett är det en modell som ökar noggrannheten jämfört med Q4_0, men som använder något mer minneskapacitet. Det är bra att vara medveten om detta. Det finns ett annat sätt att se, titta helt enkelt på filstorleken på viktfilen (safetensor eller gguf). Om detta överskrider VRAM-minneskapaciteten kommer det i allmänhet inte att fungera. Jag tror att man kan tycka det.
Härifrån har vi skapat en snabbreferenstabell över mängden VRAM-minne, kvantiseringsmetod och antal parametrar.
| VRAM-minneskapacitet [GB] | Antal parametrar (bf16,fp16)[B] | Antal parametrar (Q8_0)[B] | Antal parametrar (Q4_0)[B] |
|---|---|---|---|
| 8 | 4 | 8 | 16 |
| 16 | 8 | 16 | 32 |
| 24 | 12 | 24 | 48 |
| 32 | 16 | 32 | 64 |
| 64 | 32 | 64 | 128 |
| 128 | 64 | 128 | 256 |
| 256 | 128 | 256 | 512 |
| 512 | 256 | 512 | 1024 |
| 1024 | 512 | 1024 | 2048 |
| 2048 | 1024 | 2048 | 4096 |
Ungefär hur länge kan det göras? Med tanke på att om det är en modell med 8 GB VRAM kommer det att vara en RTX 5050, och Amazon-priset är 55 000 yen. Detta kan fungera om modellen är ungefär 8[B] kvantiserad med Q8_0. Det är nivån.
När VRAM ökar till 16GB blir det en modell kring RTX 5060 Ti, som kostar cirka 108 000 yen. Vid denna tidpunkt, med Q4_0 kvantisering, kommer en 30[B] klass LLM att fungera eller inte. Det är nivån.
När VRAM ökar till 32GB blir det RTX 5090 flaggskeppsmodell och kostar 795 000 yen. När det kommer till detta antar jag att det är på en nivå där du inte kan göra det om du inte har mycket beslutsamhet. Jag tror det. Detta är kvantiseringen av Q8_0, och huruvida 30[B] klassmodellen fungerar eller inte. Det blir ungefär samma nivå.
Detta område är den översta raden av konsumentproduktnivå. Nu, när det kommer till den professionella nivån, är RTX PRO 6000 Blackwell utrustad med 96 GB minne. **Priset är 2,35 miljoner yen. ** Här, även på Q4_0-kvantiseringsnivån, fungerar bara 192[B]-modellen, så flaggskeppsmodellen fungerar inte.
Och eftersom det fanns data för GPU-klustret som skulle installeras på servern, kommer jag att lägga upp det endast som referens. I fallet med NVIDIA B300 är minnet 288GB och priset är 8,63 miljoner yen. Om det är en, kan DeepSeek V4 Flash 0731 med Q8_0-kvantisering fungera. Q4_0 kommer att fungera. Om du har två (motsvarande 17 miljoner yen) kan MiMo-V2.5-Pro med Q4_0-kvantisering fungera.

https://www.nttpc.co.jp/cgi-bin/gpu/simulation/custom/index.cgi
Därför, om du jämför mängden minne och antalet parametrar, handlar det här om det. Naturligtvis finns det mer att diskutera än så här, och huruvida detta kommer att finnas med i minnet eller inte. Så genererar det tillräckligt med TOK/s för att användas normalt? Det finns en annan fråga. Den här artikeln talar om det allra grundläggande. LLM har arkitekturer som heter Dense och MoE, och i MoE är det bara de aktiva parametrarna som faktiskt beräknas, och beroende på exekveringsmetoden finns det ett sätt att minska mängden fysiskt minne genom att läsa ut nödvändiga Experts från lagringen etc. istället för att lagra alla Experter i minnet hela tiden. Det finns dock några speciella aspekter på hur modellen exekveras, och laddning från lagring till minne kan bli en flaskhals. Det finns några sådana här historier, men här bortser vi från sådana detaljer och överväger helt enkelt kapaciteten när alla vikter av modellen är lagrade i minnet.
Så om du vill köra den nuvarande kvantiserade flaggskeppsmodellen Q4_0 eller Q8_0, behöver du en maskin som kostar minst 10 miljoner yen. Det är känslan av det. Å andra sidan kan det fungera om du använder speciell hårdvara för att uppnå ännu större kvantisering. Till exempel finns det personer som kör 2-bitars kvantisering och 3-bitars kvantisering på M4 Mac med 128 GB minne (slutsålt) och DGX Spark (128 GB minne).
https://zenn.dev/tkhr_sait/articles/20260508_try-local-deepseek-v4
https://dev.classmethod.jp/articles/dgx-spark-deepseek-v4-flash-0731-llama-cpp/
Å andra sidan är detta förmodligen gränsen för en individ. Det är en hudkänsla. Personligen är jag uppmärksam på 1-bitars kvantisering. Kända modeller inkluderar Bonsai och teknologi som BitNet, men kunskapen för 1-bitars kvantisering har inte offentliggjorts, så jag har inte provat det (det skulle förmodligen ta enormt lång tid och minska slutledningsnoggrannheten).
Så personligen, om en 1-bitars kvantifierad version av DeepSeek (cirka 35,5 GB) släpptes, skulle jag kunna se en värld där den kunde köras lokalt på en konsumentklassad GPU, beroende på en viss uppfinningsrikedom, men eftersom vi för närvarande inte har det, är det ganska svårt. Det är den ärliga sanningen.
Därför,
**Det är inte realistiskt att köra flaggskeppsmodellen med lokal LLM. **
Det är mitt allmänna intryck. Om du verkligen vill att det ska fungera tror jag att du måste göra några tester.
Den här gången fokuserade jag mitt föredrag på lokal LLM. När Kimi-K3 kom ut blev jag ganska chockad, och Fable-klassen flyttade in i den lokala LLM! Det var ganska imponerande, men jag kan inte ens flytta det med den utrustning jag har. Det var mitt ärliga intryck. Jag postade en artikel om lokal LLM tidigare, men den fungerade inte så bra på den tiden, så jag skulle vilja gräva lite djupare i det själv. Jag trodde det.