автор: @kotauchisunsun
Дата на издаване: 2026/08/12
Ние управляваме сайт, наречен AI Coding.Info от юли 2025 г.
Това е сайт, който наблюдава тенденциите на използване, свързани с агенти за кодиране на AI, като Claude Code, Codex CLI, Github Copilot и Gemini от фиксирана точка въз основа на информация от хранилища на Github. За да определим използването на AI Coding Agent, ние провеждаме ежедневни проучвания при следните условия.
https://ai-coding.info/reports/articles/20260703
Процентът на използване на # AI Coding Agent е 13,0%
Процентът на използване на хранилището на AI Coding Agent беше 13,0%, увеличение от 0,9% от 12,1% последния път.


Процент на използване на AI Coding Agent на 2026/8/1
https://ai-coding.info/?date=2026-08-01#adoption-rate
Процент на използване на AI Coding Agent на 1 юли 2026 г
https://ai-coding.info/?date=2026-07-01#adoption-rate
Тенденции в степента на използване на AI Coding Agent от 2026/7/1 до 2026/8/1
https://ai-coding.info/?date=2026-04-01&since=2026-07-01&until=2026-08-01#share-trend
Делът по продукти е както следва.
| Класиране | Име на продукта | Процент на дял |
|---|---|---|
| 1во място | Codex CLI | 40,8% |
| 2-ро място | Клод Код | 32,0% |
| 3-то място | Агент втори пилот | 15,1% |
| 4-то място | Gemini CLI (Антигравитация) | 5,3% |
| 5-то място | Курсор | 4,4% |
Докато делът на Codex CLI се увеличава, Claude Code остава същият. Copilot Agent и Gemini CLI (Antigravity) също показват лек спад. Курсорът е нещо, на което съм обръщал малко внимание. Курсорът е придобит от SpaceX. Имаше новини.
https://www.nikkei.com/article/DGXZQOGN16BC70W6A610C2000000/
Следователно, ще има ли промяна в процента на акциите на този Cursor? Мислех така, но миналия месец беше 4,7%, а този месец беше 4,4%, така че няма чак толкова голяма промяна. Разглеждайки броя на хранилищата, споменати по-долу, на 1 юли е имало 85 хранилища, които са приели Cursor, а от 1 август броят остава непроменен на 85. Следователно, по отношение на това явление, популацията от хранилища, използващи AI Coding Agent, се е увеличила като цяло, но броят на използването на Cursor не се е увеличил. В резултат на това общият пазарен дял намалява. Това се е превърнало във феномен. Въпреки това, поради характеристиките на изследването на AI Coding.Info, броят на хранилищата със специфични за Cursor конфигурационни файлове (.cursor) няма да се промени. Като се има предвид това, самият Cursor поддържа AGENTS.md. AI Coding.Info заявява, че броят на хранилищата с AGENTS.md = броят на приемането на Codex CLI, така че въпреки че се използва Cursor, е възможно той да се брои като Codex CLI и има възможност броят на използванията да се увеличава в невидима част.

Коефициент на дял на AI Coding Agent на 01.08.2026 г
https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#agent-share
Коефициент на акции на AI Coding Agent на 1 юли 2026 г
https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#agent-share
Езикът за програмиране, на който AI Coding Agent се използва най-много, е "TypeScript", вторият е "Python", третият е "Rust", четвъртият е "Go" и петият е "C#". Степента на приемане на AI Coding за TypeScript остава висока, докато съставът на Python'', Rust'' и Go'' като втора група и C#'' като трета група е постоянна тенденция през последните години.

Класиране на AI Coding Agent по език за програмиране на 2026/8/1
https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#language-agent-rank
Класация на AI Coding Agent по език за програмиране на 1 юли 2026 г
https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#language-agent-rank
Броят на хранилищата е бил 1794 към 2026/07/01, но се е увеличил до 1940 към 2026/08/01, а броят на хранилищата, използващи AI Coding Agent, се е увеличил със 146.

Промени в броя на хранилищата, използващи AI Coding Agent от 2026/7/1 на 2026/8/1
https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#time-based-bar-chart
През юни следващото поколение LLM, Mythos и Fable 5, бяха пуснати от Claude и шокираха индустрията с представянето си. След това обаче китайската компания Kimi пусна модел с отворено тегло, наречен Kimi-K3, който е почти клас Fable. Това стана гореща тема. Дори ако погледнем действителните бенчмаркове, цифрите са близки.

https://artificialanalysis.ai/#intelligence-category-tabs
Когато си помислих това,
**Не е ли местното LLM също опция за AI кодиране? **
Мисля, че може да мислите така. Проучих този район. Таблицата по-долу изброява основните модели LLM с отворено тегло от графиката по-горе.
| Име на модел | Име на фирма | Дата на обявяване | Брой параметри | Брой активни параметри | Дължина на контекста | Индекс на интелигентност |
|---|---|---|---|---|---|---|
| Kimi K3(макс.) | Kimi(Китай) | 2026/07 | 2800B | 104B | 1M | 60 |
| GLM-5.2(макс.) | Z AI(Китай) | 2026/06 | 756B | 40B | 1M | 53 |
| DeepSeek V4 Flash 0731 | DeepSeek(Китай) | 2026/07 | 284B | 13B | 1M | 52 |
| MiMo-V2.5-Pro | Xiaomi (Китай) | 2026/04 | 1023B | 42B | 1M | 43 |
| Muse Glimmer (високо) | Мета(САЩ) | 2026/08 | 30B | 256K | 35 | |
| Gemma 4 31B (Разсъждение) | Google (САЩ) | 2026/04 | 30.7B | 256K | 30 |
Въпреки това, те наистина ли работят на вашия компютър? Това наистина не го разбирам. Следователно методът за определяне, който разгледахме, беше
Необходимата VRAM памет е
2[GB] на параметър 1[B]
е. Можете грубо да прецените дали ще работи въз основа на капацитета на VRAM паметта на вашия компютър и броя на параметрите на модела, който искате да стартирате. следователно,
**Математически, 5,6TB (5,600GB) памет са необходими за стартиране на Kimi-K3. **
Ще обясня причината за това. В стандартния разпределен LLM модел теглата се изразяват с помощта на десетични числа с точност bf16 или fp16. Те изискват 2 байта за всеки параметър. Нотацията, която често виждате, като 30[B], е броят на параметрите, а B означава милиард и представлява 10^9. Следователно може да се види, че модел като 30[B] има данни за тегло 30×10^9. И 1[GB]=1*10^9[байт]. Мислейки за това по този начин, споменахме по-рано, че стандартните тегла се съхраняват в 2 байта, така че са необходими 2 байта на тегло, което означава 2 [GB] за съхраняване на 1 [B] параметър в паметта. Това е изчислението. Това е значението на "2[GB] на параметър 1[B]", споменато по-рано. Това обаче е само приблизително; това е минималното изискване за зареждане на теглата във VRAM и тъй като паметта може да се използва в допълнение към това, е строго препоръчително да не го превишавате. Това е капацитетът на VRAM.
Тук влиза в действие концепцията за квантуване. Може да сте виждали Q4_0 или Q4_K_M. Това е техника, която компресира теглото до неговия брой битове. Следователно, в случая на Q4_0, грубо казано, тегловният капацитет е 4 бита (4-тата част на Q4_0). Следователно в този случай капацитетът е 0,5 [GB] на 1 [B]. Таблица за бърза справка за тях изглежда така:
| Метод на квантуване | Необходим обем памет за 1[B] [GB] |
|---|---|
| bf16,fp16(стандартен) | 2.0 |
| Q8_0 | 1.0 |
| Q4_0 | 0,5 |
Може да видите нотация като Q4_K_M, но грубо казано, това е модел, който повишава точността в сравнение с Q4_0, но използва малко повече капацитет на паметта. Добре е да сте наясно с това. Има друг начин да разберете, просто погледнете размера на файла с теглото (safetensor или gguf). Ако това надвишава капацитета на VRAM паметта, обикновено няма да работи. Мисля, че можете да мислите така.
От тук създадохме таблица за бърза справка за количеството VRAM памет, метода на квантуване и броя на параметрите.
| Капацитет на VRAM памет [GB] | Брой параметри (bf16,fp16)[B] | Брой параметри (Q8_0)[B] | Брой параметри (Q4_0)[B] |
|---|---|---|---|
| 8 | 4 | 8 | 16 |
| 16 | 8 | 16 | 32 |
| 24 | 12 | 24 | 48 |
| 32 | 16 | 32 | 64 |
| 64 | 32 | 64 | 128 |
| 128 | 64 | 128 | 256 |
| 256 | 128 | 256 | 512 |
| 512 | 256 | 512 | 1024 |
| 1024 | 512 | 1024 | 2048 |
| 2048 | 1024 | 2048 | 4096 |
Приблизително колко време може да се направи? Като се има предвид, че ако е модел с 8GB VRAM, ще бъде RTX 5050, а цената на Amazon е 55 000 йени. Това може да работи, ако моделът е около 8[B] квантован с Q8_0. Това е нивото.
Когато VRAM се увеличи до 16 GB, той става модел около RTX 5060 Ti, който струва около 108 000 йени. В този момент, с квантуване Q4_0, LLM от клас 30 [B] ще работи или не. Това е нивото.
Когато VRAM се увеличи до 32GB, той става водещият модел RTX 5090 и струва 795 000 йени. Що се отнася до това, предполагам, че е на ниво, на което не можете да го направите, освен ако нямате много решителност. така мисля. Това е квантуването на Q8_0 и дали моделът от клас 30[B] работи или не. Ще бъде горе-долу на същото ниво.
Тази област е най-високата линия на ниво потребителски продукт. Сега, когато става дума за професионално ниво, RTX PRO 6000 Blackwell е оборудван с 96GB памет. **Цената е 2,35 милиона йени. ** Тук дори при ниво на квантуване Q4_0 работи само моделът 192 [B], така че водещият модел не работи.
И тъй като имаше данни за GPU клъстера да бъде инсталиран на сървъра, ще го публикувам само за справка. В случая на NVIDIA B300 паметта е 288GB и цената е 8,63 милиона йени. Ако е един, DeepSeek V4 Flash 0731 с квантуване Q8_0 може да работи. Q4_0 ще работи. Ако имате две (еквивалентни на 17 милиона йени), MiMo-V2.5 Pro с квантуване Q4_0 може да работи.

https://www.nttpc.co.jp/cgi-bin/gpu/simulation/custom/index.cgi
Следователно, ако сравните количеството памет и броя на параметрите, това е всичко. Разбира се, има още за обсъждане от това и дали това ще бъде включено в паметта или не. И така, генерира ли достатъчно TOK/s, за да се използва нормално? Има и друг проблем. Тази статия говори за самите основи. LLM има архитектури, наречени Dense и MoE, а в MoE действително се изчисляват само активните параметри и в зависимост от метода на изпълнение има начин да се намали обемът на физическата памет чрез четене на необходимите експерти от хранилището и т.н., вместо да се съхраняват всички експерти в паметта през цялото време. Има обаче някои специални аспекти на начина, по който се изпълнява моделът, и зареждането от хранилище в памет може да се превърне в пречка. Има някои истории като тази, но тук пренебрегваме такива подробности и просто вземаме предвид капацитета, когато всички тегла на модела са съхранени в паметта.
Така че, ако искате да използвате текущия Q4_0 или Q8_0 квантован водещ модел, ще ви трябва машина, която струва поне 10 милиона йени. Това е усещането. От друга страна, може да работи, ако използвате специален хардуер, за да постигнете още по-голямо квантуване. Например, има хора, които използват 2-битово квантуване и 3-битово квантуване на M4 Mac със 128GB памет (разпродадена) и DGX Spark (128GB памет).
https://zenn.dev/tkhr_sait/articles/20260508_try-local-deepseek-v4
https://dev.classmethod.jp/articles/dgx-spark-deepseek-v4-flash-0731-llama-cpp/
От друга страна, това е може би границата за индивида. Това е усещане за кожата. Лично аз обръщам внимание на 1-битовото квантуване. Известни модели включват Bonsai и технология като BitNet, но ноу-хауто за 1-битово квантуване не е публикувано, така че не съм го пробвал (вероятно ще отнеме много време и ще намали точността на извода).
Така че, лично аз, ако бъде пусната 1-битова квантована версия на DeepSeek (приблизително 35,5 GB), бих могъл да видя свят, в който може да се изпълнява локално на графичен процесор от потребителски клас, в зависимост от известна изобретателност, но тъй като в момента нямаме това, е доста трудно. Това е честната истина.
следователно
**Не е реалистично да управлявате водещия модел с местен LLM. **
Това е общото ми впечатление. Ако наистина искате да работи, мисля, че трябва да направите някои тестове.
Този път съсредоточих разговора си върху местния LLM. Когато Kimi-K3 излезе, бях доста шокиран и класът Fable се премести в местния LLM! Беше доста впечатляващо, но дори не мога да го преместя с оборудването, което имам. Това беше моето искрено впечатление. Публикувах статия за местния LLM в миналото, но тогава не работеше много добре, така че бих искал да се поразровя малко по-дълбоко в нея. Така си мислех.