автор: @kotauchisunsun
Дата випуску: 2026/08/12
З липня 2025 року ми працюємо на сайті під назвою AI Coding.Info.
Це сайт, який спостерігає за тенденціями використання, пов’язаними з агентами кодування штучного інтелекту, такими як Claude Code, Codex CLI, Github Copilot і Gemini, з фіксованої точки на основі інформації в сховищах Github. Щоб визначити використання AI Coding Agent, ми проводимо щоденні опитування за таких умов.
https://ai-coding.info/reports/articles/20260703
Коефіцієнт використання репозиторію AI Coding Agent склав 13,0%, що на 0,9% більше, ніж 12,1% минулого разу.


Рівень використання AI Coding Agent на 1 серпня 2026 року
https://ai-coding.info/?date=2026-08-01#adoption-rate
Коефіцієнт використання AI Coding Agent на 1 липня 2026 року
https://ai-coding.info/?date=2026-07-01#adoption-rate
Динаміка використання AI Coding Agent з 1 липня 2026 року до 1 серпня 2026 року
https://ai-coding.info/?date=2026-04-01&since=2026-07-01&until=2026-08-01#share-trend
Частка за продуктами така.
| Рейтинг | Назва продукту | Курс акцій |
|---|---|---|
| 1 місце | Codex CLI | 40,8% |
| 2 місце | Клод Код | 32,0% |
| 3 місце | Агент другого пілота | 15,1% |
| 4 місце | Gemini CLI (Антигравітація) | 5,3% |
| 5 місце | Курсор | 4,4% |
Хоча частка Codex CLI зростає, Claude Code залишається незмінною. Copilot Agent і Gemini CLI (Antigravity) також демонструють невелике зниження. Курсор — це те, на що я приділяв трохи уваги. Курсор придбав SpaceX. Була новина.
https://www.nikkei.com/article/DGXZQOGN16BC70W6A610C2000000/
Отже, чи буде зміна курсу акцій цього Cursor? Я так і думав, але минулого місяця це було 4,7%, а цього місяця – 4,4%, тож змін не так вже й багато. Дивлячись на кількість репозиторіїв, згаданих нижче, на 1 липня було 85 репозиторіїв, які прийняли Cursor, а станом на 1 серпня це число залишається незмінним і становить 85. Таким чином, щодо цього явища кількість сховищ, які використовують AI Coding Agent, загалом зросла, але кількість використання Cursor не зросла. У результаті загальна частка ринку зменшується. Це стало феноменом. Однак через особливості дослідження AI Coding.Info кількість репозиторіїв із файлами конфігурації Cursor (.cursor) не зміниться. При цьому сам Cursor підтримує AGENTS.md. AI Coding.Info стверджує, що кількість репозиторіїв з AGENTS.md = кількість запроваджень Codex CLI, тому, незважаючи на те, що Cursor використовується, можливо, що він зараховується як Codex CLI, і існує ймовірність того, що кількість використань збільшується в невидимій частині.

Курс акцій AI Coding Agent на 01.08.2026
https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#agent-share
Курс акцій AI Coding Agent на 01.07.2026
https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#agent-share
Мова програмування, в якій найчастіше використовується AI Coding Agent, — «TypeScript», друга — «Python», третя — «Rust», четверта — «Go» і п’ята — «C#». Швидкість впровадження AI Coding для TypeScript залишається високою, тоді як склад Python'', Rust'' і Go'' як друга група, і C#'' як третя група є постійною тенденцією в останні роки.

Рейтинг AI Coding Agent за мовами програмування на 2026/8/1
https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#language-agent-rank
Рейтинг AI Coding Agent за мовами програмування на 1 липня 2026 року
https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#language-agent-rank
Кількість сховищ становила 1794 станом на 01.07.2026, але зросла до 1940 станом на 01.08.2026, а кількість сховищ, які використовують AI Coding Agent, зросла на 146.

Зміни в кількості репозиторіїв, які використовують AI Coding Agent, з 2026/7/1 до 2026/8/1
https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#time-based-bar-chart
У червні Claude випустив наступне покоління LLM, Mythos і Fable 5, які шокували галузь своєю продуктивністю. Однак після цього китайська компанія Kimi випустила відкриту модель під назвою Kimi-K3, яка майже відповідає класу Fable. Це стало гарячою темою. Навіть дивлячись на фактичні показники, цифри близькі.

https://artificialanalysis.ai/#intelligence-category-tabs
Коли я це подумав,
**Хіба місцевий LLM також не є варіантом кодування AI? **
Я думаю, ви можете так думати. Я досліджував ту місцевість. У таблиці нижче перераховані основні моделі LLM з відкритою вагою з графіка вище.
| Назва моделі | Назва компанії | Дата оголошення | Кількість параметрів | Кількість активних параметрів | Довжина контексту | Індекс інтелекту |
|---|---|---|---|---|---|---|
| Kimi K3(max) | Kimi(Китай) | 2026/07 | 2800B | 104B | 1M | 60 |
| GLM-5.2(max) | Z AI(Китай) | 2026/06 | 756B | 40B | 1M | 53 |
| DeepSeek V4 Flash 0731 | DeepSeek(Китай) | 2026/07 | 284B | 13B | 1M | 52 |
| MiMo-V2.5-Pro | Xiaomi (Китай) | 2026/04 | 1,023B | 42B | 1M | 43 |
| Muse Glimmer (високий) | Мета(США) | 2026/08 | 30B | 256 тис. | 35 | |
| Gemma 4 31B (Міркування) | Google (США) | 2026/04 | 30,7Б | 256 тис. | 30 |
Однак чи справді вони працюють на вашому ПК? Я цього не дуже розумію. Тому розглянутий нами спосіб визначення був
Необхідна пам'ять VRAM є
2[GB] на параметр 1[B]
є. Ви можете приблизно оцінити, чи буде він працювати, виходячи з обсягу пам’яті VRAM вашого ПК і кількості параметрів моделі, яку ви хочете запустити. отже,
**Математично для роботи Kimi-K3 потрібно 5,6 ТБ (5600 ГБ) пам’яті. **
Я поясню причину цього. У стандартній розподіленій моделі LLM ваги виражаються за допомогою десяткових чисел із точністю bf16 або fp16. Вони вимагають 2 байти для кожного параметра. Позначення, яке ви часто бачите, наприклад 30[B], є кількістю параметрів, а B означає мільярд і представляє 10^9. Отже, можна побачити, що така модель, як 30[B], має дані ваги 30×10^9. І 1[ГБ]=1*10^9[Байт]. Розмірковуючи про це таким чином, ми згадували раніше, що стандартні ваги зберігаються в 2 байтах, тому потрібно 2 байти на вагу, що означає 2 [ГБ] для збереження 1 [B] параметра в пам’яті. Це розрахунок. Це значення «2[GB] на параметр 1[B]», згадане раніше. Однак це лише приблизне значення; це мінімальна вимога для завантаження ваг у VRAM, і оскільки пам’ять може використовуватися на додаток до цього, суворо рекомендується не перевищувати її. Це ємність VRAM.
Ось тут і вступає в дію концепція квантування. Можливо, ви бачили Q4_0 або Q4_K_M. Це метод, який стискає вагу до його кількості бітів. Тому у випадку Q4_0, грубо кажучи, вагова ємність становить 4 біти (4 частина Q4_0). Отже, у цьому випадку ємність становить 0,5 [ГБ] на 1 [Б]. Коротка довідкова таблиця виглядає так:
| Метод квантування | Необхідний обсяг пам'яті на 1 [B] [GB] |
|---|---|
| bf16,fp16(стандарт) | 2,0 |
| Q8_0 | 1,0 |
| Q4_0 | 0,5 |
Ви можете побачити таке позначення, як Q4_K_M, але, грубо кажучи, це модель, яка підвищує точність порівняно з Q4_0, але використовує трохи більше пам’яті. Це добре усвідомлювати. Є інший спосіб дізнатися, просто подивіться на розмір файлу ваги (safetensor або gguf). Якщо це перевищує обсяг пам’яті VRAM, зазвичай це не працюватиме. Я думаю, ви можете так думати.
Звідси ми створили коротку довідкову таблицю обсягу пам’яті VRAM, методу квантування та кількості параметрів.
| Об'єм пам'яті VRAM [ГБ] | Кількість параметрів (bf16,fp16)[B] | Кількість параметрів (Q8_0)[B] | Кількість параметрів (Q4_0)[B] |
|---|---|---|---|
| 8 | 4 | 8 | 16 |
| 16 | 8 | 16 | 32 |
| 24 | 12 | 24 | 48 |
| 32 | 16 | 32 | 64 |
| 64 | 32 | 64 | 128 |
| 128 | 64 | 128 | 256 |
| 256 | 128 | 256 | 512 |
| 512 | 256 | 512 | 1024 |
| 1024 | 512 | 1024 | 2048 |
| 2048 | 1024 | 2048 | 4096 |
Скільки приблизно можна це робити? Враховуючи, що якщо це модель із 8 ГБ відеопам’яті, то це буде RTX 5050, а ціна Amazon становить 55 000 ієн. Це може спрацювати, якщо модель приблизно 8[B] квантована за допомогою Q8_0. Ось такий рівень.
Коли відеопам'ять збільшується до 16 ГБ, вона стає моделлю навколо RTX 5060 Ti, яка коштує близько 108 000 ієн. На цьому етапі з квантуванням Q4_0 LLM класу 30[B] працюватиме чи ні. Ось такий рівень.
Коли відеопам’ять збільшиться до 32 ГБ, вона стане флагманською моделлю RTX 5090 і коштуватиме 795 000 ієн. Коли справа доходить до цього, я вважаю, що це на такому рівні, коли ви не можете це зробити, якщо у вас немає великої рішучості. Я так думаю. Це квантування Q8_0 і те, чи працює модель класу 30[B] чи ні. Це буде приблизно такий же рівень.
Ця зона є верхньою межею рівня споживчого товару. Тепер, якщо говорити про професійний рівень, RTX PRO 6000 Blackwell оснащений 96 ГБ пам'яті. **Ціна 2,35 млн ієн. ** Тут навіть на рівні квантування Q4_0 працює тільки модель 192[B], тому флагманська модель не працює.
І оскільки були дані для встановлення кластера GPU на сервері, я викладу їх лише для ознайомлення. У випадку NVIDIA B300 пам’ять становить 288 ГБ, а ціна — 8,63 мільйона ієн. Якщо це один, DeepSeek V4 Flash 0731 із квантуванням Q8_0 може працювати. Q4_0 буде працювати. Якщо у вас є два (еквівалент 17 мільйонів ієн), MiMo-V2.5-Pro з квантуванням Q4_0 може працювати.

https://www.nttpc.co.jp/cgi-bin/gpu/simulation/custom/index.cgi
Тому, якщо порівнювати обсяг пам'яті і кількість параметрів, то це приблизно так. Звісно, є ще щось для обговорення, ніж це, і чи буде це включено в пам’ять чи ні. Отже, чи достатньо TOK/s для нормального використання? Є ще одне питання. Ця стаття розповідає про самі основи. LLM має архітектури під назвою Dense і MoE, а в MoE фактично обчислюються лише активні параметри, і залежно від методу виконання існує спосіб зменшити обсяг фізичної пам’яті шляхом зчитування необхідних експертів зі сховища тощо, замість постійного зберігання всіх експертів у пам’яті. Однак у способі виконання моделі є деякі особливі аспекти, і завантаження зі сховища в пам’ять може стати вузьким місцем. Є кілька подібних історій, але тут ми ігноруємо такі деталі і просто розглядаємо ємність, коли всі ваги моделі зберігаються в пам’яті.
Отже, якщо ви хочете використовувати поточну квантовану флагманську модель Q4_0 або Q8_0, вам знадобиться машина вартістю щонайменше 10 мільйонів ієн. Це відчуття. З іншого боку, це може спрацювати, якщо ви використовуєте спеціальне обладнання для досягнення ще більшого квантування. Наприклад, є люди, які використовують 2-бітове квантування та 3-бітове квантування на M4 Mac із 128 ГБ пам’яті (розпродано) та DGX Spark (128 ГБ пам’яті).
https://zenn.dev/tkhr_sait/articles/20260508_try-local-deepseek-v4
https://dev.classmethod.jp/articles/dgx-spark-deepseek-v4-flash-0731-llama-cpp/
З іншого боку, це, мабуть, межа для окремої людини. Це шкірне відчуття. Особисто я звертаю увагу на 1-бітове квантування. Відомі моделі включають Bonsai та такі технології, як BitNet, але ноу-хау для 1-бітного квантування не було оприлюднено, тому я не пробував (ймовірно, це займе багато часу та зменшить точність висновку).
Тож, особисто, якби випустили 1-бітну квантовану версію DeepSeek (приблизно 35,5 ГБ), я міг би побачити світ, у якому її можна було б запускати локально на графічному процесорі споживчого класу, залежно від певної винахідливості, але оскільки ми зараз цього не маємо, це досить складно. Це щира правда.
тому
**Нереально запустити флагманську модель із локальним LLM. **
Це моє загальне враження. Якщо ви дійсно хочете, щоб це спрацювало, я думаю, вам потрібно провести деякі тести.
Цього разу я зосередився на місцевому LLM. Коли Kimi-K3 вийшов, я був дуже шокований, і клас Fable переїхав у місцевий LLM! Це було досить вражаюче, але я навіть не можу зрушити його з того обладнання, яке у мене є. Це було моє щире враження. Раніше я публікував статтю про місцевий LLM, але тоді вона не дуже добре працювала, тому я хотів би копнути в цьому трохи глибше. Я так і думав.