AI Coding.Info
RepositoriesREPORTS
ABOUT

Чи можна використовувати місцевий LLM для кодування ШІ? ~Підсумок тенденцій кодування штучного інтелекту в липні 2026 року за даними~

автор: @kotauchisunsun

Дата випуску: 2026/08/12

Тенденції AI Coding Agent у серпні 2026 року

З липня 2025 року ми працюємо на сайті під назвою AI Coding.Info.

https://ai-coding.info/

https://x.com/AICodingInfo

Це сайт, який спостерігає за тенденціями використання, пов’язаними з агентами кодування штучного інтелекту, такими як Claude Code, Codex CLI, Github Copilot і Gemini, з фіксованої точки на основі інформації в сховищах Github. Щоб визначити використання AI Coding Agent, ми проводимо щоденні опитування за таких умов.

Тенденції минулого місяця

https://ai-coding.info/reports/articles/20260703

Коефіцієнт використання AI Coding Agent становить 13,0%

Коефіцієнт використання репозиторію AI Coding Agent склав 13,0%, що на 0,9% більше, ніж 12,1% минулого разу.

image.png

image.png

Рівень використання AI Coding Agent на 1 серпня 2026 року

https://ai-coding.info/?date=2026-08-01#adoption-rate

Коефіцієнт використання AI Coding Agent на 1 липня 2026 року

https://ai-coding.info/?date=2026-07-01#adoption-rate

Динаміка використання AI Coding Agent з 1 липня 2026 року до 1 серпня 2026 року

https://ai-coding.info/?date=2026-04-01&since=2026-07-01&until=2026-08-01#share-trend

Частка AI Coding Agent за продуктами

Частка за продуктами така.

РейтингНазва продуктуКурс акцій
1 місцеCodex CLI40,8%
2 місцеКлод Код32,0%
3 місцеАгент другого пілота15,1%
4 місцеGemini CLI (Антигравітація)5,3%
5 місцеКурсор4,4%

Хоча частка Codex CLI зростає, Claude Code залишається незмінною. Copilot Agent і Gemini CLI (Antigravity) також демонструють невелике зниження. Курсор — це те, на що я приділяв трохи уваги. Курсор придбав SpaceX. Була новина.

https://www.nikkei.com/article/DGXZQOGN16BC70W6A610C2000000/

Отже, чи буде зміна курсу акцій цього Cursor? Я так і думав, але минулого місяця це було 4,7%, а цього місяця – 4,4%, тож змін не так вже й багато. Дивлячись на кількість репозиторіїв, згаданих нижче, на 1 липня було 85 репозиторіїв, які прийняли Cursor, а станом на 1 серпня це число залишається незмінним і становить 85. Таким чином, щодо цього явища кількість сховищ, які використовують AI Coding Agent, загалом зросла, але кількість використання Cursor не зросла. У результаті загальна частка ринку зменшується. Це стало феноменом. Однак через особливості дослідження AI Coding.Info кількість репозиторіїв із файлами конфігурації Cursor (.cursor) не зміниться. При цьому сам Cursor підтримує AGENTS.md. AI Coding.Info стверджує, що кількість репозиторіїв з AGENTS.md = кількість запроваджень Codex CLI, тому, незважаючи на те, що Cursor використовується, можливо, що він зараховується як Codex CLI, і існує ймовірність того, що кількість використань збільшується в невидимій частині.

image.png

Курс акцій AI Coding Agent на 01.08.2026

https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#agent-share

Курс акцій AI Coding Agent на 01.07.2026

https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#agent-share

Статус використання AI Coding Agent за мовами програмування

Мова програмування, в якій найчастіше використовується AI Coding Agent, — «TypeScript», друга — «Python», третя — «Rust», четверта — «Go» і п’ята — «C#». Швидкість впровадження AI Coding для TypeScript залишається високою, тоді як склад Python'', Rust'' і Go'' як друга група, і C#'' як третя група є постійною тенденцією в останні роки.

image.png

Рейтинг AI Coding Agent за мовами програмування на 2026/8/1

https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#language-agent-rank

Рейтинг AI Coding Agent за мовами програмування на 1 липня 2026 року

https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#language-agent-rank

Щомісячні тенденції кількості сховищ, які використовує AI Coding Agent

Кількість сховищ становила 1794 станом на 01.07.2026, але зросла до 1940 станом на 01.08.2026, а кількість сховищ, які використовують AI Coding Agent, зросла на 146.

image.png

Зміни в кількості репозиторіїв, які використовують AI Coding Agent, з 2026/7/1 до 2026/8/1

https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#time-based-bar-chart

Чи можна використовувати місцевий LLM для кодування ШІ?

У червні Claude випустив наступне покоління LLM, Mythos і Fable 5, які шокували галузь своєю продуктивністю. Однак після цього китайська компанія Kimi випустила відкриту модель під назвою Kimi-K3, яка майже відповідає класу Fable. Це стало гарячою темою. Навіть дивлячись на фактичні показники, цифри близькі.

image.png

https://artificialanalysis.ai/#intelligence-category-tabs

Коли я це подумав,

**Хіба місцевий LLM також не є варіантом кодування AI? **

Я думаю, ви можете так думати. Я досліджував ту місцевість. У таблиці нижче перераховані основні моделі LLM з відкритою вагою з графіка вище.

Назва моделіНазва компаніїДата оголошенняКількість параметрівКількість активних параметрівДовжина контекстуІндекс інтелекту
Kimi K3(max)Kimi(Китай)2026/072800B104B1M60
GLM-5.2(max)Z AI(Китай)2026/06756B40B1M53
DeepSeek V4 Flash 0731DeepSeek(Китай)2026/07284B13B1M52
MiMo-V2.5-ProXiaomi (Китай)2026/041,023B42B1M43
Muse Glimmer (високий)Мета(США)2026/0830B256 тис.35
Gemma 4 31B (Міркування)Google (США)2026/0430,7Б256 тис.30

Однак чи справді вони працюють на вашому ПК? Я цього не дуже розумію. Тому розглянутий нами спосіб визначення був

Необхідна пам'ять VRAM є

2[GB] на параметр 1[B]

є. Ви можете приблизно оцінити, чи буде він працювати, виходячи з обсягу пам’яті VRAM вашого ПК і кількості параметрів моделі, яку ви хочете запустити. отже,

**Математично для роботи Kimi-K3 потрібно 5,6 ТБ (5600 ГБ) пам’яті. **

Я поясню причину цього. У стандартній розподіленій моделі LLM ваги виражаються за допомогою десяткових чисел із точністю bf16 або fp16. Вони вимагають 2 байти для кожного параметра. Позначення, яке ви часто бачите, наприклад 30[B], є кількістю параметрів, а B означає мільярд і представляє 10^9. Отже, можна побачити, що така модель, як 30[B], має дані ваги 30×10^9. І 1[ГБ]=1*10^9[Байт]. Розмірковуючи про це таким чином, ми згадували раніше, що стандартні ваги зберігаються в 2 байтах, тому потрібно 2 байти на вагу, що означає 2 [ГБ] для збереження 1 [B] параметра в пам’яті. Це розрахунок. Це значення «2[GB] на параметр 1[B]», згадане раніше. Однак це лише приблизне значення; це мінімальна вимога для завантаження ваг у VRAM, і оскільки пам’ять може використовуватися на додаток до цього, суворо рекомендується не перевищувати її. Це ємність VRAM.

Ось тут і вступає в дію концепція квантування. Можливо, ви бачили Q4_0 або Q4_K_M. Це метод, який стискає вагу до його кількості бітів. Тому у випадку Q4_0, грубо кажучи, вагова ємність становить 4 біти (4 частина Q4_0). Отже, у цьому випадку ємність становить 0,5 [ГБ] на 1 [Б]. Коротка довідкова таблиця виглядає так:

Метод квантуванняНеобхідний обсяг пам'яті на 1 [B] [GB]
bf16,fp16(стандарт)2,0
Q8_01,0
Q4_00,5

Ви можете побачити таке позначення, як Q4_K_M, але, грубо кажучи, це модель, яка підвищує точність порівняно з Q4_0, але використовує трохи більше пам’яті. Це добре усвідомлювати. Є інший спосіб дізнатися, просто подивіться на розмір файлу ваги (safetensor або gguf). Якщо це перевищує обсяг пам’яті VRAM, зазвичай це не працюватиме. Я думаю, ви можете так думати.

Звідси ми створили коротку довідкову таблицю обсягу пам’яті VRAM, методу квантування та кількості параметрів.

Об'єм пам'яті VRAM [ГБ]Кількість параметрів (bf16,fp16)[B]Кількість параметрів (Q8_0)[B]Кількість параметрів (Q4_0)[B]
84816
1681632
24122448
32163264
643264128
12864128256
256128256512
5122565121024
102451210242048
2048102420484096

Скільки приблизно можна це робити? Враховуючи, що якщо це модель із 8 ГБ відеопам’яті, то це буде RTX 5050, а ціна Amazon становить 55 000 ієн. Це може спрацювати, якщо модель приблизно 8[B] квантована за допомогою Q8_0. Ось такий рівень.

https://link.amazon/B0brulI9R

Коли відеопам'ять збільшується до 16 ГБ, вона стає моделлю навколо RTX 5060 Ti, яка коштує близько 108 000 ієн. На цьому етапі з квантуванням Q4_0 LLM класу 30[B] працюватиме чи ні. Ось такий рівень.

https://link.amazon/B0ghUQISo

Коли відеопам’ять збільшиться до 32 ГБ, вона стане флагманською моделлю RTX 5090 і коштуватиме 795 000 ієн. Коли справа доходить до цього, я вважаю, що це на такому рівні, коли ви не можете це зробити, якщо у вас немає великої рішучості. Я так думаю. Це квантування Q8_0 і те, чи працює модель класу 30[B] чи ні. Це буде приблизно такий же рівень.

https://link.amazon/B03EseQp5

Ця зона є верхньою межею рівня споживчого товару. Тепер, якщо говорити про професійний рівень, RTX PRO 6000 Blackwell оснащений 96 ГБ пам'яті. **Ціна 2,35 млн ієн. ** Тут навіть на рівні квантування Q4_0 працює тільки модель 192[B], тому флагманська модель не працює.

https://link.amazon/B0g76ngZz

І оскільки були дані для встановлення кластера GPU на сервері, я викладу їх лише для ознайомлення. У випадку NVIDIA B300 пам’ять становить 288 ГБ, а ціна — 8,63 мільйона ієн. Якщо це один, DeepSeek V4 Flash 0731 із квантуванням Q8_0 може працювати. Q4_0 буде працювати. Якщо у вас є два (еквівалент 17 мільйонів ієн), MiMo-V2.5-Pro ​​з квантуванням Q4_0 може працювати.

image.png

https://www.nttpc.co.jp/cgi-bin/gpu/simulation/custom/index.cgi

Тому, якщо порівнювати обсяг пам'яті і кількість параметрів, то це приблизно так. Звісно, ​​є ще щось для обговорення, ніж це, і чи буде це включено в пам’ять чи ні. Отже, чи достатньо TOK/s для нормального використання? Є ще одне питання. Ця стаття розповідає про самі основи. LLM має архітектури під назвою Dense і MoE, а в MoE фактично обчислюються лише активні параметри, і залежно від методу виконання існує спосіб зменшити обсяг фізичної пам’яті шляхом зчитування необхідних експертів зі сховища тощо, замість постійного зберігання всіх експертів у пам’яті. Однак у способі виконання моделі є деякі особливі аспекти, і завантаження зі сховища в пам’ять може стати вузьким місцем. Є кілька подібних історій, але тут ми ігноруємо такі деталі і просто розглядаємо ємність, коли всі ваги моделі зберігаються в пам’яті.

Отже, якщо ви хочете використовувати поточну квантовану флагманську модель Q4_0 або Q8_0, вам знадобиться машина вартістю щонайменше 10 мільйонів ієн. Це відчуття. З іншого боку, це може спрацювати, якщо ви використовуєте спеціальне обладнання для досягнення ще більшого квантування. Наприклад, є люди, які використовують 2-бітове квантування та 3-бітове квантування на M4 Mac із 128 ГБ пам’яті (розпродано) та DGX Spark (128 ГБ пам’яті).

https://zenn.dev/tkhr_sait/articles/20260508_try-local-deepseek-v4

https://dev.classmethod.jp/articles/dgx-spark-deepseek-v4-flash-0731-llama-cpp/

З іншого боку, це, мабуть, межа для окремої людини. Це шкірне відчуття. Особисто я звертаю увагу на 1-бітове квантування. Відомі моделі включають Bonsai та такі технології, як BitNet, але ноу-хау для 1-бітного квантування не було оприлюднено, тому я не пробував (ймовірно, це займе багато часу та зменшить точність висновку).

Тож, особисто, якби випустили 1-бітну квантовану версію DeepSeek (приблизно 35,5 ГБ), я міг би побачити світ, у якому її можна було б запускати локально на графічному процесорі споживчого класу, залежно від певної винахідливості, але оскільки ми зараз цього не маємо, це досить складно. Це щира правда.

тому

**Нереально запустити флагманську модель із локальним LLM. **

Це моє загальне враження. Якщо ви дійсно хочете, щоб це спрацювало, я думаю, вам потрібно провести деякі тести.

думки

Цього разу я зосередився на місцевому LLM. Коли Kimi-K3 вийшов, я був дуже шокований, і клас Fable переїхав у місцевий LLM! Це було досить вражаюче, але я навіть не можу зрушити його з того обладнання, яке у мене є. Це було моє щире враження. Раніше я публікував статтю про місцевий LLM, але тоді вона не дуже добре працювала, тому я хотів би копнути в цьому трохи глибше. Я так і думав.