AI Coding.Info
RepositoriesREPORTS
ABOUT

Czy lokalny LLM może być używany do kodowania AI? ~Podsumowanie trendów w kodowaniu AI w lipcu 2026 r. na podstawie danych~

autor: @kotauchisunsun

Data wydania: 2026/08/12

Trendy w agentach kodujących AI w sierpniu 2026 r

Od lipca 2025 roku prowadzimy witrynę o nazwie AI Coding.Info.

https://ai-coding.info/

https://x.com/AICodingInfo

Jest to witryna, która obserwuje trendy użytkowania związane z agentami kodującymi AI, takimi jak Claude Code, Codex CLI, Github Copilot i Gemini, z ustalonego punktu na podstawie informacji znajdujących się w repozytoriach Github. Aby określić wykorzystanie agenta kodującego AI, przeprowadzamy codzienne ankiety pod następującymi warunkami.

Trendy z ostatniego miesiąca

https://ai-coding.info/reports/articles/20260703

Wskaźnik wykorzystania agenta kodującego AI wynosi 13,0%

Wskaźnik wykorzystania repozytorium agenta kodującego AI wyniósł 13,0%, co oznacza wzrost o 0,9% w porównaniu z 12,1% ostatnim razem.

image.png

image.png

Wskaźnik wykorzystania agenta kodującego AI w dniu 1.08.2026 r

https://ai-coding.info/?date=2026-08-01#adoption-rate

Wskaźnik wykorzystania agenta kodującego AI na dzień 1 lipca 2026 r

https://ai-coding.info/?date=2026-07-01#adoption-rate

Trendy we wskaźniku wykorzystania agenta kodującego AI od 2026/7/1 do 2026/8/1

https://ai-coding.info/?date=2026-04-01&since=2026-07-01&until=2026-08-01#share-trend

Udział agenta kodującego AI według produktu

Udział według produktów jest następujący.

RankingNazwa produktuKurs akcji
1 miejsceKodeks CLI40,8%
2. miejsceKod Claude'a32,0%
3 miejsceAgent drugiego pilota15,1%
4 miejsceGemini CLI(Antygrawitacja)5,3%
5 miejsceKursor4,4%

Podczas gdy udział Codex CLI rośnie, Claude Code pozostaje taki sam. Copilot Agent i Gemini CLI (Antigravity) również wykazują niewielki spadek. Kursor to coś, na co zwracałem trochę uwagi. Kursor zostaje przejęty przez SpaceX. Były wieści.

https://www.nikkei.com/article/DGXZQOGN16BC70W6A610C2000000/

Czy zatem nastąpi zmiana kursu akcji tego Kursora? Tak myślałem, ale w zeszłym miesiącu było to 4,7%, a w tym miesiącu było to 4,4%, więc nie ma dużej zmiany. Patrząc na liczbę repozytoriów wymienioną poniżej, 1 lipca 85 repozytoriów przyjęło Cursor, a od 1 sierpnia liczba ta pozostaje niezmieniona i wynosi 85. Dlatego też, biorąc pod uwagę to zjawisko, populacja repozytoriów korzystających z AI Coding Agent ogółem wzrosła, ale liczba zastosowań Cursora nie wzrosła. W rezultacie ogólny udział w rynku spada. To stało się fenomenem. Jednakże, ze względu na specyfikę badań AI Coding.Info, liczba repozytoriów z plikami konfiguracyjnymi specyficznymi dla Cursora (.cursor) nie ulegnie zmianie. Biorąc to pod uwagę, sam Cursor obsługuje AGENTS.md. AI Coding.Info stwierdza, że ​​liczba repozytoriów z AGENTS.md = liczba adopcji Codex CLI, więc chociaż używany jest Cursor, możliwe jest, że jest on liczony jako Codex CLI i istnieje możliwość, że liczba zastosowań wzrasta w niewidocznej części.

image.png

Kurs akcji AI Coding Agent na dzień 8.01.2026

https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#agent-share

Kurs akcji AI Coding Agent na dzień 2026/7/1

https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#agent-share

Stan wykorzystania agenta kodującego AI według języka programowania

Język programowania, w którym najczęściej używany jest AI Coding Agent to „TypeScript”, drugi to „Python”, trzeci to „Rust”, czwarty to „Go”, a piąty to „C#”. Stopień przyjęcia kodowania AI dla TypeScript pozostaje wysoki, podczas gdy zestawienie Python'', Rust'' i Go'' jako drugiej grupy i C#'' jako trzeciej grupy stanowi stały trend w ostatnich latach.

image.png

Ranking agentów kodujących AI według języka programowania na dzień 2026/8/1

https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#language-agent-rank

Ranking agentów kodujących AI według języka programowania, stan na 1 lipca 2026 r

https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#language-agent-rank

Miesięczne trendy w liczbie repozytoriów używanych przez AI Coding Agent

Liczba repozytoriów wynosiła 1794 na dzień 2026/07/01, ale wzrosła do 1940 na dzień 2026/08/01, a liczba repozytoriów korzystających z AI Coding Agent wzrosła o 146.

image.png

Zmiany w liczbie repozytoriów korzystających z AI Coding Agent od 2026/7/1 do 2026/8/1

https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#time-based-bar-chart

Czy lokalny LLM może być używany do kodowania AI?

W czerwcu Claude wypuścił kolejną generację LLM, Mythos i Fable 5, która zaszokowała branżę swoimi wynikami. Jednak później chińska firma Kimi wypuściła model o otwartej masie o nazwie Kimi-K3, będący niemal klasą Fable. To stało się gorącym tematem. Nawet patrząc na rzeczywiste testy porównawcze, liczby są zbliżone.

image.png

https://artificialanalysis.ai/#intelligence-category-tabs

Kiedy o tym pomyślałem,

**Czy lokalny LLM nie jest również opcją kodowania AI? **

Myślę, że możesz tak myśleć. Zbadałem ten obszar. Poniższa tabela zawiera listę głównych modeli LLM o otwartej wadze z powyższego wykresu.

Nazwa modeluNazwa firmyData ogłoszeniaLiczba parametrówLiczba aktywnych parametrówDługość kontekstuIndeks inteligencji
Kimi K3(max)Kimi(Chiny)2026/072800B104B1M60
GLM-5.2(maks.)Z AI(Chiny)2026/06756B40B1M53
DeepSeek V4 Flash 0731DeepSeek(Chiny)2026/07284B13B1M52
MiMo-V2.5-ProXiaomi(Chiny)2026/041023B42B1M43
Muse Glimmer (wysoki)Meta(USA)2026/0830B256 tys.35
Gemma 4 31B (Rozumowanie)Google (USA)2026/0430,7B256 tys.30

Czy jednak rzeczywiście działają one na Twoim komputerze? Naprawdę tego nie rozumiem. Dlatego rozważaliśmy metodę oznaczania

Wymagana pamięć VRAM to

2[GB] na parametr 1[B]

Jest. Możesz z grubsza oszacować, czy będzie działać, na podstawie pojemności pamięci VRAM Twojego komputera i liczby parametrów modelu, który chcesz uruchomić. W związku z tym,

**Matematycznie do uruchomienia Kimi-K3 wymagane jest 5,6 TB (5600 GB) pamięci. **

Wyjaśnię przyczynę tego. W standardowym rozproszonym modelu LLM wagi wyrażane są za pomocą liczb dziesiętnych z precyzją bf16 lub fp16. Wymagają one 2 bajtów na każdy parametr. Notacja, którą często widzisz, np. 30[B], to liczba parametrów, a B oznacza miliard i reprezentuje 10^9. Można zatem zauważyć, że model taki jak 30[B] ma dane dotyczące wagi 30×10^9. Oraz 1[GB]=1*10^9[bajt]. Myśląc o tym w ten sposób, wspomnieliśmy wcześniej, że standardowe wagi są przechowywane w 2 bajtach, więc potrzeba 2 bajtów na wagę, co oznacza 2 [GB] na przechowywanie 1 [B] parametrów w pamięci. To jest kalkulacja. Takie jest znaczenie wspomnianego wcześniej „2[GB] na parametr 1[B]”. Jest to jednak tylko przybliżenie; jest to minimalne wymaganie, aby załadować odważniki do pamięci VRAM, a ponieważ oprócz tego można wykorzystać pamięć, zdecydowanie zaleca się, aby go nie przekraczać. To jest pojemność VRAM.

W tym miejscu pojawia się koncepcja kwantyzacji. Być może widziałeś Q4_0 lub Q4_K_M. Jest to technika kompresji wagi do liczby bitów. Dlatego w przypadku Q4_0, z grubsza, pojemność wagi wynosi 4 bity (4 część Q4_0). Zatem w tym przypadku pojemność wynosi 0,5[GB] na 1[B]. Skrócona tabela referencyjna wygląda następująco:

Metoda kwantyzacjiWymagana ilość pamięci na 1[B] [GB]
bf16,fp16(standard)2.0
Q8_01,0
Q4_00,5

Możesz spotkać się z notacją Q4_K_M, ale z grubsza jest to model, który zwiększa dokładność w porównaniu do Q4_0, ale zużywa nieco więcej pojemności pamięci. Dobrze jest mieć tego świadomość. Można to sprawdzić w inny sposób: po prostu spójrz na rozmiar pliku wagi (safetensor lub gguf). Jeśli przekroczy to pojemność pamięci VRAM, zazwyczaj nie będzie działać. Myślę, że możesz tak myśleć.

Na tej podstawie stworzyliśmy szybką tabelę referencyjną dotyczącą ilości pamięci VRAM, metody kwantyzacji i liczby parametrów.

Pojemność pamięci VRAM [GB]Liczba parametrów (bf16,fp16)[B]Liczba parametrów (Q8_0)[B]Liczba parametrów (Q4_0)[B]
84816
1681632
24122448
32163264
643264128
12864128256
256128256512
5122565121024
102451210242048
2048102420484096

Jak długo mniej więcej można to zrobić? Biorąc pod uwagę, że jeśli będzie to model z 8 GB pamięci VRAM, będzie to RTX 5050, a cena na Amazonie to 55 000 jenów. Może to zadziałać, jeśli model jest skwantowany w przybliżeniu 8[B] za pomocą Q8_0. Taki jest poziom.

https://link.amazon/B0brulI9R

Gdy pamięć VRAM wzrośnie do 16 GB, stanie się modelem zbliżonym do RTX 5060 Ti, który kosztuje około 108 000 jenów. W tym momencie, przy kwantyzacji Q4_0, LLM klasy 30[B] będzie działać lub nie. Taki jest poziom.

https://link.amazon/B0ghUQISo

Gdy pamięć VRAM wzrośnie do 32 GB, staje się flagowym modelem RTX 5090 i kosztuje 795 000 jenów. Jeśli chodzi o to, myślę, że jest to poziom, na którym nie można tego zrobić, jeśli nie ma się dużej determinacji. Myślę, że tak. To jest kwantyzacja Q8_0 i to, czy model klasy 30[B] działa, czy nie. Będzie mniej więcej na tym samym poziomie.

https://link.amazon/B03EseQp5

Obszar ten stanowi najwyższą linię poziomu produktów konsumenckich. Teraz jeśli chodzi o poziom profesjonalny, RTX PRO 6000 Blackwell wyposażono w 96 GB pamięci. **Cena wynosi 2,35 miliona jenów. ** Tutaj nawet na poziomie kwantyzacji Q4_0 działa tylko model 192[B], więc model flagowy nie działa.

https://link.amazon/B0g76ngZz

A ponieważ na serwerze były dane do zainstalowania klastra GPU, zamieszczę je wyłącznie w celach informacyjnych. W przypadku NVIDIA B300 pamięć wynosi 288 GB, a cena to 8,63 mln jenów. Jeśli tak, może działać DeepSeek V4 Flash 0731 z kwantyzacją Q8_0. Q4_0 będzie działać. Jeśli masz dwa (równowartość 17 milionów jenów), MiMo-V2.5-Pro ​​​​z kwantyzacją Q4_0 może zadziałać.

image.png

https://www.nttpc.co.jp/cgi-bin/gpu/simulation/custom/index.cgi

Dlatego jeśli porównasz ilość pamięci i liczbę parametrów, to o to chodzi. Oczywiście jest jeszcze wiele do omówienia i to, czy zostanie to uwzględnione w pamięci. Czy generuje wystarczającą ilość TOK/s, aby można go było normalnie używać? Jest jeszcze jedna kwestia. W tym artykule omówiono same podstawy. LLM ma architektury zwane Dense i MoE, a w MoE faktycznie obliczane są tylko aktywne parametry i w zależności od metody wykonania istnieje sposób na zmniejszenie ilości pamięci fizycznej poprzez odczytanie niezbędnych Ekspertów z pamięci itp., zamiast przechowywania wszystkich Ekspertów w pamięci przez cały czas. Istnieją jednak pewne szczególne aspekty sposobu wykonywania modelu, a ładowanie z pamięci do pamięci może stać się wąskim gardłem. Jest kilka takich historii, ale tutaj ignorujemy takie szczegóły i po prostu rozważamy pojemność, gdy wszystkie ciężary modelu są przechowywane w pamięci.

Jeśli więc chcesz uruchomić obecny, kwantyzowany model flagowy Q4_0 lub Q8_0, potrzebujesz maszyny, która kosztuje co najmniej 10 milionów jenów. Takie jest odczucie. Z drugiej strony może to zadziałać, jeśli użyjesz specjalnego sprzętu, aby osiągnąć jeszcze większą kwantyzację. Na przykład są ludzie, którzy korzystają z 2-bitowej i 3-bitowej kwantyzacji na komputerze M4 Mac z pamięcią 128 GB (wyprzedane) i DGX Spark (pamięć 128 GB).

https://zenn.dev/tkhr_sait/articles/20260508_try-local-deepseek-v4

https://dev.classmethod.jp/articles/dgx-spark-deepseek-v4-flash-0731-llama-cpp/

Z drugiej strony jest to prawdopodobnie granica dla jednostki. To uczucie skóry. Osobiście zwracam uwagę na kwantyzację 1-bitową. Słynne modele obejmują Bonsai i technologię taką jak BitNet, ale know-how dotyczące 1-bitowej kwantyzacji nie zostało upublicznione, więc nie próbowałem tego (prawdopodobnie zajęłoby to ogromną ilość czasu i zmniejszyłoby dokładność wnioskowania).

Tak więc osobiście, gdyby wypuszczono 1-bitową, skwantyzowaną wersję DeepSeek (około 35,5 GB), widziałem świat, w którym można by ją uruchomić lokalnie na procesorze graficznym klasy konsumenckiej, w zależności od odrobiny pomysłowości, ale ponieważ obecnie tego nie mamy, jest to dość trudne. To najszczersza prawda.

Dlatego,

**Uruchamianie flagowego modelu z lokalnym LLM jest nierealne. **

Takie jest moje ogólne wrażenie. Jeśli naprawdę chcesz, żeby to zadziałało, myślę, że musisz przeprowadzić pewne testy.

myśli

Tym razem skupiłem się na moim wystąpieniu na lokalnym LLM. Kiedy wyszedł Kimi-K3, byłem w szoku, a klasa Fable przeniosła się do lokalnego LLM! Robiło to wrażenie, ale sprzętem, który mam, nie jestem w stanie tego nawet ruszyć. Takie było moje szczere wrażenie. W przeszłości opublikowałem artykuł na temat lokalnego LLM, ale wówczas nie działał on zbyt dobrze, więc sam chciałbym zgłębić go nieco głębiej. Tak myślałem.