AI Coding.Info
RepositoriesREPORTS
ABOUT

Kann lokales LLM für die KI-Codierung verwendet werden? ~Zusammenfassung der KI-Codierungstrends im Juli 2026 anhand der Daten~

Autor: @kotauchisunsun

Veröffentlichungsdatum: 2026/08/12

AI Coding Agent-Trends im August 2026

Seit Juli 2025 betreiben wir eine Website namens AI Coding.Info.

https://ai-coding.info/

https://x.com/AICodingInfo

Dies ist eine Website, die Nutzungstrends im Zusammenhang mit AI Coding Agents wie Claude Code, Codex CLI, Github Copilot und Gemini von einem festen Punkt aus anhand von Informationen in Github-Repositories beobachtet. Um den Einsatz von AI Coding Agent zu ermitteln, führen wir tägliche Umfragen unter den folgenden Bedingungen durch.

Trends des letzten Monats

https://ai-coding.info/reports/articles/20260703

Die Nutzungsrate des AI Coding Agent beträgt 13,0 %

Die Auslastung des AI Coding Agent-Repositorys betrug 13,0 %, ein Anstieg von 0,9 % gegenüber 12,1 % beim letzten Mal.

image.png

image.png

Nutzungsrate des AI Coding Agent am 01.08.2026

https://ai-coding.info/?date=2026-08-01#adoption-rate

Nutzungsrate des AI Coding Agent am 1. Juli 2026

https://ai-coding.info/?date=2026-07-01#adoption-rate

Trends bei der Nutzungsrate von AI Coding Agent vom 01.07.2026 bis zum 01.08.2026

https://ai-coding.info/?date=2026-04-01&since=2026-07-01&until=2026-08-01#share-trend

Anteil des AI Coding Agent nach Produkt

Der Anteil nach Produkten ist wie folgt.

RanglisteProduktnameAktienkurs
1. PlatzCodex-CLI40,8 %
2. PlatzClaude Code32,0 %
3. PlatzCopilot-Agent15,1 %
4. PlatzGemini CLI(Antigravitation)5,3 %
5. PlatzCursor4,4 %

Während der Anteil von Codex CLI steigt, bleibt Claude Code gleich. Auch Copilot Agent und Gemini CLI (Antigravity) verzeichnen einen leichten Rückgang. Dem Cursor habe ich ein wenig Aufmerksamkeit geschenkt. Der Cursor wird von SpaceX übernommen. Es gab Neuigkeiten.

https://www.nikkei.com/article/DGXZQOGN16BC70W6A610C2000000/

Wird es daher eine Änderung in der Aktienrate dieses Cursors geben? Ich dachte schon, aber letzten Monat waren es 4,7 % und diesen Monat waren es 4,4 %, also gibt es keine große Veränderung. Betrachtet man die unten genannte Anzahl von Repositories, so gab es am 1. Juli 85 Repositories, die Cursor übernommen haben, und seit dem 1. August liegt die Zahl unverändert bei 85. Daher ist in Bezug auf dieses Phänomen die Anzahl der Repositories, die AI Coding Agent verwenden, insgesamt gestiegen, aber die Anzahl der Cursor-Nutzungen hat sich nicht erhöht. Dadurch sinkt der Gesamtmarktanteil. Das ist zu einem Phänomen geworden. Aufgrund der Merkmale der AI Coding.Info-Forschung wird sich die Anzahl der Repositorys mit Cursor-spezifischen Konfigurationsdateien (.cursor) jedoch nicht ändern. Davon abgesehen unterstützt Cursor selbst AGENTS.md. AI Coding.Info gibt an, dass die Anzahl der Repositorys mit AGENTS.md = die Anzahl der Codex CLI-Akzeptanz ist. Obwohl Cursor verwendet wird, ist es möglich, dass er als Codex CLI gezählt wird, und es besteht die Möglichkeit, dass die Anzahl der Verwendungen in einem unsichtbaren Teil zunimmt.

image.png

AI Coding Agent-Aktienkurs am 01.08.2026

https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#agent-share

AI Coding Agent-Aktienkurs am 01.07.2026

https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#agent-share

Nutzungsstatus des AI Coding Agent nach Programmiersprache

Die Programmiersprache, in der AI Coding Agent am häufigsten verwendet wird, ist „TypeScript“, die zweite ist „Python“, die dritte ist „Rust“, die vierte ist „Go“ und die fünfte ist „C#“. Die Akzeptanzrate der KI-Codierung für TypeScript bleibt hoch, während die Zusammensetzung von „Python“, „Rust“ und „Go“ als zweite Gruppe und „C#“ als dritte Gruppe in den letzten Jahren ein beständiger Trend war.

image.png

AI Coding Agent-Rangliste nach Programmiersprache am 01.08.2026

https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#language-agent-rank

AI Coding Agent-Ranking nach Programmiersprache am 1. Juli 2026

https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#language-agent-rank

Monatliche Trends in der Anzahl der vom AI Coding Agent verwendeten Repositorys

Die Anzahl der Repositorys betrug am 01.07.2026 1.794, ist jedoch am 01.08.2026 auf 1.940 gestiegen, und die Anzahl der Repositorys, die AI Coding Agent verwenden, ist um 146 gestiegen.

image.png

Änderungen in der Anzahl der Repositorys, die AI Coding Agent verwenden, vom 1.7.2026 bis zum 1.8.2026

https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#time-based-bar-chart

Kann lokales LLM für die KI-Codierung verwendet werden?

Im Juni veröffentlichte Claude die nächste Generation von LLMs, Mythos und Fable 5, und schockierte die Branche mit ihrer Leistung. Danach brachte das chinesische Unternehmen Kimi jedoch ein Modell mit offenem Gewicht namens Kimi-K3 auf den Markt, das fast der Fable-Klasse angehört. Das wurde zu einem heißen Thema. Selbst wenn man sich die tatsächlichen Benchmarks ansieht, liegen die Zahlen nahe beieinander.

image.png

https://artificialanalysis.ai/#intelligence-category-tabs

Als ich das dachte,

**Ist lokales LLM nicht auch eine Option für AI Coding? **

Ich denke, das denken Sie vielleicht. Ich habe diesen Bereich untersucht. In der folgenden Tabelle sind die wichtigsten LLM-Modelle mit offenem Gewicht aus der obigen Grafik aufgeführt.

ModellnameFirmennameAnkündigungsdatumAnzahl der ParameterAnzahl der aktiven ParameterKontextlängeIntelligenzindex
Kimi K3(max)Kimi(China)2026/072.800 B104B1M60
GLM-5.2(max)Z AI(China)2026/06756B40B1M53
DeepSeek V4 Flash 0731DeepSeek(China)2026/07284B13B1M52
MiMo-V2.5-ProXiaomi (China)2026/041.023B42B1M43
Muse Glimmer (hoch)Meta(USA)2026/0830B256K35
Gemma 4 31B (Begründung)Google (USA)2026/0430,7B256K30

Funktionieren diese jedoch tatsächlich auf Ihrem PC? Das verstehe ich nicht wirklich. Daher war die von uns in Betracht gezogene Bestimmungsmethode

Der erforderliche VRAM-Speicher ist

2[GB] pro Parameter 1[B]

Ist. Anhand der VRAM-Speicherkapazität Ihres PCs und der Anzahl der Parameter des Modells, das Sie ausführen möchten, können Sie grob abschätzen, ob es funktioniert. daher,

**Mathematisch gesehen sind 5,6 TB (5.600 GB) Speicher erforderlich, um Kimi-K3 auszuführen. **

Ich werde den Grund dafür erklären. Im standardmäßigen verteilten LLM-Modell werden Gewichte mithilfe von Dezimalzahlen mit einer Genauigkeit von bf16 oder fp16 ausgedrückt. Diese benötigen 2 Bytes für jeden Parameter. Die häufig verwendete Notation, wie zum Beispiel 30[B], gibt die Anzahl der Parameter an, und B steht für Milliarde und stellt 10^9 dar. Daher ist ersichtlich, dass ein Modell wie 30[B] 30×10^9 Gewichtsdaten hat. Und 1[GB]=1*10^9[Byte]. Wenn wir es so betrachten, haben wir bereits erwähnt, dass Standardgewichte in 2 Bytes gespeichert werden, sodass 2 Bytes pro Gewicht benötigt werden, was bedeutet, dass 2 [GB] zum Speichern von 1 [B] Parametern im Speicher erforderlich sind. Das ist die Berechnung. Dies ist die Bedeutung von „2[GB] pro Parameter 1[B]“, die bereits erwähnt wurde. Dies ist jedoch nur eine Annäherung; Dies ist die Mindestanforderung, um die Gewichte in den VRAM zu laden. Da zusätzlich Speicher verwendet werden kann, wird dringend empfohlen, diese nicht zu überschreiten. Dies ist die VRAM-Kapazität.

Hier kommt das Konzept der Quantisierung ins Spiel. Möglicherweise haben Sie Q4_0 oder Q4_K_M gesehen. Dies ist eine Technik, die das Gewicht auf die Anzahl der Bits komprimiert. Daher beträgt die Gewichtskapazität im Fall von Q4_0 grob gesagt 4 Bit (der 4. Teil von Q4_0). Daher beträgt die Kapazität in diesem Fall 0,5 [GB] pro 1 [B]. Eine Kurzreferenztabelle davon sieht folgendermaßen aus:

QuantisierungsmethodeErforderliche Speichermenge pro 1[B] [GB]
bf16,fp16(standard)2,0
Q8_01,0
Q4_00,5

Möglicherweise sehen Sie eine Notation wie Q4_K_M, aber grob gesagt handelt es sich um ein Modell, das im Vergleich zu Q4_0 die Genauigkeit erhöht, aber etwas mehr Speicherkapazität benötigt. Es ist gut, sich dessen bewusst zu sein. Es gibt noch eine andere Möglichkeit, dies festzustellen: Sehen Sie sich einfach die Dateigröße der Gewichtsdatei an (Safetensor oder gguf). Wenn dies die VRAM-Speicherkapazität überschreitet, funktioniert es in der Regel nicht. Ich denke, das kann man denken.

Von hier aus haben wir eine Kurzreferenztabelle mit der Größe des VRAM-Speichers, der Quantisierungsmethode und der Anzahl der Parameter erstellt.

VRAM-Speicherkapazität [GB]Anzahl der Parameter (bf16,fp16)[B]Anzahl der Parameter (Q8_0)[B]Anzahl der Parameter (Q4_0)[B]
84816
1681632
24122448
32163264
643264128
12864128256
256128256512
5122565121024
102451210242048
2048102420484096

Wie lange kann man das ungefähr machen? Wenn man bedenkt, dass es sich bei einem Modell mit 8 GB VRAM um eine RTX 5050 handelt und der Amazon-Preis 55.000 Yen beträgt. Dies kann funktionieren, wenn das Modell etwa 8[B] mit Q8_0 quantisiert ist. Das ist das Niveau.

https://link.amazon/B0brulI9R

Wenn der VRAM auf 16 GB erhöht wird, handelt es sich um ein Modell rund um die RTX 5060 Ti, das etwa 108.000 Yen kostet. Zu diesem Zeitpunkt funktioniert mit der Q4_0-Quantisierung ein LLM der Klasse 30[B] oder nicht. Das ist das Niveau.

https://link.amazon/B0ghUQISo

Wenn der VRAM auf 32 GB erhöht wird, wird er zum RTX 5090-Flaggschiffmodell und kostet 795.000 Yen. Wenn es darum geht, ist es meiner Meinung nach auf einem Niveau, auf dem man es nicht schaffen kann, wenn man nicht viel Entschlossenheit hat. Ich glaube schon. Dies ist die Quantisierung von Q8_0 und ob das 30[B]-Klassenmodell funktioniert oder nicht. Es wird ungefähr auf dem gleichen Niveau liegen.

https://link.amazon/B03EseQp5

Dieser Bereich ist die oberste Ebene der Verbraucherproduktebene. Für die professionelle Ebene ist die RTX PRO 6000 Blackwell nun mit 96 GB Speicher ausgestattet. **Der Preis beträgt 2,35 Millionen Yen. ** Hier funktioniert selbst auf der Q4_0-Quantisierungsebene nur das 192[B]-Modell, das Flaggschiff-Modell funktioniert also nicht.

https://link.amazon/B0g76ngZz

Und da es Daten für den GPU-Cluster gab, der auf dem Server installiert werden sollte, werde ich sie nur als Referenz veröffentlichen. Bei NVIDIA B300 beträgt der Speicher 288 GB und der Preis beträgt 8,63 Millionen Yen. Wenn dies der Fall ist, funktioniert möglicherweise DeepSeek V4 Flash 0731 mit Q8_0-Quantisierung. Q4_0 wird funktionieren. Wenn Sie zwei haben (entspricht 17 Millionen Yen), funktioniert möglicherweise MiMo-V2.5-Pro ​​​​mit Q4_0-Quantisierung.

image.png

https://www.nttpc.co.jp/cgi-bin/gpu/simulation/custom/index.cgi

Wenn Sie also die Speichergröße und die Anzahl der Parameter vergleichen, ist dies der Fall. Natürlich gibt es noch mehr zu diskutieren als nur die Frage, ob dies in die Erinnerung aufgenommen wird oder nicht. Generiert es also genug TOK/s, um normal verwendet zu werden? Es gibt noch ein anderes Problem. In diesem Artikel geht es um die Grundlagen. LLM verfügt über Architekturen namens Dense und MoE, und in MoE werden tatsächlich nur die aktiven Parameter berechnet. Abhängig von der Ausführungsmethode gibt es eine Möglichkeit, die Menge an physischem Speicher zu reduzieren, indem die erforderlichen Experten aus dem Speicher usw. ausgelesen werden, anstatt alle Experten ständig im Speicher zu speichern. Es gibt jedoch einige Besonderheiten bei der Ausführung des Modells und das Laden vom Speicher in den Speicher kann zu einem Engpass werden. Es gibt einige Geschichten wie diese, aber hier ignorieren wir solche Details und berücksichtigen einfach die Kapazität, wenn alle Gewichte des Modells im Speicher gespeichert sind.

Wenn Sie also das aktuelle quantisierte Flaggschiffmodell Q4_0 oder Q8_0 betreiben möchten, benötigen Sie eine Maschine, die mindestens 10 Millionen Yen kostet. Das ist das Gefühl. Andererseits kann es funktionieren, wenn Sie spezielle Hardware verwenden, um eine noch stärkere Quantisierung zu erreichen. Es gibt zum Beispiel Leute, die 2-Bit-Quantisierung und 3-Bit-Quantisierung auf dem M4 Mac mit 128 GB Speicher (ausverkauft) und DGX Spark (128 GB Speicher) ausführen.

https://zenn.dev/tkhr_sait/articles/20260508_try-local-deepseek-v4

https://dev.classmethod.jp/articles/dgx-spark-deepseek-v4-flash-0731-llama-cpp/

Andererseits ist dies wahrscheinlich die Grenze für eine Einzelperson. Es ist ein Hautgefühl. Persönlich achte ich auf die 1-Bit-Quantisierung. Berühmte Modelle sind Bonsai und Technologien wie BitNet, aber das Know-how zur 1-Bit-Quantisierung wurde nicht veröffentlicht, daher habe ich es nicht ausprobiert (es würde wahrscheinlich sehr viel Zeit in Anspruch nehmen und die Inferenzgenauigkeit verringern).

Wenn also eine 1-Bit-quantisierte Version von DeepSeek (ca. 35,5 GB) veröffentlicht würde, könnte ich mir persönlich eine Welt vorstellen, in der es, abhängig von etwas Einfallsreichtum, lokal auf einer Consumer-GPU ausgeführt werden könnte, aber da wir das derzeit nicht haben, ist es ziemlich schwierig. Das ist die ehrliche Wahrheit.

Daher,

**Es ist nicht realistisch, das Flaggschiffmodell mit lokalem LLM zu betreiben. **

Das ist mein allgemeiner Eindruck. Wenn Sie wirklich wollen, dass es funktioniert, müssen Sie meiner Meinung nach einige Tests durchführen.

Gedanken

Dieses Mal konzentrierte ich meinen Vortrag auf lokales LLM. Als Kimi-K3 herauskam, war ich ziemlich schockiert und der Fable-Kurs zog in das lokale LLM um! Es war ziemlich beeindruckend, aber ich kann es mit der Ausrüstung, die ich habe, nicht einmal bewegen. Das war mein ehrlicher Eindruck. Ich habe in der Vergangenheit einen Artikel über lokales LLM gepostet, der damals jedoch nicht besonders gut funktionierte, daher möchte ich mich selbst etwas tiefer damit befassen. Ich dachte auch.