Autor: @kotauchisunsun
Veröffentlichungsdatum: 2026/08/12
Seit Juli 2025 betreiben wir eine Website namens AI Coding.Info.
Dies ist eine Website, die Nutzungstrends im Zusammenhang mit AI Coding Agents wie Claude Code, Codex CLI, Github Copilot und Gemini von einem festen Punkt aus anhand von Informationen in Github-Repositories beobachtet. Um den Einsatz von AI Coding Agent zu ermitteln, führen wir tägliche Umfragen unter den folgenden Bedingungen durch.
https://ai-coding.info/reports/articles/20260703
Die Auslastung des AI Coding Agent-Repositorys betrug 13,0 %, ein Anstieg von 0,9 % gegenüber 12,1 % beim letzten Mal.


Nutzungsrate des AI Coding Agent am 01.08.2026
https://ai-coding.info/?date=2026-08-01#adoption-rate
Nutzungsrate des AI Coding Agent am 1. Juli 2026
https://ai-coding.info/?date=2026-07-01#adoption-rate
Trends bei der Nutzungsrate von AI Coding Agent vom 01.07.2026 bis zum 01.08.2026
https://ai-coding.info/?date=2026-04-01&since=2026-07-01&until=2026-08-01#share-trend
Der Anteil nach Produkten ist wie folgt.
| Rangliste | Produktname | Aktienkurs |
|---|---|---|
| 1. Platz | Codex-CLI | 40,8 % |
| 2. Platz | Claude Code | 32,0 % |
| 3. Platz | Copilot-Agent | 15,1 % |
| 4. Platz | Gemini CLI(Antigravitation) | 5,3 % |
| 5. Platz | Cursor | 4,4 % |
Während der Anteil von Codex CLI steigt, bleibt Claude Code gleich. Auch Copilot Agent und Gemini CLI (Antigravity) verzeichnen einen leichten Rückgang. Dem Cursor habe ich ein wenig Aufmerksamkeit geschenkt. Der Cursor wird von SpaceX übernommen. Es gab Neuigkeiten.
https://www.nikkei.com/article/DGXZQOGN16BC70W6A610C2000000/
Wird es daher eine Änderung in der Aktienrate dieses Cursors geben? Ich dachte schon, aber letzten Monat waren es 4,7 % und diesen Monat waren es 4,4 %, also gibt es keine große Veränderung. Betrachtet man die unten genannte Anzahl von Repositories, so gab es am 1. Juli 85 Repositories, die Cursor übernommen haben, und seit dem 1. August liegt die Zahl unverändert bei 85. Daher ist in Bezug auf dieses Phänomen die Anzahl der Repositories, die AI Coding Agent verwenden, insgesamt gestiegen, aber die Anzahl der Cursor-Nutzungen hat sich nicht erhöht. Dadurch sinkt der Gesamtmarktanteil. Das ist zu einem Phänomen geworden. Aufgrund der Merkmale der AI Coding.Info-Forschung wird sich die Anzahl der Repositorys mit Cursor-spezifischen Konfigurationsdateien (.cursor) jedoch nicht ändern. Davon abgesehen unterstützt Cursor selbst AGENTS.md. AI Coding.Info gibt an, dass die Anzahl der Repositorys mit AGENTS.md = die Anzahl der Codex CLI-Akzeptanz ist. Obwohl Cursor verwendet wird, ist es möglich, dass er als Codex CLI gezählt wird, und es besteht die Möglichkeit, dass die Anzahl der Verwendungen in einem unsichtbaren Teil zunimmt.

AI Coding Agent-Aktienkurs am 01.08.2026
https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#agent-share
AI Coding Agent-Aktienkurs am 01.07.2026
https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#agent-share
Die Programmiersprache, in der AI Coding Agent am häufigsten verwendet wird, ist „TypeScript“, die zweite ist „Python“, die dritte ist „Rust“, die vierte ist „Go“ und die fünfte ist „C#“. Die Akzeptanzrate der KI-Codierung für TypeScript bleibt hoch, während die Zusammensetzung von „Python“, „Rust“ und „Go“ als zweite Gruppe und „C#“ als dritte Gruppe in den letzten Jahren ein beständiger Trend war.

AI Coding Agent-Rangliste nach Programmiersprache am 01.08.2026
https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#language-agent-rank
AI Coding Agent-Ranking nach Programmiersprache am 1. Juli 2026
https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#language-agent-rank
Die Anzahl der Repositorys betrug am 01.07.2026 1.794, ist jedoch am 01.08.2026 auf 1.940 gestiegen, und die Anzahl der Repositorys, die AI Coding Agent verwenden, ist um 146 gestiegen.

Änderungen in der Anzahl der Repositorys, die AI Coding Agent verwenden, vom 1.7.2026 bis zum 1.8.2026
https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#time-based-bar-chart
Im Juni veröffentlichte Claude die nächste Generation von LLMs, Mythos und Fable 5, und schockierte die Branche mit ihrer Leistung. Danach brachte das chinesische Unternehmen Kimi jedoch ein Modell mit offenem Gewicht namens Kimi-K3 auf den Markt, das fast der Fable-Klasse angehört. Das wurde zu einem heißen Thema. Selbst wenn man sich die tatsächlichen Benchmarks ansieht, liegen die Zahlen nahe beieinander.

https://artificialanalysis.ai/#intelligence-category-tabs
Als ich das dachte,
**Ist lokales LLM nicht auch eine Option für AI Coding? **
Ich denke, das denken Sie vielleicht. Ich habe diesen Bereich untersucht. In der folgenden Tabelle sind die wichtigsten LLM-Modelle mit offenem Gewicht aus der obigen Grafik aufgeführt.
| Modellname | Firmenname | Ankündigungsdatum | Anzahl der Parameter | Anzahl der aktiven Parameter | Kontextlänge | Intelligenzindex |
|---|---|---|---|---|---|---|
| Kimi K3(max) | Kimi(China) | 2026/07 | 2.800 B | 104B | 1M | 60 |
| GLM-5.2(max) | Z AI(China) | 2026/06 | 756B | 40B | 1M | 53 |
| DeepSeek V4 Flash 0731 | DeepSeek(China) | 2026/07 | 284B | 13B | 1M | 52 |
| MiMo-V2.5-Pro | Xiaomi (China) | 2026/04 | 1.023B | 42B | 1M | 43 |
| Muse Glimmer (hoch) | Meta(USA) | 2026/08 | 30B | 256K | 35 | |
| Gemma 4 31B (Begründung) | Google (USA) | 2026/04 | 30,7B | 256K | 30 |
Funktionieren diese jedoch tatsächlich auf Ihrem PC? Das verstehe ich nicht wirklich. Daher war die von uns in Betracht gezogene Bestimmungsmethode
Der erforderliche VRAM-Speicher ist
2[GB] pro Parameter 1[B]
Ist. Anhand der VRAM-Speicherkapazität Ihres PCs und der Anzahl der Parameter des Modells, das Sie ausführen möchten, können Sie grob abschätzen, ob es funktioniert. daher,
**Mathematisch gesehen sind 5,6 TB (5.600 GB) Speicher erforderlich, um Kimi-K3 auszuführen. **
Ich werde den Grund dafür erklären. Im standardmäßigen verteilten LLM-Modell werden Gewichte mithilfe von Dezimalzahlen mit einer Genauigkeit von bf16 oder fp16 ausgedrückt. Diese benötigen 2 Bytes für jeden Parameter. Die häufig verwendete Notation, wie zum Beispiel 30[B], gibt die Anzahl der Parameter an, und B steht für Milliarde und stellt 10^9 dar. Daher ist ersichtlich, dass ein Modell wie 30[B] 30×10^9 Gewichtsdaten hat. Und 1[GB]=1*10^9[Byte]. Wenn wir es so betrachten, haben wir bereits erwähnt, dass Standardgewichte in 2 Bytes gespeichert werden, sodass 2 Bytes pro Gewicht benötigt werden, was bedeutet, dass 2 [GB] zum Speichern von 1 [B] Parametern im Speicher erforderlich sind. Das ist die Berechnung. Dies ist die Bedeutung von „2[GB] pro Parameter 1[B]“, die bereits erwähnt wurde. Dies ist jedoch nur eine Annäherung; Dies ist die Mindestanforderung, um die Gewichte in den VRAM zu laden. Da zusätzlich Speicher verwendet werden kann, wird dringend empfohlen, diese nicht zu überschreiten. Dies ist die VRAM-Kapazität.
Hier kommt das Konzept der Quantisierung ins Spiel. Möglicherweise haben Sie Q4_0 oder Q4_K_M gesehen. Dies ist eine Technik, die das Gewicht auf die Anzahl der Bits komprimiert. Daher beträgt die Gewichtskapazität im Fall von Q4_0 grob gesagt 4 Bit (der 4. Teil von Q4_0). Daher beträgt die Kapazität in diesem Fall 0,5 [GB] pro 1 [B]. Eine Kurzreferenztabelle davon sieht folgendermaßen aus:
| Quantisierungsmethode | Erforderliche Speichermenge pro 1[B] [GB] |
|---|---|
| bf16,fp16(standard) | 2,0 |
| Q8_0 | 1,0 |
| Q4_0 | 0,5 |
Möglicherweise sehen Sie eine Notation wie Q4_K_M, aber grob gesagt handelt es sich um ein Modell, das im Vergleich zu Q4_0 die Genauigkeit erhöht, aber etwas mehr Speicherkapazität benötigt. Es ist gut, sich dessen bewusst zu sein. Es gibt noch eine andere Möglichkeit, dies festzustellen: Sehen Sie sich einfach die Dateigröße der Gewichtsdatei an (Safetensor oder gguf). Wenn dies die VRAM-Speicherkapazität überschreitet, funktioniert es in der Regel nicht. Ich denke, das kann man denken.
Von hier aus haben wir eine Kurzreferenztabelle mit der Größe des VRAM-Speichers, der Quantisierungsmethode und der Anzahl der Parameter erstellt.
| VRAM-Speicherkapazität [GB] | Anzahl der Parameter (bf16,fp16)[B] | Anzahl der Parameter (Q8_0)[B] | Anzahl der Parameter (Q4_0)[B] |
|---|---|---|---|
| 8 | 4 | 8 | 16 |
| 16 | 8 | 16 | 32 |
| 24 | 12 | 24 | 48 |
| 32 | 16 | 32 | 64 |
| 64 | 32 | 64 | 128 |
| 128 | 64 | 128 | 256 |
| 256 | 128 | 256 | 512 |
| 512 | 256 | 512 | 1024 |
| 1024 | 512 | 1024 | 2048 |
| 2048 | 1024 | 2048 | 4096 |
Wie lange kann man das ungefähr machen? Wenn man bedenkt, dass es sich bei einem Modell mit 8 GB VRAM um eine RTX 5050 handelt und der Amazon-Preis 55.000 Yen beträgt. Dies kann funktionieren, wenn das Modell etwa 8[B] mit Q8_0 quantisiert ist. Das ist das Niveau.
Wenn der VRAM auf 16 GB erhöht wird, handelt es sich um ein Modell rund um die RTX 5060 Ti, das etwa 108.000 Yen kostet. Zu diesem Zeitpunkt funktioniert mit der Q4_0-Quantisierung ein LLM der Klasse 30[B] oder nicht. Das ist das Niveau.
Wenn der VRAM auf 32 GB erhöht wird, wird er zum RTX 5090-Flaggschiffmodell und kostet 795.000 Yen. Wenn es darum geht, ist es meiner Meinung nach auf einem Niveau, auf dem man es nicht schaffen kann, wenn man nicht viel Entschlossenheit hat. Ich glaube schon. Dies ist die Quantisierung von Q8_0 und ob das 30[B]-Klassenmodell funktioniert oder nicht. Es wird ungefähr auf dem gleichen Niveau liegen.
Dieser Bereich ist die oberste Ebene der Verbraucherproduktebene. Für die professionelle Ebene ist die RTX PRO 6000 Blackwell nun mit 96 GB Speicher ausgestattet. **Der Preis beträgt 2,35 Millionen Yen. ** Hier funktioniert selbst auf der Q4_0-Quantisierungsebene nur das 192[B]-Modell, das Flaggschiff-Modell funktioniert also nicht.
Und da es Daten für den GPU-Cluster gab, der auf dem Server installiert werden sollte, werde ich sie nur als Referenz veröffentlichen. Bei NVIDIA B300 beträgt der Speicher 288 GB und der Preis beträgt 8,63 Millionen Yen. Wenn dies der Fall ist, funktioniert möglicherweise DeepSeek V4 Flash 0731 mit Q8_0-Quantisierung. Q4_0 wird funktionieren. Wenn Sie zwei haben (entspricht 17 Millionen Yen), funktioniert möglicherweise MiMo-V2.5-Pro mit Q4_0-Quantisierung.

https://www.nttpc.co.jp/cgi-bin/gpu/simulation/custom/index.cgi
Wenn Sie also die Speichergröße und die Anzahl der Parameter vergleichen, ist dies der Fall. Natürlich gibt es noch mehr zu diskutieren als nur die Frage, ob dies in die Erinnerung aufgenommen wird oder nicht. Generiert es also genug TOK/s, um normal verwendet zu werden? Es gibt noch ein anderes Problem. In diesem Artikel geht es um die Grundlagen. LLM verfügt über Architekturen namens Dense und MoE, und in MoE werden tatsächlich nur die aktiven Parameter berechnet. Abhängig von der Ausführungsmethode gibt es eine Möglichkeit, die Menge an physischem Speicher zu reduzieren, indem die erforderlichen Experten aus dem Speicher usw. ausgelesen werden, anstatt alle Experten ständig im Speicher zu speichern. Es gibt jedoch einige Besonderheiten bei der Ausführung des Modells und das Laden vom Speicher in den Speicher kann zu einem Engpass werden. Es gibt einige Geschichten wie diese, aber hier ignorieren wir solche Details und berücksichtigen einfach die Kapazität, wenn alle Gewichte des Modells im Speicher gespeichert sind.
Wenn Sie also das aktuelle quantisierte Flaggschiffmodell Q4_0 oder Q8_0 betreiben möchten, benötigen Sie eine Maschine, die mindestens 10 Millionen Yen kostet. Das ist das Gefühl. Andererseits kann es funktionieren, wenn Sie spezielle Hardware verwenden, um eine noch stärkere Quantisierung zu erreichen. Es gibt zum Beispiel Leute, die 2-Bit-Quantisierung und 3-Bit-Quantisierung auf dem M4 Mac mit 128 GB Speicher (ausverkauft) und DGX Spark (128 GB Speicher) ausführen.
https://zenn.dev/tkhr_sait/articles/20260508_try-local-deepseek-v4
https://dev.classmethod.jp/articles/dgx-spark-deepseek-v4-flash-0731-llama-cpp/
Andererseits ist dies wahrscheinlich die Grenze für eine Einzelperson. Es ist ein Hautgefühl. Persönlich achte ich auf die 1-Bit-Quantisierung. Berühmte Modelle sind Bonsai und Technologien wie BitNet, aber das Know-how zur 1-Bit-Quantisierung wurde nicht veröffentlicht, daher habe ich es nicht ausprobiert (es würde wahrscheinlich sehr viel Zeit in Anspruch nehmen und die Inferenzgenauigkeit verringern).
Wenn also eine 1-Bit-quantisierte Version von DeepSeek (ca. 35,5 GB) veröffentlicht würde, könnte ich mir persönlich eine Welt vorstellen, in der es, abhängig von etwas Einfallsreichtum, lokal auf einer Consumer-GPU ausgeführt werden könnte, aber da wir das derzeit nicht haben, ist es ziemlich schwierig. Das ist die ehrliche Wahrheit.
Daher,
**Es ist nicht realistisch, das Flaggschiffmodell mit lokalem LLM zu betreiben. **
Das ist mein allgemeiner Eindruck. Wenn Sie wirklich wollen, dass es funktioniert, müssen Sie meiner Meinung nach einige Tests durchführen.
Dieses Mal konzentrierte ich meinen Vortrag auf lokales LLM. Als Kimi-K3 herauskam, war ich ziemlich schockiert und der Fable-Kurs zog in das lokale LLM um! Es war ziemlich beeindruckend, aber ich kann es mit der Ausrüstung, die ich habe, nicht einmal bewegen. Das war mein ehrlicher Eindruck. Ich habe in der Vergangenheit einen Artikel über lokales LLM gepostet, der damals jedoch nicht besonders gut funktionierte, daher möchte ich mich selbst etwas tiefer damit befassen. Ich dachte auch.