AI Coding.Info
RepositoriesREPORTS
ABOUT

Le LLM local peut-il être utilisé pour le codage de l'IA ? ~Résumé des tendances du codage de l'IA en juillet 2026, telles que visibles à travers les données~

auteur: @kotauchisunsun

Date de sortie: 2026/08/12

Tendances des agents de codage IA en août 2026

Nous exploitons un site appelé AI Coding.Info depuis juillet 2025.

https://ai-coding.info/

https://x.com/AICodingInfo

Il s'agit d'un site qui observe les tendances d'utilisation liées aux agents de codage AI tels que Claude Code, Codex CLI, Github Copilot et Gemini à partir d'un point fixe à partir des informations des référentiels Github. Pour déterminer l’utilisation d’AI Coding Agent, nous effectuons des enquêtes quotidiennes dans les conditions suivantes.

Les tendances du mois dernier

https://ai-coding.info/reports/articles/20260703

Le taux d'utilisation de l'agent de codage AI est de 13,0 %

Le taux d'utilisation du référentiel AI Coding Agent était de 13,0 %, soit une augmentation de 0,9 % par rapport à 12,1 % la dernière fois.

image.png

image.png

Taux d’utilisation de l’agent de codage AI au 1/8/2026

https://ai-coding.info/?date=2026-08-01#adoption-rate

Taux d’utilisation de l’AI Coding Agent au 1er juillet 2026

https://ai-coding.info/?date=2026-07-01#adoption-rate

Tendances du taux d’utilisation de l’agent de codage AI du 1/7/2026 au 1/8/2026

https://ai-coding.info/?date=2026-04-01&since=2026-07-01&until=2026-08-01#share-trend

Part d'AI Coding Agent par produit

La part par produit est la suivante.

ClassementNom du produitTaux de partage
1ère placeCodex CLI40,8%
2ème placeClaude Code32,0%
3ème placeAgent copilote15,1%
4ème placeGemini CLI (Antigravité)5,3%
5ème placeCurseur4,4%

Alors que la part du Codex CLI augmente, Claude Code reste le même. Copilot Agent et Gemini CLI (Antigravity) affichent également une légère baisse. Le curseur est quelque chose auquel j'ai prêté un peu d'attention. Cursor est acquis par SpaceX. Il y avait des nouvelles.

https://www.nikkei.com/article/DGXZQOGN16BC70W6A610C2000000/

Y aura-t-il donc un changement dans le taux de partage de ce Curseur ? Je le pensais, mais le mois dernier, c'était 4,7 % et ce mois-ci, c'était 4,4 %, donc il n'y a pas beaucoup de changement. En regardant le nombre de référentiels mentionnés ci-dessous, au 1er juillet, 85 référentiels ont adopté Cursor, et au 1er août, le nombre reste inchangé à 85. Par conséquent, en ce qui concerne ce phénomène, la population de référentiels utilisant AI Coding Agent a globalement augmenté, mais le nombre d'utilisations de Cursor n'a pas augmenté. En conséquence, la part de marché globale est en baisse. C'est devenu un phénomène. Cependant, en raison des caractéristiques de la recherche AI ​​Coding.Info, le nombre de référentiels contenant des fichiers de configuration spécifiques au curseur (.cursor) ne changera pas. Cela étant dit, Cursor lui-même prend en charge AGENTS.md. AI Coding.Info indique que le nombre de référentiels avec AGENTS.md = le nombre d'adoptions du Codex CLI, donc bien que Cursor soit utilisé, il est possible qu'il soit compté comme Codex CLI, et il est possible que le nombre d'utilisations augmente dans une partie invisible.

image.png

Taux de l’action AI Coding Agent au 01/08/2026

https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#agent-share

Taux de partage AI Coding Agent au 1/7/2026

https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#agent-share

Statut d'utilisation de l'agent de codage AI par langage de programmation

Le langage de programmation dans lequel AI Coding Agent est le plus utilisé est « TypeScript », le deuxième est « Python », le troisième est « Rust », le quatrième est « Go » et le cinquième est « C# ». Le taux d'adoption de l'IA Coding for TypeScript reste élevé, tandis que la composition de « Python », « Rust » et « Go » comme deuxième groupe, et « C# » comme troisième groupe a été une tendance constante ces dernières années.

image.png

Classement AI Coding Agent par langage de programmation au 1/8/2026

https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#language-agent-rank

Classement AI Coding Agent par langage de programmation au 1er juillet 2026

https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#language-agent-rank

Tendances mensuelles du nombre de référentiels utilisés par AI Coding Agent

Le nombre de référentiels était de 1 794 au 01/07/2026, mais est passé à 1 940 au 01/08/2026, et le nombre de référentiels utilisant AI Coding Agent a augmenté de 146.

image.png

Modifications du nombre de référentiels utilisant AI Coding Agent du 2026/7/1 au 2026/8/1

https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#time-based-bar-chart

Le LLM local peut-il être utilisé pour le codage de l'IA ?

En juin, la prochaine génération de LLM, Mythos et Fable 5, ont été publiées par Claude et ont choqué l'industrie par leurs performances. Cependant, après cela, la société chinoise Kimi a lancé un modèle à poids ouvert appelé Kimi-K3, qui appartient presque à la classe Fable. C’est devenu un sujet brûlant. Même en regardant les références réelles, les chiffres sont proches.

image.png

https://artificialanalysis.ai/#intelligence-category-tabs

Quand j'ai pensé ça,

**Le LLM local n'est-il pas également une option pour le codage IA ? **

Je pense que vous pouvez le penser. J'ai enquêté sur ce domaine. Le tableau ci-dessous répertorie les principaux modèles LLM à poids ouvert du graphique ci-dessus.

Nom du modèleNom de l'entrepriseDate d'annonceNombre de paramètresNombre de paramètres actifsLongueur du contexteIndice du renseignement
Kimi K3(max)Kimi(Chine)2026/072 800 milliards104B1M60
GLM-5.2(max)Z AI (Chine)2026/06756B40B1M53
DeepSeek V4 Flash 0731DeepSeek(Chine)2026/07284B13B1M52
MiMo-V2.5-ProXiaomi (Chine)2026/041 023 milliards42B1M43
Muse Glimmer (haut)Méta (États-Unis)2026/0830B256K35
Gemma 4 31B (Raisonnement)Google (États-Unis)2026/0430,7B256K30

Cependant, est-ce que ceux-ci fonctionnent réellement sur votre PC ? Je ne comprends pas vraiment ça. Par conséquent, la méthode de détermination que nous avons considérée était

La mémoire VRAM requise est

2[Go] par paramètre 1[B]

est. Vous pouvez estimer approximativement si cela fonctionnera en fonction de la capacité de mémoire VRAM de votre PC et du nombre de paramètres du modèle que vous souhaitez exécuter. donc,

**Mathématiquement, 5,6 To (5 600 Go) de mémoire sont nécessaires pour exécuter Kimi-K3. **

Je vais vous en expliquer la raison. Dans le modèle LLM distribué standard, les poids sont exprimés à l'aide de nombres décimaux avec une précision de bf16 ou fp16. Ceux-ci nécessitent 2 octets pour chaque paramètre. La notation que vous voyez souvent, comme 30[B], est le nombre de paramètres, et B signifie milliard et représente 10^9. Par conséquent, on peut voir qu'un modèle tel que 30[B] a des données de poids 30×10^9. Et 1[Go]=1*10^9[Octet]. En y réfléchissant de cette façon, nous avons mentionné plus tôt que les poids standard sont stockés sur 2 octets, il faut donc 2 octets par poids, ce qui signifie 2 [Go] pour stocker 1 [B] paramètres en mémoire. C'est le calcul. C'est la signification de "2[GB] par paramètre 1[B]" mentionné précédemment. Cependant, ce n’est qu’une approximation ; c'est le minimum requis pour charger les poids dans la VRAM, et comme la mémoire peut être utilisée en plus de cela, il est strictement conseillé de ne pas le dépasser. Il s'agit de la capacité de la VRAM.

C’est là qu’intervient le concept de quantification. Vous avez peut-être vu Q4_0 ou Q4_K_M. Il s'agit d'une technique qui compresse le poids à son nombre de bits. Par conséquent, dans le cas de Q4_0, grosso modo, la capacité de poids est de 4 bits (la 4 partie de Q4_0). Par conséquent, dans ce cas, la capacité est de 0,5[Go] pour 1[B]. Un tableau de référence rapide ressemble à ceci :

Méthode de quantificationQuantité de mémoire requise par 1[B] [Go]
bf16,fp16(standard)2.0
Q8_01.0
T4_00,5

Vous pouvez voir une notation telle que Q4_K_M, mais en gros, il s'agit d'un modèle qui augmente la précision par rapport à Q4_0, mais utilise légèrement plus de capacité mémoire. Il est bon d'en être conscient. Il existe une autre façon de le savoir, il suffit de regarder la taille du fichier de poids (safetensor ou gguf). Si cela dépasse la capacité de la mémoire VRAM, cela ne fonctionnera généralement pas. Je pense que tu peux le penser.

À partir de là, nous avons créé un tableau de référence rapide de la quantité de mémoire VRAM, de la méthode de quantification et du nombre de paramètres.

Capacité de la mémoire VRAM [Go]Nombre de paramètres (bf16,fp16)[B]Nombre de paramètres (Q8_0)[B]Nombre de paramètres (Q4_0)[B]
84816
1681632
24122448
32163264
643264128
12864128256
256128256512
5122565121024
102451210242048
2048102420484096

Combien de temps environ peut-on le faire ? Considérant que s’il s’agit d’un modèle avec 8 Go de VRAM, ce sera un RTX 5050 et le prix Amazon est de 55 000 yens. Cela peut fonctionner si le modèle est quantifié à environ 8[B] avec Q8_0. C'est le niveau.

https://link.amazon/B0brulI9R

Lorsque la VRAM passe à 16 Go, cela devient un modèle autour du RTX 5060 Ti, qui coûte environ 108 000 yens. À ce stade, avec la quantification Q4_0, un LLM de classe 30[B] fonctionnera ou non. C'est le niveau.

https://link.amazon/B0ghUQISo

Lorsque la VRAM passe à 32 Go, elle devient le modèle phare du RTX 5090 et coûte 795 000 yens. Quand il s’agit de cela, je suppose que nous sommes à un niveau où vous ne pouvez pas y parvenir sans beaucoup de détermination. Je pense que oui. Il s'agit de la quantification de Q8_0 et de savoir si le modèle de classe 30[B] fonctionne ou non. Ce sera à peu près au même niveau.

https://link.amazon/B03EseQp5

Cette zone est la ligne supérieure du niveau des produits de consommation. Désormais, au niveau professionnel, le RTX PRO 6000 Blackwell est équipé de 96 Go de mémoire. **Le prix est de 2,35 millions de yens. ** Ici, même au niveau de quantification Q4_0, seul le modèle 192[B] fonctionne, donc le modèle phare ne fonctionne pas.

https://link.amazon/B0g76ngZz

Et comme il y avait des données pour que le cluster GPU soit installé sur le serveur, je les publierai à titre de référence uniquement. Dans le cas du NVIDIA B300, la mémoire est de 288 Go et le prix est de 8,63 millions de yens. S'il en est un, DeepSeek V4 Flash 0731 avec quantification Q8_0 peut fonctionner. Q4_0 fonctionnera. Si vous en avez deux (équivalent à 17 millions de yens), MiMo-V2.5-Pro ​​​​avec quantification Q4_0 peut fonctionner.

image.png

https://www.nttpc.co.jp/cgi-bin/gpu/simulation/custom/index.cgi

Par conséquent, si vous comparez la quantité de mémoire et le nombre de paramètres, c'est à peu près tout. Bien sûr, il y a plus à débattre que cela, et si cela sera ou non inclus dans la mémoire. Alors, génère-t-il suffisamment de TOK/s pour être utilisé normalement ? Il y a un autre problème. Cet article parle des bases. LLM a des architectures appelées Dense et MoE, et dans MoE, seuls les paramètres actifs sont réellement calculés, et selon la méthode d'exécution, il existe un moyen de réduire la quantité de mémoire physique en lisant les experts nécessaires du stockage, etc., au lieu de stocker tous les experts en mémoire en permanence. Cependant, la manière dont le modèle est exécuté présente certains aspects particuliers, et le chargement du stockage vers la mémoire peut devenir un goulot d'étranglement. Il existe des histoires comme celle-ci, mais ici nous ignorons ces détails et considérons simplement la capacité lorsque tous les poids du modèle sont stockés en mémoire.

Ainsi, si vous souhaitez exécuter le modèle phare quantifié actuel Q4_0 ou Q8_0, vous aurez besoin d'une machine qui coûte au moins 10 millions de yens. C'est la sensation. D’un autre côté, cela peut fonctionner si vous utilisez un matériel spécial pour obtenir une quantification encore plus grande. Par exemple, certaines personnes exécutent une quantification 2 bits et une quantification 3 bits sur le Mac M4 avec 128 Go de mémoire (épuisée) et DGX Spark (128 Go de mémoire).

https://zenn.dev/tkhr_sait/articles/20260508_try-local-deepseek-v4

https://dev.classmethod.jp/articles/dgx-spark-deepseek-v4-flash-0731-llama-cpp/

En revanche, c'est probablement la limite pour un particulier. C'est une sensation cutanée. Personnellement, je fais attention à la quantification 1 bit. Les modèles célèbres incluent Bonsai et des technologies telles que BitNet, mais le savoir-faire en matière de quantification sur 1 bit n'a pas été rendu public, donc je ne l'ai pas essayé (cela prendrait probablement énormément de temps et réduirait la précision de l'inférence).

Donc, personnellement, si une version quantifiée 1 bit de DeepSeek (environ 35,5 Go) était publiée, je pourrais imaginer un monde dans lequel elle pourrait être exécutée localement sur un GPU grand public, en fonction d'une certaine ingéniosité, mais comme nous ne l'avons pas actuellement, c'est assez difficile. C'est la vérité honnête.

Donc,

**Il n'est pas réaliste d'exécuter le modèle phare avec un LLM local. **

C'est mon impression générale. Si vous voulez vraiment que cela fonctionne, je pense que vous devez faire quelques tests.

pensées

Cette fois, j'ai concentré mon exposé sur le LLM local. Quand Kimi-K3 est sorti, j'ai été assez choqué, et la classe Fable a déménagé dans le LLM local ! C'était assez impressionnant, mais je ne peux même pas le déplacer avec le matériel dont je dispose. C'était mon impression honnête. J'ai publié un article sur le LLM local dans le passé, mais cela ne fonctionnait pas très bien à l'époque, j'aimerais donc approfondir moi-même un peu ce sujet. Je le pensais.