auteur: @kotauchisunsun
Date de sortie: 2026/08/12
Nous exploitons un site appelé AI Coding.Info depuis juillet 2025.
Il s'agit d'un site qui observe les tendances d'utilisation liées aux agents de codage AI tels que Claude Code, Codex CLI, Github Copilot et Gemini à partir d'un point fixe à partir des informations des référentiels Github. Pour déterminer l’utilisation d’AI Coding Agent, nous effectuons des enquêtes quotidiennes dans les conditions suivantes.
https://ai-coding.info/reports/articles/20260703
Le taux d'utilisation du référentiel AI Coding Agent était de 13,0 %, soit une augmentation de 0,9 % par rapport à 12,1 % la dernière fois.


Taux d’utilisation de l’agent de codage AI au 1/8/2026
https://ai-coding.info/?date=2026-08-01#adoption-rate
Taux d’utilisation de l’AI Coding Agent au 1er juillet 2026
https://ai-coding.info/?date=2026-07-01#adoption-rate
Tendances du taux d’utilisation de l’agent de codage AI du 1/7/2026 au 1/8/2026
https://ai-coding.info/?date=2026-04-01&since=2026-07-01&until=2026-08-01#share-trend
La part par produit est la suivante.
| Classement | Nom du produit | Taux de partage |
|---|---|---|
| 1ère place | Codex CLI | 40,8% |
| 2ème place | Claude Code | 32,0% |
| 3ème place | Agent copilote | 15,1% |
| 4ème place | Gemini CLI (Antigravité) | 5,3% |
| 5ème place | Curseur | 4,4% |
Alors que la part du Codex CLI augmente, Claude Code reste le même. Copilot Agent et Gemini CLI (Antigravity) affichent également une légère baisse. Le curseur est quelque chose auquel j'ai prêté un peu d'attention. Cursor est acquis par SpaceX. Il y avait des nouvelles.
https://www.nikkei.com/article/DGXZQOGN16BC70W6A610C2000000/
Y aura-t-il donc un changement dans le taux de partage de ce Curseur ? Je le pensais, mais le mois dernier, c'était 4,7 % et ce mois-ci, c'était 4,4 %, donc il n'y a pas beaucoup de changement. En regardant le nombre de référentiels mentionnés ci-dessous, au 1er juillet, 85 référentiels ont adopté Cursor, et au 1er août, le nombre reste inchangé à 85. Par conséquent, en ce qui concerne ce phénomène, la population de référentiels utilisant AI Coding Agent a globalement augmenté, mais le nombre d'utilisations de Cursor n'a pas augmenté. En conséquence, la part de marché globale est en baisse. C'est devenu un phénomène. Cependant, en raison des caractéristiques de la recherche AI Coding.Info, le nombre de référentiels contenant des fichiers de configuration spécifiques au curseur (.cursor) ne changera pas. Cela étant dit, Cursor lui-même prend en charge AGENTS.md. AI Coding.Info indique que le nombre de référentiels avec AGENTS.md = le nombre d'adoptions du Codex CLI, donc bien que Cursor soit utilisé, il est possible qu'il soit compté comme Codex CLI, et il est possible que le nombre d'utilisations augmente dans une partie invisible.

Taux de l’action AI Coding Agent au 01/08/2026
https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#agent-share
Taux de partage AI Coding Agent au 1/7/2026
https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#agent-share
Le langage de programmation dans lequel AI Coding Agent est le plus utilisé est « TypeScript », le deuxième est « Python », le troisième est « Rust », le quatrième est « Go » et le cinquième est « C# ». Le taux d'adoption de l'IA Coding for TypeScript reste élevé, tandis que la composition de « Python », « Rust » et « Go » comme deuxième groupe, et « C# » comme troisième groupe a été une tendance constante ces dernières années.

Classement AI Coding Agent par langage de programmation au 1/8/2026
https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#language-agent-rank
Classement AI Coding Agent par langage de programmation au 1er juillet 2026
https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#language-agent-rank
Le nombre de référentiels était de 1 794 au 01/07/2026, mais est passé à 1 940 au 01/08/2026, et le nombre de référentiels utilisant AI Coding Agent a augmenté de 146.

Modifications du nombre de référentiels utilisant AI Coding Agent du 2026/7/1 au 2026/8/1
https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#time-based-bar-chart
En juin, la prochaine génération de LLM, Mythos et Fable 5, ont été publiées par Claude et ont choqué l'industrie par leurs performances. Cependant, après cela, la société chinoise Kimi a lancé un modèle à poids ouvert appelé Kimi-K3, qui appartient presque à la classe Fable. C’est devenu un sujet brûlant. Même en regardant les références réelles, les chiffres sont proches.

https://artificialanalysis.ai/#intelligence-category-tabs
Quand j'ai pensé ça,
**Le LLM local n'est-il pas également une option pour le codage IA ? **
Je pense que vous pouvez le penser. J'ai enquêté sur ce domaine. Le tableau ci-dessous répertorie les principaux modèles LLM à poids ouvert du graphique ci-dessus.
| Nom du modèle | Nom de l'entreprise | Date d'annonce | Nombre de paramètres | Nombre de paramètres actifs | Longueur du contexte | Indice du renseignement |
|---|---|---|---|---|---|---|
| Kimi K3(max) | Kimi(Chine) | 2026/07 | 2 800 milliards | 104B | 1M | 60 |
| GLM-5.2(max) | Z AI (Chine) | 2026/06 | 756B | 40B | 1M | 53 |
| DeepSeek V4 Flash 0731 | DeepSeek(Chine) | 2026/07 | 284B | 13B | 1M | 52 |
| MiMo-V2.5-Pro | Xiaomi (Chine) | 2026/04 | 1 023 milliards | 42B | 1M | 43 |
| Muse Glimmer (haut) | Méta (États-Unis) | 2026/08 | 30B | 256K | 35 | |
| Gemma 4 31B (Raisonnement) | Google (États-Unis) | 2026/04 | 30,7B | 256K | 30 |
Cependant, est-ce que ceux-ci fonctionnent réellement sur votre PC ? Je ne comprends pas vraiment ça. Par conséquent, la méthode de détermination que nous avons considérée était
La mémoire VRAM requise est
2[Go] par paramètre 1[B]
est. Vous pouvez estimer approximativement si cela fonctionnera en fonction de la capacité de mémoire VRAM de votre PC et du nombre de paramètres du modèle que vous souhaitez exécuter. donc,
**Mathématiquement, 5,6 To (5 600 Go) de mémoire sont nécessaires pour exécuter Kimi-K3. **
Je vais vous en expliquer la raison. Dans le modèle LLM distribué standard, les poids sont exprimés à l'aide de nombres décimaux avec une précision de bf16 ou fp16. Ceux-ci nécessitent 2 octets pour chaque paramètre. La notation que vous voyez souvent, comme 30[B], est le nombre de paramètres, et B signifie milliard et représente 10^9. Par conséquent, on peut voir qu'un modèle tel que 30[B] a des données de poids 30×10^9. Et 1[Go]=1*10^9[Octet]. En y réfléchissant de cette façon, nous avons mentionné plus tôt que les poids standard sont stockés sur 2 octets, il faut donc 2 octets par poids, ce qui signifie 2 [Go] pour stocker 1 [B] paramètres en mémoire. C'est le calcul. C'est la signification de "2[GB] par paramètre 1[B]" mentionné précédemment. Cependant, ce n’est qu’une approximation ; c'est le minimum requis pour charger les poids dans la VRAM, et comme la mémoire peut être utilisée en plus de cela, il est strictement conseillé de ne pas le dépasser. Il s'agit de la capacité de la VRAM.
C’est là qu’intervient le concept de quantification. Vous avez peut-être vu Q4_0 ou Q4_K_M. Il s'agit d'une technique qui compresse le poids à son nombre de bits. Par conséquent, dans le cas de Q4_0, grosso modo, la capacité de poids est de 4 bits (la 4 partie de Q4_0). Par conséquent, dans ce cas, la capacité est de 0,5[Go] pour 1[B]. Un tableau de référence rapide ressemble à ceci :
| Méthode de quantification | Quantité de mémoire requise par 1[B] [Go] |
|---|---|
| bf16,fp16(standard) | 2.0 |
| Q8_0 | 1.0 |
| T4_0 | 0,5 |
Vous pouvez voir une notation telle que Q4_K_M, mais en gros, il s'agit d'un modèle qui augmente la précision par rapport à Q4_0, mais utilise légèrement plus de capacité mémoire. Il est bon d'en être conscient. Il existe une autre façon de le savoir, il suffit de regarder la taille du fichier de poids (safetensor ou gguf). Si cela dépasse la capacité de la mémoire VRAM, cela ne fonctionnera généralement pas. Je pense que tu peux le penser.
À partir de là, nous avons créé un tableau de référence rapide de la quantité de mémoire VRAM, de la méthode de quantification et du nombre de paramètres.
| Capacité de la mémoire VRAM [Go] | Nombre de paramètres (bf16,fp16)[B] | Nombre de paramètres (Q8_0)[B] | Nombre de paramètres (Q4_0)[B] |
|---|---|---|---|
| 8 | 4 | 8 | 16 |
| 16 | 8 | 16 | 32 |
| 24 | 12 | 24 | 48 |
| 32 | 16 | 32 | 64 |
| 64 | 32 | 64 | 128 |
| 128 | 64 | 128 | 256 |
| 256 | 128 | 256 | 512 |
| 512 | 256 | 512 | 1024 |
| 1024 | 512 | 1024 | 2048 |
| 2048 | 1024 | 2048 | 4096 |
Combien de temps environ peut-on le faire ? Considérant que s’il s’agit d’un modèle avec 8 Go de VRAM, ce sera un RTX 5050 et le prix Amazon est de 55 000 yens. Cela peut fonctionner si le modèle est quantifié à environ 8[B] avec Q8_0. C'est le niveau.
Lorsque la VRAM passe à 16 Go, cela devient un modèle autour du RTX 5060 Ti, qui coûte environ 108 000 yens. À ce stade, avec la quantification Q4_0, un LLM de classe 30[B] fonctionnera ou non. C'est le niveau.
Lorsque la VRAM passe à 32 Go, elle devient le modèle phare du RTX 5090 et coûte 795 000 yens. Quand il s’agit de cela, je suppose que nous sommes à un niveau où vous ne pouvez pas y parvenir sans beaucoup de détermination. Je pense que oui. Il s'agit de la quantification de Q8_0 et de savoir si le modèle de classe 30[B] fonctionne ou non. Ce sera à peu près au même niveau.
Cette zone est la ligne supérieure du niveau des produits de consommation. Désormais, au niveau professionnel, le RTX PRO 6000 Blackwell est équipé de 96 Go de mémoire. **Le prix est de 2,35 millions de yens. ** Ici, même au niveau de quantification Q4_0, seul le modèle 192[B] fonctionne, donc le modèle phare ne fonctionne pas.
Et comme il y avait des données pour que le cluster GPU soit installé sur le serveur, je les publierai à titre de référence uniquement. Dans le cas du NVIDIA B300, la mémoire est de 288 Go et le prix est de 8,63 millions de yens. S'il en est un, DeepSeek V4 Flash 0731 avec quantification Q8_0 peut fonctionner. Q4_0 fonctionnera. Si vous en avez deux (équivalent à 17 millions de yens), MiMo-V2.5-Pro avec quantification Q4_0 peut fonctionner.

https://www.nttpc.co.jp/cgi-bin/gpu/simulation/custom/index.cgi
Par conséquent, si vous comparez la quantité de mémoire et le nombre de paramètres, c'est à peu près tout. Bien sûr, il y a plus à débattre que cela, et si cela sera ou non inclus dans la mémoire. Alors, génère-t-il suffisamment de TOK/s pour être utilisé normalement ? Il y a un autre problème. Cet article parle des bases. LLM a des architectures appelées Dense et MoE, et dans MoE, seuls les paramètres actifs sont réellement calculés, et selon la méthode d'exécution, il existe un moyen de réduire la quantité de mémoire physique en lisant les experts nécessaires du stockage, etc., au lieu de stocker tous les experts en mémoire en permanence. Cependant, la manière dont le modèle est exécuté présente certains aspects particuliers, et le chargement du stockage vers la mémoire peut devenir un goulot d'étranglement. Il existe des histoires comme celle-ci, mais ici nous ignorons ces détails et considérons simplement la capacité lorsque tous les poids du modèle sont stockés en mémoire.
Ainsi, si vous souhaitez exécuter le modèle phare quantifié actuel Q4_0 ou Q8_0, vous aurez besoin d'une machine qui coûte au moins 10 millions de yens. C'est la sensation. D’un autre côté, cela peut fonctionner si vous utilisez un matériel spécial pour obtenir une quantification encore plus grande. Par exemple, certaines personnes exécutent une quantification 2 bits et une quantification 3 bits sur le Mac M4 avec 128 Go de mémoire (épuisée) et DGX Spark (128 Go de mémoire).
https://zenn.dev/tkhr_sait/articles/20260508_try-local-deepseek-v4
https://dev.classmethod.jp/articles/dgx-spark-deepseek-v4-flash-0731-llama-cpp/
En revanche, c'est probablement la limite pour un particulier. C'est une sensation cutanée. Personnellement, je fais attention à la quantification 1 bit. Les modèles célèbres incluent Bonsai et des technologies telles que BitNet, mais le savoir-faire en matière de quantification sur 1 bit n'a pas été rendu public, donc je ne l'ai pas essayé (cela prendrait probablement énormément de temps et réduirait la précision de l'inférence).
Donc, personnellement, si une version quantifiée 1 bit de DeepSeek (environ 35,5 Go) était publiée, je pourrais imaginer un monde dans lequel elle pourrait être exécutée localement sur un GPU grand public, en fonction d'une certaine ingéniosité, mais comme nous ne l'avons pas actuellement, c'est assez difficile. C'est la vérité honnête.
Donc,
**Il n'est pas réaliste d'exécuter le modèle phare avec un LLM local. **
C'est mon impression générale. Si vous voulez vraiment que cela fonctionne, je pense que vous devez faire quelques tests.
Cette fois, j'ai concentré mon exposé sur le LLM local. Quand Kimi-K3 est sorti, j'ai été assez choqué, et la classe Fable a déménagé dans le LLM local ! C'était assez impressionnant, mais je ne peux même pas le déplacer avec le matériel dont je dispose. C'était mon impression honnête. J'ai publié un article sur le LLM local dans le passé, mais cela ne fonctionnait pas très bien à l'époque, j'aimerais donc approfondir moi-même un peu ce sujet. Je le pensais.