作者: @kotauchisunsun
发售日期: 2026/08/12
自 2025 年 7 月以来,我们一直在运营一个名为 AI Coding.Info 的网站。
这是一个从 Github 存储库中的信息定点观察与 AI Coding Agent(例如 Claude Code、Codex CLI、Github Copilot 和 Gemini)相关的使用趋势的网站。 为了确定 AI Coding Agent 的使用情况,我们在以下条件下进行日常调查。
https://ai-coding.info/reports/articles/20260703
AI Coding Agent 库利用率为 13.0%,较上次的 12.1% 上升 0.9%。


2026年8月1日AI Coding Agent使用率
https://ai-coding.info/?date=2026-08-01#adoption-rate
2026年7月1日AI Coding Agent使用率
https://ai-coding.info/?date=2026-07-01#adoption-rate
2026年7月1日至2026年8月1日AI Coding Agent使用率趋势
https://ai-coding.info/?date=2026-04-01&since=2026-07-01&until=2026-08-01#share-trend
按产品划分的份额如下。
| 排行榜 | 产品名称 | 分享率 |
|---|---|---|
| 第一名 | 法典 CLI | 40.8% |
| 第二名 | 克劳德·代码 | 32.0% |
| 第三名 | 副驾驶代理 | 15.1% |
| 第四名 | Gemini CLI(反重力) | 5.3% |
| 第五名 | 光标 | 4.4% |
虽然 Codex CLI 的份额不断增加,但 Claude Code 的份额保持不变。 Copilot Agent 和 Gemini CLI(反重力)也出现了小幅下降。光标是我一直关注的一个东西。 Cursor 被 SpaceX 收购。有消息。
https://www.nikkei.com/article/DGXZQOGN16BC70W6A610C2000000/
那么这个Cursor的份额会不会有变化呢?我是这么认为的,但是上个月是4.7%,这个月是4.4%,所以变化不大。从下面提到的仓库数量来看,7月1日,采用Cursor的仓库数量为85个,截至8月1日,数量保持在85个不变。因此,就这一现象而言,使用AI Coding Agent的仓库数量总体有所增加,但Cursor使用数量并没有增加。因此,整体市场份额正在下降。这已经成为一种现象。但由于AI Coding.Info研究的特点,具有Cursor特定配置文件(.cursor)的存储库数量不会改变。话虽这么说,Cursor 本身支持 AGENTS.md。 AI Coding.Info 指出,带有 AGENTS.md 的存储库数量 = Codex CLI 采用数量,因此虽然使用了 Cursor,但有可能将其算作 Codex CLI,并且使用数量有可能在无形的部分中增加。

2026 年 8 月 1 日 AI Coding Agent 份额
https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#agent-share
2026年7月1日AI Coding Agent占有率
https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#agent-share
AI Coding Agent 使用最多的编程语言是“TypeScript”,第二位是“Python”,第三位是“Rust”,第四位是“Go”,第五位是“C#”。 TypeScript 的 AI 编码采用率仍然很高,而“Python”、“Rust”和“Go”作为第二组、“C#”作为第三组的构成是近年来的一致趋势。

2026年8月1日AI Coding Agent按编程语言排名
https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#language-agent-rank
2026年7月1日AI Coding Agent按编程语言排名
https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#language-agent-rank
截至2026/07/01,存储库数量为1,794个,但截至2026/08/01已增加至1,940个,使用AI Coding Agent的存储库数量增加了146个。

2026年7月1日至2026年8月1日使用AI Coding Agent的存储库数量变化
https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#time-based-bar-chart
6月,Claude发布了下一代LLM《Mythos》和《Fable 5》,其表现震惊了业界。不过,在此之后,中国的Kimi公司发布了一款名为Kimi-K3的开放重量型号,几乎是寓言级别的。这成为了一个热门话题。即使看看实际的基准,数字也很接近。

https://artificialanalysis.ai/#intelligence-category-tabs
当我这么想的时候,
**本地法学硕士不也是人工智能编码的一个选择吗? **
我想你可能会这么想。我调查了那个地区。下表列出了上图中主要的开放权重法学硕士模型。
| 型号名称 | 公司名称 | 公告日期 | 参数数量 | 活动参数数量 | 上下文长度 | 智力指数 |
|---|---|---|---|---|---|---|
| 基米K3(max) | 基米(中国) | 2026/07 | 2,800B | 2,800B 104B | 1M | 60 |
| GLM-5.2(最大) | Z AI(中国) | 2026 年 6 月 | 756B | 756B 40B | 1M | 53 |
| DeepSeek V4 Flash 0731 | DeepSeek(中国) | 2026年7月 | 284B | 13B | 1M | 52 |
| MiMo-V2.5-Pro | 小米(中国) | 2026/04 | 1,023B | 1,023B 42B | 1M | 43 |
| 缪斯微光(高) | 梅塔(美国) | 2026/08 | 30B | 30B | 256K | 35 |
| 杰玛 4 31B(推理) | 谷歌(美国) | 2026/04 | 30.7B | 30.7B | 256K | 30 |
然而,这些真的可以在你的电脑上运行吗?我不太明白。因此,我们考虑的判定方法是
所需的 VRAM 内存是
每个参数 2[GB] 1[B]
是。您可以根据您的 PC 的 VRAM 内存容量和您要运行的模型的参数数量来粗略估计它是否可以工作。 所以,
**从数学上讲,运行 Kimi-K3 需要 5.6TB (5,600GB) 内存。 **
我将解释其原因。 在标准分布式LLM模型中,权重使用十进制数表示,精度为bf16或fp16。每个参数需要 2 个字节。 你经常看到的符号,比如30[B],就是参数的个数,B代表十亿,代表10^9。因此,可以看出,像30[B]这样的模型有30×10^9的权重数据。 1[GB]=1*10^9[字节]。这样想,我们前面提到标准权重以 2 字节存储,因此每个权重需要 2 字节,这意味着 2 [GB] 可以在内存中存储 1 [B] 个参数。这就是计算。这就是前面提到的“每个参数 1[B] 2[GB]”的含义。 然而,这只是一个近似值;这是将权重加载到 VRAM 的最低要求,并且由于除此之外还可能使用内存,因此严格建议不要超过它。这是 VRAM 容量。
这就是量化概念发挥作用的地方。您可能见过 Q4_0 或 Q4_K_M。这是一种将权重压缩为其位数的技术。因此,在Q4_0的情况下,粗略地说,权重容量为4位(Q4_0的4部分)。因此,在这种情况下,容量为每 1[B] 0.5[GB]。这些的快速参考表如下所示:
| 量化方法 | 每 1[B] [GB] 所需的内存量 |
|---|---|
| bf16,fp16(标准) | 2.0 |
| Q8_0 | 1.0 |
| Q4_0 | 0.5 |
您可能会看到诸如 Q4_K_M 之类的符号,但粗略地说,它是一个与 Q4_0 相比提高了精度的模型,但使用的内存容量略多。意识到这一点是件好事。 还有另一种方法可以判断,只需查看权重文件(safetensor 或 gguf)的文件大小即可。如果超过了 VRAM 内存容量,通常将无法工作。我想你可以这么想。
从这里,我们创建了 VRAM 内存量、量化方法和参数数量的快速参考表。
| VRAM 内存容量 [GB] | 参数数量 (bf16,fp16)[B] | 参数数量 (Q8_0)[B] | 参数数量 (Q4_0)[B] |
|---|---|---|---|
| 8 | 4 | 8 | 16 |
| 16 | 16 8 | 16 | 16 32 |
| 24 | 12 | 12 24 | 48 |
| 32 | 32 16 | 16 32 | 32 64 |
| 64 | 64 32 | 32 64 | 64 128 |
| 128 | 128 64 | 64 128 | 128 256 |
| 256 | 256 128 | 128 256 | 256 512 |
| 512 | 512 256 | 256 512 | 512 1024 |
| 1024 | 512 | 512 1024 | 1024 2048 |
| 2048 | 1024 | 1024 2048 | 2048 4096 |
大约需要多长时间可以完成?考虑到,如果是8GB VRAM的型号,那就是RTX 5050,亚马逊售价为55,000日元。如果模型使用 Q8_0 量化大约 8[B],则这可能有效。就是这个水平。
当VRAM增加到16GB时,它成为围绕RTX 5060 Ti的型号,售价约为108,000日元。此时,通过 Q4_0 量化,30[B] 级 LLM 是否有效。就是这个水平。
当VRAM增加到32GB时,它成为RTX 5090旗舰型号,售价795,000日元。说到这,我想除非你有很大的决心,否则你就无法做到这一点。我想是的。这是Q8_0的量化,以及30[B]类模型是否有效。这将是大约相同的水平。
该区域是消费产品级别的顶线。现在,说到专业级,RTX PRO 6000 Blackwell 配备了 96GB 内存。 **价格为235万日元。 ** 这里,即使在 Q4_0 量化级别,也只有 192[B] 模型有效,因此旗舰模型不起作用。
而且由于服务器上有安装GPU集群的数据,所以我贴出来仅供参考。 以NVIDIA B300为例,内存为288GB,价格为863万日元。如果是,则具有 Q8_0 量化功能的 DeepSeek V4 Flash 0731 可能会起作用。 Q4_0 可以工作。如果你有两个(相当于1700万日元),带有Q4_0量化的MiMo-V2.5-Pro可能会起作用。

https://www.nttpc.co.jp/cgi-bin/gpu/simulation/custom/index.cgi
因此,如果比较内存量和参数数量的话,也就这个了。当然,值得争论的还不止于此,以及这是否会被包含在内存中。那么,它生成的TOK/s是否足够正常使用呢?还有一个问题。 本文讨论的是非常基础的知识。 LLM 具有称为 Dense 和 MoE 的架构,在 MoE 中,实际上只计算活动参数,并且根据执行方法,有一种方法可以通过从存储等中读出必要的 Expert 来减少物理内存量,而不是始终将所有 Expert 存储在内存中。然而,模型的执行方式有一些特殊的方面,从存储加载到内存可能会成为瓶颈。有一些这样的故事,但这里我们忽略这样的细节,简单地考虑模型所有权重都存储在内存中时的容量。
所以,如果你想运行目前的Q4_0或Q8_0量化旗舰机型,你需要一台至少1000万日元的机器。这就是它的感觉。 另一方面,如果您使用特殊硬件来实现更大的量化,它可能会起作用。例如,有人在具有 128GB 内存(已售完)的 M4 Mac 和 DGX Spark(128GB 内存)上运行 2 位量化和 3 位量化。
https://zenn.dev/tkhr_sait/articles/20260508_try-local-deepseek-v4
https://dev.classmethod.jp/articles/dgx-spark-deepseek-v4-flash-0731-llama-cpp/
另一方面,这可能是个人的极限。这是一种皮肤的感觉。 就我个人而言,我关注 1 位量化。著名的模型有Bonsai和BitNet等技术,但1位量化的技术尚未公开,所以我没有尝试过(这可能会花费大量时间并降低推理精度)。
因此,就个人而言,如果 DeepSeek 的 1 位量化版本(大约 35.5 GB)发布,我可以看到一个可以在消费级 GPU 上本地运行的世界,这取决于一些独创性,但由于我们目前还没有,所以这是相当困难的。这是诚实的事实。
所以,
**用本地法学硕士来运行旗舰模型是不现实的。 **
这是我的总体印象。如果你真的想让它工作,我认为你需要做一些测试。
这次我的演讲重点是当地的LLM。当Kimi-K3出来的时候,我相当震惊,寓言类搬到了当地的LLM!这是相当令人印象深刻的,但我什至无法以我拥有的设备移动它。这是我的真实印象。我以前发过一篇关于本地LLM的文章,但当时效果不是很好,所以我想自己深入挖掘一下。我是这么想的。