tác giả: @kotauchisunsun
Ngày phát hành: 2026/08/12
Chúng tôi đã vận hành một trang web có tên AI Coding.Info kể từ tháng 7 năm 2025.
Đây là trang web quan sát xu hướng sử dụng liên quan đến AI Coding Agent như Claude Code, Codex CLI, Github Copilot và Gemini từ một điểm cố định từ thông tin trong kho Github. Để xác định việc sử dụng Tác nhân mã hóa AI, chúng tôi tiến hành khảo sát hàng ngày theo các điều kiện sau.
https://ai-coding.info/reports/articles/20260703
Tỷ lệ sử dụng kho lưu trữ của AI Coding Agent là 13,0%, tăng 0,9% so với 12,1% lần trước.


Tỷ lệ sử dụng Tác nhân mã hóa AI vào ngày 1/8/2026
https://ai-coding.info/?date=2026-08-01#adoption-rate
Tỷ lệ sử dụng AI Coding Agent vào ngày 1 tháng 7 năm 2026
https://ai-coding.info/?date=2026-07-01#adoption-rate
Xu hướng về tỷ lệ sử dụng Tác nhân mã hóa AI từ ngày 1/7/2026 đến ngày 1/8/2026
https://ai-coding.info/?date=2026-04-01&since=2026-07-01&until=2026-08-01#share-trend
Tỷ lệ chia theo sản phẩm như sau.
| Xếp hạng | Tên sản phẩm | Tỷ lệ chia sẻ |
|---|---|---|
| Vị trí số 1 | Codex CLI | 40,8% |
| Vị trí thứ 2 | Mã Claude | 32,0% |
| Vị trí thứ 3 | Đại lý phi công phụ | 15,1% |
| Vị trí thứ 4 | Song Tử CLI(Phản trọng lực) | 5,3% |
| Vị trí thứ 5 | Con trỏ | 4,4% |
Trong khi thị phần của Codex CLI ngày càng tăng thì Claude Code vẫn giữ nguyên. Copilot Agent và Gemini CLI (AntiGravity) cũng đang có dấu hiệu sụt giảm nhẹ. Con trỏ là thứ mà tôi đã chú ý một chút. Con trỏ được SpaceX mua lại. Có tin tức.
https://www.nikkei.com/article/DGXZQOGN16BC70W6A610C2000000/
Vì vậy, liệu tỷ lệ chia sẻ của Con trỏ này có thay đổi không? Tôi cũng nghĩ vậy, nhưng tháng trước là 4,7% và tháng này là 4,4%, nên không có nhiều thay đổi. Nhìn vào số lượng kho được đề cập dưới đây, vào ngày 1 tháng 7, đã có 85 kho lưu trữ sử dụng Con trỏ và tính đến ngày 1 tháng 8, con số này không thay đổi ở mức 85. Do đó, liên quan đến hiện tượng này, tổng số kho sử dụng AI Coding Agent đã tăng lên, nhưng số lượng sử dụng Con trỏ không tăng. Kết quả là thị phần chung đang giảm dần. Điều này đã trở thành một hiện tượng. Tuy nhiên, do đặc thù của nghiên cứu AI Coding.Info nên số lượng kho chứa file cấu hình dành riêng cho Cursor (.cursor) sẽ không thay đổi. Như đã nói, bản thân Cursor hỗ trợ AGENTS.md. AI Coding.Info tuyên bố rằng số lượng kho lưu trữ với AGENTS.md = số lượng sử dụng Codex CLI, do đó, mặc dù Con trỏ được sử dụng nhưng có thể nó đang được tính là Codex CLI và có khả năng số lượng sử dụng đang tăng lên ở một phần vô hình.

Tỷ lệ chia sẻ AI Coding Agent ngày 1/8/2026
https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#agent-share
Tỷ lệ chia sẻ Đại lý mã hóa AI vào ngày 1/7/2026
https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#agent-share
Ngôn ngữ lập trình mà AI Coding Agent được sử dụng nhiều nhất là "TypeScript", thứ hai là "Python", thứ ba là "Rust", thứ tư là "Go" và thứ năm là "C#". Tỷ lệ áp dụng Mã hóa AI cho TypeScript vẫn ở mức cao, trong khi thành phần của Python'', Rust'' và Go'' là nhóm thứ hai và C#'' là nhóm thứ ba đã là một xu hướng nhất quán trong những năm gần đây.

Xếp hạng AI Coding Agent theo ngôn ngữ lập trình vào ngày 1/8/2026
https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#language-agent-rank
Xếp hạng AI Coding Agent theo ngôn ngữ lập trình vào ngày 1 tháng 7 năm 2026
https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#language-agent-rank
Số lượng kho lưu trữ là 1.794 vào ngày 01/07/2026 nhưng đã tăng lên 1.940 vào ngày 01/08/2026 và số lượng kho lưu trữ sử dụng Tác nhân mã hóa AI đã tăng thêm 146.

Thay đổi số lượng kho sử dụng AI Coding Agent từ 2026/7/1 đến 2026/8/1
https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#time-based-bar-chart
Vào tháng 6, thế hệ tiếp theo của LLM, Mythos và Fable 5, đã được Claude phát hành và gây chấn động toàn ngành với hiệu suất của chúng. Tuy nhiên, sau đó, công ty Kimi của Trung Quốc đã cho ra mắt mẫu xe có trọng lượng mở mang tên Kimi-K3, gần như thuộc đẳng cấp Fable. Điều đó đã trở thành một chủ đề nóng. Ngay cả khi nhìn vào điểm chuẩn thực tế, các con số cũng rất gần.

https://artificialanalysis.ai/#intelligence-category-tabs
Khi tôi nghĩ vậy,
** LLM cục bộ không phải cũng là một tùy chọn cho Mã hóa AI sao? **
Tôi nghĩ bạn có thể nghĩ như vậy. Tôi đã điều tra khu vực đó. Bảng bên dưới liệt kê các mô hình LLM trọng lượng mở chính từ biểu đồ trên.
| Tên mẫu | Tên công ty | Ngày thông báo | Số tham số | Số tham số hoạt động | Độ dài bối cảnh | Chỉ số thông minh |
|---|---|---|---|---|---|---|
| Kimi K3(max) | Kimi(Trung Quốc) | 2026/07 | 2.800B | 104B | 1 triệu | 60 |
| GLM-5.2(tối đa) | Z AI(Trung Quốc) | 06/2026 | 756B | 40B | 1 triệu | 53 |
| DeepSeek V4 Flash 0731 | DeepSeek(Trung Quốc) | 07/2026 | 284B | 13B | 1 triệu | 52 |
| MiMo-V2.5-Pro | Xiaomi(Trung Quốc) | 2026/04 | 1.023B | 42B | 1 triệu | 43 |
| Muse Glimmer (cao) | Meta(Mỹ) | 2026/08 | 30B | 256K | 35 | |
| Gemma 4 31B (Lý luận) | Google (Mỹ) | 2026/04 | 30,7B | 256K | 30 |
Tuy nhiên, những thứ này có thực sự hoạt động trên PC của bạn không? Tôi thực sự không hiểu điều đó. Vì vậy, phương pháp xác định mà chúng tôi xem xét là
Bộ nhớ VRAM cần thiết là
2[GB] cho mỗi tham số 1[B]
là. Bạn có thể ước tính gần đúng liệu nó có hoạt động hay không dựa trên dung lượng bộ nhớ VRAM của PC và số lượng thông số của model bạn muốn chạy. Vì vậy,
**Về mặt toán học, cần có bộ nhớ 5,6TB (5.600GB) để chạy Kimi-K3. **
Tôi sẽ giải thích lý do cho việc này. Trong mô hình LLM phân bố tiêu chuẩn, trọng số được biểu thị bằng số thập phân với độ chính xác bf16 hoặc fp16. Chúng yêu cầu 2 byte cho mỗi tham số. Ký hiệu bạn thường thấy, chẳng hạn như 30[B], là số lượng tham số, còn B là viết tắt của Billion và đại diện cho 10^9. Do đó, có thể thấy rằng một mô hình như 30[B] có dữ liệu trọng lượng 30×10^9. Và 1[GB]=1*10^9[Byte]. Nghĩ theo cách đó, chúng tôi đã đề cập trước đó rằng trọng lượng tiêu chuẩn được lưu trữ trong 2 Byte, do đó, cần 2 Byte cho mỗi trọng số, nghĩa là 2 [GB] để lưu trữ 1 tham số [B] trong bộ nhớ. Đây là tính toán. Đây là ý nghĩa của "2[GB] cho mỗi tham số 1[B]" đã đề cập trước đó. Tuy nhiên, đây chỉ là con số gần đúng; đây là yêu cầu tối thiểu để tải các trọng số vào VRAM và vì bộ nhớ có thể được sử dụng thêm vào đó nên bạn không nên vượt quá nó. Đây là dung lượng VRAM.
Đây là lúc khái niệm lượng tử hóa phát huy tác dụng. Bạn có thể đã thấy Q4_0 hoặc Q4_K_M. Đây là một kỹ thuật nén trọng lượng theo số bit của nó. Do đó, trong trường hợp Q4_0, nói một cách đại khái, dung lượng trọng lượng là 4 bit (phần 4 của Q4_0). Do đó, trong trường hợp này, dung lượng là 0,5[GB] trên 1[B]. Một bảng tham khảo nhanh về những thứ này trông như thế này:
| Phương pháp lượng tử hóa | Lượng bộ nhớ cần thiết trên 1[B] [GB] |
|---|---|
| bf16,fp16(tiêu chuẩn) | 2.0 |
| Q8_0 | 1.0 |
| Q4_0 | 0,5 |
Bạn có thể thấy một ký hiệu như Q4_K_M, nhưng nói một cách đại khái, đây là mô hình tăng độ chính xác so với Q4_0, nhưng sử dụng dung lượng bộ nhớ nhiều hơn một chút. Thật tốt khi nhận thức được điều này. Có một cách khác để nhận biết, chỉ cần nhìn vào kích thước tệp của tệp trọng lượng (safetensor hoặc gguf). Nếu con số này vượt quá dung lượng bộ nhớ VRAM thì nhìn chung nó sẽ không hoạt động. Tôi nghĩ bạn có thể nghĩ như vậy.
Từ đây, chúng tôi đã tạo một bảng tham chiếu nhanh về dung lượng bộ nhớ VRAM, phương pháp lượng tử hóa và số lượng tham số.
| Dung lượng bộ nhớ VRAM [GB] | Số tham số (bf16,fp16)[B] | Số lượng tham số (Q8_0)[B] | Số lượng tham số (Q4_0)[B] |
|---|---|---|---|
| 8 | 4 | 8 | 16 |
| 16 | 8 | 16 | 32 |
| 24 | 12 | 24 | 48 |
| 32 | 16 | 32 | 64 |
| 64 | 32 | 64 | 128 |
| 128 | 64 | 128 | 256 |
| 256 | 128 | 256 | 512 |
| 512 | 256 | 512 | 1024 |
| 1024 | 512 | 1024 | 2048 |
| 2048 | 1024 | 2048 | 4096 |
Khoảng bao lâu thì có thể thực hiện được? Xét rằng, nếu đó là model có 8GB VRAM thì đó sẽ là RTX 5050 và giá trên Amazon là 55.000 yên. Điều này có thể hoạt động nếu mô hình được lượng tử hóa khoảng 8[B] bằng Q8_0. Đó là trình độ.
Khi VRAM tăng lên 16GB, nó sẽ trở thành mẫu tương đương với RTX 5060 Ti, có giá khoảng 108.000 yên. Tại thời điểm này, với lượng tử hóa Q4_0, LLM lớp 30 [B] có hoạt động hay không. Đó là trình độ.
Khi VRAM tăng lên 32GB, nó sẽ trở thành model hàng đầu của RTX 5090 và có giá 795.000 yên. Khi nói đến việc này, tôi đoán nó đã ở mức độ mà bạn không thể làm được trừ khi bạn có nhiều quyết tâm. Tôi nghĩ vậy. Đây là lượng tử hóa của Q8_0 và liệu mô hình lớp 30[B] có hoạt động hay không. Nó sẽ có cùng mức độ.
Khu vực này là dòng sản phẩm tiêu dùng hàng đầu. Giờ đây, khi nói đến mức độ chuyên nghiệp, RTX PRO 6000 Blackwell được trang bị bộ nhớ 96GB. **Giá là 2,35 triệu yên. ** Ở đây, ngay cả ở mức lượng tử hóa Q4_0, chỉ có mô hình 192[B] hoạt động, vì vậy mô hình hàng đầu không hoạt động.
Và do đã có data cho cluster GPU cài lên server nên mình đăng lên chỉ để tham khảo. Trong trường hợp NVIDIA B300, bộ nhớ là 288GB và giá là 8,63 triệu yên. Nếu là một, DeepSeek V4 Flash 0731 với lượng tử hóa Q8_0 có thể hoạt động. Q4_0 sẽ hoạt động. Nếu bạn có hai chiếc (tương đương 17 triệu yên), MiMo-V2.5-Pro với lượng tử hóa Q4_0 có thể hoạt động.

https://www.nttpc.co.jp/cgi-bin/gpu/simulation/custom/index.cgi
Do đó, nếu bạn so sánh dung lượng bộ nhớ và số lượng tham số thì đây chính là điều đó. Tất nhiên, còn nhiều điều phải tranh luận hơn điều này và liệu điều này có được đưa vào bộ nhớ hay không. Vậy nó có tạo ra đủ TOK/s để sử dụng bình thường không? Có một vấn đề khác. Bài viết này nói về những điều rất cơ bản. LLM có các kiến trúc được gọi là Dense và MoE, và trong MoE, chỉ các tham số hoạt động thực sự được tính toán và tùy thuộc vào phương pháp thực thi, có một cách để giảm dung lượng bộ nhớ vật lý bằng cách đọc các Chuyên gia cần thiết từ bộ lưu trữ, v.v., thay vì lưu trữ tất cả các Chuyên gia trong bộ nhớ mọi lúc. Tuy nhiên, có một số khía cạnh đặc biệt trong cách thực thi mô hình và việc tải từ bộ lưu trữ vào bộ nhớ có thể trở thành nút cổ chai. Có một số câu chuyện như thế này, nhưng ở đây chúng tôi bỏ qua những chi tiết đó và chỉ xem xét khả năng khi tất cả trọng số của mô hình được lưu trữ trong bộ nhớ.
Vì vậy, nếu bạn muốn chạy mẫu hàng đầu lượng tử hóa Q4_0 hoặc Q8_0 hiện tại, bạn sẽ cần một chiếc máy có giá ít nhất 10 triệu yên. Đó là cảm giác của nó. Mặt khác, nó có thể hoạt động nếu bạn sử dụng phần cứng đặc biệt để đạt được lượng tử hóa lớn hơn nữa. Ví dụ: có người đang chạy lượng tử hóa 2 bit và lượng tử hóa 3 bit trên máy Mac M4 với bộ nhớ 128GB (đã bán hết) và DGX Spark (bộ nhớ 128GB).
https://zenn.dev/tkhr_sait/articles/20260508_try-local-deepseek-v4
https://dev.classmethod.jp/articles/dgx-spark-deepseek-v4-flash-0731-llama-cpp/
Mặt khác, đây có lẽ là giới hạn đối với một cá nhân. Đó là một cảm giác về da. Cá nhân tôi đang chú ý đến lượng tử hóa 1 bit. Các mô hình nổi tiếng bao gồm Bonsai và công nghệ như BitNet, nhưng bí quyết lượng tử hóa 1 bit vẫn chưa được công khai nên tôi chưa thử (có thể sẽ tốn rất nhiều thời gian và làm giảm độ chính xác của suy luận).
Vì vậy, về mặt cá nhân, nếu phiên bản DeepSeek lượng tử hóa 1 bit (khoảng 35,5 GB) được phát hành, tôi có thể thấy một thế giới trong đó nó có thể chạy cục bộ trên GPU cấp độ người tiêu dùng, tùy thuộc vào một số sự khéo léo, nhưng vì chúng tôi hiện không có điều đó nên khá khó khăn. Đó là sự thật trung thực.
Vì thế,
**Việc chạy mô hình hàng đầu với LLM địa phương là không thực tế. **
Đó là ấn tượng chung của tôi. Nếu bạn thực sự muốn nó hoạt động, tôi nghĩ bạn cần phải thực hiện một số thử nghiệm.
Lần này, tôi tập trung nói chuyện về LLM địa phương. Khi Kimi-K3 ra mắt, tôi khá sốc và lớp Fable đã chuyển đến LLM địa phương! Nó khá ấn tượng nhưng tôi thậm chí không thể di chuyển nó bằng thiết bị tôi có. Đó là ấn tượng trung thực của tôi. Trước đây tôi đã đăng một bài viết về LLM địa phương, nhưng nó không hoạt động tốt vào thời điểm đó, vì vậy tôi muốn tự mình tìm hiểu sâu hơn một chút. Tôi đã nghĩ vậy.