autore: @kotauchisunsun
Data di rilascio: 2026/08/12
Gestiamo un sito chiamato AI Coding.Info da luglio 2025.
Questo è un sito che osserva le tendenze di utilizzo relative agli agenti di codifica AI come Claude Code, Codex CLI, Github Copilot e Gemini da un punto fisso dalle informazioni nei repository Github. Per determinare l'utilizzo dell'agente di codifica AI, conduciamo sondaggi giornalieri alle seguenti condizioni.
https://ai-coding.info/reports/articles/20260703
Il tasso di utilizzo del repository dell'agente di codifica AI è stato del 13,0%, con un aumento dello 0,9% rispetto al 12,1% dell'ultima volta.


Tasso di utilizzo dell'agente di codifica AI il 1/8/2026
https://ai-coding.info/?date=2026-08-01#adoption-rate
Tasso di utilizzo dell'agente di codifica AI al 1° luglio 2026
https://ai-coding.info/?date=2026-07-01#adoption-rate
Tendenze nel tasso di utilizzo dell'agente di codifica AI dal 1/7/2026 al 1/8/2026
https://ai-coding.info/?date=2026-04-01&since=2026-07-01&until=2026-08-01#share-trend
La quota per prodotto è la seguente.
| Classifica | Nome del prodotto | Tasso di azione |
|---|---|---|
| 1° posto | Codice CLI | 40,8% |
| 2° posto | Codice Claude | 32,0% |
| 3° posto | Agente copilota | 15,1% |
| 4° posto | Gemini CLI(Antigravità) | 5,3% |
| 5° posto | Cursore | 4,4% |
Mentre la quota di Codex CLI è in aumento, Claude Code rimane la stessa. Anche Copilot Agent e Gemini CLI (Antigravity) mostrano un leggero calo. Il cursore è qualcosa a cui ho prestato un po' di attenzione. Il cursore viene acquisito da SpaceX. C'erano novità.
https://www.nikkei.com/article/DGXZQOGN16BC70W6A610C2000000/
Ci sarà quindi una variazione nella quotazione di questo Cursore? Lo pensavo, ma il mese scorso era del 4,7% e questo mese era del 4,4%, quindi non c'è un grande cambiamento. Osservando il numero di repository menzionati di seguito, al 1 luglio c'erano 85 repository che hanno adottato Cursor e al 1 agosto il numero rimane invariato a 85. Pertanto, per quanto riguarda questo fenomeno, la popolazione di repository che utilizzano AI Coding Agent è complessivamente aumentata, ma il numero di utilizzo di Cursor non è aumentato. Di conseguenza, la quota di mercato complessiva sta diminuendo. Questo è diventato un fenomeno. Tuttavia, a causa delle caratteristiche della ricerca AI Coding.Info, il numero di repository con file di configurazione specifici del cursore (.cursor) non cambierà. Detto questo, Cursor stesso supporta AGENTS.md. AI Coding.Info afferma che il numero di repository con AGENTS.md = il numero di adozione della CLI del Codex, quindi sebbene venga utilizzato il cursore, è possibile che venga conteggiato come CLI del Codex e c'è la possibilità che il numero di utilizzi stia aumentando in una parte invisibile.

Tasso di azione dell'AI Coding Agent in data 01/08/2026
https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#agent-share
Tasso di azione dell'agente di codifica AI il 1/7/2026
https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#agent-share
Il linguaggio di programmazione in cui viene utilizzato maggiormente AI Coding Agent è "TypeScript", il secondo è "Python", il terzo è "Rust", il quarto è "Go" e il quinto è "C#". Il tasso di adozione della codifica AI per TypeScript rimane elevato, mentre la composizione di "Python", "Rust" e "Go" come secondo gruppo e "C#" come terzo gruppo ha rappresentato una tendenza costante negli ultimi anni.

Classifica dell'agente di codifica AI per linguaggio di programmazione il 1/8/2026
https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#language-agent-rank
Classifica dell'agente di codifica AI per linguaggio di programmazione al 1 luglio 2026
https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#language-agent-rank
Il numero di repository era 1.794 al 01/07/2026, ma è aumentato a 1.940 al 01/08/2026 e il numero di repository che utilizzano AI Coding Agent è aumentato di 146.

Modifiche al numero di repository che utilizzano l'agente di codifica AI dal 1/7/2026 al 1/8/2026
https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#time-based-bar-chart
A giugno, la generazione successiva di LLM, Mythos e Fable 5, è stata rilasciata da Claude e ha scioccato il settore con le loro prestazioni. Tuttavia, successivamente, la società cinese Kimi ha rilasciato un modello a peso aperto chiamato Kimi-K3, che è quasi della classe Fable. Questo è diventato un argomento caldo. Anche guardando i parametri di riferimento attuali, i numeri sono vicini.

https://artificialanalysis.ai/#intelligence-category-tabs
Quando l'ho pensato,
**LLM locale non è anche un'opzione per la codifica AI? **
Penso che potresti pensarlo. Ho indagato su quella zona. La tabella seguente elenca i principali modelli LLM a peso aperto dal grafico sopra.
| Nome modello | Nome azienda | Data annuncio | Numero di parametri | Numero di parametri attivi | Lunghezza contesto | Indice di intelligenza |
|---|---|---|---|---|---|---|
| Kimi K3(max) | Kimi(Cina) | 2026/07 | 2.800B | 104B | 1M | 60 |
| GLM-5.2(max) | Z AI(Cina) | 2026/06 | 756B | 40B | 1M | 53 |
| DeepSeek V4 Flash 0731 | DeepSeek(Cina) | 2026/07 | 284B | 13B | 1M | 52 |
| MiMo-V2.5-Pro | Xiaomi(Cina) | 2026/04 | 1.023B | 42B | 1M | 43 |
| Musa Barlume (alto) | Meta(USA) | 2026/08 | 30B | 256K | 35 | |
| Gemma 4 31B (Ragionamento) | Google (Stati Uniti) | 2026/04 | 30.7B | 256K | 30 |
Tuttavia, funzionano davvero sul tuo PC? Non lo capisco davvero. Pertanto, il metodo di determinazione da noi considerato è stato
La memoria VRAM richiesta è
2[GB] per parametro 1[B]
È. Puoi stimare approssimativamente se funzionerà in base alla capacità di memoria VRAM del tuo PC e al numero di parametri del modello che desideri eseguire. Perciò,
** Matematicamente, per eseguire Kimi-K3 sono necessari 5,6 TB (5.600 GB) di memoria. **
Spiegherò il motivo di ciò. Nel modello LLM distribuito standard, i pesi sono espressi utilizzando numeri decimali con una precisione di bf16 o fp16. Questi richiedono 2 byte per ciascun parametro. La notazione che vedi spesso, ad esempio 30[B], è il numero di parametri e B sta per miliardo e rappresenta 10^9. Pertanto, si può vedere che un modello come 30[B] ha dati di peso 30×10^9. E 1[GB]=1*10^9[Byte]. Pensando a questo in questo modo, abbiamo menzionato in precedenza che i pesi standard sono archiviati in 2 byte, quindi sono necessari 2 byte per peso, il che significa 2 [GB] per archiviare 1 [B] parametri in memoria. Questo è il calcolo. Questo è il significato di "2[GB] per parametro 1[B]" menzionato in precedenza. Tuttavia, questa è solo un'approssimazione; questo è il requisito minimo per caricare i pesi in VRAM, e poiché la memoria può essere utilizzata in aggiunta a quella, è strettamente consigliabile non superarla. Questa è la capacità della VRAM.
È qui che entra in gioco il concetto di quantizzazione. Potresti aver visto Q4_0 o Q4_K_M. Questa è una tecnica che comprime il peso nel suo numero di bit. Pertanto, nel caso di Q4_0, grosso modo, la capacità di peso è di 4 bit (la quarta parte di Q4_0). Pertanto, in questo caso, la capacità è di 0,5[GB] per 1[B]. Una tabella di riferimento rapido di questi è simile alla seguente:
| Metodo di quantizzazione | Quantità di memoria richiesta per 1[B] [GB] |
|---|---|
| bf16,fp16(standard) | 2.0 |
| Q8_0 | 1.0 |
| Q4_0 | 0,5 |
Potresti vedere una notazione come Q4_K_M, ma in parole povere è un modello che aumenta la precisione rispetto a Q4_0, ma utilizza una capacità di memoria leggermente maggiore. È bene esserne consapevoli. C'è un altro modo per dirlo, basta guardare la dimensione del file del peso (safetensor o gguf). Se supera la capacità della memoria VRAM, generalmente non funzionerà. Penso che tu possa pensarlo.
Da qui, abbiamo creato una tabella di riferimento rapido della quantità di memoria VRAM, del metodo di quantizzazione e del numero di parametri.
| Capacità di memoria VRAM [GB] | Numero di parametri (bf16,fp16)[B] | Numero di parametri (Q8_0)[B] | Numero di parametri (Q4_0)[B] |
|---|---|---|---|
| 8 | 4 | 8 | 16 |
| 16 | 8 | 16 | 32 |
| 24 | 12 | 24 | 48 |
| 32 | 16 | 32 | 64 |
| 64 | 32 | 64 | 128 |
| 128 | 64 | 128 | 256 |
| 256 | 128 | 256 | 512 |
| 512 | 256 | 512 | 1024 |
| 1024 | 512 | 1024 | 2048 |
| 2048 | 1024 | 2048 | 4096 |
Più o meno in quanto tempo si può fare? Considerando che, se si tratta di un modello con 8GB di VRAM, sarà una RTX 5050, e il prezzo Amazon è di 55.000 yen. Questo potrebbe funzionare se il modello è quantizzato circa 8[B] con Q8_0. Questo è il livello.
Quando la VRAM aumenta a 16 GB, diventa un modello attorno alla RTX 5060 Ti, che costa circa 108.000 yen. A questo punto, con la quantizzazione Q4_0, un LLM di classe 30[B] funzionerà oppure no. Questo è il livello.
Quando la VRAM aumenta a 32 GB, diventa il modello di punta della RTX 5090 e costa 795.000 yen. Quando si arriva a questo, immagino che sia a un livello in cui non puoi farcela a meno che tu non abbia molta determinazione. Credo di si. Questa è la quantizzazione di Q8_0 e se il modello della classe 30[B] funziona o meno. Sarà più o meno allo stesso livello.
Quest'area è la linea superiore del livello del prodotto di consumo. Ora, quando si tratta di livello professionale, l'RTX PRO 6000 Blackwell è dotata di 96 GB di memoria. **Il prezzo è di 2,35 milioni di yen. ** Qui, anche al livello di quantizzazione Q4_0, funziona solo il modello 192[B], quindi il modello di punta non funziona.
E poiché sul server erano presenti dati per l'installazione del cluster GPU, li pubblicherò solo come riferimento. Nel caso di NVIDIA B300, la memoria è di 288 GB e il prezzo è di 8,63 milioni di yen. Se lo è, DeepSeek V4 Flash 0731 con quantizzazione Q8_0 potrebbe funzionare. Q4_0 funzionerà. Se ne hai due (equivalenti a 17 milioni di yen), MiMo-V2.5-Pro con quantizzazione Q4_0 potrebbe funzionare.

https://www.nttpc.co.jp/cgi-bin/gpu/simulation/custom/index.cgi
Pertanto, se si confronta la quantità di memoria e il numero di parametri, questo è tutto. Naturalmente c'è altro da discutere oltre a questo, e se questo sarà incluso o meno nella memoria. Quindi, genera abbastanza TOK/s per essere utilizzato normalmente? C'è un altro problema. Questo articolo parla delle nozioni di base. LLM ha architetture chiamate Dense e MoE e in MoE vengono effettivamente calcolati solo i parametri attivi e, a seconda del metodo di esecuzione, esiste un modo per ridurre la quantità di memoria fisica leggendo gli Expert necessari dall'archivio, ecc., invece di archiviare sempre tutti gli Expert in memoria. Tuttavia, ci sono alcuni aspetti speciali nel modo in cui viene eseguito il modello e il caricamento dallo storage alla memoria può diventare un collo di bottiglia. Ci sono alcune storie come questa, ma qui ignoriamo tali dettagli e consideriamo semplicemente la capacità quando tutti i pesi del modello sono archiviati in memoria.
Quindi, se vuoi utilizzare l'attuale modello di punta quantizzato Q4_0 o Q8_0, avrai bisogno di una macchina che costi almeno 10 milioni di yen. Questa è la sensazione. D'altra parte, potrebbe funzionare se si utilizza hardware speciale per ottenere una quantizzazione ancora maggiore. Ad esempio, ci sono persone che eseguono la quantizzazione a 2 bit e la quantizzazione a 3 bit sul Mac M4 con 128 GB di memoria (esaurito) e DGX Spark (memoria da 128 GB).
https://zenn.dev/tkhr_sait/articles/20260508_try-local-deepseek-v4
https://dev.classmethod.jp/articles/dgx-spark-deepseek-v4-flash-0731-llama-cpp/
D'altra parte, questo è probabilmente il limite per un individuo. È una sensazione sulla pelle. Personalmente, sto prestando attenzione alla quantizzazione a 1 bit. Modelli famosi includono Bonsai e tecnologie come BitNet, ma il know-how per la quantizzazione a 1 bit non è stato reso pubblico, quindi non l'ho provato (probabilmente richiederebbe molto tempo e ridurrebbe la precisione dell'inferenza).
Quindi, personalmente, se venisse rilasciata una versione quantizzata a 1 bit di DeepSeek (circa 35,5 GB), potrei vedere un mondo in cui potrebbe essere eseguita localmente su una GPU di livello consumer, a seconda di un po' di ingegnosità, ma poiché al momento non disponiamo di questa soluzione, è piuttosto difficile. Questa è la verità.
Perciò,
**Non è realistico eseguire il modello di punta con LLM locale. **
Questa è la mia impressione generale. Se vuoi davvero che funzioni, penso che tu debba fare qualche test.
Questa volta ho concentrato il mio discorso sul LLM locale. Quando è uscito Kimi-K3, sono rimasto piuttosto scioccato e la classe di Fable si è trasferita al LLM locale! Era piuttosto impressionante, ma non riesco nemmeno a spostarlo con l'attrezzatura che ho. Questa è stata la mia onesta impressione. In passato ho pubblicato un articolo sul LLM locale, ma all'epoca non funzionava molto bene, quindi vorrei approfondirlo un po' più a fondo. Così ho pensato.