AI Coding.Info
RepositoriesREPORTS
ABOUT

È possibile utilizzare il LLM locale per la codifica AI? ~Riepilogo delle tendenze della codifica AI nel luglio 2026 viste attraverso i dati~

autore: @kotauchisunsun

Data di rilascio: 2026/08/12

Tendenze degli agenti di codifica AI nell'agosto 2026

Gestiamo un sito chiamato AI Coding.Info da luglio 2025.

https://ai-coding.info/

https://x.com/AICodingInfo

Questo è un sito che osserva le tendenze di utilizzo relative agli agenti di codifica AI come Claude Code, Codex CLI, Github Copilot e Gemini da un punto fisso dalle informazioni nei repository Github. Per determinare l'utilizzo dell'agente di codifica AI, conduciamo sondaggi giornalieri alle seguenti condizioni.

Tendenze del mese scorso

https://ai-coding.info/reports/articles/20260703

Il tasso di utilizzo dell'agente di codifica AI è del 13,0%

Il tasso di utilizzo del repository dell'agente di codifica AI è stato del 13,0%, con un aumento dello 0,9% rispetto al 12,1% dell'ultima volta.

image.png

image.png

Tasso di utilizzo dell'agente di codifica AI il 1/8/2026

https://ai-coding.info/?date=2026-08-01#adoption-rate

Tasso di utilizzo dell'agente di codifica AI al 1° luglio 2026

https://ai-coding.info/?date=2026-07-01#adoption-rate

Tendenze nel tasso di utilizzo dell'agente di codifica AI dal 1/7/2026 al 1/8/2026

https://ai-coding.info/?date=2026-04-01&since=2026-07-01&until=2026-08-01#share-trend

Quota di agente di codifica AI per prodotto

La quota per prodotto è la seguente.

ClassificaNome del prodottoTasso di azione
1° postoCodice CLI40,8%
2° postoCodice Claude32,0%
3° postoAgente copilota15,1%
4° postoGemini CLI(Antigravità)5,3%
5° postoCursore4,4%

Mentre la quota di Codex CLI è in aumento, Claude Code rimane la stessa. Anche Copilot Agent e Gemini CLI (Antigravity) mostrano un leggero calo. Il cursore è qualcosa a cui ho prestato un po' di attenzione. Il cursore viene acquisito da SpaceX. C'erano novità.

https://www.nikkei.com/article/DGXZQOGN16BC70W6A610C2000000/

Ci sarà quindi una variazione nella quotazione di questo Cursore? Lo pensavo, ma il mese scorso era del 4,7% e questo mese era del 4,4%, quindi non c'è un grande cambiamento. Osservando il numero di repository menzionati di seguito, al 1 luglio c'erano 85 repository che hanno adottato Cursor e al 1 agosto il numero rimane invariato a 85. Pertanto, per quanto riguarda questo fenomeno, la popolazione di repository che utilizzano AI Coding Agent è complessivamente aumentata, ma il numero di utilizzo di Cursor non è aumentato. Di conseguenza, la quota di mercato complessiva sta diminuendo. Questo è diventato un fenomeno. Tuttavia, a causa delle caratteristiche della ricerca AI Coding.Info, il numero di repository con file di configurazione specifici del cursore (.cursor) non cambierà. Detto questo, Cursor stesso supporta AGENTS.md. AI Coding.Info afferma che il numero di repository con AGENTS.md = il numero di adozione della CLI del Codex, quindi sebbene venga utilizzato il cursore, è possibile che venga conteggiato come CLI del Codex e c'è la possibilità che il numero di utilizzi stia aumentando in una parte invisibile.

image.png

Tasso di azione dell'AI Coding Agent in data 01/08/2026

https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#agent-share

Tasso di azione dell'agente di codifica AI il 1/7/2026

https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#agent-share

Stato di utilizzo dell'agente di codifica AI in base al linguaggio di programmazione

Il linguaggio di programmazione in cui viene utilizzato maggiormente AI Coding Agent è "TypeScript", il secondo è "Python", il terzo è "Rust", il quarto è "Go" e il quinto è "C#". Il tasso di adozione della codifica AI per TypeScript rimane elevato, mentre la composizione di "Python", "Rust" e "Go" come secondo gruppo e "C#" come terzo gruppo ha rappresentato una tendenza costante negli ultimi anni.

image.png

Classifica dell'agente di codifica AI per linguaggio di programmazione il 1/8/2026

https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#language-agent-rank

Classifica dell'agente di codifica AI per linguaggio di programmazione al 1 luglio 2026

https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#language-agent-rank

Tendenze mensili nel numero di repository utilizzati da AI Coding Agent

Il numero di repository era 1.794 al 01/07/2026, ma è aumentato a 1.940 al 01/08/2026 e il numero di repository che utilizzano AI Coding Agent è aumentato di 146.

image.png

Modifiche al numero di repository che utilizzano l'agente di codifica AI dal 1/7/2026 al 1/8/2026

https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#time-based-bar-chart

È possibile utilizzare il LLM locale per la codifica AI?

A giugno, la generazione successiva di LLM, Mythos e Fable 5, è stata rilasciata da Claude e ha scioccato il settore con le loro prestazioni. Tuttavia, successivamente, la società cinese Kimi ha rilasciato un modello a peso aperto chiamato Kimi-K3, che è quasi della classe Fable. Questo è diventato un argomento caldo. Anche guardando i parametri di riferimento attuali, i numeri sono vicini.

image.png

https://artificialanalysis.ai/#intelligence-category-tabs

Quando l'ho pensato,

**LLM locale non è anche un'opzione per la codifica AI? **

Penso che potresti pensarlo. Ho indagato su quella zona. La tabella seguente elenca i principali modelli LLM a peso aperto dal grafico sopra.

Nome modelloNome aziendaData annuncioNumero di parametriNumero di parametri attiviLunghezza contestoIndice di intelligenza
Kimi K3(max)Kimi(Cina)2026/072.800B104B1M60
GLM-5.2(max)Z AI(Cina)2026/06756B40B1M53
DeepSeek V4 Flash 0731DeepSeek(Cina)2026/07284B13B1M52
MiMo-V2.5-ProXiaomi(Cina)2026/041.023B42B1M43
Musa Barlume (alto)Meta(USA)2026/0830B256K35
Gemma 4 31B (Ragionamento)Google (Stati Uniti)2026/0430.7B256K30

Tuttavia, funzionano davvero sul tuo PC? Non lo capisco davvero. Pertanto, il metodo di determinazione da noi considerato è stato

La memoria VRAM richiesta è

2[GB] per parametro 1[B]

È. Puoi stimare approssimativamente se funzionerà in base alla capacità di memoria VRAM del tuo PC e al numero di parametri del modello che desideri eseguire. Perciò,

** Matematicamente, per eseguire Kimi-K3 sono necessari 5,6 TB (5.600 GB) di memoria. **

Spiegherò il motivo di ciò. Nel modello LLM distribuito standard, i pesi sono espressi utilizzando numeri decimali con una precisione di bf16 o fp16. Questi richiedono 2 byte per ciascun parametro. La notazione che vedi spesso, ad esempio 30[B], è il numero di parametri e B sta per miliardo e rappresenta 10^9. Pertanto, si può vedere che un modello come 30[B] ha dati di peso 30×10^9. E 1[GB]=1*10^9[Byte]. Pensando a questo in questo modo, abbiamo menzionato in precedenza che i pesi standard sono archiviati in 2 byte, quindi sono necessari 2 byte per peso, il che significa 2 [GB] per archiviare 1 [B] parametri in memoria. Questo è il calcolo. Questo è il significato di "2[GB] per parametro 1[B]" menzionato in precedenza. Tuttavia, questa è solo un'approssimazione; questo è il requisito minimo per caricare i pesi in VRAM, e poiché la memoria può essere utilizzata in aggiunta a quella, è strettamente consigliabile non superarla. Questa è la capacità della VRAM.

È qui che entra in gioco il concetto di quantizzazione. Potresti aver visto Q4_0 o Q4_K_M. Questa è una tecnica che comprime il peso nel suo numero di bit. Pertanto, nel caso di Q4_0, grosso modo, la capacità di peso è di 4 bit (la quarta parte di Q4_0). Pertanto, in questo caso, la capacità è di 0,5[GB] per 1[B]. Una tabella di riferimento rapido di questi è simile alla seguente:

Metodo di quantizzazioneQuantità di memoria richiesta per 1[B] [GB]
bf16,fp16(standard)2.0
Q8_01.0
Q4_00,5

Potresti vedere una notazione come Q4_K_M, ma in parole povere è un modello che aumenta la precisione rispetto a Q4_0, ma utilizza una capacità di memoria leggermente maggiore. È bene esserne consapevoli. C'è un altro modo per dirlo, basta guardare la dimensione del file del peso (safetensor o gguf). Se supera la capacità della memoria VRAM, generalmente non funzionerà. Penso che tu possa pensarlo.

Da qui, abbiamo creato una tabella di riferimento rapido della quantità di memoria VRAM, del metodo di quantizzazione e del numero di parametri.

Capacità di memoria VRAM [GB]Numero di parametri (bf16,fp16)[B]Numero di parametri (Q8_0)[B]Numero di parametri (Q4_0)[B]
84816
1681632
24122448
32163264
643264128
12864128256
256128256512
5122565121024
102451210242048
2048102420484096

Più o meno in quanto tempo si può fare? Considerando che, se si tratta di un modello con 8GB di VRAM, sarà una RTX 5050, e il prezzo Amazon è di 55.000 yen. Questo potrebbe funzionare se il modello è quantizzato circa 8[B] con Q8_0. Questo è il livello.

https://link.amazon/B0brulI9R

Quando la VRAM aumenta a 16 GB, diventa un modello attorno alla RTX 5060 Ti, che costa circa 108.000 yen. A questo punto, con la quantizzazione Q4_0, un LLM di classe 30[B] funzionerà oppure no. Questo è il livello.

https://link.amazon/B0ghUQISo

Quando la VRAM aumenta a 32 GB, diventa il modello di punta della RTX 5090 e costa 795.000 yen. Quando si arriva a questo, immagino che sia a un livello in cui non puoi farcela a meno che tu non abbia molta determinazione. Credo di si. Questa è la quantizzazione di Q8_0 e se il modello della classe 30[B] funziona o meno. Sarà più o meno allo stesso livello.

https://link.amazon/B03EseQp5

Quest'area è la linea superiore del livello del prodotto di consumo. Ora, quando si tratta di livello professionale, l'RTX PRO 6000 Blackwell è dotata di 96 GB di memoria. **Il prezzo è di 2,35 milioni di yen. ** Qui, anche al livello di quantizzazione Q4_0, funziona solo il modello 192[B], quindi il modello di punta non funziona.

https://link.amazon/B0g76ngZz

E poiché sul server erano presenti dati per l'installazione del cluster GPU, li pubblicherò solo come riferimento. Nel caso di NVIDIA B300, la memoria è di 288 GB e il prezzo è di 8,63 milioni di yen. Se lo è, DeepSeek V4 Flash 0731 con quantizzazione Q8_0 potrebbe funzionare. Q4_0 funzionerà. Se ne hai due (equivalenti a 17 milioni di yen), MiMo-V2.5-Pro ​​​​con quantizzazione Q4_0 potrebbe funzionare.

image.png

https://www.nttpc.co.jp/cgi-bin/gpu/simulation/custom/index.cgi

Pertanto, se si confronta la quantità di memoria e il numero di parametri, questo è tutto. Naturalmente c'è altro da discutere oltre a questo, e se questo sarà incluso o meno nella memoria. Quindi, genera abbastanza TOK/s per essere utilizzato normalmente? C'è un altro problema. Questo articolo parla delle nozioni di base. LLM ha architetture chiamate Dense e MoE e in MoE vengono effettivamente calcolati solo i parametri attivi e, a seconda del metodo di esecuzione, esiste un modo per ridurre la quantità di memoria fisica leggendo gli Expert necessari dall'archivio, ecc., invece di archiviare sempre tutti gli Expert in memoria. Tuttavia, ci sono alcuni aspetti speciali nel modo in cui viene eseguito il modello e il caricamento dallo storage alla memoria può diventare un collo di bottiglia. Ci sono alcune storie come questa, ma qui ignoriamo tali dettagli e consideriamo semplicemente la capacità quando tutti i pesi del modello sono archiviati in memoria.

Quindi, se vuoi utilizzare l'attuale modello di punta quantizzato Q4_0 o Q8_0, avrai bisogno di una macchina che costi almeno 10 milioni di yen. Questa è la sensazione. D'altra parte, potrebbe funzionare se si utilizza hardware speciale per ottenere una quantizzazione ancora maggiore. Ad esempio, ci sono persone che eseguono la quantizzazione a 2 bit e la quantizzazione a 3 bit sul Mac M4 con 128 GB di memoria (esaurito) e DGX Spark (memoria da 128 GB).

https://zenn.dev/tkhr_sait/articles/20260508_try-local-deepseek-v4

https://dev.classmethod.jp/articles/dgx-spark-deepseek-v4-flash-0731-llama-cpp/

D'altra parte, questo è probabilmente il limite per un individuo. È una sensazione sulla pelle. Personalmente, sto prestando attenzione alla quantizzazione a 1 bit. Modelli famosi includono Bonsai e tecnologie come BitNet, ma il know-how per la quantizzazione a 1 bit non è stato reso pubblico, quindi non l'ho provato (probabilmente richiederebbe molto tempo e ridurrebbe la precisione dell'inferenza).

Quindi, personalmente, se venisse rilasciata una versione quantizzata a 1 bit di DeepSeek (circa 35,5 GB), potrei vedere un mondo in cui potrebbe essere eseguita localmente su una GPU di livello consumer, a seconda di un po' di ingegnosità, ma poiché al momento non disponiamo di questa soluzione, è piuttosto difficile. Questa è la verità.

Perciò,

**Non è realistico eseguire il modello di punta con LLM locale. **

Questa è la mia impressione generale. Se vuoi davvero che funzioni, penso che tu debba fare qualche test.

pensieri

Questa volta ho concentrato il mio discorso sul LLM locale. Quando è uscito Kimi-K3, sono rimasto piuttosto scioccato e la classe di Fable si è trasferita al LLM locale! Era piuttosto impressionante, ma non riesco nemmeno a spostarlo con l'attrezzatura che ho. Questa è stata la mia onesta impressione. In passato ho pubblicato un articolo sul LLM locale, ma all'epoca non funzionava molto bene, quindi vorrei approfondirlo un po' più a fondo. Così ho pensato.