AI Coding.Info
RepositoriesREPORTS
ABOUT

O LLM local pode ser usado para codificação de IA? ~Resumo das tendências de codificação de IA em julho de 2026, conforme visto pelos dados~

autor: @kotauchisunsun

Data de lançamento: 2026/08/12

Tendências do agente de codificação AI em agosto de 2026

Operamos um site chamado AI Coding.Info desde julho de 2025.

https://ai-coding.info/

https://x.com/AICodingInfo

Este é um site que observa tendências de uso relacionadas a agentes de codificação de IA, como Claude Code, Codex CLI, Github Copilot e Gemini, a partir de um ponto fixo a partir de informações nos repositórios do Github. Para determinar o uso do AI Coding Agent, realizamos pesquisas diárias sob as seguintes condições.

Tendências do último mês

https://ai-coding.info/reports/articles/20260703

A taxa de uso do AI Coding Agent é de 13,0%

A taxa de utilização do repositório do AI Coding Agent foi de 13,0%, um aumento de 0,9% em relação aos 12,1% da última vez.

image.png

image.png

Taxa de uso do AI Coding Agent em 01/08/2026

https://ai-coding.info/?date=2026-08-01#adoption-rate

Taxa de uso do AI Coding Agent em 1º de julho de 2026

https://ai-coding.info/?date=2026-07-01#adoption-rate

Tendências na taxa de uso do agente de codificação de IA de 01/07/2026 a 01/08/2026

https://ai-coding.info/?date=2026-04-01&since=2026-07-01&until=2026-08-01#share-trend

Participação do agente de codificação AI por produto

A participação por produto é a seguinte.

ClassificaçãoNome do produtoTaxa de participação
1º lugarCLI do Codex40,8%
2º lugarCódigo Cláudio32,0%
3º lugarAgente Copiloto15,1%
4º lugarGemini CLI(Antigravidade)5,3%
5º lugarCursor4,4%

Embora a participação do Codex CLI esteja aumentando, o Claude Code permanece o mesmo. O Copilot Agent e o Gemini CLI (Antigravity) também apresentam um ligeiro declínio. Cursor é algo em que tenho prestado um pouco de atenção. Cursor é adquirido pela SpaceX. Houve novidades.

https://www.nikkei.com/article/DGXZQOGN16BC70W6A610C2000000/

Portanto, haverá alteração na taxa de participação deste Cursor? Eu pensei que sim, mas no mês passado foi 4,7% e neste mês foi 4,4%, então não houve muita mudança. Olhando para o número de repositórios mencionados abaixo, em 1º de julho, havia 85 repositórios que adotaram o Cursor, e a partir de 1º de agosto, o número permanece inalterado em 85. Portanto, em relação a esse fenômeno, a população de repositórios que usam o AI Coding Agent aumentou em geral, mas o número de uso do Cursor não aumentou. Como resultado, a quota de mercado global está a diminuir. Isso se tornou um fenômeno. Porém, devido às características da pesquisa AI Coding.Info, o número de repositórios com arquivos de configuração específicos do Cursor (.cursor) não será alterado. Dito isto, o próprio Cursor suporta AGENTS.md. AI Coding.Info afirma que o número de repositórios com AGENTS.md = o número de adoção do Codex CLI, portanto, embora o Cursor seja usado, é possível que ele esteja sendo contado como Codex CLI, e existe a possibilidade de que o número de usos esteja aumentando em uma parte invisível.

image.png

Taxa de participação do AI Coding Agent em 01/08/2026

https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#agent-share

Taxa de participação do AI Coding Agent em 01/07/2026

https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#agent-share

Status de uso do AI Coding Agent por linguagem de programação

A linguagem de programação em que o AI Coding Agent é mais usado é “TypeScript”, a segunda é “Python”, a terceira é “Rust”, a quarta é “Go” e a quinta é “C#”. A taxa de adoção de AI Coding para TypeScript permanece alta, enquanto a composição de Python'', Rust'' e Go'' como o segundo grupo, e C#'' como o terceiro grupo tem sido uma tendência consistente nos últimos anos.

image.png

Classificação do AI Coding Agent por linguagem de programação em 01/08/2026

https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#language-agent-rank

Classificação do AI Coding Agent por linguagem de programação em 1º de julho de 2026

https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#language-agent-rank

Tendências mensais no número de repositórios usados ​​pelo AI Coding Agent

O número de repositórios era 1.794 em 01/07/2026, mas aumentou para 1.940 em 01/08/2026, e o número de repositórios que usam o AI Coding Agent aumentou em 146.

image.png

Mudanças no número de repositórios usando AI Coding Agent de 01/07/2026 a 01/08/2026

https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#time-based-bar-chart

O LLM local pode ser usado para codificação de IA?

Em junho, a próxima geração de LLMs, Mythos e Fable 5, foi lançada por Claude e chocou a indústria com seu desempenho. No entanto, depois disso, a empresa chinesa Kimi lançou um modelo aberto chamado Kimi-K3, que é quase da classe Fable. Isso se tornou um assunto quente. Mesmo olhando para os benchmarks reais, os números estão próximos.

imagem.png

https://artificialanalysis.ai/#intelligence-category-tabs

Quando pensei isso,

**O LLM local também não é uma opção para codificação de IA? **

Eu acho que você pode pensar assim. Eu investiguei essa área. A tabela abaixo lista os principais modelos LLM de peso aberto do gráfico acima.

Nome do modeloNome da empresaData do anúncioNúmero de parâmetrosNúmero de parâmetros ativosComprimento do contextoÍndice de Inteligência
Kimi K3(máx.)Kimi(China)2026/072.800 bilhões104B1 milhão60
GLM-5.2(máx.)Z AI(China)2026/06756B40B1 milhão53
DeepSeek V4 Flash 0731DeepSeek(China)2026/07284B13B1 milhão52
MiMo-V2.5-ProXiaomi(China)2026/041.023B42B1 milhão43
Muse Glimmer (alto)Meta(EUA)2026/0830B256K35
Gema 4 31B (raciocínio)Google (EUA)2026/0430,7B256K30

No entanto, eles realmente funcionam no seu PC? Eu realmente não entendo isso. Portanto, o método de determinação que consideramos foi

A memória VRAM necessária é

2[GB] por parâmetro 1[B]

é. Você pode estimar aproximadamente se funcionará com base na capacidade de memória VRAM do seu PC e no número de parâmetros do modelo que deseja executar. portanto,

**Matematicamente, são necessários 5,6 TB (5.600 GB) de memória para executar o Kimi-K3. **

Vou explicar o motivo disso. No modelo LLM distribuído padrão, os pesos são expressos usando números decimais com precisão de bf16 ou fp16. Eles requerem 2 bytes para cada parâmetro. A notação que você vê com frequência, como 30[B], é o número de parâmetros, e B significa bilhão e representa 10^9. Portanto, pode-se observar que um modelo como 30[B] possui dados de peso 30×10^9. E 1[GB]=1*10^9[Byte]. Pensando dessa forma, mencionamos anteriormente que os pesos padrão são armazenados em 2 Bytes, portanto são necessários 2 Bytes por peso, o que significa 2 [GB] para armazenar 1 [B] parâmetro na memória. Este é o cálculo. Este é o significado de "2[GB] por parâmetro 1[B]" mencionado anteriormente. No entanto, esta é apenas uma aproximação; este é o requisito mínimo para carregar os pesos na VRAM e, como pode ser utilizada memória além disso, é estritamente aconselhável não ultrapassá-lo. Esta é a capacidade VRAM.

É aqui que o conceito de quantização entra em jogo. Você pode ter visto Q4_0 ou Q4_K_M. Esta é uma técnica que comprime o peso ao seu número de bits. Portanto, no caso de Q4_0, grosso modo, a capacidade de peso é de 4 bits (a 4ª parte de Q4_0). Portanto, neste caso, a capacidade é de 0,5[GB] por 1[B]. Uma tabela de referência rápida é semelhante a esta:

Método de quantizaçãoQuantidade de memória necessária por 1[B] [GB]
bf16,fp16(padrão)2,0
Q8_01,0
4º trimestre_00,5

Você pode ver uma notação como Q4_K_M, mas grosso modo, é um modelo que aumenta a precisão em comparação com Q4_0, mas usa um pouco mais de capacidade de memória. É bom estar ciente disso. Existe outra maneira de saber, basta olhar o tamanho do arquivo de peso (safetensor ou gguf). Se exceder a capacidade de memória VRAM, geralmente não funcionará. Eu acho que você pode pensar assim.

A partir daqui, criamos uma tabela de referência rápida da quantidade de memória VRAM, método de quantização e número de parâmetros.

Capacidade de memória VRAM [GB]Número de parâmetros (bf16,fp16)[B]Número de parâmetros (Q8_0)[B]Número de parâmetros (Q4_0)[B]
84816
1681632
24122448
32163264
643264128
12864128256
256128256512
5122565121024
102451210242048
2048102420484096

Aproximadamente em quanto tempo isso pode ser feito? Considerando que, se for um modelo com 8GB de VRAM, será um RTX 5050, e o preço da Amazon é de 55.000 ienes. Isso pode funcionar se o modelo for cerca de 8[B] quantizado com Q8_0. Esse é o nível.

https://link.amazon/B0brulI9R

Quando a VRAM aumenta para 16 GB, torna-se um modelo em torno do RTX 5060 Ti, que custa cerca de 108.000 ienes. Neste ponto, com a quantização Q4_0, um LLM classe 30[B] funcionará ou não. Esse é o nível.

https://link.amazon/B0ghUQISo

Quando a VRAM aumenta para 32 GB, ele se torna o modelo carro-chefe do RTX 5090 e custa 795.000 ienes. Quando se trata disso, acho que está em um nível em que você não consegue fazer isso a menos que tenha muita determinação. Eu penso que sim. Esta é a quantização de Q8_0 e se o modelo da classe 30[B] funciona ou não. Será aproximadamente o mesmo nível.

https://link.amazon/B03EseQp5

Esta área é a linha superior do nível de produto de consumo. Agora, quando se trata do nível profissional, a RTX PRO 6000 Blackwell vem equipada com 96GB de memória. **O preço é de 2,35 milhões de ienes. ** Aqui, mesmo no nível de quantização Q4_0, apenas o modelo 192[B] funciona, portanto o modelo principal não funciona.

https://link.amazon/B0g76ngZz

E como havia dados para o cluster GPU ser instalado no servidor, vou postá-los apenas para referência. No caso da NVIDIA B300, a memória é de 288 GB e o preço é de 8,63 milhões de ienes. Se for um, DeepSeek V4 Flash 0731 com quantização Q8_0 pode funcionar. Q4_0 funcionará. Se você tiver dois (equivalente a 17 milhões de ienes), o MiMo-V2.5-Pro ​​​​com quantização Q4_0 pode funcionar.

imagem.png

https://www.nttpc.co.jp/cgi-bin/gpu/simulation/custom/index.cgi

Portanto, se você comparar a quantidade de memória e o número de parâmetros, é isso. É claro que há mais a debater do que isto, e se isto será ou não incluído na memória. Então, ele gera TOK/s suficientes para ser usado normalmente? Há outro problema. Este artigo fala sobre o básico. O LLM possui arquiteturas chamadas Dense e MoE, e no MoE apenas os parâmetros ativos são realmente calculados e, dependendo do método de execução, existe uma maneira de reduzir a quantidade de memória física lendo os Experts necessários do armazenamento, etc., em vez de armazenar todos os Experts na memória o tempo todo. No entanto, existem alguns aspectos especiais na forma como o modelo é executado, e o carregamento do armazenamento para a memória pode se tornar um gargalo. Existem algumas histórias como essa, mas aqui ignoramos tais detalhes e simplesmente consideramos a capacidade quando todos os pesos do modelo estão armazenados na memória.

Portanto, se você quiser executar o atual modelo quantizado Q4_0 ou Q8_0, precisará de uma máquina que custe pelo menos 10 milhões de ienes. Essa é a sensação. Por outro lado, pode funcionar se você usar hardware especial para obter uma quantização ainda maior. Por exemplo, há pessoas que estão executando quantização de 2 bits e quantização de 3 bits no Mac M4 com 128 GB de memória (esgotado) e DGX Spark (memória de 128 GB).

https://zenn.dev/tkhr_sait/articles/20260508_try-local-deepseek-v4

https://dev.classmethod.jp/articles/dgx-spark-deepseek-v4-flash-0731-llama-cpp/

Por outro lado, este é provavelmente o limite para um indivíduo. É uma sensação na pele. Pessoalmente, estou prestando atenção à quantização de 1 bit. Modelos famosos incluem Bonsai e tecnologias como BitNet, mas o know-how para quantização de 1 bit não foi divulgado, então não tentei (provavelmente levaria muito tempo e reduziria a precisão da inferência).

Então, pessoalmente, se uma versão quantizada de 1 bit do DeepSeek (aproximadamente 35,5 GB) fosse lançada, eu poderia ver um mundo em que ele poderia ser executado localmente em uma GPU de consumo, dependendo de alguma engenhosidade, mas como atualmente não temos isso, é bastante difícil. Essa é a verdade honesta.

Portanto,

**Não é realista executar o modelo principal com LLM local. **

Essa é a minha impressão geral. Se você realmente quer que funcione, acho que precisa fazer alguns testes.

pensamentos

Desta vez, concentrei minha palestra no LLM local. Quando o Kimi-K3 foi lançado, fiquei bastante chocado e a turma do Fable mudou para o LLM local! Foi bastante impressionante, mas não consigo nem movê-lo com o equipamento que tenho. Essa foi minha impressão honesta. Publiquei um artigo sobre LLM local no passado, mas não funcionou muito bem naquela época, então gostaria de me aprofundar um pouco mais nele. Eu pensei assim.