AI Coding.Info
RepositoriesREPORTS
ABOUT

¿Se puede utilizar un LLM local para la codificación AI? ~Resumen de las tendencias de codificación de IA en julio de 2026 según lo visto a través de los datos~

autor: @kotauchisunsun

fecha de lanzamiento: 2026/08/12

Tendencias del agente de codificación de IA en agosto de 2026

Operamos un sitio llamado AI Coding.Info desde julio de 2025.

https://ai-coding.info/

https://x.com/AICodingInfo

Este es un sitio que observa tendencias de uso relacionadas con agentes de codificación de IA como Claude Code, Codex CLI, Github Copilot y Gemini desde un punto fijo a partir de información en los repositorios de Github. Para determinar el uso de AI Coding Agent, realizamos encuestas diarias bajo las siguientes condiciones.

Tendencias del mes pasado

https://ai-coding.info/reports/articles/20260703

La tasa de uso del agente de codificación AI es del 13,0%

La tasa de utilización del repositorio del agente de codificación AI fue del 13,0 %, un aumento del 0,9 % desde el 12,1 % la última vez.

imagen.png

imagen.png

Tasa de uso del agente de codificación AI el 1/8/2026

https://ai-coding.info/?date=2026-08-01#adoption-rate

Tasa de uso del agente de codificación AI el 1 de julio de 2026

https://ai-coding.info/?date=2026-07-01#adoption-rate

Tendencias en la tasa de uso del agente de codificación de IA del 1/7/2026 al 1/8/2026

https://ai-coding.info/?date=2026-04-01&since=2026-07-01&until=2026-08-01#share-trend

Proporción de agente de codificación de IA por producto

La participación por producto es la siguiente.

ClasificaciónNombre del productoTasa de participación
1er lugarCLI del Códice40,8%
2do lugarCódigo Claude32,0%
3er lugarAgente copiloto15,1%
4to lugarCLI de Géminis (antigravedad)5,3%
5to lugarCursores4,4%

Si bien la proporción de Codex CLI está aumentando, Claude Code sigue siendo el mismo. Copilot Agent y Gemini CLI (Antigravity) también muestran una ligera disminución. El cursor es algo a lo que he estado prestando un poco de atención. El cursor es adquirido por SpaceX. Hubo novedades.

https://www.nikkei.com/article/DGXZQOGN16BC70W6A610C2000000/

Por tanto, ¿habrá un cambio en la tasa de participación de este Cursor? Eso pensé, pero el mes pasado fue del 4,7% y este mes fue del 4,4%, por lo que no hay mucho cambio. Si observamos la cantidad de repositorios que se mencionan a continuación, el 1 de julio, había 85 repositorios que adoptaron Cursor y, a partir del 1 de agosto, el número permanece sin cambios en 85. Por lo tanto, con respecto a este fenómeno, la población de repositorios que utilizan AI Coding Agent ha aumentado en general, pero la cantidad de uso de Cursor no ha aumentado. Como resultado, la cuota de mercado general está disminuyendo. Esto se ha convertido en un fenómeno. Sin embargo, debido a las características de la investigación de AI Coding.Info, la cantidad de repositorios con archivos de configuración específicos del cursor (.cursor) no cambiará. Dicho esto, el propio Cursor es compatible con AGENTS.md. AI Coding.Info establece que la cantidad de repositorios con AGENTS.md = la cantidad de adopción de Codex CLI, por lo que aunque se usa Cursor, es posible que se cuente como Codex CLI, y existe la posibilidad de que la cantidad de usos esté aumentando en una parte invisible.

imagen.png

Tasa de participación del agente de codificación AI el 1/8/2026

https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#agent-share

Tasa de participación del agente de codificación AI el 1/7/2026

https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#agent-share

Estado de uso del agente de codificación AI por lenguaje de programación

El lenguaje de programación en el que más se utiliza AI Coding Agent es "TypeScript", el segundo es "Python", el tercero es "Rust", el cuarto es "Go" y el quinto es "C#". La tasa de adopción de codificación AI para TypeScript sigue siendo alta, mientras que la composición de Python'', Rust'' y Go'' como segundo grupo, y C#'' como tercer grupo ha sido una tendencia constante en los últimos años.

imagen.png

Clasificación de agentes de codificación de IA por lenguaje de programación el 1/8/2026

https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#language-agent-rank

Clasificación de agentes de codificación de IA por lenguaje de programación el 1 de julio de 2026

https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#language-agent-rank

Tendencias mensuales en la cantidad de repositorios utilizados por AI Coding Agent

La cantidad de repositorios era 1794 a partir del 01/07/2026, pero aumentó a 1940 a partir del 01/08/2026, y la cantidad de repositorios que utilizan AI Coding Agent aumentó en 146.

imagen.png

Cambios en la cantidad de repositorios que utilizan AI Coding Agent del 1/7/2026 al 1/8/2026

https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#time-based-bar-chart

¿Se puede utilizar el LLM local para la codificación AI?

En junio, Claude lanzó la próxima generación de LLM, Mythos y Fable 5, y sorprendió a la industria con su desempeño. Sin embargo, después de eso, la compañía china Kimi lanzó un modelo de peso abierto llamado Kimi-K3, que es casi de la clase Fable. Ese se convirtió en un tema candente. Incluso mirando los puntos de referencia reales, las cifras están cercanas.

imagen.png

https://artificialanalysis.ai/#intelligence-category-tabs

Cuando pensé eso,

** ¿No es el LLM local también una opción para la codificación AI? **

Creo que puedes pensar que sí. Investigué esa zona. La siguiente tabla enumera los principales modelos LLM de peso abierto del gráfico anterior.

Nombre del modeloNombre de la empresaFecha del anuncioNúmero de parámetrosNúmero de parámetros activosLongitud del contextoÍndice de Inteligencia
Kimi K3(máx.)Kimi(China)2026/072.800 mil millones104B1 millón60
GLM-5.2(máx.)Z AI(China)2026/06756B40B1 millón53
DeepSeek V4 Flash 0731DeepSeek(China)2026/07284B13B1 millón52
MiMo-V2.5-ProXiaomi(China)2026/041.023 mil millones42B1 millón43
Muse Glimmer (alto)Meta(Estados Unidos)2026/0830B256K35
Gema 4 31B (Razonamiento)Google (EE.UU.)2026/0430,7 mil millones256K30

Sin embargo, ¿funcionan realmente en tu PC? Realmente no entiendo eso. Por lo tanto, el método de determinación que consideramos fue

La memoria VRAM requerida es

2[GB] por parámetro 1[B]

es. Puede estimar aproximadamente si funcionará en función de la capacidad de memoria VRAM de su PC y la cantidad de parámetros del modelo que desea ejecutar. por lo tanto,

**Matemáticamente, se requieren 5,6 TB (5600 GB) de memoria para ejecutar Kimi-K3. **

Explicaré el motivo de esto. En el modelo LLM distribuido estándar, los pesos se expresan utilizando números decimales con una precisión de bf16 o fp16. Estos requieren 2 Bytes para cada parámetro. La notación que se ve a menudo, como 30[B], es el número de parámetros, y B significa mil millones y representa 10^9. Por lo tanto, se puede ver que un modelo como 30 [B] tiene datos de peso de 30 × 10 ^ 9. Y 1[GB]=1*10^9[Byte]. Pensándolo de esa manera, mencionamos anteriormente que los pesos estándar se almacenan en 2 Bytes, por lo que se necesitan 2 Bytes por peso, lo que significa 2 [GB] para almacenar 1 [B] parámetros en la memoria. Este es el cálculo. Este es el significado de "2[GB] por parámetro 1[B]" mencionado anteriormente. Sin embargo, esto es sólo una aproximación; este es el requisito mínimo para cargar los pesos en VRAM y, dado que se puede utilizar memoria además de eso, es estrictamente recomendable no excederlo. Esta es la capacidad de VRAM.

Aquí es donde entra en juego el concepto de cuantificación. Es posible que hayas visto Q4_0 o Q4_K_M. Esta es una técnica que comprime el peso a su número de bits. Por lo tanto, en el caso de Q4_0, en términos generales, la capacidad de peso es de 4 bits (la 4 parte de Q4_0). Por tanto, en este caso, la capacidad es de 0,5[GB] por 1[B]. Una tabla de referencia rápida de estos se ve así:

Método de cuantificaciónCantidad de memoria requerida por 1[B] [GB]
bf16,fp16(estándar)2.0
Q8_01.0
Q4_00,5

Es posible que vea una notación como Q4_K_M, pero en términos generales, es un modelo que aumenta la precisión en comparación con Q4_0, pero utiliza un poco más de capacidad de memoria. Es bueno ser consciente de esto. Hay otra forma de saberlo: simplemente mire el tamaño del archivo de peso (safetensor o guff). Si esto excede la capacidad de la memoria VRAM, generalmente no funcionará. Creo que puedes pensar eso.

A partir de aquí, hemos creado una tabla de referencia rápida de la cantidad de memoria VRAM, el método de cuantificación y la cantidad de parámetros.

Capacidad de memoria VRAM [GB]Número de parámetros (bf16,fp16)[B]Número de parámetros (Q8_0)[B]Número de parámetros (Q4_0)[B]
84816
1681632
24122448
32163264
643264128
12864128256
256128256512
5122565121024
102451210242048
2048102420484096

¿En cuanto tiempo aproximadamente se puede hacer? Teniendo en cuenta que, si es un modelo con 8GB de VRAM, será una RTX 5050, y el precio en Amazon es de 55.000 yenes. Esto puede funcionar si el modelo está cuantificado aproximadamente en 8[B] con Q8_0. Ese es el nivel.

https://link.amazon/B0brulI9R

Cuando la VRAM aumenta a 16 GB, se convierte en un modelo cercano al RTX 5060 Ti, que cuesta alrededor de 108.000 yenes. En este punto, con la cuantificación Q4_0, un LLM de clase 30[B] funcionará o no. Ese es el nivel.

https://link.amazon/B0ghUQISo

Cuando la VRAM aumenta a 32 GB, se convierte en el modelo insignia RTX 5090 y cuesta 795.000 yenes. Cuando se trata de esto, supongo que está en un nivel en el que no puedes hacerlo a menos que tengas mucha determinación. Creo que sí. Esta es la cuantificación de Q8_0 y si el modelo de clase 30[B] funciona o no. Estará aproximadamente al mismo nivel.

https://link.amazon/B03EseQp5

Esta área es la línea superior del nivel de productos de consumo. Ahora bien, si hablamos del nivel profesional, el RTX PRO 6000 Blackwell está equipado con 96 GB de memoria. **El precio es de 2,35 millones de yenes. ** Aquí, incluso en el nivel de cuantificación Q4_0, solo funciona el modelo 192[B], por lo que el modelo insignia no funciona.

https://link.amazon/B0g76ngZz

Y dado que había datos para que el clúster de GPU se instalara en el servidor, los publicaré solo como referencia. En el caso de NVIDIA B300, la memoria es de 288 GB y el precio es de 8,63 millones de yenes. Si es así, DeepSeek V4 Flash 0731 con cuantificación Q8_0 puede funcionar. Q4_0 funcionará. Si tienes dos (equivalente a 17 millones de yenes), MiMo-V2.5-Pro ​​​​con cuantificación Q4_0 puede funcionar.

imagen.png

https://www.nttpc.co.jp/cgi-bin/gpu/simulation/custom/index.cgi

Por lo tanto, si comparamos la cantidad de memoria y la cantidad de parámetros, eso es todo. Por supuesto, hay más que debatir que esto, y si esto se incluirá o no en la memoria. Entonces, ¿genera suficientes TOK/s para ser utilizado normalmente? Hay otro problema. Este artículo habla de los conceptos básicos. LLM tiene arquitecturas llamadas Dense y MoE, y en MoE, solo se calculan realmente los parámetros activos y, dependiendo del método de ejecución, hay una manera de reducir la cantidad de memoria física leyendo los Expertos necesarios del almacenamiento, etc., en lugar de almacenar a todos los Expertos en la memoria todo el tiempo. Sin embargo, existen algunos aspectos especiales en la forma en que se ejecuta el modelo, y la carga desde el almacenamiento a la memoria puede convertirse en un cuello de botella. Hay algunas historias como esta, pero aquí ignoramos esos detalles y simplemente consideramos la capacidad cuando todos los pesos del modelo están almacenados en la memoria.

Por lo tanto, si desea ejecutar el actual modelo insignia cuantificado Q4_0 o Q8_0, necesitará una máquina que cueste al menos 10 millones de yenes. Esa es la sensación. Por otro lado, puede funcionar si utilizas hardware especial para lograr una cuantización aún mayor. Por ejemplo, hay personas que ejecutan cuantificación de 2 bits y cuantificación de 3 bits en la Mac M4 con memoria de 128 GB (agotada) y DGX Spark (memoria de 128 GB).

https://zenn.dev/tkhr_sait/articles/20260508_try-local-deepseek-v4

https://dev.classmethod.jp/articles/dgx-spark-deepseek-v4-flash-0731-llama-cpp/

Por otro lado, este es probablemente el límite para un individuo. Es una sensación en la piel. Personalmente, presto atención a la cuantificación de 1 bit. Los modelos famosos incluyen Bonsai y tecnología como BitNet, pero los conocimientos técnicos para la cuantificación de 1 bit no se han hecho públicos, por lo que no lo he probado (probablemente llevaría una gran cantidad de tiempo y reduciría la precisión de la inferencia).

Entonces, personalmente, si se lanzara una versión cuantificada de 1 bit de DeepSeek (aproximadamente 35,5 GB), podría ver un mundo en el que podría ejecutarse localmente en una GPU de consumo, dependiendo de algo de ingenio, pero como actualmente no tenemos eso, es bastante difícil. Esa es la pura verdad.

Por lo tanto,

**No es realista ejecutar el modelo insignia con un LLM local. **

Esa es mi impresión general. Si realmente quieres que funcione, creo que necesitas hacer algunas pruebas.

pensamientos

Esta vez centré mi charla en el LLM local. Cuando salió Kimi-K3, me sorprendió bastante y ¡la clase de Fable se trasladó al LLM local! Fue bastante impresionante, pero ni siquiera puedo moverlo con el equipo que tengo. Esa fue mi honesta impresión. Publiqué un artículo sobre LLM local en el pasado, pero no funcionó muy bien en ese momento, así que me gustaría profundizar un poco más en él. Ya me lo imaginaba.