מְחַבֵּר: @kotauchisunsun
תאריך יציאה: 2026/08/12
אנו מפעילים אתר בשם AI Coding.Info מאז יולי 2025.
זהו אתר שצופה במגמות שימוש הקשורות לסוכני קידוד בינה מלאכותית כגון Claude Code, Codex CLI, Github Copilot ו-Gemini מנקודה קבועה ממידע במאגרי Github. כדי לקבוע את השימוש ב-AI Coding Agent, אנו עורכים סקרים יומיים בתנאים הבאים.
https://ai-coding.info/reports/articles/20260703
שיעור השימוש במאגר AI Coding Agent היה 13.0%, עלייה של 0.9% מ-12.1% בפעם הקודמת.


שיעור השימוש ב-AI Coding Agent ב-2026/8/1
https://ai-coding.info/?date=2026-08-01#adoption-rate
שיעור השימוש ב-AI Coding Agent ב-1 ביולי 2026
https://ai-coding.info/?date=2026-07-01#adoption-rate
מגמות בשיעור השימוש ב-AI Coding Agent מ-2026/7/1 עד 2026/8/1
https://ai-coding.info/?date=2026-04-01&since=2026-07-01&until=2026-08-01#share-trend
הנתח לפי מוצר הוא כדלקמן.
| דירוג | שם המוצר | שיעור מניות |
|---|---|---|
| מקום ראשון | Codex CLI | 40.8% |
| מקום 2 | קלוד קוד | 32.0% |
| מקום שלישי | סוכן טייס משנה | 15.1% |
| מקום רביעי | תאומים CLI(אנטי כבידה) | 5.3% |
| מקום 5 | סמן | 4.4% |
בעוד שהנתח של Codex CLI גדל, קלוד קוד נשאר זהה. Copilot Agent ו-Gemini CLI (Antigravity) מציגים גם הם ירידה קלה. הסמן הוא משהו ששמתי לב אליו מעט. Cursor נרכש על ידי SpaceX. היו חדשות.
https://www.nikkei.com/article/DGXZQOGN16BC70W6A610C2000000/
לכן, האם יהיה שינוי בשיעור המניות של הסמן הזה? חשבתי שכן, אבל בחודש שעבר זה היה 4.7% והחודש זה היה 4.4%, אז אין כל כך שינוי. בהסתכלות על מספר המאגרים המוזכרים להלן, ב-1 ביולי, היו 85 מאגרים שאימצו את Cursor, ונכון ל-1 באוגוסט, המספר נותר ללא שינוי על 85. לכן, לגבי תופעה זו, אוכלוסיית המאגרים המשתמשים ב-AI Coding Agent גדלה בסך הכל, אך מספר השימוש בסמן לא גדל. כתוצאה מכך, נתח השוק הכולל יורד. זו הפכה לתופעה. עם זאת, בשל המאפיינים של מחקר AI Coding.Info, מספר המאגרים עם קובצי תצורה ספציפיים לסמן (.cursor) לא ישתנה. עם זאת, Cursor עצמו תומך ב-AGENTS.md. AI Coding.Info מציין שמספר המאגרים עם AGENTS.md = מספר האימוץ של Codex CLI, כך שלמרות שמשתמשים ב-Cursor, ייתכן שהוא נספר כ-Codex CLI, וקיימת אפשרות שמספר השימושים גדל בחלק בלתי נראה.

שיעור מניות AI Coding Agent ב-1/8/2026
https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#agent-share
שיעור מניות AI Coding Agent ב-2026/7/1
https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#agent-share
שפת התכנות שבה נעשה שימוש הכי הרבה ב-AI Coding Agent היא "TypeScript", השנייה היא "Python", השלישית היא "Rust", הרביעית היא "Go" והחמישית היא "C#". שיעור האימוץ של קידוד AI עבור TypeScript נותר גבוה, בעוד שההרכב של Python'', Rust'' ו-Go'' בתור הקבוצה השנייה, ו-C#'' בתור הקבוצה השלישית הייתה מגמה עקבית בשנים האחרונות.

דירוג סוכן קידוד AI לפי שפת תכנות ב-2026/8/1
https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#language-agent-rank
דירוג סוכן קידוד AI לפי שפת תכנות ב-1 ביולי 2026
https://ai-coding.info/?date=2026-07-01&since=2026-07-01&until=2026-08-01#language-agent-rank
מספר המאגרים היה 1,794 נכון ל-2026/07/01, אך גדל ל-1,940 נכון ל-2026/08/01, ומספר המאגרים המשתמשים ב-AI Coding Agent גדל ב-146.

שינויים במספר המאגרים באמצעות AI Coding Agent מ-2026/7/1 ל-2026/8/1
https://ai-coding.info/?date=2026-08-01&since=2026-07-01&until=2026-08-01#time-based-bar-chart
ביוני, הדור הבא של LLMs, Mythos ו-Fable 5, שוחררו על ידי קלוד וזעזע את התעשייה עם הביצועים שלהם. עם זאת, לאחר מכן, חברת Kimi הסינית הוציאה דגם משקל פתוח בשם Kimi-K3, שהוא כמעט מחלקת Fable. זה הפך לנושא חם. אפילו מסתכלים על המדדים בפועל, המספרים קרובים.

https://artificialanalysis.ai/#intelligence-category-tabs
כשחשבתי את זה,
**האם LLM מקומי לא אופציה גם לקידוד AI? **
אני חושב שאתה יכול לחשוב כך. חקרתי את התחום הזה. הטבלה שלהלן מפרטת את דגמי ה-LLM הפתוחים העיקריים מהגרף שלמעלה.
| שם דגם | שם חברה | תאריך הודעה | מספר פרמטרים | מספר פרמטרים פעילים | אורך הקשר | אינדקס מודיעין |
|---|---|---|---|---|---|---|
| Kimi K3(max) | Kimi(סין) | 2026/07 | 2,800B | 104B | 1 מיליון | 60 |
| GLM-5.2(max) | Z AI(סין) | 2026/06 | 756B | 40B | 1 מיליון | 53 |
| DeepSeek V4 Flash 0731 | DeepSeek(סין) | 2026/07 | 284B | 13B | 1 מיליון | 52 |
| MiMo-V2.5-Pro | Xiaomi(סין) | 2026/04 | 1,023B | 42B | 1 מיליון | 43 |
| מוזה גלימר (גבוהה) | Meta(ארה"ב) | 2026/08 | 30B | 256K | 35 | |
| Gemma 4 31B (נימוק) | גוגל (ארה"ב) | 2026/04 | 30.7B | 256K | 30 |
עם זאת, האם אלה באמת עובדים במחשב שלך? אני לא ממש מבין בזה. לכן, שיטת הקביעה ששקלנו הייתה
זיכרון ה-VRAM הנדרש הוא
2[GB] לכל פרמטר 1[B]
הוא. אתה יכול להעריך באופן גס אם זה יעבוד על סמך קיבולת זיכרון ה-VRAM של המחשב האישי שלך ומספר הפרמטרים של הדגם שאתה רוצה להפעיל. לָכֵן,
**מתמטית, נדרש 5.6TB (5,600GB) של זיכרון כדי להפעיל את Kimi-K3. **
אסביר את הסיבה לכך. במודל ה-LLM המבוזר הסטנדרטי, משקלים מבוטאים באמצעות מספרים עשרוניים בדיוק של bf16 או fp16. אלה דורשים 2 בייטים עבור כל פרמטר. הסימון שאתה רואה לעתים קרובות, כגון 30[B], הוא מספר הפרמטרים, ו-B מייצג מיליארד ומייצג 10^9. לכן, ניתן לראות שלדגם כמו 30[B] יש נתוני משקל של 30×10^9. ו-1[GB]=1*10^9[בייט]. כשחושבים על זה כך, הזכרנו קודם לכן שמשקולות סטנדרטיות מאוחסנות ב-2 בתים, אז צריך 2 בתים לכל משקל, כלומר 2 [GB] כדי לאחסן 1 [B] פרמטרים בזיכרון. זה החישוב. זוהי המשמעות של "2[GB] לכל פרמטר 1[B]" שהוזכרה קודם לכן. עם זאת, זהו רק הערכה; זוהי הדרישה המינימלית לטעינת המשקולות ל-VRAM, ומכיוון שניתן להשתמש בזיכרון בנוסף לכך, מומלץ בהחלט לא לחרוג ממנו. זוהי קיבולת ה-VRAM.
כאן נכנס לתמונה מושג הקוונטיזציה. אולי ראית את Q4_0 או Q4_K_M. זוהי טכניקה שדוחסת את המשקל למספר הביטים שלו. לכן, במקרה של Q4_0, באופן גס, קיבולת המשקל היא 4 סיביות (החלק ה-4 של Q4_0). לכן, במקרה זה, הקיבולת היא 0.5[GB] לכל 1[B]. טבלת התייחסות מהירה של אלה נראית כך:
| שיטת קוונטיזציה | כמות הזיכרון הנדרשת לכל 1[B] [GB] |
|---|---|
| bf16,fp16(סטנדרט) | 2.0 |
| Q8_0 | 1.0 |
| Q4_0 | 0.5 |
אולי תראה סימון כגון Q4_K_M, אבל בגדול, מדובר במודל שמגביר את הדיוק בהשוואה ל-Q4_0, אבל משתמש במעט יותר קיבולת זיכרון. טוב להיות מודע לכך. יש דרך אחרת לדעת, פשוט תסתכל על גודל הקובץ של קובץ המשקל (safetensor או gguf). אם זה חורג מקיבולת זיכרון ה-VRAM, זה בדרך כלל לא יעבוד. אני חושב שאתה יכול לחשוב כך.
מכאן, יצרנו טבלת התייחסות מהירה של כמות זיכרון ה-VRAM, שיטת הקוונטיזציה ומספר הפרמטרים.
| קיבולת זיכרון VRAM [GB] | מספר פרמטרים (bf16,fp16)[B] | מספר פרמטרים (Q8_0)[B] | מספר פרמטרים (Q4_0)[B] |
|---|---|---|---|
| 8 | 4 | 8 | 16 |
| 16 | 8 | 16 | 32 |
| 24 | 12 | 24 | 48 |
| 32 | 16 | 32 | 64 |
| 64 | 32 | 64 | 128 |
| 128 | 64 | 128 | 256 |
| 256 | 128 | 256 | 512 |
| 512 | 256 | 512 | 1024 |
| 1024 | 512 | 1024 | 2048 |
| 2048 | 1024 | 2048 | 4096 |
כמה זמן בערך אפשר לעשות את זה? בהתחשב בכך, אם מדובר בדגם עם 8GB של VRAM, זה יהיה RTX 5050, ומחיר אמזון הוא 55,000 ין. זה עשוי לעבוד אם המודל הוא בערך 8[B] בכימות עם Q8_0. זו הרמה.
כאשר ה-VRAM גדל ל-16GB, הוא הופך לדגם סביב ה-RTX 5060 Ti, שעולה כ-108,000 ין. בשלב זה, עם קוונטיזציה של Q4_0, LLM מחלקה 30[B] יעבוד או לא. זו הרמה.
כאשר ה-VRAM גדל ל-32GB, הוא הופך לדגם הדגל RTX 5090 ועולה 795,000 ין. כשזה מגיע לזה, אני מניח שזה ברמה שבה אתה לא יכול לעשות את זה אלא אם יש לך הרבה נחישות. אני חושב שכן. זהו הקוונטיזציה של Q8_0, והאם מודל המחלקה 30[B] עובד או לא. זה יהיה בערך אותה רמה.
תחום זה הוא השורה העליונה של רמת מוצרי הצריכה. כעת, כשזה מגיע לרמה המקצועית, ה-RTX PRO 6000 Blackwell מצויד בזיכרון של 96GB. **המחיר הוא 2.35 מיליון ין. ** כאן, גם ברמת הקוונטיזציה Q4_0, רק מודל 192[B] עובד, כך שמודל הדגל לא עובד.
ומכיוון שהיו נתונים לאשכול ה-GPU להתקנה על השרת, אפרסם אותם לעיון בלבד. במקרה של NVIDIA B300 הזיכרון הוא 288GB והמחיר 8.63 מיליון ין. אם זה כזה, DeepSeek V4 Flash 0731 עם קוונטיזציה Q8_0 עשוי לעבוד. Q4_0 יעבוד. אם יש לך שניים (שווה ערך ל-17 מיליון ין), MiMo-V2.5-Pro עם קוונטיזציה של Q4_0 עשוי לעבוד.

https://www.nttpc.co.jp/cgi-bin/gpu/simulation/custom/index.cgi
לכן, אם אתה משווה את כמות הזיכרון ומספר הפרמטרים, זה בערך זה. כמובן, יש יותר מה להתווכח מזה, והאם זה ייכלל בזיכרון או לא. אז, האם זה מייצר מספיק TOK/s לשימוש רגיל? יש עוד סוגיה. מאמר זה מדבר על היסודות מאוד. ל-LLM יש ארכיטקטורות שנקראות Dense ו-MoE, וב-MoE מחושבים בפועל רק הפרמטרים הפעילים, ובהתאם לשיטת הביצוע, יש דרך לצמצם את כמות הזיכרון הפיזי על ידי קריאת ה-Experts הדרושים מהאחסון וכו', במקום לאחסן את כל ה-Experts בזיכרון כל הזמן. עם זאת, ישנם כמה היבטים מיוחדים לאופן ביצוע המודל, וטעינה מאחסון לזיכרון עלולה להפוך לצוואר בקבוק. יש כמה סיפורים כאלה, אבל כאן אנחנו מתעלמים מפרטים כאלה ופשוט שוקלים את הקיבולת כאשר כל המשקולות של הדגם מאוחסנות בזיכרון.
לכן, אם אתה רוצה להפעיל את דגם הדגל הקוונטי הנוכחי Q4_0 או Q8_0, תצטרך מכונה שעולה לפחות 10 מיליון ין. זו התחושה של זה. מצד שני, זה עשוי לעבוד אם אתה משתמש בחומרה מיוחדת כדי להשיג קוונטיזציה גדולה עוד יותר. לדוגמה, ישנם אנשים שמפעילים קוונטיזציה של 2 סיביות וקונטיזציה של 3 סיביות ב-M4 Mac עם זיכרון של 128GB (סולד אאוט) ו-DGX Spark (זיכרון של 128GB).
https://zenn.dev/tkhr_sait/articles/20260508_try-local-deepseek-v4
https://dev.classmethod.jp/articles/dgx-spark-deepseek-v4-flash-0731-llama-cpp/
מצד שני, זה כנראה הגבול לפרט. זו תחושת עור. באופן אישי, אני שם לב לקוונטיזציה של 1-bit. דגמים מפורסמים כוללים את בונסאי וטכנולוגיה כמו BitNet, אבל הידע לכימות 1-bit לא פורסם ברבים, אז לא ניסיתי את זה (זה כנראה ייקח כמות עצומה של זמן ויקטין את דיוק ההסקות).
אז באופן אישי, אם תשוחרר גרסה 1-bit כמותית של DeepSeek (בערך 35.5 ג'יגה-בייט), יכולתי לראות עולם שבו ניתן יהיה להפעיל אותו באופן מקומי על GPU בדרגת צרכן, תלוי בכמה כושר המצאה, אבל מכיוון שאין לנו את זה כרגע, זה די קשה. זו האמת הכנה.
לָכֵן,
**לא ריאלי להפעיל את מודל הדגל עם LLM מקומי. **
זו ההתרשמות הכללית שלי. אם אתה באמת רוצה שזה יעבוד, אני חושב שאתה צריך לעשות כמה בדיקות.
הפעם, התמקדתי בהרצאה שלי ב-LLM מקומי. כאשר Kimi-K3 יצא, הייתי די בהלם, והכיתה Fable עברה ל-LLM המקומי! זה היה די מרשים, אבל אני אפילו לא יכול להזיז אותו עם הציוד שיש לי. זה היה הרושם הכנה שלי. פרסמתי בעבר מאמר על LLM מקומי, אבל זה לא עבד טוב באותה תקופה, אז הייתי רוצה לחפור קצת יותר לעומק בעצמי. כך חשבתי.