GPT
Q

Qwen3-Coder-30B-A3B-Instruct-MLX-4bit

קוד פתוח

lmstudio-communityapache-2.02025-07-31

  • transformers
  • safetensors
  • qwen3_moe
  • text-generation
  • mlx

גרסה מכווצת למק של מודל קוד מבוסס תערובת מומחים. היא מיועדת למי שרוצה חלון הקשר ענקי של 262 אלף טוקנים מקומית על אפל סיליקון בלי לשלם על שרתי ענן.

  • 31Bפרמטרים
  • 262,144טוקנים בהקשר
  • 16.0 GBמשקל הקבצים
  • 141,401הורדות בחודש

מה זה

מדובר בהמרה של מודל הקוד ממשפחת קוון לארכיטקטורת MLX של אפל, בכימות של 4 ביט. המודל בנוי על ארכיטקטורת תערובת מומחים עם 48 שכבות ויותר מ־30 מיליארד פרמטרים בסך הכול, אבל משקל הקבצים שלו יורד ל־16 ג'יגה בזכות הכיווץ. המטרה המרכזית כאן היא כתיבת קוד ועיבוד טקסט לפי הוראות, כשהייחוד הבולט הוא היכולת לטעון קבצים שלמים או מאגרי קוד ענקיים לתוך הזיכרון בבת אחת.

המפרסמים לא כללו בתיעוד תוצאות של מבחני ביצועים או השוואות מספריות מול גרסאות אחרות. כל מה שיש כאן הוא ההתאמה הישירה לחומרת מק דרך ספריית mlx_lm, שנועדה לתת מהירות עבודה סבירה בלי לתפוס את כל הזיכרון המאוחד של המחשב.

מתאים ל

  • ניתוח תיקיות קוד מקומיות

    חלון הקשר של 262 אלף טוקנים מאפשר לקרוא פרויקטים שלמים במק בלי להעלות קוד קנייני לרשת.

  • עבודה כעוזר פיתוח באופליין

    משקל של 16 ג'יגה מתאים לעבודה שוטפת על מקבוק מנותק מאינטרנט דרך סביבת MLX.

  • השלמת פונקציות ודיבאגינג

    הארכיטקטורה מכוונת למשימות קוד ומאפשרת לקבל הצעות לתיקון שגיאות ישירות מתוך הטרמינל.

איפה זה נופל

הכרטיס לא מספק נתונים על רמת הדיוק שאבדה במעבר לכימות של 4 ביט, וגם לא כולל מבחני ביצועים ספציפיים. בנוסף, LM Studio מבהירים בפירוש שהם לא אחראים לתקינות, לדיוק או לבטיחות הפלטים, ושתוכן עלול להיות מטעה או שגוי. חלון הקשר של 262 אלף טוקנים נשמע נהדר, אבל בניצול מלא שלו על מחשב אישי הביצועים עלולים לצנוח בצורה דרסטית.

אותה משפחה

Qwen3-Coder יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יעבוד על מחשב עם כרטיס מסך של אנבידיה?

לא בגרסה הזו. הקבצים כאן קודדו במיוחד עבור ספריית MLX, שפועלת אך ורק על המעבדים הגרפיים של אפל סיליקון במחשבי מק. למחשב מבוסס חלונות או לינוקס תצטרכו לחפש גרסה שהומרה לפורמט אחר כמו GGUF.

כמה זיכרון בפועל נדרש כדי להשתמש בכל חלון ההקשר?

המודל לבדו תופס 16 ג'יגה, אבל שמירת היסטוריה של מאות אלפי טוקנים דורשת זיכרון נוסף עבור ה־KV cache. בפועל, ניצול מלא של ההקשר ידרוש כנראה מחשב עם 48 או 64 ג'יגה זיכרון כדי לא לקרוס.

איך מריצים

כדי להריץ אותו צריך מק עם שבב אפל סיליקון וספריית mlx_lm או תוכנת LM Studio. הקבצים שוקלים 16 ג'יגה, כך שמחשב עם 24 או 36 ג'יגה זיכרון מאוחד יוכל להחזיק אותו בנוחות לצד מערכת ההפעלה, אבל אם תנסו לנצל את כל חלון ההקשר העצום, דרישות הזיכרון בפועל יקפצו משמעותית מעבר למשקל הבסיסי של המודל.

אם יש לכם מחשב עם 16 ג'יגה זיכרון בלבד, הוא כנראה ייחנק או יזחל כשתתחילו להעמיס קוד. במקרה כזה, או כשאין ברשותכם מק, עדיף לפנות ל־API חיצוני ולא לנסות להריץ את המשקל הזה מקומית.

from transformers import pipeline

pipe = pipeline("text-generation", model="lmstudio-community/Qwen3-Coder-30B-A3B-Instruct-MLX-4bit")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. הוא מתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה מחדש בלי תמלוגים. התנאי העיקרי הוא שמירת הודעת זכויות היוצרים וצירוף עותק של הרישיון המקורי בכל הפצה של המוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗