GPT
Q

Qwen3.6-35B-A3B-MLX-8bit

קוד פתוח

unslothapache-2.02026-04-17

  • mlx
  • safetensors
  • qwen3_5_moe
  • unsloth
  • qwen

גרסת שמונה ביט לתשתית MLX של מודל תערובת מומחים, שמפעיל רק 3 מיליארד פרמטרים מתוך 35 מיליארד בכל שלב. הוא מכוון ישירות לפיתוח קוד וסוכנים על חומרת אפל.

  • 35Bפרמטרים
  • 262,144טוקנים בהקשר
  • 35.1 GBמשקל הקבצים
  • 4,449הורדות בחודש

מה זה

מדובר בהמרה של Unsloth למודל מולטי־מודאלי שמשלב עיבוד תמונה וטקסט, המבוסס על ארכיטקטורת MoE עם 256 מומחים שמהם מופעלים שמונה מומחים ועוד אחד משותף. המבנה הזה נותן קיבולת זיכרון רחבה של 35 מיליארד פרמטרים, אבל שומר על מהירות חישוב של מודל קטן בהרבה, לצד חלון הקשר עצום שנפתח ב־262,144 טוקנים.

הדגש המרכזי בגרסה הזו הוא משימות של סוכני קוד. במבחן SWE-bench Verified הוא מגיע לציון 73.4, ובמבחן SWE-bench Pro ל־49.5. זה מציב אותו בבירור מעל דגמים כמו Gemma4-26BA4B ומראה עדיפות ברורה בפתרון בעיות אמיתיות בריפוזיטורי ופקודות טרמינל, שם רשם 51.5 ב־Terminal-Bench 2.0. לצד זה הוא כולל מנגנון שמשמר את תהליך המחשבה בין הודעות ושיפור בפענוח קריאות לפונקציות מקוננות.

מתאים ל

  • סוכן קוד מקומי לפרויקטים

    ניווט בריפוזיטורי ופתרון תקלות מורכבות הודות לציונים גבוהים במבחני SWE-bench ותמיכה בהקשר ארוך.

  • אוטומציה עם פקודות טרמינל

    הרצת סקריפטים ומשימות מערכת בזכות תוצאה של 51.5 נקודות במבחן Terminal-Bench 2.0.

  • חיבור כלים וקריאת פונקציות

    עבודה מול סכמות מורכבות בעזרת שיפור ייעודי לפענוח אובייקטים מקוננים בכלי עבודה חיצוניים.

איפה זה נופל

במשימות של סוכנים כלליים שלא קשורות ישירות לקוד, הביצועים שלו פחות מרשימים. במבחן VITA-Bench הוא נעצר על 35.6, וב־Tool Decathlon על 26.9, תוצאות שנמוכות אפילו מגרסאות דחוסות פחות או ממודלים צפופים מסדרת 3.5. בנוסף, מודל של 35 גיגה־בייט בפורמט שמונה ביט עדיין זולל זיכרון מהר מאוד ברגע שמעמיסים תמונות מורכבות או היסטוריית שיחה ארוכה.

אותה משפחה

Qwen3.6 יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל הזה על כרטיס RTX 4090?

לא. מדובר בהמרה שמיועדת ספציפית לספריית MLX שעובדת רק על החומרה של אפל סיליקון במחשבי מק. כדי להריץ על כרטיס של אנבידיה תצטרכו לחפש את משקלי ה־Transformers המקוריים או גרסאות GGUF.

כמה זיכרון בפועל נדרש במק שלי?

המודל תופס כ־35.1 גיגה־בייט של זיכרון מאוחד רק בשביל המשקלים. מומלץ להחזיק מחשב עם 64 גיגה־בייט זיכרון כדי להשאיר מקום למערכת ההפעלה, לטוקנים הנוספים של ההקשר ולעיבוד תמונות בלי חניקה של המערכת.

איך מריצים

המשקל הכולל של הקבצים עומד על 35.1 גיגה־בייט, והוא נבנה ספציפית עבור ספריית MLX. המשמעות היא שאתם חייבים מחשב מק עם זיכרון מאוחד של 48 גיגה־בייט לפחות כדי לטעון אותו, ולמעשה 64 גיגה־בייט אם אתם מתכננים לנצל חלונות הקשר ארוכים של מאות אלפי טוקנים או להעביר תמונות.

ההרצה מתבצעת ישירות בפייתון דרך mlx_vlm.chat אחרי התקנת הסקריפט הייעודי. אם יש לכם מחשב עם פחות מ־48 גיגה זיכרון, או שאתם מחפשים שרת לינוקס מבוסס כרטיסי אנבידיה, הפורמט הזה פשוט לא מתאים ותעדיפו גרסאות GGUF, תשתית vLLM, או גישה ל־API מרוחק.

pip install -U huggingface_hub
hf download unsloth/Qwen3.6-35B-A3B-MLX-8bit

הרישיון

הרישיון הוא Apache 2.0 מלא. אתם יכולים להשתמש בו באופן חופשי למטרות מסחריות, לשנות אותו, להטמיע אותו במוצרים שלכם ולהפיץ אותו, כל עוד אתם שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗