GPT
Q

Qwen3.6-35B-A3B-OptiQ-4bit

קוד פתוח

mlx-communityapache-2.02026-04-26

  • mlx
  • safetensors
  • qwen3_5_moe
  • quantized
  • mixed-precision

גרסה מכווצת למחשבי מק של מודל תערובת מומחים עם 35 מיליארד פרמטרים. היא משלבת רמות דיוק שונות כדי לשמור על ביצועים בלי לנפח את הזיכרון.

  • 35Bפרמטרים
  • 262,144טוקנים בהקשר
  • 23.0 GBמשקל הקבצים
  • 8,532הורדות בחודש

מה זה

המודל הזה מבוסס על ארכיטקטורת תערובת מומחים ומגיע בכיול מיוחד של ארבע ביט שפותח עבור מעבדי אפל. במקום לכווץ את כל השכבות באותה צורה, התהליך משאיר 392 שכבות רגישות ברמת שמונה ביט ומוריד 118 שכבות לארבע ביט. הכיול נעשה מול דוגמאות של קוד, חשיבה, כתיבה והפעלת פקודות.

במבחני הביצועים הוא מציג יתרון מובהק בשליפת מידע מהקשר ארוך ובקריאות לפונקציות, עם 92.5% במבחן BFCL לעומת גרסת ארבע ביט אחידה. בקוד הוא שומר על 91.5% הצלחה. מצד שני, הממוצע הכולל שלו גבוה יותר בעיקר בזכות השליפה, כי בידע כללי ובמתמטיקה הוא מפסיד מעט לגרסה הרגילה.

מתאים ל

  • הפעלת כלים וסוכנים מקומיים

    הוא מגיע ל־92.5% במבחן BFCL לקריאות פונקציה, תוצאה גבוהה יותר מגרסאות כיווץ סטנדרטיות.

  • יצירת קוד במחשבי מק

    ציון של 91.5% ב־HumanEval ומענה מהיר יחסית על מחשב אישי בלי תלות ברשת.

  • שרת מקומי לתשובות מהירות

    שימוש ברכיב החיזוי המובנה מאפשר לקבל קצב ייצור טקסט מהיר פי 1.4 על חומרת אפל.

איפה זה נופל

למרות השמירה על שכבות ברמת דיוק גבוהה יותר, המודל מאבד נקודות במשימות חשיבה מתמטית וידע כללי לעומת כיווץ אחיד. במבחן GSM8K הוא יורד מ־89.4% ל־87.9%, וב־MMLU מ־84.6% ל־83.7%. בנוסף, במבחן HashHop לשליפת הקשר ארוך הוא מגיע ל־52% בלבד, שזה שיפור מול חלופות קטנות אבל עדיין רחוק מדיוק מלא. התוספת של שכבות שמונה ביט גם מגדילה את הקבצים בכשלושה גיגה בייט לעומת גרסת ארבע ביט רגילה.

שאלות
נפוצות

האם המודל יעבוד על כרטיס מסך של Nvidia?

לא. הקבצים והספריות כאן מיועדים ישירות לתשתית MLX של אפל. כדי להריץ על חומרה אחרת תצטרכו להשתמש בגרסה המקורית של המודל או לחפש המרות לפורמטים כמו GGUF.

מה נותן ראש החיזוי המצורף לחבילה?

מדובר במנגנון שמאפשר למודל לנחש כמה טוקנים קדימה במקביל. בהרצה דרך הכלי של optiq הוא מעלה את קצב ייצור הטקסט בכארבעים אחוז עם פגיעה מינימלית.

איך מריצים

טוענים אותו ישירות בפייתון עם ספריית mlx-lm או מריצים שרת מקומי דרך חבילת mlx-optiq. החבילה הזו תומכת בראש חיזוי שמאיץ את ייצור הטקסט פי 1.4 עם שיעור קבלה של 70% בערך. קבצי המודל תופסים כ־23 גיגה בייט, כך שצריך מחשב מק עם לפחות 32 גיגה בייט זיכרון מאוחד כדי להחזיק את המשקלים ואת זיכרון ההקשר בלי לפגוע בביצועים.

אם אין לכם חומרה ייעודית של אפל עם מספיק זיכרון, עדיף להשתמש בנקודת קצה מרוחקת בענן. המודל בנוי ספציפית לטכנולוגיית MLX ולא ירוץ ישירות על כרטיסי מסך אחרים בלי המרה נפרדת.

pip install -U huggingface_hub
hf download mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit

הרישיון

הרישיון הוא Apache 2.0, שמועבר ישירות ממודל המקור. אפשר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗