GPT
Q

Qwen3.6-27B-OptiQ-4bit

קוד פתוח

mlx-communityapache-2.02026-04-25

  • mlx
  • safetensors
  • qwen3_5
  • quantized
  • mixed-precision

גרסת 4 ביט מעורבת של Qwen3.6-27B למחשבי מק, שמצמצמת את הפגיעה באיכות מול קוונטיזציה רגילה. היא כוללת ראש חיזוי מובנה שמאיץ את מהירות הפלט ב־1.4x.

  • 27Bפרמטרים
  • 262,144טוקנים בהקשר
  • 18.6 GBמשקל הקבצים
  • 3,699הורדות בחודש

מה זה

מדובר במודל שרץ על תשתית MLX של אפל, שנוצר באמצעות כלי בשם mlx-optiq. במקום לדחוס את כל השכבות לאותה רמה בדיוק, הכלי בודק אילו שכבות רגישות לדיוק ומשאיר 220 מהן ב־8 ביט, בעוד 276 שכבות עמידות יותר יורדות ל־4 ביט. השילוב הזה שומר על חלון הקשר המלא של 262,144 טוקנים ותופס 18.6 גיגה בייט בדיסק.

התוצאה בפועל מורכבת ממה שהמפתחים מכריזים עליו. בציון הממוצע של שישה מבחנים יש יתרון קל של פחות מחצי נקודה מול קוונטיזציה אחידה, אך מבט על המספרים עצמם מראה פשרות: יש שיפור מסוים בעמידה בהנחיות קפדניות ובשליפת מידע מהקשר ארוך, אבל ביצועי הקוד והמתמטיקה מעט נמוכים יותר מהגרסה האחידה.

מתאים ל

  • עבודה עם טקסטים ארוכים

    מבחן שליפת המידע HashHop מציג שיפור של 3 אחוזים מול דחיסה אחידה, מה שעוזר בניתוח מסמכים גדולים מקומית.

  • שרת הסקה מקומי מהיר במק

    ראש ה־MTP המצורף מאפשר מהירות פלט של פי 1.4 על חומרת אפל סיליקון בלי צורך בהגדרות מורכבות.

  • משימות מעקב אחר הנחיות

    במבחן IFEval הקפדני המודל רושם עלייה של 2.4 אחוזים ביכולת לדייק בפורמטים ומגבלות שהוגדרו מראש.

איפה זה נופל

למרות ההבטחה לעקוף קוונטיזציה אחידה בכל מבחן, במבחן כתיבת הקוד HumanEval המודל משיג 90.2 אחוז לעומת 92.1 אחוז בגרסה הרגילה, ירידה מורגשת של כמעט שני אחוזים. נרשמו גם ירידות קטנות בפתרון בעיות מתמטיקה, מבחני ידע כללי וקריאות לכלים. בנוסף, המודל שוקל בדיסק 17.5 עד 18.6 גיגה בייט, תוספת של שני גיגה וחצי לעומת דחיסה אחידה. אם המשימה העיקרית שלכם היא קוד, הדחיסה הזו כנראה פחות מתאימה.

שאלות
נפוצות

האם אפשר להריץ את המודל הזה על כרטיס של אנבידיה או בלינוקס?

לא, קבצי המודל נבנו ספציפית עבור ספריית MLX שעובדת רק על מערכות macOS ומעבדי אפל סיליקון. כדי להריץ את Qwen3.6-27B על חומרה אחרת תצטרכו לחפש המרות בפורמטים כמו GGUF או משקלים מקוריים של Hugging Face.

כמה זיכרון מחשב צריך בשביל להריץ אותו בפועל?

מחשב עם 16 גיגה בייט זיכרון אחוד יקרוס או ייכנס להחלפות דיסק כבדות כי המודל לבדו תופס מעל 18 גיגה בייט. הסף המעשי לעבודה תקינה מתחיל במחשבי מק עם 32 גיגה בייט, ורצוי יותר אם רוצים לפתוח חלון הקשר משמעותי.

איך מריצים

טוענים את המודל ישירות דרך ספריית mlx-lm בפייתון עם הפונקציות load ו־generate, או מריצים שרת מקומי עם mlx-optiq. כדי להרוויח את האצת הפלט של ראש ה־MTP המצורף, שמגיע לדיוק קבלה של כ־70 אחוז, צריך להפעיל את פקודת השרת עם הדגל הייעודי.

המשקל בדיסק עומד על 18.6 גיגה בייט, כך שבפועל צריך מק עם זיכרון אחוד של 32 גיגה בייט לפחות כדי להריץ אותו בנוחות יחד עם מערכת ההפעלה והקשר בסיסי. אם אתם מתכננים לנצל חלון הקשר מלא של מעל רבע מיליון טוקנים, תצטרכו נפח זיכרון עצום עבור ה־KV cache, ושם זול ופשוט יותר לשלם ל־API חיצוני לפי שימוש מאשר לקנות חומרה מתאימה.

pip install -U huggingface_hub
hf download mlx-community/Qwen3.6-27B-OptiQ-4bit

הרישיון

המודל מופץ תחת רישיון Apache 2.0 שעובר בירושה ממודל הבסיס. הרישיון חופשי ומאפשר שימוש מסחרי מלא, שינוי של המשקלים והפצה בתוך מוצרים סגורים. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים והעתק הרישיון המקורי בקבצי המוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗