GPT
Q

Qwen3.5-9B-OptiQ-4bit

קוד פתוח

mlx-communityapache-2.02026-03-05

  • mlx
  • safetensors
  • qwen3_5
  • quantized
  • mixed-precision

גרסה מכווצת של מודל תשעה מיליארד פרמטרים שמיועדת למחשבי אפל בלבד. היא משלבת רמות דיוק שונות לפי רגישות השכבות כדי לחלץ ביצועים עדיפים בלי לנפח את הזיכרון.

  • 9Bפרמטרים
  • 262,144טוקנים בהקשר
  • 7.7 GBמשקל הקבצים
  • 16,938הורדות בחודש

מה זה

המודל הזה לוקח את הדגם הבסיסי של תשעה מיליארד פרמטרים ומכווץ אותו לעבודה מקומית עם ספריית MLX. במקום לחתוך את כל השכבות לארבעה ביטים בצורה אחידה, המפתחים בדקו רגישות והשאירו 132 שכבות קריטיות בשמונה ביטים, בזמן ש־116 השכבות העמידות יותר ירדו לארבעה ביטים. הוא כולל גם ראש חיזוי מובנה שמאיץ את ייצור הטוקנים בערך פי 1.4 בהרצה תואמת.

במבחני הביצועים הוא מציג יתרון קל על פני כיבוץ אחיד רגיל, במיוחד בכתיבת קוד עם זינוק של 2.4 נקודות ב־HumanEval. מנגד, השיפור הכללי זעיר, פחות מרבע נקודה בממוצע ששת המבחנים. קריאות לפונקציות ושליפת מידע מהקשר ארוך אפילו חטפו פגיעה של אחוז שלם לעומת הכיבוץ הרגיל, כך שלא מדובר בהתעלות גורפת בכל תחום.

מתאים ל

  • השלמת קוד מקומית במק

    הוא מציג קפיצה ל־81.1 אחוז ב־HumanEval ורץ מקומית בלי חיבור לרשת על מחשב נייד.

  • שרת צ'אט אישי מהיר

    ראש החיזוי המובנה מאפשר האצה של פי 1.4 בקצב הפליטה בעזרת כלי ההרצה הייעודי.

  • פיתוח סוכנים מבודד

    חבילת ההרצה שלו כוללת תמיכה בהרצת פייתון בסביבה סגורה למשימות סוכנים אוטונומיים.

איפה זה נופל

הנקודה החלשה ביותר בגרסה הזו היא שליפת מידע מתוך הקשר ארוך. למרות חלון הקשר עצום של 262,144 טוקנים, במבחן HashHop הוא השיג ציון נמוך במיוחד של 25 אחוז בלבד, שזה אפילו פחות מגרסת הכיבוץ הרגילה. גם בתחום של הפעלת כלים וקריאות לפונקציות הוא רשם נסיגה קלה ל־91 אחוז. בנוסף, משקל הקובץ בדיסק עלה ביותר מגיגה בייט לעומת גרסת ארבעה ביטים רגילה כדי לקבל הפרש ביצועים כולל שכמעט ולא מורגש ברוב המשימות.

שאלות
נפוצות

האם אפשר להריץ את המודל הזה על מחשב עם חלונות וכרטיס מסך של אנבידיה?

לא. מדובר בגרסה שנבנתה ישירות עבור MLX, ספריית העיבוד שפועלת אך ורק על המעבדים הגרפיים של מחשבי אפל סיליקון. עבור חומרה אחרת תצטרכו לחפש פורמטים חלופיים כמו GGUF.

האם הוא באמת שומר על זיכרון של ארבעה ביטים?

לא לגמרי. השם ארבעה ביטים מציין את הדיוק של רוב השכבות, אבל יותר ממחצית מהשכבות הוגדרו בשמונה ביטים כדי להגן על הדיוק. בגלל זה המשקל שלו על הדיסק גבוה ב־1.1 גיגה בייט לעומת כיבוץ אחיד רגיל.

איך מפעילים את מהירות הדור המשופרת שהמפתחים מדברים עליה?

כדי לנצל את תוספת המהירות צריך להתקין את ספריית mlx-optiq ולהריץ את פקודת השרת עם הדגל הייעודי לחיזוי מרובה טוקנים, שמשתמש בקובץ הראש המצורף ומגיע לכשבעים אחוזי קבלה.

איך מריצים

כדי להריץ אותו צריך מק עם שבב אפל וספריית mlx-lm או mlx-optiq בפייתון. הקבצים שוקלים 7.7 גיגה בייט, ובפועל המודל תופס קצת מעל שישה גיגה זיכרון פנימי, כך שמחשב עם 16 גיגה זיכרון מאוחד יריץ אותו בקלות לצד מערכת ההפעלה.

אם אין לכם חומרה של אפל, המודל הזה פשוט לא בשבילכם כי הוא תלוי לחלוטין בארכיטקטורה של MLX. במקרה שאתם בונים שירות שדורש שרתים מרוחקים של לינוקס או מעבדי אנבידיה, עדיף לפנות לגרסאות בפורמטים אחרים או להשתמש בחיבור ישיר למודל בענן.

pip install -U huggingface_hub
hf download mlx-community/Qwen3.5-9B-OptiQ-4bit

הרישיון

הרישיון הוא Apache 2.0 מלא שעובר מהמודל המקורי. אפשר להשתמש בו חופשי למוצרים מסחריים, לשנות את הקוד, לפרסם גרסאות משלכם ולהפיץ אותו בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗