GPT
Q

Qwen3.8-27B-MTPLX-Optimized-Quality

קוד פתוח

Youssofalapache-2.02026-08-14

  • mlx
  • safetensors
  • qwen3_5
  • apple-silicon
  • macos

גרסת 8 ביט של Qwen 27B למחשבי מק, ששומרת על דיוק כמעט זהה למקור המלא. היא מיועדת למי שרוצה תשובות ברמת משקל מלא בלי לוותר על מהירות סבירה.

  • 27Bפרמטרים
  • 262,144טוקנים בהקשר
  • 27.9 GBמשקל הקבצים
  • 26,614הורדות בחודש

מה זה

המודל הזה נבנה ספציפית לסביבת mlx על גבי מחשבי אפל, תוך שימוש בכימות דינמי של 8 ביט למטריצות המשקלים ושמירה על שכבות רגישות כמו הנורמליזציה וראש החיזוי ב־16 ביט. המטרה כאן היא איכות פלט ולא מהירות שיא. מרחק ה־KL מהמודל המקורי עומד על 0.00105 בלבד, מה שאומר שבפועל קשה מאוד להבחין בהבדל בינו לבין המקור הלא מכומת.

הוא כולל מנגנון חיזוי מרובה טוקנים שמאפשר לו לייצר טיוטות ולאמת אותן במעבר יחיד, מה שמניב 48.3 טוקנים לשנייה במשימות קוד וקצת מעל 33 טוקנים לשנייה בחשיבה ארוכה על מעבד M5 Max. חלון ההקשר עומד על 262,144 טוקנים, כך שאפשר להזין תיעוד ענק או קבצי קוד שלמים בלי לחתוך שום דבר בדרך.

מתאים ל

  • פיתוח ובדיקת קוד מקומית

    שומר על דיוק מלא במשימות תכנות ומגיע לכמעט 50 טוקנים לשנייה על מק חזק.

  • הסקה עם שרשראות חשיבה ארוכות

    תומך במענה של עשרות אלפי טוקנים ומאפשר ריצת חשיבה עמוקה בלי לאבד יציבות.

  • ניתוח מסמכים ועצי קוד גדולים

    חלון הקשר של 262,144 טוקנים מאפשר לקרוא ספריות שלמות בפעימה אחת על המחשב.

איפה זה נופל

הפשרה המרכזית פה היא מהירות מול איכות. גרסאות ה־4 ביט של אותה משפחה מגיעות לעד 65 טוקנים לשנייה, בזמן שכאן תרדו לאזור ה־33 עד 48 טוקנים לשנייה. בנוסף, חלון ההקשר העצום תיאורטית דורש חומרה חזקה מאוד, והמדידות נעשו על מעבד M5 Max עם מאווררים בעוצמה מקסימלית, כך שעל חומרה חלשה יותר או תחת עומס חום הביצועים יהיו נמוכים משמעותית.

שאלות
נפוצות

כמה זיכרון מחשב אני באמת צריך כדי שהמודל יעבוד?

הכרטיס דורש לפחות 36 גיגה זיכרון אחוד במק, כשהצריכה בפועל בעבודה מגיעה ל־32.7 גיגה. במחשב עם 32 גיגה או פחות הוא לא יעבוד בצורה יציבה ותקבלו קריסות או זחילת ביצועים.

למה לבחור בו ולא בגרסת Optimized Speed?

גרסת האיכות הזו קרובה פי 21 למודל המקורי הלא מכומת ומיועדת למי שלא מוכן להתפשר על דיוק הפלט. אם המטרה היא מהירות כתיבה מקסימלית ואתם מוכנים לאבד מעט דיוק, גרסאות ה־4 ביט יהיו מהירות יותר.

האם המודל מתאים לעבודה על מחשבי מק ישנים?

לא מומלץ להריץ את הגרסה הזו על שבבי M1 או M2. היוצר מציין במפורש שבמחשבים כאלה עדיף להשתמש בבילד ה־FP16 הנפרד של המודל כדי לקבל תוצאות תקינות.

איך מריצים

כדי להריץ אותו צריך מק עם 36 גיגה זיכרון אחוד לפחות, כשבפועל צריכת הזיכרון שנמדדה מגיעה ל־32.7 גיגה. ההרצה נעשית דרך ספריית mtplx בפקודת שרת פשוטה או באפליקציה ייעודית למק. אם יש לכם מחשב עם מעבדי M1 או M2, המפתח מציין שצריך לעבור לגרסת ה־FP16 ולא לגרסה הזו.

אם יש לכם פחות מ־36 גיגה זיכרון, המודל הזה פשוט יחנוק את המחשב. במקרה כזה, או אם אתם צריכים רק מהירות שיא לכתיבת קוד פשוטה בלי לנתח מערכות מורכבות, עדיף להשתמש בגרסאות ה־4 ביט כמו Optimized Speed או Bare Speed, או לשלם על API חיצוני.

pip install -U huggingface_hub
hf download Youssofal/Qwen3.8-27B-MTPLX-Optimized-Quality

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0, שמאפשר שימוש חופשי כולל שימוש מסחרי מלא, שינוי של הקוד והפצה מחדש. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים וצירוף עותק של הרישיון המקורי בתוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗