GPT
Q

Qwen3.8-27B-MTPLX-Optimized-Speed

קוד פתוח

Youssofalapache-2.02026-08-14

  • mlx
  • safetensors
  • qwen3_5
  • apple-silicon
  • macos

גרסה מכוילת לקוד על גבי מחשבי מק, שמנצלת חיזוי רב טוקנים כדי להאיץ את הפליטה. היא שומרת על דיוק קרוב למקור למרות כימוס דינמי לארבע ביט.

  • 27Bפרמטרים
  • 262,144טוקנים בהקשר
  • 19.3 GBמשקל הקבצים
  • 69,355הורדות בחודש

מה זה

מדובר בהסבה של Qwen 3.8 בגודל 27B עבור ספריית mlx, שמכוונת להרצה מקומית מהירה על חומרת אפל. במקום כימוס אחיד שפוגע ביכולות התכנות, שילבו כאן דחיסה מעורבת. רוב הרשת יושבת ב־4 ביט, אבל חלקים רגישים כמו שכבות ה־MLP האחרונות וההטמעות נשארו ב־8 ביט, וראש החיזוי נשאר ב־16 ביט מלאים. זה מוריד את הסטייה מגרסת המקור לערך נמוך של 0.0220 במבחני קוד.

בבדיקות על שבב M5 Max, המודל פולט 58.7 טוקנים לשנייה במשימות פיתוח עם חשיבה בינונית, וצונח לאזור ה־35 טוקנים לשנייה כשהוא מייצר תשובות ארוכות מאוד בעומס חשיבה גבוה. מנגנון הניחוש קדימה נותן פה קצב עבודה גבוה בלי לפגוע בהתפלגות התוצאות, כי כל טוקן שנחזה מאומת מול הרשת המקורית לפני שהוא מאושר.

מתאים ל

  • פיתוח עם סוכני קוד מקומיים

    חיבור ישיר לכלי עבודה ב־API מקומי, עם קצב פליטה מהיר במיוחד למשימות תכנות שוטפות.

  • עבודה מבוססת הקשר ארוך

    תמיכה בחלון ענק של 262,144 טוקנים מאפשרת לטעון תיעוד נרחב וקבצי מקור שלמים לזיכרון.

  • הרצה מקומית על מחשבי מק

    ניצול מלא של זיכרון מאוחד בנפח 32 גיגה ללא תלות ברשת או תשלום לפי טוקן.

איפה זה נופל

המהירות הגבוהה נשענת על מנגנון חיזוי שמאבד יעילות כשהתשובות הופכות למורכבות במיוחד. בתשובות ארוכות עם חשיבה עמוקה הקצב יורד לכמעט חצי, סביב 35 טוקנים לשנייה. בנוסף, כל אימות לוקח 50 עד 53 מילישניות, כך שאם אחוז קבלת הטוקנים יורד מעבר לעומק מסוים, היתרון של החיזוי המקדים מתקזז מול עלות הבדיקה החוזרת.

שאלות
נפוצות

האם המודל ירוץ לי על מחשב עם 16 גיגה זיכרון?

לא. צריכת הזיכרון המדודה בשיא מגיעה ל־23.6 גיגה, כך שחובה להצטייד במחשב מק עם 32 גיגה זיכרון מאוחד לפחות כדי שהוא יעלה ויעבוד באופן יציב.

האם שיטת הניחוש המהיר פוגעת באיכות הקוד שהוא פולט?

היא לא פוגעת באיכות. המערכת משתמשת באימות מתמטי מדויק לכל טוקן שנחזה, כך שהפלט זהה לחלוטין למה שהמודל המקורי היה מייצר באותן הגדרות דגימה ללא ההאצה.

איך מריצים

כדי להריץ אותו צריך מק עם 32 גיגה זיכרון מאוחד לפחות, כי המודל עצמו תופס בשיא 23.6 גיגה בזיכרון. ההרצה נעשית דרך ספריית mtplx בפקודה קצרה בטרמינל שמרימה שרת מקומי בפורט 8000, או ישירות באפליקציית המק שלהם. השרת מתממשק ישירות לכלים כמו Cline או Claude Code בלי הגדרות מיוחדות.

אם אתם על מחשבי M1 או M2, היוצרים ממליצים דווקא על גרסת ה־FP16 ולא על הגרסה הזו. מי שאין לו מק עם מספיק זיכרון משותף יצטרך לפנות ל־API בענן, כי על חומרת פיסי רגילה או כרטיסי אנבידיה אין למשקלים האלה בפורמט mlx שום שימוש.

pip install -U huggingface_hub
hf download Youssofal/Qwen3.8-27B-MTPLX-Optimized-Speed

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה מחדש במוצרים סגורים. התנאי היחיד הוא שמירת הודעת הרישיון ומתן קרדיט ליוצרים המקוריים, בלי שום דרישה לחשוף את הפיתוחים שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗