GPT
Q

Qwen3.8-Flash-Next-REAP-288-MLX-4bit

קוד פתוח

sh0wieother2026-08-27

  • mlx-vlm
  • safetensors
  • qwen4_exp
  • mlx
  • moe

גרסה מכווצת של מודל ענק שמיועדת להרצה מקומית על מחשבי מק עם אפל סיליקון. חתכו ממנו מומחים כדי לחסוך עשרות גיגהבייט בזיכרון בלי לפרק את יכולות התכנות.

  • 125Bפרמטרים
  • 262,144טוקנים בהקשר
  • 68.5 GBמשקל הקבצים
  • 14,921הורדות בחודש

מה זה

מדובר בהסבה של מודל תערובת מומחים מסדרת קוון, שבה צמצמו את כמות המומחים מ־512 ל־288 בכל שכבה בעזרת שיטת גיזום בשם REAP. המשקל הכולל ירד ב־31 אחוזים בהשוואה למודל המלא המכומת, מה שמאפשר לו להיכנס במלואו לזיכרון של מחשבי מק עם 128 גיגהבייט זיכרון מאוחד. הוא משלב ארכיטקטורה היברידית של שכבות תשומת לב דלילה לצד שכבות דלתא־נט, ומכיל טבלת שיבוץ אנ־גרם גדולה של 51B פרמטרים שניתן להזרים ישירות מכונן האחסון כדי לחסוך עוד מקום בראם.

במדד HumanEval המודל שומר על ציון של 91.5 אחוזים במעבר ראשון, לעומת 93.9 אחוזים בגרסת הבסיס המלאה של 512 מומחים. המשמעות היא שהוויתור על כמעט מחצית מהמומחים עולה בפועל בפחות משניים וחצי אחוזים בדיוק כתיבת הקוד, אך מאפשר לו לרוץ בקצב סביר של 28 טוקנים לשנייה ומעלה על גבי שבב M4 Max.

מתאים ל

  • סוכן תכנות מקומי במק

    מתאים לעבודה שוטפת מול קבצי קוד בלי לשלוח נתונים החוצה, עם ביצועי HumanEval גבוהים של 91.5 אחוזים.

  • שרת מקומי דל זיכרון

    שימוש במצב הזרמה מבוסס כונן מהיר תופס כ־39 גיגהבייט זיכרון בלבד ומפנה ראם למשימות פיתוח מקבילות.

  • בדיקת פיענוח ספקולטיבי

    התנסות עם מודל טיוטה ייעודי מסוג MTP לבדיקת יחסי האצה בחומרות אפל שונות.

איפה זה נופל

הכיול לגיזום המומחים נעשה כולו על כ־686 אלף טוקנים של תעבורת קוד ומשימות סוכנים של צוות בודד. המשמעות היא שבתחומים שרחוקים מתכנות הביצועים עלולים לצנוח בצורה חדה הרבה יותר ממה שנמדד במבחני הקוד. בנוסף, רכיב עיבוד התמונה קיים במשקלי המודל אך לא נבדק כלל לאחר הגיזום, ולכן אי אפשר להסתמך עליו למשימות ראייה ממוחשבת. הכרטיס מזהיר גם מבעיית אמינות בשמות נדירים, שבהם המודל מתבלבל באחת מכל עשר דגימות ומייצר טקסט משובש שמחייב ניקוי של היסטוריית השיחה.

שאלות
נפוצות

האם המודל תומך בתמונות למרות שמדובר בגרסת קוד מכווצת?

משקלי הראייה שמורים בתוך הקבצים, אבל המפתחים לא בדקו אותם כלל לאחר הסרת המומחים. אם המערכת שלכם נשענת על ניתוח תרשימים או תמונות ממשק, עדיף להניח שהיכולת הזו לא יציבה או לקויה עד שתבדקו אותה ידנית.

כמה זיכרון מחשב צריך בשביל להריץ אותו בפועל?

ההרצה הרגילה בתוך הזיכרון דורשת כ־68 גיגהבייט פנויים, מה שמחייב מחשב עם 128 גיגהבייט זיכרון מאוחד. עם זאת, הרצה דרך כלי שתומך בהזרמת טבלת האנ־גרם מהכונן מאפשרת להסתפק בכ־39 גיגהבייט זיכרון פעיל, כך שניתן להרים אותו גם על מכונות עם פחות זיכרון במחיר של פגיעה מסוימת בקצב הייצור.

איך מריצים

כדי להריץ אותו בזיכרון מלא של 68 גיגהבייט משתמשים בספריית mlx-vlm מגרסה עדכנית התומכת בארכיטקטורה הזו. אם רוצים לחסוך זיכרון ולהסתפק בכ־39 גיגהבייט ראם, מריצים אותו דרך כלי בשם omlx החל מגרסה 0.6.4 שמזרים את טבלת האנ־גרם ישירות מכונן ה־NVMe עם הגבלת זיכרון מתאימה. פעולה כזו מאפשרת להרים שרת מקומי שתואם לממשק של OpenAI בפורט המקומי שלכם.

המפרסם מציין תמיכה בפיענוח ספקולטיבי עם מודל טיוטה קטן, אבל בבדיקות שלהם על שבבי M4 השיפור במהירות כמעט לא מורגש ומגיע לנקודת איזון בלבד, לעומת שבבי M5 שבהם נרשמה האצה משמעותית. אם אין לכם מק חזק עם לפחות 48 או 128 גיגהבייט זיכרון פנוי, עדיף בהחלט לפנות למודל גדול שיושב מאחורי ענן ולא לנסות להריץ 68 גיגהבייט מקומית.

pip install -U huggingface_hub
hf download sh0wie/Qwen3.8-Flash-Next-REAP-288-MLX-4bit

הקבצים

150 קבצים במאגר, 68.5 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא רישיון קהילתי מבית קוון בגרסה אחת נקודה אפס, שירש ממודל המקור. ברישיון מסוג זה יש בדרך כלל מגבלות שימוש מסחרי שקשורות לכמות משתמשים חודשית פעילה ומגבלות על אימון מודלים מתחרים. מי שמתכנן לשלב אותו במוצר מסחרי עם נפח שימוש רחב צריך לבדוק את התנאים המלאים של עליבאבא בקובץ המצורף.

הרישיון המלא בעמוד המודל ↗