GPT
Q

Qwen3.6-35B-A3B-Escha-W2

קוד פתוח

EschaLabsapache-2.02026-07-22

  • mlx
  • safetensors
  • qwen3_5_moe
  • mixture-of-experts
  • moe

גרסה מכווצת בשני ביט של מודל המומחים מבית עליבאבא, שנדחסת לכרטיס מסך בודד. מי שיוריד אותה יקבל ביצועים קרובים למקור בגודל קובץ של 12.3 גיגה בלבד.

  • 7.3Bפרמטרים
  • 262,144טוקנים בהקשר
  • 11.5 GBמשקל הקבצים
  • 4,966הורדות בחודש

מה זה

הפרויקט הזה לוקח את Qwen3.6-35B-A3B ומכווץ את המומחים שלו לפורמט של שני ביט, תוך שמירה על שכבות צפופות בפורמט int8. המשקל יורד מנפח עצום של קרוב לשבעים גיגה בגרסת הבסיס לכדי 11.5 עד 12.3 גיגה בדיסק. המודל שומר על כמעט 90 אחוז התאמה בבחירת הטוקן הבא ביחס לקוד המקורי, כך שבפועל הוא כמעט ולא מאבד איכות.

בבדיקות השוואה מול מודל FP8 מלא, הוא מציג תוצאות דומות מאוד ברוב המשימות, כולל ציון של 93.8 במתמטיקה ו־88.9 בהפעלת כלים. הירידה העיקרית נרשמה במשימות תכנות ארוכות ומורכבות, שם הוא איבד מעט יכולת לעומת המקור. המודל תומך במצב חשיבה מובנה שמאפשר לו לנמק לפני שהוא עונה.

מתאים ל

  • עוזר פיתוח מקומי

    מתחבר ישירות לכלי עבודה דרך ממשק OpenAI ומייצר קוד במהירות גבוהה על גבי מחשב מקומי עם כרטיס בודד.

  • הפעלת כלים וסוכנים

    שומר על דיוק גבוה של 88.9 אחוזים בקריאה לפונקציות ומתאים לעבודה שדורשת מענה מדויק על פי פורמט.

  • מערכות מענה מבוססות חשיבה

    מפעיל נימוק מעמיק צעד אחר צעד לשאלות מורכבות במתמטיקה ומדע בעזרת תקציב טוקנים ייעודי למחשבה.

איפה זה נופל

המודל הזה מיועד לטקסט בלבד. אף על פי שהמבנה הפנימי כולל הגדרות לרכיב ראייה, המשקלים של התמונות נמחקו בכיווץ ואי אפשר לשלוח לו תמונות. בנוסף, חובה להשתמש בגרסת transformers מגובה 5.8 ומעלה, כי גרסאות ישנות יותר מייצרות ג'יבריש שוטף עם אזהרה בודדת בלוג. במנוע ZML חלה נפילה של יותר מחצי ממהירות הפלט ברגע שמשנים את הטמפרטורה מעל אפס, וכרטיסי 16 גיגה קורסים שם עם שגיאת שרת פנימית בטקסטים ארוכים.

שאלות
נפוצות

האם אפשר להריץ אותו על כרטיס מסך עם 16 גיגה זיכרון?

כן, כרטיסים כמו RTX 5080 או RTX 5060 Ti נתמכים באמצעות מנוע SGLang עם הגדרות זיכרון ייעודיות. עם זאת, תצטרכו להגביל את ההקשר לשמונת אלפים טוקנים אם תרצו לשרת כמה שיחות במקביל, או להישאר עם שיחה בודדת לחלון מלא של שלושים ושניים אלף. מנוע ZML קורס על כרטיסים כאלה בטקסטים ארוכים.

למה המודל מחזיר טקסט שנראה הגיוני אבל לא קשור לשאלה?

ברוב המקרים מדובר בגרסה ישנה של ספריית transformers בסביבת העבודה שלכם. גרסאות מתחת ל־5.8 אינן מזהות את מבנה המודל נכון, והשרת ימשיך לרוץ ויפלוט מלל שגוי במקום לעצור עם שגיאה. התקנת הגרסה העדכנית לפי הוראות המנוע פותרת את התקלה.

איך מריצים

בשביל להריץ אותו צריך כרטיס של 16 גיגה זיכרון לפחות, כמו RTX 5060 Ti, אבל כרטיס של 24 גיגה כמו RTX 4090 הוא הבחירה הבטוחה לעבודה חלקה. על 16 גיגה נאלצים לבחור בין הקשר ארוך לבין כמה בקשות במקביל. ההרצה דורשת לינוקס ומנהל התקן של אנווידיה, כאשר את המנוע עצמו מורידים ממאגר חיצוני שמציע שתי אפשרויות: מנוע SGLang מבוסס פייתון 3.12 שתומך בפניות מקביליות וכלים, או קובץ הרצה בודד בשם ZML למשתמש יחיד. יש גם תמיכה ישירה במק דרך ספריית MLX.

השרת חושף ממשק תואם OpenAI בפורט שלושים אלף. אם אין לכם כרטיס מסך מודרני מסדרת Ampere ומעלה, או שאתם צריכים לשרת עשרות משתמשים בו־זמנית בלי להתעסק בהגדרות זיכרון עדינות, עדיף להשתמש ב־API מרוחק.

pip install -U huggingface_hub
hf download EschaLabs/Qwen3.6-35B-A3B-Escha-W2

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש במודל, לשנות אותו ולשלב אותו במוצרים מסחריים בלי לשלם תמלוגים, כל עוד מצרפים את עותק הרישיון והודעות זכויות היוצרים המקוריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗