GPT
Q

Qwen3.8-27B-Escha-W2

קוד פתוח

EschaLabsapache-2.02026-08-20

  • safetensors
  • qwen3_5
  • qwen3
  • 2-bit
  • quantization

גרסה מכווצת של מודל ענק שנדחסת לכרטיס מסך בודד של 24 גיגה-בייט בלי לאבד יכולות חישוב. היא מתאימה למי שרוצה חשיבה כבדה מקומית בלי לתחזק שרת מרובה כרטיסים.

  • 6.3Bפרמטרים
  • 262,144טוקנים בהקשר
  • 10.3 GBמשקל הקבצים
  • 4,568הורדות בחודש

מה זה

מדובר במודל שמבוסס על שילוב של שכבות תשומת לב עם מנגנון מבוסס מצב חוזר, שעבר כימות אגרסיבי לממוצע של 2.469 ביט למשקל. במקום לדרוש מערך שרתים יקר, כל המשקלים יושבים בנפח של 10.15 גיגה-בייט בלבד. המבנה ההיברידי חוסך זיכרון בשיחה ארוכה, כי רוב השכבות שומרות מצב פנימי בגודל קבוע במקום לשמור היסטוריה מלאה שתופחת עם כל מילה.

בבדיקות מול גרסת מקור גדולה בהרבה בפורמט שמונה ביט, המודל שומר על כוחו כמעט לחלוטין. הוא מוביל במבחני היגיון בריא, מציג יתרון קל בבדיקות קוד של לייב-קוד-בנץ', ובמבחן שאלות המומחים ג'י-פי-קיו-איי פיגר בשאלה בודדת בלבד. במילים פשוטות, הכיווץ הקיצוני לא ריסק את יכולת ההסקה שלו, והוא מתנהג כמעט כמו המודל המלא.

מתאים ל

  • פתרון בעיות היגיון וקוד

    מצב החשיבה המעמיק מתאים לפיצוח שאלות תכנות מורכבות ומשימות מתמטיקה על חומרה ביתית.

  • ניתוח מסמכים ארוכים

    המבנה ההיברידי מחזיק הקשר של מעל 64 אלף טוקנים על כרטיס בודד בלי לחרוג מזיכרון הווידאו.

  • שרת מקומי אישי ומאובטח

    מאפשר עיבוד נתונים רגישים על תחנת עבודה עצמאית עם ממשק תואם אופן-איי-איי וללא תלות ברשת.

איפה זה נופל

המודל מגיע עם מצב חשיבה שמוגדר כברירת מחדל ברמה קיצונית, ובלי תקציב מוגדר הוא עלול לשרוף את כל מגבלת הטוקנים על מחשבות ולהחזיר תשובה ריקה לחלוטין. הוא לא מקבל פניות בתפקיד מפתח בממשק תואם אופן-איי-איי ויזרוק שגיאת 400 אם תשלחו כזה. בנוסף, שמירת הקשר במטמון עובדת רק על בקשה זהה לחלוטין, כך ששיחות מתמשכות או סוכנים שמוסיפים מידע בכל סיבוב לא ייהנו מקיצור זמנים ויספגו השהיית עיבוד מלאה בכל פעם מחדש. למרות שהארכיטקטורה תומכת בטקסט ארוך מאוד, איכות התוצאות מעל 64 אלף טוקנים לא נבדקה, ואין בו שום תמיכה בתמונות.

שאלות
נפוצות

האם אפשר לשלוח למודל הזה תמונות?

לא. למרות שההגדרות של מודל הבסיס כוללות רכיב ראייה, המשקלים הדחוסים כאן הופשטו מכל רכיב חזותי וכוללים טקסט בלבד. שליחת קלטי תמונה תגרור שגיאה או תתעלם מהם.

למה קיבלתי תשובה ריקה מהמודל בלולאת סוכן?

ברירת המחדל של מאמץ החשיבה מוגדרת למקסימום ומנסחת מחשבות ארוכות במיוחד. אם מגבלת האורך של התשובה נמוכה, כל המכסה מתבזבזת על שלב ההיגיון והתוכן הסופי נחתך. כדי לפתור את זה יש להגדיר מאמץ בינוני בהגדרות התבנית או לקבוע תקציב חשיבה מפורש.

האם אפשר להריץ אותו דרך ספריות רגילות בלי מנוע ייעודי?

לא, המשקלים נדחסו בפורמט ייחודי שדורש קרנלים מותאמים אישית. חייבים להתקין את חבילת אס-ג'י-לאנג המותאמת של אסכה לפי ההוראות, אחרת המערכת לא תדע לטעון את השכבות.

איך מריצים

כדי להריץ אותו צריך כרטיס אנבידיה בארכיטקטורת אמפר ומעלה, כמו אר-טי-אקס 3090, 4090 או 5090, וסביבת לינוקס עם פייתון 3.12 ופייטורץ' מותאם. המודל דורש מנוע הרצה ייעודי של אסכה המבוסס על אס-ג'י-לאנג כדי לפענח את הקרנלים הדחוסים. אפשר להפעיל גם מודול פענוח ספקולטיבי מובנה שמעלה את הקצב כמעט פי שניים למשתמש בודד על 4090, ומגיע לכ־129 טוקנים בשנייה.

אם אתם צריכים לשרת עשרות משתמשים במקביל או שאין לכם כרטיס עם לפחות 16 עד 24 גיגה זיכרון גרפי, עדיף לפנות לממשק רשת מנוהל. הרצה מקומית על כרטיס בודד דורשת כוונון עדין של הקצאת הזיכרון, ואם מעמיסים עליה כמה פניות בו-זמנית זיכרון ההקשר ייגמר במהירות.

pip install -U huggingface_hub
hf download EschaLabs/Qwen3.8-27B-Escha-W2

הרישיון

הקוד והמשקלים מופצים ברישיון אפאצ'י 2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של המשקלים והפצה חופשית שלהם בתוך מוצרים, ללא תשלום תמלוגים. התנאי העיקרי הוא שמירה על הודעות זכויות היוצרים ועותק של הרישיון בכל הפצה של התוכנה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗