GPT
Q

Qwen3.8-Whittle-MoE-27B-A17.8B

קוד פתוח

logic65apache-2.02026-08-18

  • safetensors
  • qwen3_5_moe
  • moe
  • mixture-of-experts
  • research-preview

פירוק של מודל גדול לארכיטקטורת מומחים שרצה על חומרה ביתית. הוא מציע פתרון למי שרוצה ביצועים של מודל רחב בלי לשלם על כל הפרמטרים בכל טוקן.

  • 27Bפרמטרים
  • 262,144טוקנים בהקשר
  • 159 GBמשקל הקבצים
  • 34,950הורדות בחודש

מה זה

הבסיס כאן הוא חיתוך ישיר של מודל צפוף לרשת מומחים. במקום לאמן מודל מאפס, המפתח חילק את שכבות החישוב לשישים וארבעה מומחים קטנים ומומחה אחד משותף, כך שבכל רגע נתון פועלים רק שבעה עשר נקודה שמונה מיליארד פרמטרים מתוך עשרים ושבעה מיליארד. הבעיה המקורית בחיתוך כזה היא שהמודל מאבד כיוון ונוטה לחזור על עצמו בלי סוף. הגרסאות האחרונות התמקדו בתיקון מנגנון העצירה והניתוב כדי לייצב אותו.

במבחני הבדיקה של הפרויקט, שיעור הלולאות האינסופיות ירד משמעותית משישים ותשעה אחוזים לשמונה בלבד בתשובות ארוכות. מבחן הידע הכללי החזיר עשרים ושמונה מתוך שלושים ותשע תשובות נכונות, מה שמראה שהמידע המקורי נשמר בחלקו אך ספג פגיעה מסוימת. זהו ניסוי קהילתי מתמשך ולא מוצר של חברת ענק, אך הוא מוכיח שאפשר להחיות מודל מנוון בעזרת אימון ממוקד של שכבות הניתוב בלבד.

מתאים ל

  • שיחה כללית על כרטיס ביתי

    הוא מציע שיחה רציפה בלי להיתקע בלולאות ורץ על כרטיס מסך בודד של עשרים וארבעה גיגה בייט.

  • מחקר על ארכיטקטורת מומחים

    כל נתוני הזיקוק ומשקלי הניתוב פתוחים לחלוטין למי שרוצה לבדוק שיטות כיווץ עצמאיות.

  • הפקת טקסט חופשי ארוך

    מנגנון העצירה המשופר שומר על אורך תשובה ממוצע של קרוב לארבע מאות מילים בלי לקטוע את המשפט.

איפה זה נופל

החולשה הבולטת ביותר היא פלט מובנה. כשלושים ותשעה אחוזים מהניסיונות לייצר טבלאות, קוד SQL או HTML מתקלקלים או נכנסים ללולאות. בנוסף, המודל אינו יודע לספור פריטים באופן מדויק ברשימות של מעל שלושים פריטים, והוא סובל משיבושי מילים ומספרים שנולדו בעת החיתוך הראשוני. המדידות כולן בוצעו על ידי אדם אחד במבחנים מצומצמים, כך שאין להסתמך עליהן כתו תקן תעשייתי, ולא הייתי משלב אותו בתהליכי אוטומציה קריטיים שדורשים דיוק במבנה הנתונים.

שאלות
נפוצות

האם כדאי להפעיל את מצב הנימוק במודל?

בקבצי הקיבוץ הקיימים התשובה היא חד משמעית לא. שער העצירה בקבצים אלה נסגר מוקדם מדי בתוך בלוק החשיבה, מה שגורם לתשובה להיקטע לפני שהיא מתחילה. מצב החשיבה תוקן רק במשקלים המלאים של גרסה שתיים נקודה שתיים נקודה אחת.

האם הוא יכול להחליף את המודל המקורי לכל משימה?

לא. החיתוך פגע ביכולות המתמטיות שלו וביכולת לעקוב אחרי כמויות מדויקות של פריטים. אם אתם צריכים שליפת נתונים נוקשה במבנה מוגדר או חישובים, המודל המקורי עדיף בהרבה.

איך מריצים

המשקל המלא של הקבצים מגיע למאה חמישים ותשעה גיגה בייט, כך שהרצת המשקלים הגולמיים דורשת שרת ייעודי כבד. הגרסה המעשית היא קובץ מכווץ בפורמט Q4_K_M, אותו מריצים ישירות דרך llama.cpp. גרסה כזו דורשת כעשרים וארבעה גיגה בייט של זיכרון גרפי, ואפשר לפצל אותה בין שני כרטיסים של שנים עשר גיגה בייט.

אם אין לכם כרטיס מתאים בבית או בשרת, עדיף להשתמש במודל סגור דרך ממשק ענן. בנוסף, חשוב לזכור שקבצי הקיבוץ הקיימים מחזיקים עדיין את שער העצירה של גרסה שתיים נקודה שתיים, ולכן חובה לכבות בהם את מצב החשיבה כדי למנוע קטיעה של התשובות באמצע.

pip install -U huggingface_hub
hf download logic65/Qwen3.8-Whittle-MoE-27B-A17.8B

הקבצים

87 קבצים במאגר, 159 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0. זהו רישיון פתוח ומתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה מחדש בחינם. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי בקבצים שתפיצו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗