GPT
G

GLM-5.2-REAP-504B-GGUF

קוד פתוח

0xSeromit2026-06-21

  • gguf
  • moe
  • reap
  • pruning
  • router-kd

גרסת GGUF שעברה גיזום של 34 אחוז מהמומחים כדי לרוץ מקומית. הפתרון היחיד שמאפשר להריץ את ארכיטקטורת GLM-5.2 ישירות בתוך llama.cpp בזכות מעקף לשכבות תשומת הלב.

  • 1.6 TBמשקל הקבצים
  • 1,370הורדות בחודש
  • 47לייקים

מה זה

מדובר בהמרה של מודל ענק שצומצם ל־504 מיליארד פרמטרים באמצעות שיטת REAP, תוך שמירה על 168 מתוך 256 מומחים בכל שכבה. כדי להחזיר חלק מהיכולות בוצע זיקוק של הנתב מול מודל המקור המלא. ההבדל הגדול כאן הוא ההתאמה לחומרת קצה, מכיוון ש־llama.cpp המקורי לא תומך במנגנון שיתוף האינדקסים של GLM, המפתחים שכפלו 285 טנסורים לאורך 57 שכבות כדי שהקובץ בכלל ייטען.

הקוונטיזציה כאן דינמית ולא אחידה. חלקים רגישים כמו שכבות הקלט, הראש הסופי ושכבת החיזוי נשמרו בדיוק גבוה, בעוד שמשקולות המומחים נדחסו חזק יותר. המדידות מראות שהגיזום הכפיל את הנטייה לחזרתיות בלולאה מ־3.6 אחוזים במקור ל־7.2 אחוזים, אך שימוש בהגדרות דגימה נכונות מחזיר את שיעור הלולאות ל־2.3 אחוזים בלבד.

מתאים ל

  • שרת היקש פנימי לחברות

    מאפשר הרצה מקומית של מודל ענק ללא הוצאת מידע רגיש החוצה, תחת רישיון MIT גמיש.

  • יצירת טקסט בספקולציה

    שכבת ה־MTP נשמרה בדיוק גבוה, מה שמאפשר פענוח ספקולטיבי מהיר בתוך llama.cpp.

  • מחקר ואימון המשך

    קבצי ה־BF16 המלאים מאפשרים לבצע כיול מחדש, אימוני LoRA או קוונטיזציה עצמאית.

איפה זה נופל

המודל הזה נולד מטלאי הנדסי ולא מהטמעה טבעית. שכפול הטנסורים כדי לעקוף את המגבלה של llama.cpp גורם לחישוב מחדש בכל שכבה במקום שימוש חוזר במקור, כך שהפלט לא זהה למודל הבסיס. בנוסף, הקוונטים לא עברו כיול imatrix, מה שמשפיע על האיכות במיוחד ברמות הדחיסה הנמוכות.

בעיית הלולאות מורגשת מאוד. אם לא מגדירים ענישה על חזרתיות, הוא נוטה להיתקע בלולאות טקסט פי שניים מהמודל הלא גזום, והעלאה של ענישת החזרתיות עלולה לפגוע ביצירת קטעי קוד לגיטימיים שמכילים חזרות טבעיות.

שאלות
נפוצות

למה המודל חוזר על עצמו ואיך עוצרים את זה?

הגיזום של המומחים פגע ביכולת הסיום של המודל והכפיל את שיעור הלולאות ל־7.2 אחוזים. מומלץ להפעיל את llama-cli עם דגלי min-p של 0.05 וקנס חזרתיות של 1.05 שמוריד את התופעה ל־4.9 אחוזים, או להעלות את הקנס ל־1.10 כדי לרדת ל־2.3 אחוזים בלבד.

האם שכפול שכבות האינדקס פוגע באיכות התוצאה?

כן, המעקף הטכני משכפל משקולות במקום להשתמש במנגנון המקורי, ולכן התוצאה אינה זהה למודל הבסיס ברמת הביט. בבדיקות הפלט יצא קוהרנטי, אך מומלץ לבחור בגרסת Q4_K_XL כדי למזער סטיות נוספות.

איך מריצים

טוענים את הקובץ הראשון והמערכת מושכת את שאר החלקים לבד. גם בגרסה הקלה ביותר, Q2_K_XL, מדובר על קבצים בנפח של כ־111 גיגה בייט, כך שצריך שרת ייעודי עמוס בזיכרון RAM או מערך כרטיסי מסך כבדים. הגרסה המומלצת לאיכות עבודה היא Q4_K_XL שתופסת כ־325 גיגה בייט, וגרסת ה־BF16 המלאה מגיעה לכמעט טרה בייט.

אם אין לכם אשכול מחשוב מקומי של מאות גיגה בייט זיכרון פנוי, אין טעם להוריד את הקבצים. במקרה כזה עדיף לשלם על קריאות API לשירות ענן שמחזיק את המודל המקורי, במקום לתחזק שרת פיזי ייעודי בעלויות גבוהות.

ollama run hf.co/0xSero/GLM-5.2-REAP-504B-GGUF:Q4_K_XL

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

45 קבצים במאגר, 1.6 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא רישיון MIT. הוא מתיר שימוש מסחרי חופשי לחלוטין, שינוי של הקוד והמשקולות והפצה בתוך מוצרים סגורים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים וכתב הוויתור על האחריות לצד הקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗