GPT
G

GLM-4.5-Air-REAP-82B-A12B

קוד פתוח

cerebrasmit2025-10-20

  • transformers
  • safetensors
  • glm4_moe
  • text-generation
  • glm

cerebras עומדים גם מאחורי Cerebras-GPT, ויש עליו סקירה כאן.

גרסה דחוסה של מודל המומחים GLM-4.5-Air שמקצצת רבע מהמומחים כדי לחסוך בזיכרון. היא שומרת כמעט על כל כוח המחשוב בתכנות והפעלת כלים.

  • 82Bפרמטרים
  • 131,072טוקנים בהקשר
  • 158 GBמשקל הקבצים
  • 238הורדות בחודש

מה זה

המודל הזה לוקח את GLM-4.5-Air המקורי ומקצץ ממנו עשרים וחמישה אחוז מכמות המומחים בשיטת גיזום שנקראת REAP. במקום מאה עשרים ושמונה מומחים נשארו תשעים ושבעה, מתוכם שמונה מופעלים בכל טוקן, כך שמדובר בשמונים ושניים מיליארד פרמטרים שמתנהגים בזמן ריצה כמו מודל של שנים עשר מיליארד פרמטרים. ההבדל המרכזי מול שיטות דחיסה אחרות הוא שאין כאן מיזוג משקלים שפוגע בנתב, אלא מחיקה נקודתית של רכיבים שלא תורמים הרבה לפי נתוני כיול על קוד ומסלולי סוכנים.

במבחני ביצועים רואים שהירידה ביכולת שולית לגמרי. במבחן HumanEval יש ירידה קלה מציון של 92.7 לציון של 89.6, ובמבחני הפעלת פונקציות כמו BFCL-v3 עם מצב חשיבה הוא עומד על 76.3 לעומת 76.8 במקור. בחלק מהמקרים, כמו LiveCodeBench או תרחישי שירות לקוחות בבנצ'מרק של חברות תעופה וקמעונאות, הגרסה הזו אפילו עוקפת במעט את מודל המקור.

מתאים ל

  • סוכני פיתוח תוכנה אוטונומיים

    כיול המודל כלל מסלולי עבודה מרובי שלבים של סוכנים, ויכולות הפעלת הכלים נשמרו כמעט במלואן בבדיקות BFCL.

  • שרתי הסקת מסקנות מקומיים

    חיסכון של רבע מהמשקלים לעומת המודל המקורי מוריד את דרישות הזיכרון ומאפשר להריץ אותו על אשכול של ארבעה כרטיסים.

  • ניתוח מאגרי קוד ענקיים

    חלון הקשר של מאה שלושים ואחד אלף טוקנים מאפשר לטעון תיקיות פרויקט שלמות ולבצע שאילתות מורכבות.

איפה זה נופל

הקיצוץ אמנם מדויק אבל עדיין קיים, וביצועי הקוד נפגעו בכשלושה אחוזים במבחני HumanEval ומתמטיקה כמו AIME24. מעבר לזה, המודל מוגדר רשמית לשפה האנגלית בלבד, ואין שום תיעוד או הבטחה לתמיכה בעברית או בשפות אחרות. בתרחישי עבודה מורכבים ספציפיים, כמו בדיקות בעולם הטלקום, התוצאות נשארות נמוכות מאוד סביב שלושים אחוז הצלחה בדיוק כמו במודל המקורי, כך שהדחיסה לא פתרה חולשות בסיסיות שהיו שם קודם.

שאלות
נפוצות

האם המודל דורש התקנה מיוחדת של ספריות או קוד מותאם?

לא. המודל נתמך ישירות בגרסאות vLLM מגרסה 0.11.0 ומעלה, ואין צורך בטלאים או בקוד ייעודי מעבר לפקודת ההרצה הרגילה.

במה שיטת הגיזום הזו עדיפה על מיזוג משקלים רגיל?

מיזוג משקלים נוטה לפגוע בעצמאות הנתב של המודל ולייצר נפילה בביצועים במשימות יצירתיות, בעוד שגיזום REAP פשוט מסיר מומחים מיותרים ושומר על ההתנהגות המקורית.

איך מריצים

המשקלים תופסים מאה חמישים ושמונה גיגהבייט על הדיסק בפורמט bfloat16, כך שאין שום אפשרות להריץ אותו על כרטיס בודד רגיל. בשביל להעלות אותו תצטרכו שרת עם ארבעה כרטיסים חזקים לפחות, והכרטיס הרשמי מדגים פקודת הפעלה דרך vLLM עם חלוקה לארבעה מעבדים גרפיים במקביל והפעלת מנגנון expert-parallel.

אם חסר לכם זיכרון vRAM בזמן ריצה, המפתחים מציעים להגביל את מספר הרצפים המקבילים לשישים וארבעה. עבור רוב המפתחים שלא מחזיקים שרת ייעודי כזה פועל ברצף, עלויות החומרה והתחזוקה יהיו גבוהות בהרבה מפנייה ישירה למודל דרך ספק API חיצוני.

from transformers import pipeline

pipe = pipeline("text-generation", model="cerebras/GLM-4.5-Air-REAP-82B-A12B")
print(pipe("שלום"))

הקבצים

42 קבצים במאגר, 158 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להריץ אותו פנימית או לשלב אותו בתוך מוצר שמוכרים ללקוחות, ללא עלויות תמלוגים. התנאי היחיד הוא השארת הודעת זכויות היוצרים המקורית והפניה למאמר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗