GPT
G

GLM-4.7-REAP-218B-A32B-GGUF

קוד פתוח

unslothmit2026-01-12

  • transformers
  • gguf
  • glm
  • MOE
  • pruning

גרסה מכווצת של מודל ענק שמקצצת 40 אחוז מהמשקל ומפעילה רק חלק קטן מהמומחים בכל שלב. מתאים למי שרוצה ביצועי קוד וסוכנים של מודל ענק בפחות משאבים.

  • 3.3 TBמשקל הקבצים
  • 1,788הורדות בחודש
  • 50לייקים

מה זה

מדובר במודל שנוצר מדחיסה של GLM-4.7 המקורי, שירד מ־355 מיליארד פרמטרים ל־218 מיליארד. הדחיסה נעשתה בשיטה שגוזמת מומחים מיותרים ברשת במקום למזג אותם, כך שנשארו 96 מומחים מתוך 160. בכל טוקן המודל מפעיל רק 32 מיליארד פרמטרים דרך 8 מומחים, עם חלון הקשר ענקי של 202,752 טוקנים.

הגיזום התמקד בכיול על משימות סוכנים, יצירת קוד וקריאות לפונקציות, במטרה לשמור על יכולות תכנות כמעט ללא פגיעה בדיוק. לפי המפתחים, הגישה הזו משאירה את יכולת הניתוב של המודל שלמה ומתאימה למשימות יצירתיות, חישוב וקוד יותר משיטות דחיסה מסורתיות.

מתאים ל

  • פיתוח סוכני תוכנה אוטונומיים

    המודל כויל ספציפית על מסלולי ריצה של סוכנים ויודע לבצע קריאות לפונקציות באופן מובנה.

  • ניתוח בסיסי קוד גדולים

    הקשר של מעל 200 אלף טוקנים מאפשר לקרוא ריפו שלם ולהבין תלויות מורכבות בפרויקט.

  • הסקה מקומית בארגון סגור

    מאפשר לקבל איכות של מודל ענק בתשתית פנימית עם דרישות חומרה נמוכות יותר מהמקור.

איפה זה נופל

הקובץ שמופיע כאן מתועד באנגלית בלבד ואין מידע לגבי ביצועים או תמיכה בעברית, כך שלא כדאי לבנות עליו לעיבוד שפה מקומית בלי לבדוק קודם. בנוסף, למרות ההבטחות על גיזום ללא אובדן יכולות, מבחני הביצועים הרשמיים לגרסה הזו סומנו ככאלה שעדיין בעבודה ולא פורסמו במלואם.

שאלות
נפוצות

איך המודל שוקל 218B אבל מפעיל רק 32B?

המודל מבוסס על ארכיטקטורת תערובת מומחים. בכל רגע נתון, הנתב בוחר רק שמונה מומחים ספציפיים שמבצעים את החישוב בפועל, כך שמהירות הריצה דומה למודל של 32 מיליארד פרמטרים בלבד.

האם אני חייב להריץ אותו דרך llama.cpp?

לא, אפשר להשתמש בגרסת הבסיס ישירות ב־vLLM מגרסה 0.11.0 ומעלה, אבל אם בחרתם בקובץ ה־GGUF של Unsloth, llama.cpp היא הבחירה הטבעית, וצריך לזכור להפעיל את תבנית השיחה עם jinja.

איך מריצים

את הגרסה הזו של Unsloth בפורמט GGUF מריצים דרך llama.cpp, כאשר חובה להוסיף את הדגל jinja כדי לקבל תבנית שיחה תקינה. אפשר להרים אותו גם בגרסת המקור דרך vLLM עם חלוקה ל־8 מעבדים גרפיים במקביל.

בגודל כזה, גם כשהוא מכווץ ומריץ 32 מיליארד פרמטרים בפועל, מדובר במפלצת של מאות ג'יגה בייט זיכרון וידאו. אם אין לכם שרת עם כמה כרטיסי A100 או H100 פנויים, להרים אותו עצמאית זה כאב ראש לוגיסטי ותשתיתי, ועדיף להשתמש בנקודת קצה מנוהלת.

ollama run hf.co/unsloth/GLM-4.7-REAP-218B-A32B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

87 קבצים במאגר, 3.3 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון MIT. המשמעות פשוטה וישירה, מותר להשתמש בו לצרכים מסחריים ופרטיים, לשנות אותו, להריץ אותו בשירותים שלכם ולשלב אותו במוצרים, בלי תמלוגים או הגבלות שימוש מיוחדות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗