GPT
G

GLM-4.7-Flash-REAP-23B-A3B-GGUF

קוד פתוח

unslothmit2026-01-23

  • transformers
  • gguf
  • glm
  • unsloth
  • MOE

גרסה מכווצת של מודל קוד שמפעילה רק 3 מיליארד פרמטרים בפועל מתוך 23, בלי לאבד דיוק במבחני תכנות. היא מתאימה למי שרוצה ביצועים של מודל גדול על חומרה מקומית צנועה בהרבה.

  • 363 GBמשקל הקבצים
  • 25,925הורדות בחודש
  • 270לייקים

מה זה

מדובר במודל מסוג Mixture-of-Experts שעבר דילול מבוסס שיטה בשם REAP. במקום להחזיק 64 מומחים כמו במקור, חתכו אותו ב־25 אחוז ל־48 מומחים, כך שגודלו הכולל ירד מ־30 מיליארד פרמטרים ל־23 מיליארד. בכל טוקן נתון, המערכת מפעילה ארבעה מומחים בלבד ששווים ל־3 מיליארד פרמטרים פעילים, מה שנותן מהירות חישוב גבוהה מאוד בהשוואה למודלים צפופים בגודל דומה.

במבחני הקוד הרשמיים, הדילול לא פגע בתוצאות. הוא קיבל 95.1 נקודות ב־HumanEval לעומת 94.5 במודל המקורי המלא, וב־HumanEval+ הוא שמר במדויק על תוצאה של 89.0. זה אומר שקיבלתם מודל קל וזול יותר להרצה שמסוגל לטפל במשימות קוד, קריאות לפונקציות וסוכנים אוטונומיים באותה רמה בדיוק.

מתאים ל

  • סוכני פיתוח אוטונומיים

    המודל כויל על מסלולי SWE-bench ויודע לרוץ בלולאות של כתיבה, בדיקה ותיקון קוד.

  • קריאה לפונקציות וכלים

    יש לו תמיכה מובנית ב־tool calling שמחזירה תשובות מדויקות שמפעילות מערכות צד שלישי.

  • ניתוח מאגרי קוד גדולים

    חלון הקשר של מעל 200 אלף טוקנים מאפשר להזין תיקיות קוד שלמות בבת אחת.

איפה זה נופל

המודל הוגדר רשמית רק באנגלית, ולכן לא כדאי להסתמך עליו לפרויקטים שדורשים עברית בלי לבדוק אותו קודם בצורה יסודית. מעבר לכך, מדובר במודל שנוצר בדילול חד פעמי ללא אימון המשך. המבחנים שלו מתמקדים בעיקר בקוד ובקריאות לפונקציות, כך שבתחומים אחרים ייתכנו פערים שלא נבדקו בכרטיס.

שאלות
נפוצות

למה המודל הזה ולא הדגם המקורי המלא של 30B?

כי הוא דורש 25 אחוז פחות זיכרון ומספק כמעט את אותם ביצועים בקוד. בדיקות HumanEval מראות שהוא אפילו השווה או עקף את המקור, כך שחוסכים משאבי שרת בלי לשלם בדיוק.

אפשר להריץ אותו על כרטיס מסך ביתי אחד?

בגרסאות המכווצות החזקות אולי תצליחו לדחוס אותו לכרטיס חזק של 24 גיגה זיכרון, אבל בהרצה מלאה דרך vLLM ההמלצה בכרטיס היא לפצל אותו על ארבעה כרטיסים. אם יש לכם כרטיס בודד, תצטרכו לכווץ אותו לכימות נמוך ב־llama.cpp.

איך מריצים

כדי להריץ אותו דרך llama.cpp צריך להשתמש בדגל jinja בגלל התאמות שנעשו בתבנית השיחה של אנלאות'. אם אתם מריצים אותו על שרת עם vLLM, תצטרכו לחלק אותו על פני ארבעה כרטיסי מסך בעזרת tensor-parallel-size 4, ולהגדיר מפענחים ייעודיים להסקה ולקריאות פונקציה. אם נגמר לכם הזיכרון, הכרטיס ממליץ להוריד את max-num-seqs לאזור ה־64.

אפשר להריץ אותו מקומית אם יש לכם מספיק זיכרון וידאו להחזיק 23 מיליארד פרמטרים, אבל אם המטרה היא להריץ שאילתות בודדות פעם ביום בלי לתחזק שרת עם כמה כרטיסים גרפיים דולקים, עדיף להשתמש ב־API חיצוני.

ollama run hf.co/unsloth/GLM-4.7-Flash-REAP-23B-A3B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא MIT, שזה הרישיון הכי חופשי שיש. אתם יכולים להשתמש בו במוצר מסחרי, לשנות את הקבצים, להטמיע אותם בקוד סגור ולהפיץ הלאה בלי תמלוגים. התנאי היחיד הוא להשאיר את הצהרת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗