GPT
G

GLM-5-GGUF

קוד פתוח

unslothmit2026-02-10

  • transformers
  • gguf
  • unsloth
  • glm_moe_dsa
  • text-generation

גרסת קוונטיזציה בפורמט GGUF למודל ענק שמכוון למשימות הנדסה ותכנות מורכבות. שוקלים אותו כשחייבים להריץ מקומית יכולות שמגרדות מודלים סגורים מובילים.

  • 11.6 TBמשקל הקבצים
  • 1,887הורדות בחודש
  • 228לייקים

מה זה

מדובר במודל של 744 מיליארד פרמטרים שבהם 40 מיליארד פעילים בכל רגע נתון, אשר אומן על 28.5 טריליון טוקנים ומשלב ארכיטקטורת DeepSeek Sparse Attention. המטרה המרכזית שלו היא ביצוע משימות סוכנים ארוכות טווח, הפעלת כלים וכתיבת קוד ברמה גבוהה. כדי לייעל את שלב הלמידה מחיזוקים, המפתחים השתמשו בתשתית אסינכרונית בשם slime שאפשרה איטרציות ממוקדות יותר.

במבחני ביצועים הוא עוקף את קודמיו ומציג תחרות ישירה למובילי השוק. הוא מקבל 77.8 במבחן SWE-bench Verified וציון של 56.2 במבחן Terminal-Bench 2.0. המדדים האלה מראים שהוא באמת יודע לתקן באגים, לנהל שיחות ארוכות מול טרמינל ולבצע מחקר ברשת בלי לאבד את ההקשר מהר מדי.

מתאים ל

  • סוכן אוטונומי לפתרון באגים

    הוא מגיע לתוצאה של 77.8 ב־SWE-bench Verified ומסוגל לקבל משימות קוד שלמות ולתקן שגיאות במאגר.

  • אוטומציה בטרמינל

    תוצאה של 60.7 בגרסה המאומתת של Terminal-Bench 2.0 מאפשרת לו להריץ סדרות פקודות בסביבת פיתוח בלי לקרוס.

  • מחקר ברשת וסיכום נתונים

    עם ציון של 75.9 ב־BrowseComp בניהול הקשר, הוא מתאים לשליפת מידע אמין מרובה מקורות.

איפה זה נופל

הנתונים מראים נפילה משמעותית במשימות מסוימות. במבחן Tool-Decathlon הוא משיג רק 38 נקודות, הרבה מתחת ל־46.3 של GPT-5.2 ו־43.5 של Claude Opus 4.5. בנוסף, המודל אומן ותומך רשמית רק באנגלית ובסינית. אין בו שום תמיכה מובטחת בעברית, ולכן צריך לבדוק אותו היטב על טקסט מקומי לפני שחושבים לשלב אותו במערכת ישראלית.

שאלות
נפוצות

האם אני יכול להריץ את המודל הזה על תחנת עבודה רגילה עם כרטיס RTX בודד?

לא. מדובר במודל של 744 מיליארד פרמטרים שדורש חומרת שרתים עם שמונה כרטיסים מקביליים כדי לעלות לזיכרון. כרטיס ביתי פשוט ייחנק מחוסר זיכרון.

איך המודל מתמודד עם משימות וטקסטים בעברית?

המאגר מציין תמיכה בשפות אנגלית וסינית בלבד. הוא עשוי לפלוט מילים בעברית בזכות נתונים כלליים, אבל הוא לא עבר אופטימיזציה לשפה ולא מומלץ להסתמך עליו למשימות בעברית.

איך מריצים

המשקל הכולל של הקבצים במאגר הזה הוא 11.6 טרה-בייט שמחולקים ל־300 קבצים, כך שלא מורידים את הכל אלא בוחרים את הקובץ המתאים לקונפיגורציה שלכם. פריסה מקומית של מודל בסדר גודל כזה דורשת חומרת שרתים כבדה מאוד, כמו אשכול של שמונה מאיצים עם תמיכה במקביליות מסוג Tensor Parallelism ברוחב 8 תחת vLLM או SGLang.

אם אין לכם שרת ייעודי של ארכיטקטורת Hopper או Blackwell עם מאות ג'יגה-בייט של זיכרון מהיר, אין טעם לנסות להריץ אותו על מחשב אישי. במצב כזה עדיף באופן מובהק לפנות ל־API הרשמי של Z.ai שחוסך את כל עלויות החומרה והתחזוקה.

ollama run hf.co/unsloth/GLM-5-GGUF:Q3_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

300 קבצים במאגר, 11.6 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המאגר מפורסם תחת רישיון MIT. הרישיון הזה מתיר שימוש חופשי לחלוטין, כולל שימוש מסחרי, שינוי הקוד והפצה פנימית או מסחרית במוצר שלכם, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗