GPT
G

GLM-4.5-GGUF

קוד פתוח

unslothmit2025-08-05

  • transformers
  • gguf
  • text-generation
  • en
  • zh

גרסת קוונטיזציה של מודל ענק עם חשיבה היברידית לסוכנים אוטונומיים וכתיבת קוד. מתאים למי שרוצה ביצועים ברמה עולמית בהרצה מקומית, אבל יש לו שרתים רציניים.

  • 5.3 TBמשקל הקבצים
  • 1,949הורדות בחודש
  • 52לייקים

מה זה

מדובר בגרסאות מכווצות של מודל MoE עצום שמכיל 355 מיליארד פרמטרים בסך הכול, מתוכם 32 מיליארד פעילים בכל ריצה. המודל בנוי במיוחד עבור סוכנים ומשלב יכולות תכנות והסקה, עם שני מצבי פעולה שונים. יש מצב חשיבה שמיועד לבעיות מורכבות והפעלת כלים חיצוניים, ומצב רגיל שפולט תשובות מיידיות בלי שלב ביניים של מחשבה.

במבחני ביצועים רוחביים על פני 12 מדדים שונים, הוא הגיע לציון של 63.2 והתברג במקום השלישי מול מודלים מסחריים ופתוחים. זה אומר שהוא יודע להתמודד עם לוגיקה כבדה ומשימות רב שלביות ברמה של הכלים הסגורים המובילים, בעיקר באנגלית ובסינית שבהן הוא אומן.

מתאים ל

  • סוכנים עצמאיים ומורכבים

    מצב החשיבה המובנה יודע להריץ לוגיקה רב שלבית ולהפעיל כלים חיצוניים.

  • כתיבת קוד ודיבאגינג

    הארכיטקטורה אומנה מראש למשימות תכנות ברמה גבוהה באנגלית.

  • שרת פנימי מאובטח בארגון

    רישיון MIT מאפשר להטמיע את המודל עצמאית בלי להוציא מידע החוצה.

איפה זה נופל

המודל מיועד באופן רשמי רק לשפות אנגלית וסינית. מי שבונה עליו לעברית יגלה מהר מאוד שהיא לא נתמכת רשמית בכרטיס, מה שבדרך כלל גורר שבירת תחביר ותרגום עילג. מעבר לזה, המשקל העצום והארכיטקטורה שלו דורשים ספריות תומכות ומנהלי מודלים מתאימים, ואם המשימה שלכם פשוטה יחסית, מצב החשיבה רק יוסיף זמני המתנה מיותרים.

שאלות
נפוצות

האם אפשר להריץ את המודל הזה על מחשב פיתוח רגיל?

לא. מדובר במודל של 355 מיליארד פרמטרים שמחייב שרת עם כמה כרטיסי מסך חזקים ונפח זיכרון ענק, גם בגרסאות ה־GGUF המכווצות. אם אין לכם חומרה כזאת, השימוש היחיד הרלוונטי הוא מול ה־API.

איך הוא מתפקד בעברית?

הכרטיס מצהיר על תמיכה באנגלית ובסינית בלבד. הוא לא אומן על עברית כשפה מרכזית, ולכן הוא לא מתאים לעיבוד טקסטים או לשיחה שוטפת בעברית ברמה מקצועית.

איך מריצים

המשקל הכולל של הקבצים במאגר הזה הוא 5.3 טרה בייט, שמחולקים ל־134 קבצים בפורמט GGUF של unsloth. לא מורידים את כל המאגר הזה למחשב רגיל, אלא בוחרים קובץ קוונטיזציה ספציפי שמתאים ליכולת של הברזלים שלכם.

בשביל להריץ מודל עם 355 מיליארד פרמטרים, גם כשהוא מכווץ, צריך שרת ייעודי עם נפח זיכרון גרפי או מערכת ענק. אם אין לכם אשכול מחשוב כזה, אין טעם להסתבך עם התקנה מקומית. עדיף לפנות ל־API הרשמי של Z.ai שמופיע בתיעוד ולשלם לפי קריאה במקום להחזיק תשתית כבדה ויקרה.

ollama run hf.co/unsloth/GLM-4.5-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

134 קבצים במאגר, 5.3 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל משוחרר ברישיון MIT חופשי לחלוטין. אפשר להשתמש בו במוצרים מסחריים, לבצע פיתוח המשך, לשנות אותו ולהפיץ אותו בלי תמלוגים או הגבלות שימוש מורכבות, כל עוד שומרים על הודעת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗