GPT
G

GLM-4.5-Air-GGUF

קוד פתוח

unslothmit2025-08-05

  • transformers
  • gguf
  • unsloth
  • text-generation
  • en

גרסת קוונטיזציה של מודל סוכנים וחישוב היברידי, עם ארכיטקטורת תערובת מומחים של 106 מיליארד פרמטרים. היא פונה למי שמחפש יכולות תכנות והפעלת כלים במשקל הרצה של 12 מיליארד פרמטרים פעילים.

  • 1.8 TBמשקל הקבצים
  • 12,842הורדות בחודש
  • 185לייקים

מה זה

מדובר במודל שמכוון ישירות לעבודה עם סוכנים חכמים, כתיבת קוד ופתרון בעיות מורכבות. המבנה שלו מבוסס על 106 מיליארד פרמטרים בסך הכול, אך בכל מעבר מופעלים רק 12 מיליארד, מה שמאפשר מהירות תגובה גבוהה ביחס לגודל המלא. הוא כולל שני מצבי עבודה מובנים, מצב חשיבה מעמיק שמיועד להפעלת כלים ולהסקה לוגית שלב אחר שלב, ומצב מהיר ללא חשיבה שמתאים למענה ישיר.

לפי המבחנים של היוצרים שפורסמו בכרטיס, הוא השיג ציון של 59.8 בבדיקה רוחבית של 12 מבחני ביצועים מובילים בתעשייה. התוצאה הזו מציבה אותו קרוב למודל האב הגדול שלו שהגיע לציון 63.2. בפועל זה אומר שמקבלים ביצועי חשיבה תחרותיים מאוד מול מודלים קנייניים, תוך חיסכון משמעותי במשאבי החישוב הנדרשים בזמן הריצה בזכות מנגנון הניתוב של המומחים.

מתאים ל

  • סוכני אוטונומיה וכלים

    מצב החשיבה המובנה והתמיכה בכלים מאפשרים לו לתכנן משימות מורכבות ולהפעיל פונקציות ברצף ללא תיווך ידני.

  • פיתוח וניתוח קוד

    הארכיטקטורה אומנה מראש למשימות תכנות הדורשות שרשור לוגי ארוך לצד מהירות תגובה של מודל קומפקטי.

  • מענה היברידי באנגלית

    שילוב המצבים מאפשר לעבור בין שליפה מהירה של תשובות לבין ניתוח עמוק לפי סוג השאילתה במערכת.

איפה זה נופל

המודל אומן והוגדר רשמית רק עבור אנגלית וסינית. הוא לא מיועד לעברית, ואין שום תיעוד שתומך בביצועים סבירים בשפה זו. בנוסף, מודל כזה דורש בדיקה מעמיקה של יציבות הפעלת הכלים ומנגנוני הפירסור של הנימוקים לפני שילובו במוצר, שכן שגיאה קטנה במעבר בין מצב חשיבה למצב רגיל עלולה לשבור את זרימת העבודה של הסוכן.

שאלות
נפוצות

האם המודל מתאים לעבודה בעברית?

הכרטיס מציין תמיכה באנגלית ובסינית בלבד. הוא לא אומן לעברית, ולכן פלט בעברית צפוי להיות משובש או לא יציב, ולא מומלץ לבנות עליו למוצר מקומי.

למה צריך את דגל jinja בהרצה?

המאגר כולל תיקונים מיוחדים של Unsloth לתבנית השיחה. שימוש בדגל jinja ב־llama.cpp מבטיח שהפרומפטים יפורסרו במבנה המדויק שהמודל מצפה לו במעבר בין מצבי החשיבה.

איך מריצים

המשקל הכולל של הקבצים במאגר מגיע ל־1.8 טרה־בייט ב־55 קבצים שונים, שמכילים מגוון דרגות קוונטיזציה בפורמט GGUF של Unsloth. כדי להריץ את המודל דרך llama.cpp חובה להשתמש בדגל jinja כדי לתמוך בתבנית השיחה המעודכנת. תצטרכו שרת עם זיכרון משמעותי כדי להחזיק מודל של 106 מיליארד פרמטרים, גם אם מופעלים רק חלקם בכל טוקן.

אם אין לכם שרת ייעודי מרובה כרטיסים גרפיים או זיכרון מערכת עצום, עדיף לפנות ל־API שמציעות Z.ai או Zhipu AI. הרצה עצמית כאן דורשת תשתית פיזית כבדה, ופנייה לשירות ענן מוכן תחסוך את עלויות החומרה והתחזוקה המסובכת של ארכיטקטורה כזו.

ollama run hf.co/unsloth/GLM-4.5-Air-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

55 קבצים במאגר, 1.8 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל שוחרר תחת רישיון MIT. זהו רישיון פתוח ומתירני לחלוטין שמאפשר שימוש מסחרי, שינוי של המשקלים ופיתוח מוצרים נגזרים ללא תשלום תמלוגים. התנאי היחיד הוא שמירת הצהרת זכויות היוצרים המקורית והפטור מאחריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗