GPT
G

GLM-4.7-Flash-GGUF

קוד פתוח

unslothmit2026-01-20

  • transformers
  • gguf
  • unsloth
  • text-generation
  • en

גרסת GGUF מכווצת למודל תערובת מומחים של שלושים מיליארד פרמטרים שמפעיל רק שלושה בכל צעד. הוא נותן ביצועי קוד וסוכנים חזקים בלי לטחון זיכרון של מודל ענק.

  • 484 GBמשקל הקבצים
  • 216,245הורדות בחודש
  • 703לייקים

מה זה

מדובר בארכיטקטורת תערובת מומחים, MoE, של שלושים מיליארד פרמטרים סך הכול, אבל רק שלושה מיליארד פעילים בכל טוקן. המשמעות היא חישוב מהיר מאוד ביחס לגודל המודל השלם. אנשי Unsloth ארזו אותו בפורמט GGUF עם כיול דינמי משלהם, מה שמקל על הרצה מקומית בכלי קוד פתוח כמו llama.cpp בלי שרת ייעודי כבד.

במדדים הטכניים המודל מתבלט במיוחד בעבודה מול סביבות תוכנה וכלים. ב־SWE-bench Verified הוא מגיע ל־59.2 אחוז, שזה פער ענק מול דגמים כמו Qwen3 שמגרדים את ה־22 אחוז באותה קטגוריית גודל. הוא מציג תוצאות גבוהות גם ב־BrowseComp וב־τ²-Bench, מה שאומר שבמשימות של סוכנים, דפדפן וקריאות לפונקציות יש לו יתרון מורגש על פני רוב מה שנמצא על המדף במשקל הזה.

מתאים ל

  • סוכני קוד ואוטומציה

    הוא משיג 59.2 אחוז במבחן SWE-bench, מה שהופך אותו לבחירה טבעית לפתרון באגים אוטומטי.

  • הפעלת פונקציות וכלים

    התוצאות הגבוהות ב־τ²-Bench והתמיכה המובנית בפענוח ארגומנטים מאפשרות לחבר אותו ישירות ל־API.

  • סריקה ואיסוף מידע ברשת

    עם ציון של 42.8 ב־BrowseComp הוא יודע לנתח דפי אינטרנט ומשימות דפדפן טוב יותר מרוב הדגמים בגודלו.

איפה זה נופל

השפות הנתמכות רשמית הן אנגלית וסינית בלבד, כך שאין כאן התאמה או אימון מכוון לעברית. אם תנסו לתחקר אותו בעברית מורכבת סביר להניח שתקבלו הזיות או תרגום קלוקל. מעבר לכך, המודל רגיש מאוד לפרמטרים של ההרצה. באגים ראשוניים ב־llama.cpp גרמו לו להיכנס ללולאות טקסט אינסופיות ולפלוט תוכן ירוד, ועדיין נדרש כיול ידני מוקפד של עונש החזרתיות והטמפרטורה כדי לא לקלקל את התוצאה.

שאלות
נפוצות

למה המודל מייצר לי טקסט שחוזר על עצמו בלולאה?

הגרסאות המוקדמות של llama.cpp סבלו מבאג שגרם לפלט גרוע ולולאות. ודאו שהורדתם את קובץ ה־GGUF המעודכן, ובטלו לחלוטין את ה־repeat penalty או קבעו אותו ידנית לערך 1.0.

האם הוא מתאים לעבודה בעברית?

הכרטיס מציין תמיכה באנגלית ובסינית בלבד. הוא עשוי להבין מילים בסיסיות, אבל ללא אימון ייעודי לעברית עדיף לבחור מודל רב לשוני אחר למשימות מקומיות.

איך מריצים

כדי להריץ אותו דרך מנועים מקומיים כמו vLLM או SGLang תצטרכו את גרסאות הפיתוח העדכניות ישירות מהמאגרים שלהם, וההגדרות הרשמיות דורשות חלוקה על פני ארבעה מעבדים גרפיים באמצעות טנזור פרלליזם. המאגר כולל קבצים במשקל כולל של 484 גיגה בייט המחולקים ל־32 קבצים שונים, כך שאתם מורידים רק את רמת הדיוק שמתאימה לזיכרון שלכם ולא את כל התיקייה.

מי שמשתמש ב־llama.cpp חייב להקפיד על הגדרות דגימה מדויקות. צריך לבטל את עונש החזרתיות או לקבוע אותו על 1.0, להגדיר min-p על 0.01 במקום ברירת המחדל, ולכוון טמפרטורה לפי המשימה, 0.7 לקריאות כלים ו־1.0 לשיחה רגילה. אם אין לכם חומרה עם מספיק זיכרון וידאו להחזיק את המודל, עדיף להשתמש ב־API של Z.ai במקום להסתבך עם ביצועים אטיים על זיכרון מערכת.

ollama run hf.co/unsloth/GLM-4.7-Flash-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון MIT. זהו רישיון קוד פתוח מתירני מאוד שמאפשר שימוש מסחרי, שינוי של הקוד והמשקולות, שילוב במוצרים סגורים והפצה מחדש, כשהתנאי המרכזי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗