GPT
Z

zai-org_GLM-4.7-Flash-GGUF

קוד פתוח

bartowskimit2026-01-20

  • gguf
  • text-generation
  • en
  • zh
  • endpoints_compatible

גרסת GGUF מכווצת של מודל המשלב חשיבה מובנית, המתאימה להרצה מקומית בכלי llama.cpp. הבחירה בה נועדה לקבל ביצועי שפה טובים באנגלית ובסינית על חומרה מקומית נגישה.

  • 450 GBמשקל הקבצים
  • 9,898הורדות בחודש
  • 57לייקים

מה זה

מדובר בהמרה של GLM-4.7-Flash ממשפחת המודלים של zai-org, שהוכנה בעזרת llama.cpp גרסה b7779 וקובץ כיול imatrix. ההמרה הזו מיועדת לייצור טקסט וכוללת תמיכה במבנה שיחה ספציפי שמפריד בין מערכת, משתמש ותהליך חשיבה פנימי של המודל. המאגר כולל מגוון רחב מאוד של רמות דיוק, החל מגרסת המקור בפורמט bf16 ועד לקבצים מכווצים מאוד בעומק של 2 ביט.

בגרסאות מסוימות כמו Q6_K_L או Q4_K_L, משקלי השכבות החיצוניות וההטמעות נשמרו באיכות Q8_0 כדי לצמצם פגיעה באיכות הפלט לעומת כיווץ אחיד. המודל פונה בעיקר לעבודה בשפות אנגלית וסינית, ודורש שימוש בגרסאות תוכנה עדכניות כדי להתמודד עם פונקציית הניתוב הפנימית שלו.

מתאים ל

  • שרת שיחה מקומי באנגלית

    מאפשר הרצה מקומית מלאה של עוזר אינטראקטיבי באנגלית ללא תלות ברשת ובעלויות API חיצוניות.

  • ניתוח ועיבוד טקסט בסינית

    מתאים למשימות הבנה וייצור טקסט בסינית על חומרה מקומית הודות לאימון הייעודי בשפה זו.

  • פיתוח על כרטיס 24GB

    גרסאות Q4 ו־Q5 נכנסות במלואן לזיכרון של כרטיס מסך בודד בנפח 24GB ומספקות איכות עבודה גבוהה.

איפה זה נופל

הנתונים בדף מגדירים תמיכה בשפות אנגלית וסינית בלבד, כך שלא מומלץ להסתמך עליו לפרויקטים שדורשים עברית. בנוסף, הרצת המודל דורשת עקיפת הגדרות רגילות, כמו כיבוי יזום של מנגנון Flash Attention, מה שעלול לפגוע במהירות הריצה.

המשקלים גם עברו העלאה מחדש בעקבות בעיה קודמת ב־imatrix ובפונקציית הניתוב. המשמעות היא שספריות הרצה ישנות ייצרו פלטים שגויים או יקרסו, ומחייבות בדיקה קפדנית של גרסת התוכנה המקומית לפני הטמעה.

שאלות
נפוצות

איזה קובץ הכי כדאי להוריד למחשב עם כרטיס מסך של 24GB?

האפשרות המומלצת היא Q4_K_M ששוקלת 18.47GB, או Q5_K_M ששוקלת 21.57GB. שתיהן ישבו במלואן בתוך זיכרון הכרטיס ויאפשרו מהירות טובה בלי לגלוש לזיכרון הראשי של המחשב.

למה התשובות של המודל יוצאות מקולקלות?

המודל דורש גרסת llama.cpp עדכנית שכוללת תיקון לפונקציית ה־gating. בנוסף, חשוב לוודא שמבטלים את Flash Attention עם הדגל הייעודי לפי ההנחיות בכרטיס.

האם אפשר להשתמש במודל הזה בעברית?

המודל הוגדר ואומן עבור אנגלית וסינית בלבד. הוא אינו מיועד לפעולה בעברית ואינו מומלץ למשימות בשפה זו.

איך מריצים

להרצה מלאה בזיכרון של כרטיס המסך תצטרכו נפח שתואם לקובץ שתורידו. גרסת ברירת המחדל המאוזנת, Q4_K_M, שוקלת 18.47GB ודורשת מעבד גרפי עם 24GB של VRAM, כמו RTX 3090 או RTX 4090. אם יש לכם פחות זיכרון, קבצי IQ3 או Q3_K_M יורדים לאזור ה־14GB, ובקצה התחתון קבצי IQ2 נכנסים ב־7.62GB עד 11GB על חשבון ירידה מורגשת באיכות. המודל פועל ישירות בתוכנות כמו LM Studio, llama.cpp ו־Jan AI.

בכרטיס מודגש שחובה לבטל את Flash Attention באמצעות הדגל flash-attn off כדי לקבל ביצועים תקינים. בנוסף, נדרשת גרסת llama.cpp עדכנית כדי לתמוך בתיקון מנגנון ה־gating שנכלל בגרסה הזו. אם אין לכם חומרה ייעודית עם זיכרון מספק, עדיף להשתמש בשירות מרוחק במקום לנסות לדחוף גרסאות כבדות לתוך זיכרון המחשב הרגיל.

ollama run hf.co/bartowski/zai-org_GLM-4.7-Flash-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון MIT. הרישיון חופשי ומתיר שימוש מסחרי, שינוי קוד, הפצה והטמעה במוצרים סגורים בלי תשלום תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים ונוסח הרישיון המקורי בקבצי המוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗