GPT
G

GLM-4.7-Flash-Uncensored-Heretic-NEO-CODE-Imatrix-MAX-GGUF

קוד פתוח

DavidAUmit2026-01-22

  • gguf
  • GLM 4.7 Flash
  • thinking
  • reasoning
  • NEO Imatrix

גרסת GGUF שעברה הסרת סינונים עבור מודל MoE עם כ־2 מיליארד פרמטרים פעילים. מתאים למי שמחפש מודל קוד וטקסט שלא מסרב לפקודות ויכול לרוץ מקומית גם על מעבד.

  • 219 GBמשקל הקבצים
  • 36,724הורדות בחודש
  • 418לייקים

מה זה

הבסיס כאן הוא מודל תערובת מומחים שנקרא GLM-4.7-Flash בגודל כולל של 30B, אבל בכל רגע נתון פועלים רק ארבעה מומחים. המשמעות היא שאתם מקבלים רוחב יריעה של מודל גדול, אבל בזמן ריצה המחשב מתמודד עם עומס חישובי של מודל קטן מאוד. הגרסה הזו עברה תהליך הסרת סינונים שמכונה Heretic, והיוצר מדווח שהוא גם צמצם את בלוקי החשיבה והפך את התשובות לממוקדות יותר.

הכימות נעשה בעזרת מערך כפול של Imatrix שמכוון לקוד ולטקסטים כלליים, כאשר שכבת הפלט נשמרה ברמת דיוק מלאה של 16 ביט כדי למנוע ירידה באיכות הטקסט והחשיבה. המודל בנוי להתמודד עם חלון הקשר של עד 200 אלף טוקנים בלי צורך בטריקים מיוחדים, ומייצר פלטים מפורטים שלפעמים עוברים ליטוש עצמי בתוך התשובה עצמה.

מתאים ל

  • כתיבת קוד ואוטומציה

    כימות ה־Imatrix נבנה על דאטה-סט ייעודי של תכנות ונותן מענה מהיר על חומרה מקומית צנועה.

  • שיחה ומשחקי תפקידים

    הסרת הסינונים מאפשרת לעסוק בנושאים מורכבים בלי שהמודל יסרב או יצנזר תוכן בצורה אוטומטית.

  • ניתוח מסמכים ארוכים

    היכולת לקרוא עד 200 אלף טוקנים מאפשרת לעבד קבצים גדולים בלי לחתוך אותם לחלקים קטנים.

איפה זה נופל

הסרת הסינונים כאן לא הופכת אותו אוטומטית למודל בוטה, והוא נוטה לייצר טקסטים יבשים אם לא דוחפים אותו ישירות עם מילות מפתח ברורות. מעבר לזה, המודל רשום רשמית רק באנגלית ובסינית, כך שאין שום הבטחה לעברית תקינה. הוא גם נוטה לפטפטנות יתר בפלט הסופי, ומחייב הגדרת חלון מינימלי של 8k כדי לא להיחתך באמצע תהליך הליטוש העצמי שלו.

שאלות
נפוצות

האם המודל ירוץ טוב על מעבד בלי כרטיס מסך חזק?

כן, המבנה שלו מפעיל כ־2 מיליארד פרמטרים בלבד בכל שלב, ולכן העומס החישובי נמוך מאוד. כל מה שצריך זה מספיק זיכרון פנימי כדי להחזיק את קובץ הכימות שבחרתם.

למה קצב הפקת הטקסט איטי מאוד למרות החומרה?

בגרסאות הקיימות יש באג בשימוש ב־Flash Attention שגורם לו לחזור לעיבוד במעבד. נטרול האפשרות הזו בהגדרות של מנוע ההרצה יפתור את הבעיה.

האם המודל מייצר תוכן בוטה ישירות מהקופסה?

לא תמיד. מנגנון הסירוב הוסר ולכן הוא לא יחסום בקשות, אבל ברירת המחדל שלו מתונה ותצטרכו לכוון אותו במפורש לפלטים חריפים.

איך מריצים

כדי להריץ את המודל צריך גרסה עדכנית של llama.cpp, ספציפית מקומיט 7789 והלאה, כי גרסאות קודמות כללו באגים במבנה הטנסורים שלו. בגלל שרק כ־2 מיליארד פרמטרים פעילים בכל ריצה, אפשר לטעון אותו לכרטיס מסך ביתי או אפילו למעבד רגיל עם מספיק זיכרון עבודה, במיוחד בגרסאות מכוילות כמו IQ4_NL או Q5_1 שמתקנות בעיות דיוק בשכבות.

חובה לכבות כרגע את מנגנון Flash Attention בהגדרות הריצה, כי יש בו תקלה שמעבירה חישובים למעבד ומאיטה משמעותית את קצב הפקת הטוקנים. אם אתם עובדים בממשקים כמו KoboldCpp או Text Generation WebUI, מומלץ לקבוע Smoothing Factor של 1.5 כדי למנוע חזרתיות ולקבל זרימה יציבה.

ollama run hf.co/DavidAU/GLM-4.7-Flash-Uncensored-Heretic-NEO-CODE-Imatrix-MAX-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים ופרטיים, לשנות את הקוד ולהפיץ אותו הלאה, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי. זה רישיון מתירני מאוד שלא מגביל שילוב במוצרים סגורים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗