GPT
T

THUDM_GLM-4-32B-0414-GGUF

קוד פתוח

bartowskimit2025-04-14

  • gguf
  • text-generation
  • zh
  • en
  • endpoints_compatible

גרסת קוונטיזציה של GLM-4 בגודל 32B עם תיקון לטוקנייזר. היא מיועדת למי שצריך מודל דו-לשוני באנגלית וסינית להרצה מקומית על llama.cpp.

  • 485 GBמשקל הקבצים
  • 4,137הורדות בחודש
  • 101לייקים

מה זה

מדובר בהמרה של GLM-4-32B לפורמט GGUF בעזרת llama.cpp גרסה b5228, תוך שימוש ב־imatrix לכיול כדי לשמור על דיוק המשקולות. המטרה העיקרית של ההפצה הזו, לפי הכרטיס, היא תיקון של הטוקנייזר לעומת גרסאות קודמות. המודל מתמקד ביצירת טקסט בשפות סינית ואנגלית ומבוסס על הארכיטקטורה של THUDM.

המשקלים מגיעים במגוון רחב של רמות דחיסה, החל מגרסת bf16 מלאה של 65.14GB ועד לקבצי שתי ביט קטנים של פחות מעשרה ג'יגה. bartowski השתמש פה גם בשיטות שמשאירות את שכבות הקלט והפלט ב־Q8_0 כדי לצמצם פגיעה באיכות, כך שמקבלים ביצועים עדיפים בגדלים כמו Q4_K_L או Q5_K_L לעומת קוונטיזציה רגילה.

מתאים ל

  • עיבוד טקסט דו-לשוני

    תרגום וניתוח טקסטים בין אנגלית לסינית מקומית בלי תלות בענן.

  • הרצה מקומית ב־LM Studio

    עבודה על תחנת עבודה עם כרטיס של 24GB VRAM באמצעות גרסת Q4_K_M.

  • הסקה על מעבדי ARM

    שימוש בגרסאות Q4_0 או IQ4_NL שמנצלות את מנגנון הרה-פאקינג להאצה.

איפה זה נופל

הכרטיס מגדיר תמיכה בשפות סינית ואנגלית בלבד. עברית לא נתמכת כאן באופן רשמי, ואם תנסו להריץ שאילתות בעברית סביר להניח שתקבלו פלט שבור או הזיות, במיוחד לאור העובדה שמדובר במודל 32B מכויל לשפות אסייתיות.

בנוסף, הפורמט דורש תבנית פרומפט נוקשה מאוד שכוללת טוקנים ייעודיים של gMASK ו־sop. סטייה מהתבנית הזו תפגע ישירות באיכות התשובות.

שאלות
נפוצות

איזה קובץ הכי כדאי להוריד מהרשימה?

עבור רוב השימושים מומלץ לקחת את Q4_K_M ששוקל 19.68GB. הוא מספק איזון מצוין בין איכות הטקסט לבין דרישות הזיכרון. אם יש לכם מספיק מקום בכרטיס המסך, גרסת Q6_K_L תיתן תוצאה קרובה מאוד למקור.

האם אפשר להשתמש במודל הזה לטקסטים בעברית?

המודל מאומן ומיועד לאנגלית וסינית. לא מומלץ לבנות עליו לפרויקטים בעברית, שכן חסר לו אימון בסיסי בשפה והוא צפוי להחזיר שגיאות תחביריות והזיות.

איך מריצים

כדי להריץ אותו צריך כלי שתומך ב־llama.cpp, כמו LM Studio או הרצה ישירה משורת הפקודה. המשקל קובע הכל, גרסת ברירת המחדל המומלצת היא Q4_K_M ושוקלת 19.68GB, מה שאומר שצריך לפחות כרטיס מסך עם 24GB של VRAM כדי שהכל יישב בזיכרון הגרפי וירוץ מהר. אם יורדים לגרסאות נמוכות יותר כמו IQ3_XS אפשר להסתפק בפחות זיכרון, בסביבות 14GB.

אם אין לכם חומרה ייעודית עם מספיק זיכרון מהיר ל־20GB ומעלה, המודל ייגרר ל־RAM של המחשב ויזחל. במצב כזה, עדיף להשתמש ב־API מרוחק במקום להשקיע בחומרה מקומית.

ollama run hf.co/bartowski/THUDM_GLM-4-32B-0414-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון המדווח במאגר הוא MIT. מדובר ברישיון קוד פתוח מתירני מאוד שמאפשר שימוש מסחרי, שינוי של הקוד והפצה מחדש בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗