GPT
G

GLM-Z1-9B-0414

קוד פתוח

zai-orgmit2025-04-08

  • transformers
  • safetensors
  • glm4
  • text-generation
  • conversational

גרסת 9.4 מיליארד פרמטרים שמביאה יכולות חשיבה מעמיקה ופתרון בעיות מתמטיות למכונות מקומיות. פתרון ממוקד שמתאים למי שמחפש היגיון מובנה בקובץ ששוקל 17.5 גיגה בייט.

  • 9.4Bפרמטרים
  • 32,768טוקנים בהקשר
  • 17.5 GBמשקל הקבצים
  • 1,310הורדות בחודש

מה זה

המודל הזה נבנה כגרסה מוקטנת במשפחת הדגמים של zai-org, במטרה לשמור על יכולות הסקה וחשיבה מורכבות גם בנפח של תשעה מיליארד פרמטרים. המפתחים העבירו אותו תהליכי אימון מבוססי למידת חיזוק ומדגם דחיות, בעיקר סביב משימות של מתמטיקה, קוד והיגיון פורמלי. הוא מיועד לייצר תהליך חשיבה פנימי לפני שהוא פולט תשובה סופית, כך שהתוצר מבוסס על שלבי ביניים מנומקים.

המבנה שלו כולל ארכיטקטורת Glm4 עם 40 שכבות וחלון הקשר של 32,768 טוקנים. השפות הרשמיות שנתמכות הן אנגלית וסינית בלבד, ללא התייחסות לעברית. בכרטיס המודל לא פורסמו טבלאות ציונים מספריות ספציפיות עבור הגודל הזה אלא רק תרשימים, אך המפתחים מצהירים שהוא מציג ביצועים מובילים ביחס למודלים פתוחים בגודל דומה במשימות מתמטיות וכלליות.

מתאים ל

  • פתרון בעיות מתמטיות

    אימון החיזוק שלו הותאם ספציפית לפתרון משוואות וניתוח לוגי רב שלבי בשרת מקומי.

  • הסקה לוגית מובנית

    התמיכה בתגיות חשיבה מאפשרת לקבל תהליך הסקה מפורט לפני הפקת התשובה הסופית.

  • עיבוד טקסט באנגלית וסינית

    הארכיטקטורה מכוונת במפורש לשתי השפות האלה ומפיקה בהן ביצועים יציבים יחסית לגודלו.

איפה זה נופל

החולשה המרכזית היא היעדר תמיכה רשמית בעברית, כאשר המודל אומן ונבדק על אנגלית וסינית. בנוסף, חובת החשיבה המובנית דורשת להקצות עד 30,000 טוקנים רק ליצירת הפלט הפנימי, מה שמאט את קצב התגובה. אם מפעילים את מנגנון YaRN לטקסטים ארוכים, הוא עלול לשנמך את איכות התוצאות בשיחות קצרות. כרטיס המודל גם אינו מציג נתונים מספריים גלויים על שיעורי שגיאות במבחנים סטנדרטיים.

שאלות
נפוצות

האם המודל מתאים לעבודה שוטפת בעברית?

הכרטיס מציין תמיכה באנגלית ובסינית בלבד. הוא לא עבר התאמה מוצהרת לעברית, ולכן לא מומלץ להסתמך עליו למשימות שדורשות הבנה מקומית מדויקת או דקדוק תקין.

איזה כרטיס מסך נחוץ כדי לעבוד איתו?

המשקלים דורשים 17.5 גיגה בייט בזיכרון. תצטרכו כרטיס עם 24 גיגה בייט זיכרון וידאו לפחות כדי להריץ אותו בדיוק המקורי בלי קריסות של חוסר זיכרון בזמן יצירת פלט ארוך.

האם חובה לשמור את תהליך החשיבה בהיסטוריית הצ'אט?

המפתחים ממליצים בפירוש לחתוך את תגיות החשיבה ולשמור בהיסטוריה רק את התשובה הסופית. השארת שלבי החשיבה הפנימיים יוצרת הפרעות בבקשות הבאות ומבזבזת טוקנים בחלון ההקשר.

איך מריצים

כדי להריץ אותו בדיוק המקורי של bfloat16 צריך כרטיס מסך עם לפחות 24 גיגה בייט זיכרון, כמו RTX 3090 או RTX 4090, שכן המשקלים לבדם תופסים 17.5 גיגה בייט לפני חישובי ההקשר. הריצה מתבצעת ישירות דרך ספריית transformers בגרסה 4.51.3 ומעלה, תוך שימוש בתבנית השיחה המובנית שמזריקה תגית חשיבה ייעודית בתחילת הבקשה.

אם הטקסט הנכנס חוצה את רף 8,192 הטוקנים, המפתחים ממליצים להפעיל מנגנון הרחבה בשם YaRN בקובץ ההגדרות. הפעלת ההרחבה הזו עלולה לפגוע מעט בביצועים בקלטים קצרים, ולכן עדיף להשאיר אותה כבויה כברירת מחדל.

from transformers import pipeline

pipe = pipeline("text-generation", model="zai-org/GLM-Z1-9B-0414")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון MIT. מדובר ברישיון פתוח ומתירני שמאפשר שימוש מסחרי, שינוי קוד, הפצה מחדש והטמעה במוצרים סגורים, בלי דרישה לפתוח את הקוד שלכם. התנאי היחיד הוא שמירת הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗