GPT
G

GLM-4-32B-0414

קוד פתוח

zai-orgmit2025-04-07

  • transformers
  • safetensors
  • glm4
  • text-generation
  • conversational

מודל שיחה וקוד בגודל 33 מיליארד פרמטרים שמתמקד בריצה מקומית ומשימות סוכנים. הוא מתאים למי שצריך תמיכה בהפעלת פונקציות וכתיבת קוד בלי להסתמך על שירותי ענן סגורים.

  • 33Bפרמטרים
  • 32,768טוקנים בהקשר
  • 60.7 GBמשקל הקבצים
  • 4,611הורדות בחודש

מה זה

המודל מציע חלון הקשר של 32,768 טוקנים ואומן מראש על 15 טריליון טוקנים, כולל נתוני חשיבה סינתטיים. בשלבי הכוונון לאחר האימון הושם דגש על יישור להעדפות אנושיות לצד חיזוק התנהגות במשימות סוכנים, מעקב אחר הוראות, הפעלת פונקציות וכתיבת קוד הנדסי. המפתחים מציגים יכולת יצירה של רכיבי ממשק משתמש בטכנולוגיות ווב כמו Tailwind CSS, גרפיקת SVG מורכבת וסימולציות פיזיקליות מונפשות בקוד.

לפי כרטיס המודל, בבנצ'מרקים של כתיבת קוד ומענה על שאלות הוא מציג ביצועים שמשתווים למודלים ענקיים כמו GPT-4o וגרסת DeepSeek-V3 של 671 מיליארד פרמטרים. המשמעות המעשית היא שאין צורך להחזיק תשתית עתירת מעבדים כדי לקבל פלט איכותי בלוגיקת תכנות או ניתוח נתונים, אלא אם כן נדרש ניתוח מעמיק ביותר שלגביו פותחו גרסאות ייעודיות באותה משפחה.

מתאים ל

  • פיתוח סוכני קוד פנימיים

    הוא אומן על הפעלת פונקציות וקוד הנדסי, מה שמאפשר לו לתפקד כסוכן שרץ ישירות על השרת הארגוני.

  • יצירת רכיבי פרונטאנד

    מתאים להפקת קוד ממשקים ב־Tailwind CSS ואיורי SVG מורכבים לפי הוראות מדויקות.

  • כתיבת דוחות מבוססי חיפוש

    מפיק סקירות מעמיקות ומובנות המשלבות הערות שוליים וציטוטים מתוך תוצאות חיפוש או מערכות אחזור מידע.

איפה זה נופל

המודל מוגבל רשמית לשפות אנגלית וסינית בלבד, כך שלא כדאי לבנות עליו לעיבוד או יצירת טקסט בעברית ללא בדיקה יסודית מראש. בנוסף, חלון ההקשר נעצר ב־32,768 טוקנים, מגבלה משמעותית אם אתם מתכננים להזין מסמכים ענקיים או בסיסי קוד שלמים בבת אחת. עבור מחקר מעמיק בסגנון דוחות השוואתיים ארוכים, יוצרי המודל עצמם מציינים שנדרש מודל הסקת מסקנות מתקדם יותר כמו גרסת ה־Rumination שלהם, ולא מודל הבסיס הזה.

שאלות
נפוצות

האם המודל יתפקד היטב עם פרומפטים בעברית?

הכרטיס מצהיר על תמיכה באנגלית ובסינית בלבד. הוא עשוי להבין מילים בודדות בעברית, אך אינו מיועד לכך והתחביר יישבר בקלות, לכן לא מומלץ להשתמש בו ליישומים בשפה העברית.

האם אפשר להריץ אותו על כרטיס מסך ביתי יחיד?

לא בגרסה המקורית שלו. הקבצים שוקלים 60.7 גיגה בייט ודורשים יותר מ־65 גיגה בייט זיכרון גרפי ב־bfloat16. כדי להריץ על חומרה ביתית תצטרכו להמתין לגרסה שעברה קוונטיזציה לארבעה ביטים, או להשתמש בגרסת ה־9B של המשפחה.

איך מריצים

המשקל הכולל של הקבצים עומד על 60.7 גיגה בייט בדיוק של bfloat16 על פני 24 קבצים. כדי להריץ אותו בצורה מקורית ללא קוונטיזציה תצטרכו כרטיס מקצועי עם לפחות 80 גיגה בייט זיכרון גרפי, כמו A100 או שילוב של שני כרטיסי 48 גיגה בייט, לצד תמיכה בספריית transformers.

אם אין ברשותכם חומרה ייעודית כזו או שאתם בונים שירות שצריך לשרת משתמשים רבים במקביל, עדיף לפנות לנקודת קצה מנוהלת דרך שירות ענן. הרצה מקומית מומלצת רק כאשר דרישות אבטחת המידע או הפרטיות מחייבות שהטקסט והקוד לא ייצאו מגבולות השרת שלכם.

from transformers import pipeline

pipe = pipeline("text-generation", model="zai-org/GLM-4-32B-0414")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון MIT. זהו רישיון מתירני שמאפשר שימוש חופשי לחלוטין, כולל שינוי הקוד, שילובו במוצרים מסחריים והפצה מחדש, ללא תשלום תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים ונוסח הרישיון המקורי בתוכנה שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗