GPT
G

GLM-4-9B-0414

קוד פתוח

zai-orgmit2025-04-07

  • transformers
  • safetensors
  • glm4
  • text-generation
  • conversational

פתרון קומפקטי שמכוון להסקה מתמטית וכתיבת קוד בסביבה מוגבלת משאבים. הוא מביא יכולות של משפחת GLM המעודכנת לחומרה מקומית נגישה, תחת רישיון פתוח לחלוטין.

  • 9.4Bפרמטרים
  • 32,768טוקנים בהקשר
  • 17.5 GBמשקל הקבצים
  • 22,643הורדות בחודש

מה זה

הדגם הזה שייך לסדרת הדגמים המעודכנת של משפחת GLM, והוא נבנה כגרסה קלה של כ־9.4 מיליארד פרמטרים שמתאימה להרצה על מכונות בודדות. המפתחים אימנו אותו באמצעות טכניקות של למידת חיזוק, דגימת דחייה והתאמה להעדפות אנושיות, תוך שימת דגש מיוחד על יכולות חשיבה, לוגיקה, פתרון בעיות במתמטיקה ויצירת קוד הנדסי.

למרות שעיקר התיעוד בכרטיס מתמקד בגרסאות ה־32B של הסדרה, הגרסה הזו מיועדת לספק שיווי משקל מוצלח בין משאבי חישוב נמוכים לבין ביצועים תחרותיים מול דגמים מקבילים באותו סדר גודל. הדגם כולל ארכיטקטורה של 40 שכבות ותמיכה בחלון הקשר של 32,768 טוקנים, שמתאים לעיבוד מסמכים באורך בינוני, ניתוח קוד ושיחות מתמשכות עם כלים חיצוניים.

הוא מיועד בעיקר למי שמחפש יכולות מעקב אחר הוראות, הפעלת פונקציות וכתיבת דוחות טכניים, בלי להיגרר לעלויות התשתית של מודלי ענק. עם זאת, יש לזכור שהוא אומן בעיקר עבור שפות אנגלית וסינית, ואין בתיעוד נתונים על שפות אחרות.

מתאים ל

  • הפעלת סוכנים וכלים

    התאמה למעקב אחר הוראות וקריאת פונקציות מאפשרת שילוב כרכיב קבלת החלטות.

  • כתיבת קוד ובדיקות

    יכולות מוכחות במשימות הנדסת תוכנה ויצירת לוגיקה מאפשרות סיוע בפיתוח מקומי.

  • ניתוח מבוסס חיפוש

    יכולת סיכום ואיסוף מקורות בתוך חלון של 32 אלף טוקנים מתאימה למערכות RAG.

איפה זה נופל

הכרטיס מציג כמעט את כל הדוגמאות וההדגמות על דגמי ה־32B הגדולים יותר, כולל משימות חשיבה עמוקה, עיצוב אתרים וציור וקטורי. המשמעות היא שדגם ה־9B לא בהכרח מפיק תוצאות דומות במשימות מורכבות במיוחד. הדגם תומך רשמית רק באנגלית ובסינית, כך שאינו מתאים לעיבוד טקסט בעברית ללא בדיקה יסודית של איכות הפלט וההבנה. בנוסף, חלון ההקשר מוגבל לכ־32 אלף טוקנים, מה שלא יספיק לפרויקטים שמחייבים קריאת ספריות קוד שלמות בבת אחת.

שאלות
נפוצות

האם הדגם מתאים לעבודה בעברית?

הדגם מוגדר רשמית עבור אנגלית וסינית בלבד. הוא עשוי לפלוט עברית מקוטעת או שגויה תחבירית, ולכן אינו מומלץ למשימות בעברית ללא כוונון נוסף.

האם חובה להשתמש בכרטיס מסך ייעודי כדי להפעיל אותו?

בדיוק מלא תצטרכו כרטיס עם כ־24 גיגה זיכרון. במידה ותמירו את המשקלים למודל מכווץ, תוכלו להריץ אותו גם על מחשב נייד חזק או מעבד סביר.

איך מריצים

המשקל הכולל של הקבצים עומד על 17.5 גיגה־בייט בפורמט bfloat16, כך שכדי להריץ אותו בדיוק המקורי תצטרכו כרטיס מסך עם לפחות 20 עד 24 גיגה־בייט של זיכרון גרפי, כמו RTX 3090 או RTX 4090. אם תבצעו קוונטיזציה ל־4 ביט, תוכלו לדחוס אותו בקלות לכרטיסים צרכניים נפוצים עם 12 או 16 גיגה־בייט VRAM, או להריץ אותו על מעבדי אפל סיליקון בעלי זיכרון אחוד מתאים.

הטעינה מתבצעת ישירות דרך ספריית transformers המוכרת באמצעות ארכיטקטורת Glm4ForCausalLM. אם השרת שלכם נטול מאיצים גרפיים מתאימים או שאתם בונים שירות שדורש שיהוי אפסי תחת עומס משתמשים כבד, שווה לשקול פנייה ל־API מנוהל של מודל גדול יותר במקום לתחזק שרת ייעודי.

from transformers import pipeline

pipe = pipeline("text-generation", model="zai-org/GLM-4-9B-0414")
print(pipe("שלום"))

הרישיון

הרישיון המדווח הוא MIT, מה שאומר שיש לכם חופש מלא לעשות בקוד ובמשקלים כמעט כל מה שתרצו. מותר להשתמש בו במוצרים מסחריים, לשנות אותו, לאמן אותו מחדש או להפיץ אותו ללקוחות ללא תשלום תמלוגים. הדרישה היחידה היא לשמור על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗