GPT
G

glm-4-9b-chat

קוד פתוח

zai-orgother2024-06-04

  • transformers
  • safetensors
  • chatglm
  • glm
  • thudm

מודל שיחה פתוח שמביא ביצועי קריאת פונקציות וקונטקסט של 128K לחומרה מקומית נגישה. בחירה מעניינת למי שבונה סוכנים אוטומטיים ורוצה דיוק גבוה בלי תלות בענן סגור.

  • 9.4Bפרמטרים
  • 17.5 GBמשקל הקבצים
  • 88,119הורדות בחודש
  • 708לייקים

מה זה

מדובר במודל שיחה עם 9.4 מיליארד פרמטרים מבית Zhipu AI, שמגיע עם תמיכה מקורית בחלון הקשר של 128K טוקנים. מעבר לשיחה רגילה, הוא אומן ישירות להפעלת כלים חיצוניים, כתיבת קוד וגלישה, תכונות שבדרך כלל שמורות למודלי ענק מסחריים.

במבחני הביצועים הוא עוקף את Llama-3-8B ברוב המדדים המשמעותיים. הפער בולט במיוחד בפתרון בעיות מתמטיות מורכבות עם 50.6 נקודות ב־MATH לעומת 30 של המתחרה, וציון של 71.8 ב־HumanEval לכתיבת קוד. בלוח המבחנים של ברקלי לקריאת פונקציות הוא מגיע לדיוק כולל של 81 אחוזים, תוצאה שמציבה אותו קרוב מאוד לביצועים של GPT-4 Turbo באותה משימה.

מתאים ל

  • סוכני קריאת פונקציות

    דיוק של 81 אחוז ב־BFCL מאפשר להפעיל כלים ו־API חיצוניים ברמה שמזכירה מודלי ענן מסחריים.

  • ניתוח מסמכים ארוכים

    חלון הקשר של 128K טוקנים מתאים לעיבוד דוחות טכניים או קבצי קוד שלמים בהרצה מקומית.

  • פתרון בעיות קוד

    תוצאה של 71.8 ב־HumanEval הופכת אותו לעוזר פיתוח וכתיבת סקריפטים יעיל על חומרה צנועה.

איפה זה נופל

הנתונים הרשמיים מציינים תמיכה ב־26 שפות, אך עברית אינה מופיעה ברשימות המבחנים המרכזיות ויש לבדוק את התנהגותו היטב לפני שימוש בשפה הזו. בנוסף, מדובר במאגר קוד ישן יחסית שהיוצרים עצמם ממליצים לעבור לגרסת Hugging Face הרשמית כדי למנוע בעיות תאימות ושבירה בשדרוגי ספריות עתידיים.

אותה משפחה

glm-4 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית בצורה טובה?

הכרטיס מפרט תמיכה ב־26 שפות ומציג מבחנים בערבית, רוסית, גרמנית ואחרות, אך עברית אינה מוזכרת במפורש. סביר שהוא מסוגל לייצר טקסט בסיסי, אך איכות ההבנה והתחביר דורשות בדיקה מעשית שלכם לפני כל שימוש רציני.

כמה זיכרון GPU צריך כדי לעבוד איתו בפועל?

המודל שוקל 17.5 גיגה בייט בדיוק המקורי, ולכן כרטיס עם 24 גיגה זיכרון הוא המינימום לעבודה שוטפת. אם תרצו לנצל את מלוא חלון ההקשר של 128K, תצטרכו חומרה חזקה משמעותית או שימוש בקוונטיזציה כדי לחסוך מקום במפתח והערכים של תשומת הלב.

איך מריצים

המשקלים תופסים 17.5 גיגה בייט בפורמט bfloat16 על פני 24 קבצים, כך שצריך לפחות כרטיס מסך יחיד עם 24 גיגה זיכרון כדי לטעון ולהריץ אותו באופן סביר, או לכווץ אותו לקוונטיזציה נמוכה יותר. ההרצה נעשית דרך ספריית transformers החל מגרסה 4.44.0 או דרך מנוע vLLM להספק גבוה יותר.

אם אין לכם כרטיס מתאים או שהמטרה היא ניסוי קצר בלבד, עדיף להשתמש ב־API מנוהל. הרצה עצמית של חלון הקשר מלא של 128K תדרוש זיכרון וידאו עצום מעבר למשקל הבסיסי של המודל.

from transformers import pipeline

pipe = pipeline("text-generation", model="zai-org/glm-4-9b-chat")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other ומפנה לקובץ תנאים ייעודי של GLM-4. לא מדובר ברישיון קוד פתוח סטנדרטי כמו אפאצ'י או MIT, ולכן אי אפשר להניח שמותר לשלב אותו במוצר מסחרי בלי לקרוא את ההגבלות המדויקות במסמך המקורי.

הרישיון המלא בעמוד המודל ↗