GPT
C

chatglm2-6b

קוד פתוח

zai-orgרישיון לא דווח2023-06-24

  • transformers
  • pytorch
  • chatglm
  • glm
  • thudm

מודל שיחה דו לשוני בסינית ובאנגלית שרץ בקלות על חומרה מקומית צנועה. הוא מציע שדרוג בביצועים ובחלון ההקשר לעומת הדור הראשון, לצד תמיכה בשיחות ארוכות.

  • 11.6 GBמשקל הקבצים
  • 437,620הורדות בחודש
  • 2,056לייקים

מה זה

הגרסה הזו מגיעה עם אימון על 1.4 טריליון טוקנים בסינית ובאנגלית, ושיפורים ברורים לעומת הדור הקודם. במבחני MMLU הוא מציג עלייה של 23 אחוזים, ובמתמטיקה על GSM8K יש קפיצה של 571 אחוזים. זה אומר שבמקום לזרוק תשובות מומצאות בתרגילי חישוב פשוטים, הוא מתחיל להתמודד עם היגיון בסיסי בצורה יציבה בהרבה ממודלים מקבילים בגודל 6 מיליארד פרמטרים.

בסיס המודל תומך כעת בעד 32 אלף טוקנים בזכות FlashAttention, אבל אימון השיחה בפועל נעשה על 8 אלף טוקנים. בנוסף, השילוב של Multi-Query Attention חותך משמעותית את צריכת הזיכרון ומאיץ את מהירות ההסקה ב־42 אחוזים.

מתאים ל

  • צ'אטבוט דו לשוני בסינית

    הוא נבנה ואומן במיוחד לשיחות שוטפות באנגלית ובסינית על חומרה מקומית פשוטה.

  • הרצה מקומית על כרטיס 6G

    בזכות כיול INT4 הוא מחזיק שיחות של 8 אלף טוקנים על חומרה זולה בלי לקרוס.

  • פתרון בעיות היגיון קלות

    עם קפיצה של 571 אחוז ב־GSM8K הוא מספק תשובות סבירות למשימות חשיבה פשוטות.

איפה זה נופל

היוצרים מציינים במפורש שההבנה שלו במסמכים בודדים וארוכים במיוחד עדיין מוגבלת, למרות חלון ההקשר הטכני הרחב. מעבר לזה, המודל אומן אך ורק על סינית ואנגלית. אם תנסו לתת לו קלט בעברית הוא ייכשל, יג'ברש או יתרגם עקום, כך שהוא לחלוטין לא רלוונטי לעבודה ישירה בעברית.

אותה משפחה

chatglm2 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית?

לא. המודל אומן על 1.4 טריליון טוקנים בסינית ובאנגלית בלבד. כל ניסיון לשוחח איתו בעברית יוביל לתוצאות שבורות או חסרות משמעות.

מה המגבלה האמיתית של חלון ההקשר?

אף על פי שבסיס המודל הוגדל טכנית ל־32 אלף טוקנים, שלב השיחה אומן על 8 אלף בלבד. היוצרים מציינים בעצמם שהבנת מסמכים ארוכים ברצף אחד עדיין חלשה, כך שלא מומלץ להעמיס עליו טקסטים ענקיים.

איך מריצים

כדי להריץ אותו ב־float16 תצטרכו כרטיס מסך עם לפחות 13 או 14 גיגה זיכרון כדי להחזיק את 11.6 הגיגה של המשקולות לצד ההקשר. אם תורידו אותו לכיול של INT4, אפשר לדחוף שיחה של 8 אלף טוקנים לתוך כרטיס עם 6 גיגה בלבד, מה שמאפשר להריץ אותו כמעט על כל כרטיס ביתי מודרני.

ההתקנה מסתמכת על ספריית transformers עם גרסה 4.30.2 ודורשת פקג'ים ייעודיים כמו cpm_kernels ו־torch 2.0. אם אתם לא צריכים פרטיות מקומית מוחלטת או תמיכה ייעודית בסינית, פנייה ל־API חיצוני תחסוך לכם את ההתעסקות בתחזוקת הסביבה הזו.

from transformers import pipeline

pipe = pipeline("text-generation", model="zai-org/chatglm2-6b")
print(pipe("שלום"))

הרישיון

הקוד בריפו מוגדר תחת Apache-2.0, אבל המשקולות כפופות לתנאים נפרדים. מחקר אקדמי חופשי לחלוטין, ואילו שימוש מסחרי מותנה במילוי שאלון וקבלת אישור בחינם. בעמוד המודל הנוכחי הרישיון מסומן כלא דווח, ולכן אסור להכניס אותו למוצר מסחרי בלי להסדיר מראש את הטופס מול היוצרים.

הרישיון המלא בעמוד המודל ↗