GPT
C

chatglm2-6b-int4

קוד פתוח

zai-orgרישיון לא דווח2023-06-25

  • transformers
  • pytorch
  • chatglm
  • glm
  • thudm

גרסה מכווצת בארבעה ביטים של מודל שיחה דו לשוני בסינית ובאנגלית. הוא נכנס בקלות לכרטיסי מסך ביתיים וחסכוני מאוד במשאבי זיכרון.

  • 3.7 GBמשקל הקבצים
  • 572הורדות בחודש
  • 237לייקים

מה זה

מדובר בדור השני של מודל השיחה הדו לשוני מבית היוצר של GLM, שמגיע כאן בכיול INT4 כדי לחסוך מקום. הוא אומן מראש על 1.4 טריליון טוקנים בסינית ובאנגלית ועבר יישור להעדפות אנושיות, תוך שימוש במנגנונים כמו Multi-Query Attention לשיפור מהירות הריצה וצריכת הזיכרון.

לפי נתוני הבדיקה, המודל הזה מציג קפיצה משמעותית ביחס לדור הראשון, כולל עלייה של 571 אחוזים במבחן GSM8K לחשיבה מתמטית, שיפור של 33 אחוזים בבדיקות ידע בסינית דרך CEval, ושיפור של 23 אחוזים במבחן MMLU. בפועל זה אומר שהוא מתמודד הרבה יותר טוב עם שאלות היגיון וחישוב, ומספק תשובות יציבות בהרבה בהשוואה לקודמו.

הבסיס תומך בחלון הקשר של עד 32 אלף טוקנים, אך שלב האימון לשיחה הוגבל לשמונת אלפים טוקנים. החיבור של הכיול עם תשומת הלב המרוכזת מעלה את מהירות ההסקה ב־42 אחוזים לעומת הגרסה הראשונה, ומאפשר לנהל דיאלוג רציף בלי לחנוק את החומרה.

מתאים ל

  • עוזר מקומי בסינית ואנגלית

    מתאים לשיחה שוטפת בשתי השפות על חומרה ביתית פשוטה בלי לשלוח מידע לענן.

  • פתרון בעיות היגיון וחשבון

    הזינוק בתוצאות GSM8K מאפשר מענה מדויק יחסית למשימות חישוב קלות.

  • צ'אט מרובה תורות מקומי

    שומר על הקשר שיחה עד 8K טוקנים בכרטיס של 6 גיגה בייט בלבד.

איפה זה נופל

היוצרים מבהירים במפורש שלמרות התמיכה הרחבה בהקשר, היכולת של המודל להבין מסמכים ארוכים במיוחד בסבב יחיד עדיין מוגבלת, והנושא נמצא בעבודה לגרסאות הבאות. בנוסף, המודל מיועד אך ורק לסינית ולאנגלית, כך שאין כאן תמיכה בעברית או בשפות אחרות. כיול לרמת INT4 עלול לפגוע בעדינות הפלט במשימות שדורשות דיוק לשוני מחמיר, ולכן חובה לבדוק את התוצרים לפני שילוב שלו במוצר אמיתי.

אותה משפחה

chatglm2 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית?

לא. המודל אומן מראש על מאגרי נתונים בסינית ובאנגלית בלבד, ואינו כולל תמיכה בעברית. ניסיון לשוחח איתו בעברית יפיק שגיאות או פלטים חסרי משמעות.

איזה כרטיס מסך מינימלי צריך כדי להריץ אותו?

המשקלים דורשים פחות מארבעה גיגה בייט של אחסון, וכרטיס מסך עם 6 גיגה זיכרון גרפי מספיק כדי לנהל שיחה מלאה של עד 8K טוקנים בזכות הכיול לרמת ארבעה ביטים.

איך מריצים

כדי להריץ אותו צריך התקנה של ספריית transformers בגרסה 4.30.2 יחד עם cpm_kernels, accelerate ופייטורץ׳ 2.0 ומעלה. קבצי המשקלים תופסים 3.7 גיגה בייט בלבד, כך שלא צריך מכונות יקרות בענן.

בגרסת INT4 הזו, כרטיס מסך בסיסי עם 6 גיגה בייט של זיכרון גרפי מחזיק שיחה באורך של עד 8K טוקנים, לעומת אלף בלבד בדור הקודם. אם המטרה היא שירות זול שרץ על חומרה מקומית קיימת ללא תלות ברשת, הרצה עצמית כאן משתלמת במיוחד.

from transformers import pipeline

pipe = pipeline("text-generation", model="zai-org/chatglm2-6b-int4")
print(pipe("שלום"))

הרישיון

בעמוד המודל הספציפי הזה לא דווח רישיון רשמי. בכרטיס המקורי מוסבר שהקוד פתוח תחת Apache-2.0 אך המשקלים כפופים לרישיון מודל נפרד שאינו מפורט כאן. בהיעדר הגדרה ברורה במאגר, שימוש מסחרי או הפצה במוצר מהווים סיכון משפטי ודורשים בדיקה מול היוצרים.

הרישיון המלא בעמוד המודל ↗