GPT
C

chatglm2-6b-32k

קוד פתוח

zai-orgרישיון לא דווח2023-07-30

  • transformers
  • pytorch
  • chatglm
  • glm
  • thudm

גרסה מורחבת לשיחות ארוכות שתומכת בסינית ובאנגלית עם חלון של שלושים ושניים אלף טוקנים. היא מיועדת למי שצריך לעבד מסמכים ארוכים על חומרה מקומית נגישה יחסית.

  • 11.6 GBמשקל הקבצים
  • 642הורדות בחודש
  • 293לייקים

מה זה

מדובר במודל שיחה דו לשוני שנבנה על בסיס אימון מקדים של 1.4 טריליון טוקנים בסינית ובאנגלית, עם התאמה להעדפות אנושיות. המאפיין המרכזי כאן הוא הרחבת חלון ההקשר לשיחות ארוכות במיוחד באמצעות אינטרפולציית מיקומים ושימוש בטכנולוגיית FlashAttention, כשהמודל אומן מראש על רצפים באורך המלא.

הוא כולל מנגנון Multi-Query Attention שמייעל את תפיסת הזיכרון ומאיץ את ההסקה ב־42 אחוזים לעומת הדור הראשון. המפתחים עצמם מבהירים שאם רוב העבודה שלכם נשארת בתוך טווח של שמונת אלפים טוקנים, אין סיבה להעמיס את הגרסה הזו ועדיף להישאר עם הגרסה הרגילה. היתרון שלה נפתח רק כשנכנסים למסמכים כבדים או דיאלוגים מרובי סבבים.

מתאים ל

  • ניתוח מסמכים ארוכים באנגלית

    קריאת חוזים, מאמרים או תמלילים ארוכים בתוך חלון של שלושים ושניים אלף טוקנים ללא צורך בחיתוך אגרסיבי.

  • סוכן שיחה לשירות לקוחות

    ניהול שיחה מתמשכת עם היסטוריה עמוקה של עשרות סבבים בלי שההקשר הראשוני ילך לאיבוד.

  • עיבוד תוכן דו לשוני

    תרגום, סיכום והשוואת מקורות בין סינית לאנגלית בהיקף טקסט נרחב.

איפה זה נופל

המודל מוגדר ומאומן רשמית עבור אנגלית וסינית בלבד. אין כאן שום תמיכה רשמית בעברית, ולכן ניסיון להזין טקסט מקומי יוביל כנראה לפגיעה קשה באיכות התוצאה ובחלוקת הטוקנים.

בנוסף, הרחבת ההקשר מעבר לשמונת אלפים טוקנים דורשת משאבי זיכרון כבדים מאוד כדי להימנע מקריסות, והיעילות שלו מול הגרסה הבסיסית יורדת אם אתם לא באמת מנצלים את עומק הטקסט הזה.

אותה משפחה

chatglm2 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יתאים לטקסטים בעברית?

לא מומלץ לבנות על זה. המודל אומן והותאם ספציפית על דאטהסטים בסינית ובאנגלית בלבד, ואינו כולל אופטימיזציה לשפה העברית.

האם אני חייב כרטיס של 24 גיגה כדי להפעיל אותו?

לא בהכרח. בהרצה מלאה ב־FP16 עם חלון מקסימלי תצטרכו סביב 20 גיגה, אבל בכיול ל־INT4 אפשר להסתפק ב־6 גיגה זיכרון עבור טקסטים של עד שמונת אלפים טוקנים.

איך מריצים

המשקלים שוקלים 11.6 גיגה בייט ומגיעים בדיוק float16. כדי לפתוח את מלוא חלון ההקשר של 32K תצטרכו כרטיס עם כ־20 גיגה זיכרון וידאו, הודות לשיפורים שנעשו במבנה ה־KV Cache. בגרסת כיול של INT4, כרטיס צנוע של 6 גיגה מסוגל לדחוף הקשר של עד שמונת אלפים טוקנים.

ההרצה מתבצעת ישירות דרך ספריית transformers של פייתון, בגרסה 4.30.2, לצד חבילות כמו cpm_kernels, torch ו־accelerate. אם אין לכם כרטיס עם 24 גיגה פנויים כדי לקבל את מלוא האורך, שווה לשקול פתרון מנוהל.

from transformers import pipeline

pipe = pipeline("text-generation", model="zai-org/chatglm2-6b-32k")
print(pipe("שלום"))

הרישיון

הקוד עצמו משוחרר תחת רישיון Apache 2.0, אבל על המשקלים חלים תנאים אחרים. הם חופשיים לחלוטין למחקר אקדמי, אך שימוש מסחרי מותנה במילוי טופס שאלון רשמי ורישום מול החברה. בעמוד המודל הנוכחי הרישיון מסומן כלא מדווח, לכן חשוב לבדוק את תנאי השימוש המדויקים לפני שילוב בקוד מסחרי.

הרישיון המלא בעמוד המודל ↗