GPT
G

glm-4-9b-chat-1m

קוד פתוח

zai-orgother2024-06-04

  • transformers
  • safetensors
  • chatglm
  • glm
  • thudm

גרסת צ'אט של 9.5 מיליארד פרמטרים שמחזיקה חלון הקשר של מיליון טוקנים. פתרון ממוקד למי שחייב לעבד מסמכי ענק מקומית בלי לשלוח מידע החוצה.

  • 9.5Bפרמטרים
  • 17.7 GBמשקל הקבצים
  • 15,415הורדות בחודש
  • 201לייקים

מה זה

מדובר במודל שיחה שפותח כדי לבלוע כמויות חומר חריגות, סדר גודל של שני מיליון תווים בסינית או ספרים שלמים בבת אחת, תחת ארכיטקטורת ChatGLMModel עם 40 שכבות. מעבר לשיחה רגילה, הוא מיועד להפעלת כלים חיצוניים, הרצת קוד וגלישה ברשת, ומציע תמיכה מוצהרת ב־26 שפות.

הייחוד האמיתי כאן ביחס לגודל של 9.5B הוא ההתמודדות עם טקסט ארוך. לפי בדיקות מחט בערימת שחת ומדדי LongBench-Chat שהיוצרים מציגים, הוא מצליח לאתר מידע ספציפי ולשמור על לכידות לאורך כל חלון המיליון, תחום שבו רוב המודלים בקטגוריית המשקל הזו קורסים לחלוטין או מוגבלים לטווחים קצרים בהרבה.

מתאים ל

  • תחקור ארכיונים גדולים

    מאפשר לסרוק תיקי מסמכים שלמים בפעימה אחת בזכות חלון של מיליון טוקנים.

  • ניתוח בסיסי קוד מלאים

    מתאים לטעינת עשרות קובצי מקור יחד כדי למצוא תלויות ולבצע תיקונים.

  • סוכני אוטומציה מבוססי כלים

    כולל תמיכה מובנית בהפעלת קוד ובקריאה לפונקציות חיצוניות ישירות מהשיחה.

איפה זה נופל

הכרטיס מפרט תמיכה רחבה בשפות כמו אנגלית, סינית, יפנית, קוריאנית וגרמנית, אבל עברית לא מוזכרת שם בכלל, מה שאומר שהביצועים והשליטה בשפה המקומית צפויים להיות מוגבלים מאוד. בנוסף, חלון הקשר של מיליון טוקנים הוא תובעני להחריד מבחינת משאבים, וגם אם המודל שולף מידע נקודתי, יכולת ההסקה העמוקה שלו על טקסטים מורכבים עדיין מוגבלת על ידי גודלו הצנוע.

אותה משפחה

glm-4 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים לשימוש בעברית?

התיעוד מציין 26 שפות שביניהן אנגלית, סינית, גרמנית ויפנית, אך עברית אינה ברשימה. סביר להניח שהוא יתקשה בהבנה מדויקת, יסבול מהזיות וייצר פלט פחות קוהרנטי בעברית.

כמה זיכרון וידאו צריך כדי לנצל את כל חלון ההקשר?

המשקלים הבסיסיים דורשים כ־18 ג'יגה בייט ב־bfloat16 להרצה פשוטה. ברגע שפותחים את ההקשר מעבר לכמה עשרות אלפי טוקנים, תוספת הזיכרון הנדרשת עבור ה־KV cache עצומה ותדרוש חומרת שרתים ייעודית עם מספר כרטיסים.

איך מריצים

המשקלים דורשים הורדה של 17.7 ג'יגה בייט בפורמט bfloat16, כך שבשביל להריץ אותו בכלל תצטרכו כרטיס מסך עם לפחות 24 ג'יגה זיכרון וידאו עבור הקשר קצר. אם אתם בונים על ניצול מלא של מיליון הטוקנים, זיכרון הווידאו הנדרש לניהול ה־KV cache יזנק בצורה חדה ויחייב מערך של כמה כרטיסים חזקים.

ההפעלה מתבצעת ישירות דרך ספריית transformers החל מגרסה 4.44.0 או באמצעות vLLM לצורך ביצועים יעילים. אם אין לכם שרת ייעודי כבד זמין לתמיכה בעומס של ההקשר המלא, תשלום על קריאות דרך API חיצוני יהיה זול והגיוני בהרבה מאשר רכישת החומרה.

from transformers import pipeline

pipe = pipeline("text-generation", model="zai-org/glm-4-9b-chat-1m")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר בתור other ומפנה לקובץ תנאים נפרד של היוצרים. אי אפשר להניח שמותר להשתמש בו באופן מסחרי חופשי או לשלב אותו במוצר בלי לקרוא היטב את נוסח הרישיון המקורי ולוודא אילו מגבלות חלות על שימוש בארגונים.

הרישיון המלא בעמוד המודל ↗