GPT
L

LongWriter-glm4-9b

קוד פתוח

zai-orgרישיון לא דווח2024-08-12

  • transformers
  • safetensors
  • chatglm
  • feature-extraction
  • Long Context

רוב המודלים בגודל הזה נחנקים כשתבקשו מהם לכתוב יותר מאלף מילים. המודל הזה אומן במיוחד לפלוט מעל עשרת אלפים מילים ברצף בלי לאבד את הצפון באמצע.

  • 9.4Bפרמטרים
  • 17.5 GBמשקל הקבצים
  • 569הורדות בחודש
  • 134לייקים

מה זה

מדובר בהתאמה של glm-4-9b שנועדה לפתור בעיה מעצבנת במיוחד, מודלים שיודעים לקרוא טקסט ארוך אבל מסרבים לכתוב יותר מכמה פסקאות. החוקרים אימנו אותו על דאטהסט ייעודי בשם LongWriter-6k כדי שיחזיק פלט רציף של עשרת אלפים מילים ויותר בקריאה אחת.

הוא מבוסס על ארכיטקטורת ChatGLM עם ארבעים שכבות ודיוק bfloat16. השפות הנתמכות הן אנגלית וסינית, כך שאם בניתם על עברית ארוכה, זה לא הכלי המתאים. השוני העיקרי מול מודלי תשעה מיליארד פרמטרים סטנדרטיים הוא היכולת לייצר תוכן ארוך באמת בלי לקצר תשובות בכוח או להיכנס ללולאות טקסט אינסופיות.

מתאים ל

  • מדריכים מקיפים באנגלית

    הוא מתוכנן לפלוט מעל עשרת אלפים מילים ברצף לפי הנחיה אחת, בדיוק מה שצריך למדריכים עמוקים.

  • סיכומי ענק ודוחות טכניים

    מסוגל לייצר טקסט ארוך ומובנה בלי לעצור באמצע ולבקש מכם להמשיך אותו ידנית.

  • כתיבת תוכן עלילתי ארוך

    אידיאלי למי שמחפש יצירת פרקים שלמים או סיפורים מפורטים באנגלית או סינית בלי קיטועים.

איפה זה נופל

הבעיה המרכזית היא שאין תמיכה מוגדרת בעברית, רק אנגלית וסינית. מעבר לזה, המודל מחייב שימוש ב־trust_remote_code גם בטוקנייזר וגם במודל עצמו, מה שמאלץ אתכם להריץ קוד צד שלישי לא בדוק בסביבה שלכם. יצירה של עשרת אלפים מילים ברצף דורשת ניהול זיכרון כבד מאוד בגלל ה־KV cache בחלון של שלושים ושניים אלף טוקנים.

שאלות
נפוצות

האם אפשר לייצר איתו טקסטים ארוכים בעברית?

הכרטיס מגדיר תמיכה באנגלית וסינית בלבד. הוא אומנם מבוסס על GLM-4 אבל האימון הספציפי ליצירה ארוכה לא כוון לעברית, ולכן הפלט בעברית צפוי להיות חלש או להישבר.

איזה כרטיס מסך צריך כדי להגיע למקסימום אורך?

המשקל הבסיסי הוא 17.5 ג'יגה בייט. כדי להחזיק גם את המודל וגם הקשר פלט של 32,768 טוקנים תצטרכו כרטיס של 24 ג'יגה בייט זיכרון ומעלה, ועדיף להשתמש ב־vLLM כמו שממליצים היוצרים.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־17.5 ג'יגה בייט. כדי להריץ אותו מקומית ב־bfloat16 מלא תצטרכו כרטיס מסך עם לפחות 24 ג'יגה בייט זיכרון, במיוחד אם אתם מכוונים לחלון יצירה שמגיע ל־32,768 טוקנים. פחות מזה, ותצטרכו קוונטיזציה או שתיפלו על שגיאות זיכרון מהר מאוד.

ההרצה עובדת דרך transformers החל מגרסה 4.43.0, אבל מומלץ להרים אותו עם vLLM. הקוד בכרטיס המודל מראה שבשימוש ב־vLLM אפשר לייצר מעל עשרת אלפים מילים תוך פחות מדקה. אם אין לכם חומרה ייעודית שתחזיק הקשר של 32k טוקנים פעיל, שווה לבדוק פתרונות ענן במקום להילחם עם הזיכרון המקומי.

from transformers import pipeline

pipe = pipeline("text-generation", model="zai-org/LongWriter-glm4-9b")
print(pipe("שלום"))

הרישיון

בדף המודל לא מוגדר רישיון רשמי, והוא רק מפנה לרישיון של glm-4-9b-chat. במצב כזה אין אישור שימוש ברור ומסודר במטא-דאטה, ומי שמתכנן להטמיע אותו במוצר מסחרי לוקח סיכון משפטי עד שיבדוק לעומק את תנאי הרישיון המקורי של THUDM.

הרישיון המלא בעמוד המודל ↗